O aprendizado por reforço consegue operar cripto com lucro?
Todas as 219 execuções perderam dinheiro. Três das seis funções de recompensa obtiveram retorno positivo antes dos custos e devolveram tudo, o que torna isto um problema de custos e não de previsão.
O que testamos
Dê a um agente dados de um minuto sobre um universo de contratos perpétuos USD-M da Binance livre de viés de sobrevivência. Deixe-o escolher quais contratos manter, comprados ou vendidos, em que tamanho e quando mudar de ideia. Cobre dele o que operar realmente custa. Ele ganha dinheiro?
A pergunta merece cuidado porque o registro publicado é escasso. Os resultados costumam vir de um único treinamento, os custos muitas vezes estão ausentes, e a referência costuma ser uma posição comprada e mantida em vez de um agente aleatório operando na mesma intensidade. Cada uma dessas escolhas favorece o método.
O universo e a decisão
354 contratos, dos quais 56 foram descontinuados antes do fim da amostra e permanecem no histórico nas datas em que de fato foram negociados. O universo é reconstruído na data, classificando por volume em dólares dos 30 dias estritamente anteriores, com os filtros de elegibilidade aplicados antes da classificação para que não possam depender de um resultado.
As decisões são horárias em 20 posições, compradas ou vendidas, limitadas a 25% da conta por contrato e a 100% no bruto. Há uma zona morta em torno de zero, de modo que não manter nada seja uma escolha fácil e não um equilíbrio instável.
O que foi congelado antes de qualquer resultado ser lido
Validação deslizante em 20 janelas: 18 meses de treino, 3 de validação e 3 de teste, com expurgo de 7 dias e embargo de 1 dia em cada fronteira. O período fora da amostra vai de novembro de 2021 a agosto de 2026. A normalização é ajustada apenas nas linhas de treino, o ponto de verificação é escolhido na validação, e o teste é tocado uma única vez por configuração.
Os custos ficam dentro da recompensa em vez de serem subtraídos depois: 5 pontos-base de taxa de tomador e 2 pontos-base de deslizamento base por execução, impacto de mercado em raiz quadrada escalado pela volatilidade realizada, participação limitada a 5% do volume negociado do intervalo, e financiamento às taxas realizadas na barra real de liquidação.
A regra de pontuação foi escrita de antemão: o percentil 25 do retorno ajustado ao risco fora da amostra entre os pontos de partida aleatórios, medido contra um agente aleatório operando no mesmo giro. Essa escolha de estatística acaba pesando mais do que qualquer outra coisa no estudo.
Resultados
Não. Todas as 219 execuções perderam dinheiro, e cinco das seis funções de recompensa perdem para um agente aleatório operando na própria intensidade delas. O melhor retorno ajustado ao risco registrado em todo o estudo pertence a um agente aleatório que compra e mantém por cerca de 42 dias.
A probabilidade de sobreajuste do backtest na família de configurações é 1,00, o que significa que a classificação dentro da amostra não carregou nenhuma informação fora da amostra, em nenhuma partição, e nada sobrevive à correção para comparações múltiplas. Isso seria um resultado nulo sem graça. Três achados por baixo dele não são.
É um problema de custos, não de previsão
Separar o resultado de cada função entre o que as posições ganharam antes dos custos e o que a negociação custou distingue dois fracassos muito diferentes.
| Função de recompensa | Antes dos custos | Custo | Financiamento | Líquido | Custo / vantagem |
|---|---|---|---|---|---|
| Sinal de cada operação | +22,3% | −55,6% | −0,8% | −34,0% | 2,5× |
| Lucro líquido por operação | +7,4% | −29,7% | −2,6% | −24,8% | 4,0× |
| Retorno logarítmico | +2,4% | −17,0% | −3,1% | −17,6% | 7,0× |
| Retorno escalado pela volatilidade | −1,6% | −14,2% | −3,2% | −18,9% | — |
| Retorno menos rebaixamento | −3,0% | −11,6% | −3,2% | −17,7% | — |
| Índice de Sharpe diretamente | −10,6% | −13,7% | −0,4% | −24,7% | — |
Média por trimestre como fração do capital, oito trimestres fora da amostra, cinco pontos de partida aleatórios por função. A razão só aparece quando o retorno antes dos custos é positivo, pois de outro modo não tem sentido.
Três das seis funções encontraram vantagem direcional positiva fora da amostra ao longo de oito trimestres. A ordem se inverte. A função que mais perde no líquido é a que mais acertou a direção, por um fator de três sobre a seguinte.
As duas funções no topo da tabela líquida têm retorno negativo antes dos custos, de modo que se classificam bem por serem baratas e não por acertarem. Esse é o mecanismo por trás de uma probabilidade de sobreajuste de 1,00: a classificação mede contenção, e contenção não se generaliza como habilidade.
A recompensa controla o tamanho da operação, não a frequência. Os encerramentos por hora ficam entre 9,66 e 10,23 nas seis funções, uma diferença de 6%, enquanto o tamanho médio varia 19 vezes. As funções são igualmente ativas e diferem apenas na timidez.
O agente que mais perdeu foi o que mais acertou a direção. Ele apenas devolveu a vantagem dezenove vezes.
Informar à rede o formato do problema é o maior efeito isolado
Uma escolha de projeto valeu mais do que todas as outras variáveis testadas. A política passa cada um dos 20 contratos pelo mesmo codificador pequeno e compartilha uma única cabeça de decisão, de modo que não pode tratar um contrato de forma diferente de outro a não ser pelos dados. A alternativa óbvia é uma rede comum que enxerga as 1.192 entradas como um vetor indiferenciado.
Uma diferença de 19 pontos, sem sobreposição entre as faixas. Para efeito de escala, a função de recompensa abrange cerca de 2 pontos e a escolha de variáveis não separa nada. A rede comum não aprendeu uma política pior: ela nunca aprendeu a manter posição. Gira 85% da carteira a cada hora e é zerada nos oito trimestres.
Diante de um vetor plano, ela não consegue descobrir que a entrada é na verdade 20 contratos por 59 colunas mais 12 números de conta, de modo que suas 20 saídas não compartilham pesos e nada liga os dados de um contrato à posição nesse mesmo contrato. Carrega 16 vezes mais parâmetros que a política de codificador compartilhado e ainda assim perde por 19 pontos: trata-se, portanto, de informar à rede a estrutura do problema, não do tamanho do modelo.
Isso fixa o piso, não levanta o teto. A política de codificador compartilhado ainda perde 89% do capital e continua falhando contra um agente aleatório no próprio giro dela. Em um simulador sem custos as duas teriam parecido muito mais próximas, e boa parte do trabalho publicado nessa área não cobra custo algum.
O sorteio aleatório domina todas as comparações
Uma configuração, um conjunto de dados, dez pontos de partida aleatórios: uma amplitude de 10 pontos de retorno ajustado ao risco. Em 40 pontos de partida, o giro varia 50 vezes na mesma configuração. Isso basta para encobrir qualquer efeito que se queira medir aqui.
Um único treinamento, que é como a maior parte do trabalho publicado nessa área reporta, carrega uma taxa de falso positivo de 40% nesta configuração. Dois em cada cinco estudos relatariam mediana lucrativa para algo que perde 2,7 pontos em dez pontos de partida. Isso basta para explicar o histórico de replicação da área sem supor desonestidade de ninguém.
Tornar o custo legível não resolve
Como os custos ficam dentro da recompensa, o agente é pago pelo líquido. Uma objeção é que um único número agregado não consegue dizer a ele se perdeu na direção ou nas taxas, deixando-o incapaz de aprender que operar é o que o prejudica. A taxa representa entre 1,6% e 10,2% de um movimento de preço horário típico, de modo que essa atribuição precisa ser extraída de um ruído de 10 a 60 vezes o tamanho do sinal.
| Variante | Partidas | Giro por hora | Custo | Antes dos custos | Líquido | p do giro |
|---|---|---|---|---|---|---|
| Referência | 40 | 8,1% | 27,2% | +4,2% | −24,9% | — |
| Custo mostrado ao agente | 10 | 11,0% | 28,3% | +1,9% | −25,1% | 0,56 |
| Penalidade, 5× o custo real | 10 | 9,3% | 29,9% | +5,6% | −29,0% | 0,51 |
| Penalidade, 25× o custo real | 40 | 4,4% | 18,5% | +4,8% | −19,3% | 0,087 |
Duas intervenções sobre a mesma função de recompensa. A penalidade de 25× e a referência têm 40 pontos de partida aleatórios cada; as outras duas têm 10. O teste sobre o giro é unilateral.
Mostrar ao agente quanto custou sua última decisão não mudou nada mensurável. Cobrar dele uma penalidade proporcional ao que acabara de negociar, a 25 vezes o custo real, reduziu o giro em 45% e os custos em 8,7 pontos de capital, mantendo o retorno antes dos custos estável e melhorando o líquido em 5,6 pontos.
Quatro medidas se movem juntas, e é essa a combinação que importa, porque a penalidade removeu a negociação que não se pagava, e não a que carregava a vantagem. Ainda assim o limiar registrado de antemão não é alcançado, e a razão é o próprio achado: a penalidade baixa a metade inferior da distribuição de giro e deixa o quartil superior intacto. Alguns pontos de partida ainda negociam 12% da carteira por hora enquanto pagam vinte e cinco vezes o custo real.
Um sinal de custo, por mais alto que seja, detém o operador marginal e não o convicto. O experimento seguinte é portanto estrutural e não econômico: limitar quanto a carteira pode mudar por hora, de modo que o giro excessivo se torne impossível em vez de caro, e então verificar se a vantagem antes dos custos sobrevive a um giro que a estrutura de custos consiga sustentar.
Defeitos encontrados antes da publicação
Três merecem ser nomeados, porque cada um produziria uma resposta errada e confiante em vez de uma falha visível.
Um preço de preenchimento estava sendo usado para liquidar a rotação para uma posição cujo contrato havia mudado. O agente de referência de peso igual relatava retorno de 31 vezes onde a aritmética feita à mão dá 1,46. Todas as execuções anteriores à correção foram descartadas.
Uma comparação de variáveis foi executada com um conjunto mais estreito sobrevivendo à regra de completude em mais linhas do que um conjunto mais amplo, de modo que os braços ficavam sobre amostras diferentes e a comparação media silenciosamente cobertura em vez de informação. Agora todos os braços precisam compartilhar uma mesma assinatura de contagem de linhas antes de qualquer afirmação.
Uma primeira decomposição de custos foi construída somando colunas do registro de operações ao longo das janelas e dos pontos de partida, o que conta em dobro e soma frações de capital que reiniciam em um. O registro é primeiro a entrar, primeiro a sair e apenas realizado, de modo que sua soma difere legitimamente do retorno total pela marcação a mercado do estoque ainda aberto no fim da janela. As decomposições agora vêm dos acumuladores do simulador.
Um resultado encontrado, publicado e retirado
Com cinco pontos de partida aleatórios, uma comparação de variáveis produziu +42,5% em quatro trimestres fora da amostra, sobre linhas verificadamente idênticas e com mecanismo plausível, e foi redigida. Ao estender a mesma configuração para dez pontos de partida, a mediana passou de +0,56 para −2,67 e o total de +42,5% para −85,9%, porque as cinco primeiras execuções eram a metade superior da distribuição.
Com os sete conjuntos de variáveis em dez pontos de partida, a classificação aparente então se inverteu, e nenhum par de conjuntos é distinguível após a correção das 21 comparações. A leitura honesta é que a classificação de variáveis é ruído em todos os tamanhos de amostra tentados.
A estatística registrada de antemão recusou os +42,5% antes que a extensão explicasse o porquê. Esse é o argumento mais forte do estudo em favor de escrever o critério de aceitação antes de olhar, e vale mais do que o achado valeria.
Limitações
São decisões horárias em uma única corretora sob uma única modelagem de custos, de modo que nada se diz sobre horizontes mais rápidos, outras praças, formação de mercado ou o que uma mesa real teria pago. O número de 22,3% antes dos custos é o menos confiável daqui, porque a função que o produz negocia 32% da carteira por hora, fundo o bastante no modelo de impacto para que sua própria estimativa seja a mais dependente do modelo entre as seis.
A comparação de variáveis cobre apenas quatro janelas tardias, porque o histórico de contratos em aberto anterior a dezembro de 2021 não existe para a maioria dos contratos. O agente aleatório de referência é pareado pelo giro e não pela concentração, embora as políticas mantenham em mediana 15 das 20 posições e toquem 35 contratos distintos por janela, de modo que a diferença de diversificação é pequena.
Duas das vinte janelas reservadas foram usadas na triagem, contrariando o plano original, o que as consumiu e deixou apenas duas intactas. Uma grade de cadência secundária foi abandonada por falta de tempo, de modo que a questão da cadência se apoia apenas nos agentes de referência. Nada aqui é uma estratégia, e nenhum modelo foi exposto a dados ao vivo.
Fontes de dados, regra de universo na data, espaço de observação e de ação, modelo de custos e financiamento, mecânica da validação deslizante, as seis funções de recompensa, os agentes de referência, a inferência e os controles bloqueantes, com trechos de código.

