← Alpha
Alpha Research · · 12 min de leitura

Quanto o machine learning consegue melhorar estratégias de trading perdedoras?

Pegue uma biblioteca de regras que perde dinheiro, coloque um modelo por cima para decidir quais trades tomar e meça quanto isso recupera em 420 regras, dois mercados e 43 meses.

Uma proposta comum de machine learning em trading sistemático deixa as estratégias como estão e coloca um modelo por cima delas. As regras continuam gerando sinais, enquanto um modelo treinado nos trades passados delas decide quais sinais tomar, que tamanho dar a cada um ou quais priorizar. É um pedido menor do que prever o mercado diretamente, já que o modelo só precisa julgar se o próximo trade de uma regra conhecida vai dar lucro.

Testar essa proposta de forma justa exige três controles. Um modelo que opera menos vai bater uma linha de base perdedora sem escolher trades melhores, então a comparação precisa de um nulo que opere igualmente pouco, ao acaso. Uma biblioteca escolhida porque suas regras já ganhavam dinheiro carrega essa seleção para o resultado, e um ganho de acurácia na previsão não diz nada sobre se o P&L sobrevive a spreads, taxas e funding.

Este estudo coloca uma camada de modelo sobre uma biblioteca fixa de 420 regras técnicas que perdem dinheiro depois dos custos nos dois mercados testados, em duas frequências de barra, e depois a roda em walk-forward ao longo de 43 meses para medir quanto dessa perda o modelo consegue recuperar. Cada política de modelo é comparada com tomar todos os sinais e com um filtro simples construído à mão, em comparações registradas antes de existir qualquer número fora da amostra.

Reprodutibilidade

A receita exata por trás de cada número fica em página própria: a grade de regras, as features, a busca de modelos, o loop walk-forward, o modelo de custos, a inferência e as verificações.

Ler a reprodutibilidade →

O que testamos

Regras. 420 estratégias mecânicas, 30 parametrizações em cada uma de 14 famílias: seguimento de tendência, reversão à média, rompimentos, momentum, expansão e contração de volatilidade, cruzamentos de médias móveis, rompimentos de canal e de Donchian, reversões de RSI e de Bollinger, momentum confirmado por volume, rompimentos do range de abertura e entradas em horários fixos do dia. Nenhuma foi escolhida por ter ganhado dinheiro, então as regras perdedoras ficam na biblioteca, e uma regra só sai de uma janela de treino por motivo mecânico, como operar raramente demais para que se aprenda algo com ela.

Mercados. Dez ações americanas grandes e dez perpétuos líquidos da Binance margeados em USDT, cada um em barras de 15 minutos e de uma hora, o que dá quatro células mercado-timeframe negociadas fora da amostra de janeiro de 2023 a julho de 2026. Todo trade entra na abertura da barra seguinte ao sinal e sai depois de um número fixo de barras, sem stops nem alvos.

Cada par regra-instrumento segura no máximo uma posição por vez, e todos os pares recebem o mesmo capital.

O que o modelo enxerga. Features de mercado construídas a partir de preço e volume na barra do sinal, a família e os parâmetros da regra, a direção e a força do sinal, além do histórico recente da própria regra naquele instrumento e entre instrumentos. Custos, spreads, funding e o preço de abertura da barra seguinte nunca entram como insumo, porque nenhum deles é conhecido no momento da decisão.

Modelos. Um modelo linear regularizado, um ensemble de árvores com gradient boosting e uma rede neural pequena, cada um treinado duas vezes: uma para prever o retorno líquido do trade e outra para prever se ele termina com lucro. A cada mês, cada modelo testa 30 configurações fixas, escolhe uma numa fatia reservada dos 24 meses anteriores, é reajustado sobre os 24 meses inteiros e prevê o mês seguinte uma única vez, o que soma 1,032 modelos selecionados a partir de 30,960 configurações tentadas.

O que o modelo pode fazer. Três usos, cada um testado separadamente. Como filtro, ele só toma um trade quando a previsão é positiva; no dimensionamento, todo trade acontece, escalado entre 0.25 e 1.75 vezes o tamanho normal conforme a posição da previsão no ranking.

No ranqueamento, ele fica com o quinto superior dos novos sinais em cada timestamp e dá a eles todo o orçamento de entrada do lote.

Comparadores. Toda política de modelo é avaliada contra duas alternativas. Uma é tomar todos os sinais, a linha de base, e a outra é um filtro simples que só opera quando pelo menos duas de três condições valem (volatilidade alta, tendência forte e volume alto), cada uma medida contra a mediana dentro da amostra do próprio instrumento.

Custos. Cripto paga a taxa taker de 5 bp da Binance e 2 bp de slippage por execução, mais metade do spread medido na entrada e na saída, além do funding efetivamente cobrado enquanto a posição está aberta. Ações pagam metade do spread medido por execução mais 0.5 bp de taxas.

O que conta como melhora. Um contraste só é creditado quando os sete critérios registrados valem: o retorno líquido supera o comparador no total e por unidade de capital alocado, com q ajustado por Benjamini-Hochberg abaixo de 0.05 entre todos os 144 contrastes, e vence em mais da metade dos meses com ganhos maiores que as perdas. O ganho também precisa sobreviver à exclusão do melhor mês e superar 95% de um nulo que escolhe ao acaso o mesmo número de trades com a mesma exposição.

Uma afirmação geral de que machine learning melhora essas estratégias exige resultados creditados nos dois mercados, nos dois timeframes e em pelo menos duas das três famílias de modelo.

Resultados

Os modelos aprenderam alguma coisa, e a vantagem de cripto é quase toda volatilidade

Agrupados ao longo de 43 meses, os modelos de classificação separam trades vencedores de perdedores com ROC AUC entre 0.512 e 0.523 em ações e entre 0.566 e 0.618 em cripto. O IC de rank entre o retorno líquido previsto e o realizado vai de -0.0006 a 0.0135 em ações, contra 0.0165 a 0.0376 em cripto.

CélulaROC AUC, três famílias de modeloVolatilidade × √manutenção, sem modeloIC de rank, três famílias de modelo
Ações 1h0.512 a 0.5130.509-0.0006 a 0.0085
Ações 15m0.521 a 0.5230.5150.0095 a 0.0135
Cripto 1h0.566 a 0.5740.5540.0165 a 0.0255
Cripto 15m0.606 a 0.6180.6030.0242 a 0.0376

Qualidade da previsão ao longo dos 43 meses fora da amostra. A coluna sem modelo pontua cada trade pela volatilidade de 24 barras vezes a raiz quadrada do seu período de manutenção.

A maior parte da margem de cripto dispensa modelo. Pontuar cada trade pela volatilidade recente do instrumento vezes a raiz quadrada do seu período de manutenção, um número sem nenhuma opinião sobre direção, já chega a um AUC de 0.554 em barras de uma hora e de 0.603 em barras de 15 minutos, porque um trade que deve andar mais tem mais chance de superar um round trip fixo de 14.8 bp, seja qual for a direção.

Contra esse score, os modelos acrescentam de 0.003 a 0.020 de AUC em cripto e de 0.004 a 0.009 em ações, então a distância entre os mercados é bem menor do que os números brutos sugerem.

Fig. 1: Qualidade da previsão agregada fora da amostra por célula. Na visão de AUC, a barra cinza é o score de volatilidade sem modelo; em cripto, ele já concentra a maior parte da margem dos modelos sobre um cara ou coroa.

A biblioteca perde dinheiro antes de qualquer modelo tocar nela

Tomar todos os sinais perde nas quatro células. Os retornos aqui são retornos diários somados sobre o capital do book, e não compostos, já que os books de cripto perdem mais do que o próprio capital e a composição prenderia toda política de cripto perto de -100%.

CélulaTradesBruto por tradeCustos por tradeLíquido por tradeRetorno líquido somado
Ações 1h1,560,113+0.62 bp3.30 bp-2.67 bp-10.65%
Ações 15m5,272,831+0.34 bp3.30 bp-2.96 bp-39.35%
Cripto 1h6,888,035-0.56 bp14.79 bp-15.36 bp-268.19%
Cripto 15m26,187,705-0.24 bp14.79 bp-15.02 bp-993.24%

Todos os sinais tomados. Os números por trade são médias sobre todos os trades executados; custos são spread, taxas e slippage, com o funding incorporado ao líquido.

As regras de ações ganham um pouco de dinheiro bruto e o perdem para um round trip de 3.3 bp. As regras de cripto não ganham nada bruto e ainda pagam 10 bp de taxa taker e 4 bp de slippage em cada round trip, então qualquer modelo de cripto começa cerca de 15 bp atrás.

Fig. 2: O que um trade ganha, paga e mantém na política selecionada. Alternar entre tomar todos os sinais, o filtro simples e cada uso do modelo mostra onde a vantagem bruta sobe e onde a barra de custo fica parada.

19 de 144 contrastes passam, e a afirmação geral falha

Dezenove contrastes superam todos os critérios: dez em ações de uma hora, sete em ações de 15 minutos, dois em cripto de 15 minutos e nenhum em cripto de uma hora. Nenhum contraste de cripto é creditado contra o filtro simples, e como a afirmação geral registrada exige os dois mercados, ela falha: o modelo melhora algumas dessas estratégias em alguns lugares, não essas estratégias em geral.

As três famílias de modelo aparecem entre os dezessete créditos em ações, e todos esses créditos, menos um, são filtros. O dimensionamento não é creditado em nenhuma das 48 tentativas, enquanto o ranqueamento é creditado três vezes contra a linha de base e nunca contra o filtro simples.

19 / 144
Contrastes registrados creditados
0 / 48
Contrastes de dimensionamento creditados
0 / 36
Contrastes de cripto creditados contra o filtro simples
Não
Afirmação geral: dois mercados, duas frequências
Uso do modeloCreditados contra a linha de baseCreditados contra o filtro simples
Filtro7 de 249 de 24
Dimensionamento0 de 240 de 24
Ranqueamento3 de 240 de 24

Dois desses créditos de ranqueamento estão em barras de 15 minutos de cripto, onde os books ranqueados perdem 910.91% e 927.76% do capital em retornos somados, contra 993.24% da linha de base. Compostos, os três books terminam em -99.99%, e o critério registrado de retorno líquido total lê isso como uma vitória por 0.00006.

O filtro simples também é um benchmark fraco. Contra o mesmo nulo de seleção aleatória, as escolhas dele se saem pior que o acaso em todas as células, com p empírico entre 0.896 e 0.998, o que favorece todo contraste medido contra ele.

Outros doze contrastes passam em todos os demais critérios e ainda assim falham, porque batem o comparador em todos os 43 meses: seis filtros de ações de 15 minutos e seis filtros de cripto de uma hora, cinco destes contra o filtro simples. Sem nenhum mês perdedor, a razão reward-to-risk fica sem denominador, e o avaliador congelado conta um valor indefinido como falha.

Contar esses doze daria 31 créditos e colocaria cripto de uma hora entre as células creditadas contra o filtro simples. A afirmação geral ainda falharia nas barras de 15 minutos de cripto, onde todo filtro aloca tão pouco capital que sua perda por unidade alocada é maior que a do filtro simples.

Fig. 3: Todos os contrastes registrados. Quadros preenchidos são creditados; quadros tracejados são os doze que superam todos os critérios exceto o de reward-to-risk, que fica indefinido quando uma política vence todos os meses; passar o mouse ou tocar num quadro mostra seus números.

Como os filtros de ações vencem

A maior parte da vantagem de cada filtro sobre a linha de base vem de operar menos. Em barras de 15 minutos de ações, os filtros tomam entre 4.8% e 13.0% dos sinais que a biblioteca produz, contra 57.7% do filtro simples, e um book que opera 5% de uma biblioteca perdedora perde menos só por isso.

A habilidade aparece no nulo de rotação, que entrega a um seletor aleatório o mesmo número de trades com a mesma exposição. Todo filtro creditado supera 95% dessas seleções aleatórias, com p empírico de 0.001, o que significa que os trades que os modelos mantêm são melhores que os que uma moeda manteria.

PolíticaSinais tomadosBruto por tradeLíquido por tradeRetorno líquido somadoExposição médiaSharpe diário
Tomar todos os sinais100%+0.34 bp-2.96 bp-39.35%19.6%-8.92
Filtro simples57.7%+0.40 bp-3.04 bp-23.31%11.8%-6.05
Linear, filtro de retorno líquido4.8%+3.92 bp+0.86 bp+0.55%1.4%0.33
Árvores com boosting, filtro de lucro6.7%+4.07 bp+0.84 bp+0.75%2.3%0.23
Rede neural, filtro de lucro9.5%+2.07 bp-1.18 bp-1.50%3.2%-0.45

Barras de 15 minutos de ações. Retorno líquido somado ao longo de 43 meses sobre o capital do book; exposição é a exposição bruta média.

O lucro bruto por trade sobe cerca de doze vezes nos melhores filtros, de 0.34 bp para aproximadamente 4 bp, o que supera o round trip de 3.3 bp por menos de um basis point.

Quanto vale a melhora

Três filtros de ações de 15 minutos terminam no lucro depois dos custos, somados ao longo de 43 meses: o filtro linear de retorno líquido com +0.55%, o filtro de árvores com boosting de retorno líquido com +0.55% e o filtro de árvores com boosting de lucro com +0.75%. Eles alocam em média entre 1.4% e 2.3% do capital, com Sharpe diário entre 0.20 e 0.33, e nenhum dos três lucros se distingue de zero isoladamente, já que um bootstrap do P&L semanal reamostrado por semana dá a cada book um intervalo de 95% que cruza o zero.

Só o linear é creditado, porque os dois filtros de árvores com boosting estão entre os contrastes que venceram todos os meses, enquanto os outros três filtros creditados de ações de 15 minutos perdem entre 0.98% e 3.78%.

Em ações de uma hora, todo filtro creditado ainda perde em termos absolutos, entre -0.23% e -1.77%, e o único ranqueamento creditado, árvores com boosting em barras de 15 minutos, termina em -8.53%. O único outro book positivo do estudo é o ranqueamento linear de lucro em ações de uma hora, com +0.84%, que não é creditado porque seu q-valor é 0.35 e cujo próprio intervalo semanal também cruza o zero.

Esse é o tamanho da melhora. A camada de modelo transforma uma biblioteca que perde muito numa quase zerada, que na maior parte do tempo aloca quase nenhum capital, levando as barras de 15 minutos de ações de -39.35% para algo entre -3.78% e +0.75%, dependendo do filtro.

Fig. 4: Retorno fora da amostra somado, semana a semana. Escolha uma célula e uma política de modelo; mude para só o modelo para ler a linha do próprio modelo em sua escala real, ou para antes dos custos para ver quanto da vantagem bruta os custos levam.

Por que cripto não acompanha

Em cripto, os filtros de árvores e de rede neural elevam o lucro bruto por trade de cerca de zero para algo entre +3.6 bp e +8.5 bp em barras de 15 minutos e entre +4.5 bp e +5.8 bp em barras de uma hora, enquanto o filtro linear de retorno líquido chega a +10.0 bp em barras de uma hora. É uma seleção mais forte que qualquer coisa em ações, mas com um round trip de 14.8 bp o melhor número líquido por trade ainda é -4.7 bp.

Cripto de uma hora é o que chega mais perto. Cinco dos seus filtros superam todos os critérios contra o filtro simples exceto o de reward-to-risk indefinido, e os seis batem escolhas aleatórias do mesmo tamanho, mas todos eles ainda perdem dinheiro, de -0.20% a -11.58%.

O filtro linear de retorno líquido em cripto de uma hora perde só 0.20% em retornos somados, e chega lá tomando 16,755 de 6,888,035 sinais e alocando em média 0.09% do capital. Entre os filtros de cripto, a vantagem bruta que os modelos encontram cobre entre um quarto e dois terços do custo de agir sobre ela.

Filtrar uma biblioteca de regras fraca com um modelo escolhe trades que batem escolhas aleatórias do mesmo tamanho, e em ações os melhores filtros multiplicam por doze o lucro bruto por trade. Os trades mantidos são poucos e magros demais para fazer diferença, e em cripto a vantagem que carregam é menor que a taxa.

Limitações

  • Vinte instrumentos, quatro células e 43 meses. O resultado descreve esta biblioteca nestes mercados, não machine learning em geral nem qualquer das duas classes de ativos como um todo.
  • Os trades saem por tempo, sem stops nem alvos, e uma biblioteca com outras saídas dá ao modelo outro alvo para aprender.
  • Os custos assumem o nível base de taxas da Binance sem execuções maker, então uma mesa que deixa ordens no book ou paga taxas menores enfrenta uma barreira menor em cripto, o que este estudo não mede.
  • Doze contrastes que vencem todos os meses, seis em barras de 15 minutos de ações e seis em barras de uma hora de cripto, são reportados como falhas porque o critério registrado de reward-to-risk fica indefinido quando nada perde. A regra foi fixada antes da rodada e é mantida como foi escrita.
  • Cada célula agrupa todas as 420 regras e os dez instrumentos num único modelo por mês, então modelos por família ou por instrumento seriam outro teste.
  • O purge entre o treino interno e a validação é de 16 barras de tempo de relógio, o que um trade de ações mantido durante a noite pode ultrapassar. Isso muda qual configuração vence dentro de uma janela, mas nunca a avaliação fora da amostra, e afeta menos de 0.1% das linhas de treino de ações nas janelas verificadas.
  • O ranqueamento entrega ao quinto selecionado todo o orçamento de entrada do lote, então os ranqueamentos do modelo de lucro carregam em média mais capital que a linha de base, de 30% a 38% contra 18% a 22%.

Todo gráfico desta página é desenhado no seu navegador a partir das tabelas de resultado e dos ledgers de trades do estudo, os mesmos números reportados no texto e na página de reprodutibilidade, sem arquivos de imagem por trás deles.

Metodologia completa

A grade de regras, a lista de features, a busca de modelos, o loop walk-forward, o modelo de custos e todas as verificações, com hashes e trechos de código.

Reprodutibilidade →