Revisão de pesquisa · espinha dorsal metodológica · estudo 00
Sobreajuste de backtest e o Deflated Sharpe Ratio
Em cerca de 92.500 estratégias reais em cripto, ações e forex, a melhor parece uma estrela, e vira cara ou coroa assim que se contam os testes
Se você experimenta muitas configurações de estratégia e fica com a melhor, o Sharpe do backtest vencedor é inflado pela seleção e quase nada lhe diz. Este estudo constrói e verifica o aparato quantitativo que precifica essa inflação, o False Strategy Theorem, o Deflated Sharpe Ratio, a Probability of Backtest Overfitting e a contagem de testes efetivos, e então o aplica a três corpora reais, com custos integrais, abrangendo cerca de 92.500 estratégias: 50.000 em cripto, 22.500 em ações dos EUA e 20.000 em forex. Em cada uma dessas classes de ativos, a melhor estratégia isolada não supera o nulo de testes múltiplos, e a calculadora abaixo permite reproduzir o mecanismo central no navegador.
Deflated Sharpe Ratio (2014)
Bailey & López de Prado · J. Portfolio Management 40(5)
Código e dados
lopez-de-prado-work-review / projects / 00
the claim
O que diz López de Prado
- Se você experimenta muitas configurações de estratégia e fica com a melhor, o Sharpe do backtest vencedor é inflado pela seleção e quase nada lhe diz, portanto qualquer Sharpe reportado precisa ser descontado pelo número de testes.
- Ele construiu o aparato para precificar essa inflação: o False Strategy Theorem (o Sharpe máximo esperado de N testes sem habilidade, via a expansão de Euler–Mascheroni), o Deflated Sharpe Ratio, a Probability of Backtest Overfitting (CSCV) e a contagem de testes efetivos.
- Sua demonstração: um passeio aleatório puro varrido por milhares de nós de parâmetros produz um Sharpe anualizado acima de 1 só a partir de ruído, "qualquer pesquisador perseverante sempre conseguirá encontrar um backtest com o Sharpe ratio desejado."
our result
O que encontramos
- Aplicado a três corpora reais com custos integrais, cerca de 92.500 estratégias em cripto (50.000), ações dos EUA (22.500) e forex (20.000), a melhor estratégia isolada de cada classe de ativos fica abaixo do seu nulo pelo False Strategy Theorem (cripto 2,00 vs 2,72, ações 3,21 vs 10,89, forex 1,78 vs 7,70).
- O Deflated Sharpe da melhor do corpus é 0,029 em cripto e efetivamente 0,000 em ações e forex, todos muito abaixo da barra de 0,95; nada sobrevive à deflação.
- A contagem de testes efetivos confirma: as contagens nominais de testes colapsam para cerca de 434 / 39 / 26 apostas independentes. A ilusão não é uma peculiaridade da cripto, vale entre os mercados, e o DSR é o portão que todo estudo posterior precisa atravessar.
O resultado em três linhas
~92.500 estratégias · 3 classes de ativos
A melhor fica abaixo do nulo em toda parte
Três corpora reais com custos integrais, 50.000 estratégias de cripto (20 pares), 22.500 estratégias de ações dos EUA (9 ETFs) e 20.000 estratégias de forex (8 majors). Em cada classe de ativos a melhor isolada do corpus fica abaixo do nulo pelo False Strategy Theorem: cripto 2,00 vs 2,72, ações 3,21 vs 10,89, forex 1,78 vs 7,70. O que se obteria por sorte é maior do que o que foi encontrado.
DSR < 0,95
Nada sobrevive à deflação
O Deflated Sharpe Ratio da melhor do corpus é 0,029 em cripto e efetivamente 0,000 em ações e forex, todos muito abaixo da barra de 0,95. Mesmo a estratégia mais forte de cada mercado é estatisticamente indistinguível de um sorteio afortunado quando a seleção é contabilizada honestamente.
N efetivo: 434 · 39 · 26
Multimercado, com porteira no DSR
Agrupados, os 50.000 testes de cripto valem cerca de 434 apostas independentes, os 22.500 testes de ações cerca de 39 e os 20.000 testes de forex cerca de 26 (razão de participação dos autovalores). A conclusão passa pela porteira do Deflated Sharpe Ratio nas três classes de ativos, não por um único backtest.
Em escala, cerca de 92.500 estratégias reais em três classes de ativos
Em cripto, ações e forex, igualmente, a melhor do corpus fica abaixo do seu nulo
O arcabouço é construído e autotestado em uma grade limpa (abaixo), mas o verdadeiro teste é em escala, e em mais de uma classe de ativos. Três corpora sustentam o veredito: 50.000 estratégias de cripto otimizadas por walk-forward profundo em 20 pares de perpétuos, 22.500 estratégias de ações dos EUA em 9 ETFs e 20.000 estratégias de forex em 8 majors, cerca de 92.500 estratégias no total. Todas têm custos realistas: cripto carrega taxa, slippage e funding; ações e forex passam por uma camada de realismo com spreads conforme a hora do dia, comissão, rollover de FX / swap de quarta-feira tripla com fechamento forçado no fim de semana, e empréstimo de ações para venda a descoberto.
Em todas as três, a melhor isolada do corpus fica abaixo do máximo esperado do False Strategy Theorem para testes sem habilidade, e em nenhuma delas supera a barra de 0,95 do Deflated Sharpe. O alto Sharpe da melhor em ações, 3,21, é deriva de ETFs de índice long-beta minerada por testes correlacionados, ainda muito abaixo do seu nulo de 10,89 (DSR 0,000), com os 22.500 testes valendo apenas cerca de 39 apostas independentes. A ilusão não é uma peculiaridade da cripto; vale entre as classes de ativos.
| mercado | nº estrat | melhor SR | E[máx] nulo | DSR | PBO mediana | testes efet. |
|---|---|---|---|---|---|---|
| Cripto20 pares | 50,000 | 2.00 | 2.72 | 0.029 | 0.28 | 434 |
| Ações EUA9 ETFs | 22,500 | 3.21 | 10.89 | 0.000 | 0.00 | 39 |
| Forex8 majors | 20,000 | 1.78 | 7.70 | 0.000 | 0.005 | 26 |
melhor SR e E[máx] nulo são anualizados; o DSR usa a contagem nominal de testes com a dispersão empírica dos Sharpe dos testes (conservador). Em todos os mercados a melhor isolada fica abaixo do seu nulo pelo False Strategy Theorem e o Deflated Sharpe fica muito abaixo da barra de 0,95.
Cripto em detalhe, 50.000 estratégias, 20 pares
O corpus de cripto é composto por 2.500 estratégias otimizadas por walk-forward profundo em cada um de 20 pares de perpétuos, 50.000 estratégias no total, estruturalmente diversas e lidas de ledgers de produção por trade que já vêm com custos (taxa de 5 bp, slippage de 3 bp, funding de 1 bp).
A melhor do corpus anualiza para um Sharpe de 2,00. Isso parece uma estrela. Mas o False Strategy Theorem diz que o Sharpe máximo esperado de 50.000 testes sem habilidade é 2,72, maior do que o que foi encontrado. O Deflated Sharpe Ratio dessa melhor do corpus é 0,029, contra uma barra de 0,95. As 50.000 estratégias carregam apenas 434 apostas independentes, e a probability of backtest overfitting mediana por par é 0,28. Mesmo a estratégia mais forte entre 50.000 é cara ou coroa assim que se contam os testes.
estratégias
50.000
2.500 × 20 pares
melhor Sharpe do corpus
2,00
anualizado, líquido de custos
E[máx] nulo (N=50k)
2,72
False Strategy Theorem
Deflated Sharpe
0,029
a barra é 0,95
PBO mediana por par
0,28
CSCV
testes efetivos
434
de 50.000
A contagem de testes efetivos é o que torna o veredito honesto nessa escala. As estratégias dentro de um par são correlacionadas, então os 2.500 testes nominais por par valem apenas algumas centenas de apostas independentes; agrupadas em todos os 20 pares, as 50.000 estratégias colapsam para 434. O nulo recebe essa contagem efetiva, contar todas as 50.000 como independentes só faria a melhor descoberta parecer mais fácil de achar por sorte.
Os números abaixo são por par, direto dos ledgers de produção. A melhor de nenhum par supera o seu próprio nulo após a deflação.
| par | T (barras) | melhor SR | PBO | testes efet. |
|---|---|---|---|---|
| AAVE | 1,772 | 0.96 | 0.25 | 327 |
| ALGO | 626 | 2.00 | 0.27 | 211 |
| APE | 1,251 | 0.84 | 0.47 | 274 |
| ARB | 626 | 1.60 | 0.50 | 166 |
| ATOM | 626 | 1.88 | 0.32 | 180 |
| AVAX | 1,772 | 1.17 | 0.35 | 332 |
| BCH | 2,085 | 0.84 | 0.14 | 411 |
| BNB | 1,563 | 0.81 | 0.15 | 186 |
| BTC | 2,817 | 0.62 | 0.19 | 234 |
| DOGE | 2,189 | 0.80 | 0.29 | 357 |
| DOT | 626 | 1.92 | 0.48 | 193 |
| ETC | 626 | 1.21 | 0.62 | 173 |
| ETH | 2,921 | 0.90 | 0.22 | 339 |
| LINK | 2,398 | 0.99 | 0.19 | 510 |
| LTC | 2,816 | 0.65 | 0.13 | 445 |
| NEAR | 1,772 | 0.90 | 0.39 | 367 |
| SOL | 1,457 | 1.25 | 0.24 | 427 |
| TRX | 2,607 | 0.77 | 0.27 | 292 |
| UNI | 1,772 | 1.17 | 0.36 | 444 |
| XLM | 626 | 1.75 | 0.49 | 193 |
Melhor SR é o melhor Sharpe anualizado in-sample por par; testes efet. é a razão de participação dos autovalores da matriz de correlação dos retornos dos testes. Corpus agrupado: melhor 2,00 vs nulo 2,72, DSR 0,029, 434 testes efetivos.
Ações e forex, o mesmo quadro em escala
Uma ilustração controlada
O mesmo mecanismo, isolado em uma grade pequena e limpa, uma família estrutural, 136 testes por instrumento, de modo que a única coisa que varia é a seleção, não a ideia da estratégia.
Antes da rodada multimercado de cerca de 92.500 estratégias acima, o aparato foi construído e verificado em uma grade pequena e deliberadamente limpa: um único cruzamento de duas médias móveis varrido sobre 136 lookbacks (rápido, lento) por instrumento, em cripto, ações e forex. Esta é a ilustração controlada do mesmo efeito que o corpus mostra em escala, pequena o bastante para raciocinar sobre cada teste e ver o vencedor pousar na sua própria barra de sorte. Daqui em diante, um resultado só é "real" se supera o Deflated Sharpe Ratio após uma contagem honesta dos testes.
A barra que uma descoberta precisa superar
O False Strategy Theorem dá o Sharpe máximo esperado de N testes sem habilidade sobre T observações. Qualquer Sharpe-alvo é alcançável por sorte com testes suficientes, então a única pergunta honesta é se um backtest supera a sua própria barra de sorte. A calculadora implementa o teorema diretamente, a expansão da CDF normal inversa com a correção de Euler–Mascheroni, e fixa um segundo painel nas medianas reais do estudo por mercado. Arraste N e T e veja a barra subir; carregue o corpus de 50.000 estratégias para ver a melhor de 50 mil pousar abaixo do seu nulo (E[máx] ≈ 2,72), ou a pequena grade N=136 para ver o mesmo efeito na ilustração controlada.
Demo, False Strategy Theorem / Deflated Sharpe
Escolha quantas configurações você testou (N) e quantas observações você tem (T). A calculadora retorna o Sharpe que você deveria esperar topar só por sorte, a barra que um edge real precisa superar. Depois teste o Sharpe do seu próprio backtest contra ela.
| mercado | melhor SR | E[máx] nulo | DSR | PBO |
|---|---|---|---|---|
| Cripto (50k · 20 pares) | 2.001 | 2.721 | 0.03 | 0.28 |
| Ações EUA (22,5k · 9 ETFs) | 3.206 | 10.886 | 0.00 | 0.00 |
| Forex (20k · 8 majors) | 1.779 | 7.701 | 0.00 | 0.01 |
Em cerca de 92.500 estratégias reais com custos integrais em três classes de ativos, o Sharpe da melhor isolada do corpus (vermelho) fica abaixo da sua barra de sorte (âmbar) em toda parte, cripto 2,00 vs 2,72, ações 3,21 vs 10,89, forex 1,78 vs 7,70, e o Deflated Sharpe nunca se aproxima da barra de 0,95. Carregue o corpus (N=50k) para traçar o caso da cripto no gráfico acima.
Com N=50,000 testes e T=1,700 observações, a barra de sorte é 1.632 anualizada. Seu Sharpe de 2.00 a supera, necessário mas não suficiente; o DSR completo também penaliza por assimetria, curtose e testes correlacionados.
O arcabouço foi autotestado contra Monte Carlo: a fórmula bate com a simulação a cerca de 1e-3 e converge (N=10: 0,050 vs 0,048; N=100: 0,080 vs 0,080; N=1000: 0,103 vs 0,103). Em um exemplo construído, um vencedor sem habilidade deflaciona para DSR 0,32 enquanto um edge genuíno por barra deflaciona para 0,87, a estatística cumpre o seu papel.
Na grade pequena também, a melhor está na sorte ou abaixo dela
Nos três mercados, o Sharpe in-sample mediano da melhor-entre-136 fica abaixo da expectativa do False Strategy Theorem para testes sem habilidade. O forex é o mais gritante: um Sharpe mediano da melhor-entre-136 de 0,53 contra um nulo de 1,06, você esperaria fazer melhor do que isso por acaso. Tendências fracas somadas ao spread tornam a significância deflacionada do forex a mais baixa das três.
Nada sobrevive à deflação
O Deflated Sharpe Ratio é a probabilidade de que o Sharpe verdadeiro do vencedor exceda o benchmark de máximo-esperado-sob-o-nulo, após corrigir pelo número de testes, sua dispersão e a assimetria e curtose dos retornos. O DSR mediano fica em 0,10–0,44 em toda parte, contra uma barra de significância de 0,95. Ao lado dele, a Probability of Backtest Overfitting chega a 0,70 em cripto: a melhor configuração in-sample tem mais chance do que não de ficar abaixo da mediana out-of-sample.
In-sample não é out-of-sample
Plotar o Sharpe in-sample de cada teste contra o seu Sharpe out-of-sample torna o sobreajuste visível: o melhor ponto in-sample não está nem perto do melhor ponto out-of-sample. O ranking pelo qual você teria selecionado não se sustenta.
136 testes ≈ 3 apostas independentes
A grade parece ter 136 testes, mas as estratégias são cerca de 55% correlacionadas par a par, então o número efetivo de testes independentes, a razão de participação dos autovalores da matriz de correlação dos retornos dos testes, é cerca de três. É exatamente por isso que o nulo precisa receber a contagem efetiva, não a nominal: contar todos os 136 como independentes subestimaria quão fácil foi encontrar o melhor sorteio.
O veredito expresso em anos
O Deflated Sharpe Ratio precifica a inflação como uma probabilidade; o Minimum Track Record Length (MinTRL) e o Minimum Backtest Length (MinBTL) a precificam em tempo. O MinTRL é o comprimento de histórico que seria necessário para que o melhor Sharpe superasse com confiança seu limiar de testes múltiplos; o MinBTL é o comprimento de histórico abaixo do qual se esperaria que uma busca sem habilidade, com aquele número de testes, produzisse por puro acaso um Sharpe tão alto quanto o observado.
O MinTRL é infinito nos três mercados: o melhor Sharpe já está no nível do seu limiar ou abaixo dele, de modo que nenhum histórico finito o torna crível diante dessa barra. O MinBTL é o mesmo veredito deflacionado dito em anos. A busca em cripto precisa de cerca de 4,5 anos de histórico para justificar 50.000 testes, mas rodou sobre aproximadamente 2,5; o forex precisa de cerca de 5,1 anos e rodou sobre aproximadamente 3,7. As buscas são simplesmente amplas demais para o histórico de que dispunham.
| mercado | melhor SR | limiar E[max] | histórico (anos) | MinTRL (anos) | MinBTL (anos) |
|---|---|---|---|---|---|
| CriptoALGO | 2.00 | 2.72 | 2.48 | infinite | 4.49 |
| Ações dos EUAQQQ | 3.21 | 10.89 | 19.35 | infinite | 1.60 |
| ForexUSDJPY | 1.78 | 7.70 | 3.71 | infinite | 5.12 |
Os índices de Sharpe são anualizados; o MinBTL usa a contagem nominal de testes. O MinTRL é infinito sempre que o melhor Sharpe está no nível do seu limiar ou abaixo dele. O MinBTL é o veredito do Deflated Sharpe Ratio expresso em anos de histórico necessário: cripto e forex rodaram bem aquém do seu.
Resumo por mercado, ilustração controlada da grade de MA (136 testes)
Valores medianos por mercado para a pequena grade controlada, líquidos de custos, em barras orientadas por informação. melhor SR é o melhor Sharpe anualizado in-sample; E[máx] nulo é a expectativa do False Strategy Theorem para testes sem habilidade; o DSR é o Deflated Sharpe Ratio; a PBO é a Probability of Backtest Overfitting; a última coluna é testes nominais → efetivos.
| mercado | melhor SR | E[máx] nulo | DSR | PBO | testes |
|---|---|---|---|---|---|
| Cripto (8 perpétuos) | 0.62 | 0.66 | 0.44 | 0.70 | 136 → 3 |
| Ações (7 ETFs) | 0.31 | 0.44 | 0.32 | 0.38 | 136 → 3 |
| Forex (8 majors) | 0.53 | 1.06 | 0.10 | 0.37 | 136 → 3 |
A consistência entre mercados é o ponto da ilustração: o efeito de testes múltiplos não é uma peculiaridade da cripto; ações e forex também o mostram na grade limpa. E a rodada de cerca de 92.500 estratégias no topo desta página é a mesma lição em escala, buscas reais, com custos integrais, nas três classes de ativos em que até a melhor estratégia isolada entre dezenas de milhares não supera o seu nulo.
Método
- Uma família estrutural por instrumento: um cruzamento de duas médias móveis varrido sobre uma grade de lookbacks (rápido, lento), 136 testes cada, de modo que a única coisa que varia é a seleção, não a ideia da estratégia.
- Barras orientadas por informação: dollar bars para cripto e ações (ações dentro do horário regular), tick bars para forex, com custos realistas não nulos aplicados ao giro (cripto 7 bp, ações 2 bp, forex 1 bp por unidade).
- A série de retornos líquidos por barra de cada teste alimenta o arcabouço, que retorna o melhor Sharpe anualizado in-sample, o Deflated Sharpe Ratio, a Probability of Backtest Overfitting (CSCV, 924 divisões) e o número efetivo de testes independentes.
- O False Strategy Theorem fornece o nulo: o Sharpe máximo esperado de N testes sem habilidade. Um Sharpe descoberto só é interessante se supera essa barra, e então o DSR o penaliza ainda mais por assimetria, curtose e testes correlacionados.
- Contagem de testes efetivos via a razão de participação dos autovalores da matriz de correlação dos retornos dos testes: testes correlacionados não são independentes, então o nulo recebe a contagem efetiva, não a nominal.
Notas e limitações
Ambas as rodadas deliberadamente não encontram nada, e essa é a descoberta. A grade controlada (uma família estrutural, 136 testes por instrumento) isola o mecanismo; a rodada multimercado de cerca de 92.500 estratégias mostra que ele sobrevive ao contato com buscas reais, de custos integrais, de milhares de testes correlacionados por instrumento em cripto, ações e forex. A CSCV usa doze blocos (924 combinações). O DSR usa a contagem nominal de testes com a dispersão empírica dos Sharpe dos testes, o que é conservador: alimentá-lo com a contagem efetiva elevaria ligeiramente o DSR, e o veredito "não significativo" se mantém de qualquer forma.
Reprodutibilidade
O arcabouço, seus autotestes e a rodada em escala estão reunidos no repositório complementar, projeto 00 de lopez-de-prado-work-review. A calculadora nesta página é autocontida: a fórmula do False Strategy Theorem e as medianas por mercado estão codificadas no componente, de modo que o mecanismo que ela ilustra se reproduz exatamente a cada carregamento.
Citar
Referências
As fontes primárias do aparato aqui revisado:
- Bailey, D. H., & López de Prado, M. (2014). The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting, and Non-Normality. Journal of Portfolio Management, 40(5).
- Bailey, D. H., Borwein, J., López de Prado, M., & Zhu, Q. J. (2017). The Probability of Backtest Overfitting. Journal of Computational Finance, 20(4).
- Bailey, D. H., Borwein, J., López de Prado, M., & Zhu, Q. J. (2014). Pseudo-Mathematics and Financial Charlatanism: The Effects of Backtest Overfitting on Out-of-Sample Performance. Notices of the AMS, 61(5).
- López de Prado, M. (2021). The False Strategy Theorem: A Financial Application of Experimental Mathematics. American Mathematical Monthly, 128(9).
- López de Prado, M. (2019). A Data Science Solution to the Multiple-Testing Crisis in Financial Research. Journal of Financial Data Science, 1(1).
Veja também
O tema de disciplina de seleção que percorre este estudo é desenvolvido de forma narrativa em The edge is in the process, e o corpo de trabalho mais amplo está em Research.

