Voltar para López de Prado

Revisão de pesquisa · espinha dorsal metodológica · estudo 00

Sobreajuste de backtest e o Deflated Sharpe Ratio

Em cerca de 92.500 estratégias reais em cripto, ações e forex, a melhor parece uma estrela, e vira cara ou coroa assim que se contam os testes

Se você experimenta muitas configurações de estratégia e fica com a melhor, o Sharpe do backtest vencedor é inflado pela seleção e quase nada lhe diz. Este estudo constrói e verifica o aparato quantitativo que precifica essa inflação, o False Strategy Theorem, o Deflated Sharpe Ratio, a Probability of Backtest Overfitting e a contagem de testes efetivos, e então o aplica a três corpora reais, com custos integrais, abrangendo cerca de 92.500 estratégias: 50.000 em cripto, 22.500 em ações dos EUA e 20.000 em forex. Em cada uma dessas classes de ativos, a melhor estratégia isolada não supera o nulo de testes múltiplos, e a calculadora abaixo permite reproduzir o mecanismo central no navegador.

fonte

Deflated Sharpe Ratio (2014)

Bailey & López de Prado · J. Portfolio Management 40(5)

Código e dados

lopez-de-prado-work-review / projects / 00

the claim

O que diz López de Prado

  • Se você experimenta muitas configurações de estratégia e fica com a melhor, o Sharpe do backtest vencedor é inflado pela seleção e quase nada lhe diz, portanto qualquer Sharpe reportado precisa ser descontado pelo número de testes.
  • Ele construiu o aparato para precificar essa inflação: o False Strategy Theorem (o Sharpe máximo esperado de N testes sem habilidade, via a expansão de Euler–Mascheroni), o Deflated Sharpe Ratio, a Probability of Backtest Overfitting (CSCV) e a contagem de testes efetivos.
  • Sua demonstração: um passeio aleatório puro varrido por milhares de nós de parâmetros produz um Sharpe anualizado acima de 1 só a partir de ruído, "qualquer pesquisador perseverante sempre conseguirá encontrar um backtest com o Sharpe ratio desejado."

our result

O que encontramos

  • Aplicado a três corpora reais com custos integrais, cerca de 92.500 estratégias em cripto (50.000), ações dos EUA (22.500) e forex (20.000), a melhor estratégia isolada de cada classe de ativos fica abaixo do seu nulo pelo False Strategy Theorem (cripto 2,00 vs 2,72, ações 3,21 vs 10,89, forex 1,78 vs 7,70).
  • O Deflated Sharpe da melhor do corpus é 0,029 em cripto e efetivamente 0,000 em ações e forex, todos muito abaixo da barra de 0,95; nada sobrevive à deflação.
  • A contagem de testes efetivos confirma: as contagens nominais de testes colapsam para cerca de 434 / 39 / 26 apostas independentes. A ilusão não é uma peculiaridade da cripto, vale entre os mercados, e o DSR é o portão que todo estudo posterior precisa atravessar.

O resultado em três linhas

~92.500 estratégias · 3 classes de ativos

A melhor fica abaixo do nulo em toda parte

Três corpora reais com custos integrais, 50.000 estratégias de cripto (20 pares), 22.500 estratégias de ações dos EUA (9 ETFs) e 20.000 estratégias de forex (8 majors). Em cada classe de ativos a melhor isolada do corpus fica abaixo do nulo pelo False Strategy Theorem: cripto 2,00 vs 2,72, ações 3,21 vs 10,89, forex 1,78 vs 7,70. O que se obteria por sorte é maior do que o que foi encontrado.

DSR < 0,95

Nada sobrevive à deflação

O Deflated Sharpe Ratio da melhor do corpus é 0,029 em cripto e efetivamente 0,000 em ações e forex, todos muito abaixo da barra de 0,95. Mesmo a estratégia mais forte de cada mercado é estatisticamente indistinguível de um sorteio afortunado quando a seleção é contabilizada honestamente.

N efetivo: 434 · 39 · 26

Multimercado, com porteira no DSR

Agrupados, os 50.000 testes de cripto valem cerca de 434 apostas independentes, os 22.500 testes de ações cerca de 39 e os 20.000 testes de forex cerca de 26 (razão de participação dos autovalores). A conclusão passa pela porteira do Deflated Sharpe Ratio nas três classes de ativos, não por um único backtest.

Em escala, cerca de 92.500 estratégias reais em três classes de ativos

Em cripto, ações e forex, igualmente, a melhor do corpus fica abaixo do seu nulo

Fig. 1:A ilusão de testes múltiplos em três classes de ativos. À esquerda: em cripto, ações dos EUA e forex o Sharpe anualizado da melhor isolada do corpus (cripto 2,00, ações 3,21, forex 1,78) fica abaixo do nulo pelo False Strategy Theorem (2,72, 10,89, 7,70). À direita: as contagens nominais de testes (50.000 / 22.500 / 20.000) colapsam para algumas centenas ou menos de apostas independentes efetivas (434 / 39 / 26). Nenhuma supera a barra de significância deflacionada.

O arcabouço é construído e autotestado em uma grade limpa (abaixo), mas o verdadeiro teste é em escala, e em mais de uma classe de ativos. Três corpora sustentam o veredito: 50.000 estratégias de cripto otimizadas por walk-forward profundo em 20 pares de perpétuos, 22.500 estratégias de ações dos EUA em 9 ETFs e 20.000 estratégias de forex em 8 majors, cerca de 92.500 estratégias no total. Todas têm custos realistas: cripto carrega taxa, slippage e funding; ações e forex passam por uma camada de realismo com spreads conforme a hora do dia, comissão, rollover de FX / swap de quarta-feira tripla com fechamento forçado no fim de semana, e empréstimo de ações para venda a descoberto.

Em todas as três, a melhor isolada do corpus fica abaixo do máximo esperado do False Strategy Theorem para testes sem habilidade, e em nenhuma delas supera a barra de 0,95 do Deflated Sharpe. O alto Sharpe da melhor em ações, 3,21, é deriva de ETFs de índice long-beta minerada por testes correlacionados, ainda muito abaixo do seu nulo de 10,89 (DSR 0,000), com os 22.500 testes valendo apenas cerca de 39 apostas independentes. A ilusão não é uma peculiaridade da cripto; vale entre as classes de ativos.

mercadonº estratmelhor SRE[máx] nuloDSRPBO medianatestes efet.
Cripto20 pares50,0002.002.720.0290.28434
Ações EUA9 ETFs22,5003.2110.890.0000.0039
Forex8 majors20,0001.787.700.0000.00526

melhor SR e E[máx] nulo são anualizados; o DSR usa a contagem nominal de testes com a dispersão empírica dos Sharpe dos testes (conservador). Em todos os mercados a melhor isolada fica abaixo do seu nulo pelo False Strategy Theorem e o Deflated Sharpe fica muito abaixo da barra de 0,95.

Cripto em detalhe, 50.000 estratégias, 20 pares

O corpus de cripto é composto por 2.500 estratégias otimizadas por walk-forward profundo em cada um de 20 pares de perpétuos, 50.000 estratégias no total, estruturalmente diversas e lidas de ledgers de produção por trade que já vêm com custos (taxa de 5 bp, slippage de 3 bp, funding de 1 bp).

A melhor do corpus anualiza para um Sharpe de 2,00. Isso parece uma estrela. Mas o False Strategy Theorem diz que o Sharpe máximo esperado de 50.000 testes sem habilidade é 2,72, maior do que o que foi encontrado. O Deflated Sharpe Ratio dessa melhor do corpus é 0,029, contra uma barra de 0,95. As 50.000 estratégias carregam apenas 434 apostas independentes, e a probability of backtest overfitting mediana por par é 0,28. Mesmo a estratégia mais forte entre 50.000 é cara ou coroa assim que se contam os testes.

Fig. 2:A distribuição do Sharpe anualizado das 50.000 estratégias de cripto. A melhor do corpus (Sharpe 2,00) fica à esquerda da barra do nulo pelo False Strategy Theorem (2,72), o máximo esperado de 50.000 testes sem habilidade é maior do que a melhor estratégia de fato encontrada.

estratégias

50.000

2.500 × 20 pares

melhor Sharpe do corpus

2,00

anualizado, líquido de custos

E[máx] nulo (N=50k)

2,72

False Strategy Theorem

Deflated Sharpe

0,029

a barra é 0,95

PBO mediana por par

0,28

CSCV

testes efetivos

434

de 50.000

Fig. 3:Probability of backtest overfitting por par (à esquerda) e número efetivo de testes independentes (à direita). A PBO se agrupa em torno da sua mediana de 0,28, e os 2.500 testes nominais por par colapsam para algumas centenas de apostas efetivas, agrupados no corpus, 50.000 testes valem cerca de 434.

A contagem de testes efetivos é o que torna o veredito honesto nessa escala. As estratégias dentro de um par são correlacionadas, então os 2.500 testes nominais por par valem apenas algumas centenas de apostas independentes; agrupadas em todos os 20 pares, as 50.000 estratégias colapsam para 434. O nulo recebe essa contagem efetiva, contar todas as 50.000 como independentes só faria a melhor descoberta parecer mais fácil de achar por sorte.

Os números abaixo são por par, direto dos ledgers de produção. A melhor de nenhum par supera o seu próprio nulo após a deflação.

parT (barras)melhor SRPBOtestes efet.
AAVE1,7720.960.25327
ALGO6262.000.27211
APE1,2510.840.47274
ARB6261.600.50166
ATOM6261.880.32180
AVAX1,7721.170.35332
BCH2,0850.840.14411
BNB1,5630.810.15186
BTC2,8170.620.19234
DOGE2,1890.800.29357
DOT6261.920.48193
ETC6261.210.62173
ETH2,9210.900.22339
LINK2,3980.990.19510
LTC2,8160.650.13445
NEAR1,7720.900.39367
SOL1,4571.250.24427
TRX2,6070.770.27292
UNI1,7721.170.36444
XLM6261.750.49193

Melhor SR é o melhor Sharpe anualizado in-sample por par; testes efet. é a razão de participação dos autovalores da matriz de correlação dos retornos dos testes. Corpus agrupado: melhor 2,00 vs nulo 2,72, DSR 0,029, 434 testes efetivos.

Ações e forex, o mesmo quadro em escala

Fig. 4:Ações dos EUA, 22.500 estratégias em 9 ETFs. A melhor do corpus (Sharpe 3,21) é deriva de ETFs de índice long-beta minerada por testes correlacionados, mas fica bem abaixo do nulo pelo False Strategy Theorem (10,89): DSR 0,000, apenas cerca de 39 apostas independentes efetivas entre 22.500.
Fig. 5:Forex, 20.000 estratégias em 8 majors. A melhor do corpus (Sharpe 1,78) fica bem abaixo do nulo pelo False Strategy Theorem (7,70): DSR 0,000, PBO mediana 0,005, apenas cerca de 26 apostas independentes efetivas entre 20.000.

Uma ilustração controlada

O mesmo mecanismo, isolado em uma grade pequena e limpa, uma família estrutural, 136 testes por instrumento, de modo que a única coisa que varia é a seleção, não a ideia da estratégia.

Antes da rodada multimercado de cerca de 92.500 estratégias acima, o aparato foi construído e verificado em uma grade pequena e deliberadamente limpa: um único cruzamento de duas médias móveis varrido sobre 136 lookbacks (rápido, lento) por instrumento, em cripto, ações e forex. Esta é a ilustração controlada do mesmo efeito que o corpus mostra em escala, pequena o bastante para raciocinar sobre cada teste e ver o vencedor pousar na sua própria barra de sorte. Daqui em diante, um resultado só é "real" se supera o Deflated Sharpe Ratio após uma contagem honesta dos testes.

A barra que uma descoberta precisa superar

O False Strategy Theorem dá o Sharpe máximo esperado de N testes sem habilidade sobre T observações. Qualquer Sharpe-alvo é alcançável por sorte com testes suficientes, então a única pergunta honesta é se um backtest supera a sua própria barra de sorte. A calculadora implementa o teorema diretamente, a expansão da CDF normal inversa com a correção de Euler–Mascheroni, e fixa um segundo painel nas medianas reais do estudo por mercado. Arraste N e T e veja a barra subir; carregue o corpus de 50.000 estratégias para ver a melhor de 50 mil pousar abaixo do seu nulo (E[máx] ≈ 2,72), ou a pequena grade N=136 para ver o mesmo efeito na ilustração controlada.

Demo, False Strategy Theorem / Deflated Sharpe

Escolha quantas configurações você testou (N) e quantas observações você tem (T). A calculadora retorna o Sharpe que você deveria esperar topar só por sorte, a barra que um edge real precisa superar. Depois teste o Sharpe do seu próprio backtest contra ela.

E[máx SR] sob o nulo
N, número de testes50,000
1101001k10k100k
T, observações (barras)1700
Seu Sharpe anualizado2.00
barra de sorte, E[máx SR], anualizada
1.632
seu Sharpe vs barra
+0.368
p(edge é real) no estilo DSR
0.83
SHARPE ANUALIZADO, seu backtest vs a barra de sorte0.00.51.01.52.0barra de sorte1.632seu SR2.00N=50,000 · T=1,700 · supera a barra
Em escala, melhor isolada do corpus vs seu próprio nulo, por classe de ativos
mercadomelhor SRE[máx] nuloDSRPBO
Cripto (50k · 20 pares)2.0012.7210.030.28
Ações EUA (22,5k · 9 ETFs)3.20610.8860.000.00
Forex (20k · 8 majors)1.7797.7010.000.01

Em cerca de 92.500 estratégias reais com custos integrais em três classes de ativos, o Sharpe da melhor isolada do corpus (vermelho) fica abaixo da sua barra de sorte (âmbar) em toda parte, cripto 2,00 vs 2,72, ações 3,21 vs 10,89, forex 1,78 vs 7,70, e o Deflated Sharpe nunca se aproxima da barra de 0,95. Carregue o corpus (N=50k) para traçar o caso da cripto no gráfico acima.

Com N=50,000 testes e T=1,700 observações, a barra de sorte é 1.632 anualizada. Seu Sharpe de 2.00 a supera, necessário mas não suficiente; o DSR completo também penaliza por assimetria, curtose e testes correlacionados.

O arcabouço foi autotestado contra Monte Carlo: a fórmula bate com a simulação a cerca de 1e-3 e converge (N=10: 0,050 vs 0,048; N=100: 0,080 vs 0,080; N=1000: 0,103 vs 0,103). Em um exemplo construído, um vencedor sem habilidade deflaciona para DSR 0,32 enquanto um edge genuíno por barra deflaciona para 0,87, a estatística cumpre o seu papel.

Fig. 6:Ilustração controlada da grade de MA (136 testes). Melhor Sharpe in-sample (observado) versus o Sharpe máximo esperado de testes sem habilidade (o nulo pelo False Strategy Theorem). Em todos os mercados a melhor observada está na ou abaixo da linha do nulo, o edge aparente é o que 136 testes compram por sorte.

Na grade pequena também, a melhor está na sorte ou abaixo dela

Nos três mercados, o Sharpe in-sample mediano da melhor-entre-136 fica abaixo da expectativa do False Strategy Theorem para testes sem habilidade. O forex é o mais gritante: um Sharpe mediano da melhor-entre-136 de 0,53 contra um nulo de 1,06, você esperaria fazer melhor do que isso por acaso. Tendências fracas somadas ao spread tornam a significância deflacionada do forex a mais baixa das três.

Nada sobrevive à deflação

O Deflated Sharpe Ratio é a probabilidade de que o Sharpe verdadeiro do vencedor exceda o benchmark de máximo-esperado-sob-o-nulo, após corrigir pelo número de testes, sua dispersão e a assimetria e curtose dos retornos. O DSR mediano fica em 0,10–0,44 em toda parte, contra uma barra de significância de 0,95. Ao lado dele, a Probability of Backtest Overfitting chega a 0,70 em cripto: a melhor configuração in-sample tem mais chance do que não de ficar abaixo da mediana out-of-sample.

Fig. 7:Ilustração controlada da grade de MA (136 testes). Deflated Sharpe Ratio por instrumento (à esquerda) e Probability of Backtest Overfitting (à direita). O DSR de nenhum instrumento se aproxima da barra de 0,95; a PBO mediana de 0,70 da cripto diz que o vencedor in-sample em geral cai na metade inferior out-of-sample.
Fig. 8:Ilustração controlada da grade de MA (136 testes). Sharpe in-sample versus out-of-sample na grade de testes. A configuração que você teria escolhido in-sample não é a que vence out-of-sample, a assinatura clássica de seleção sobre ruído.

In-sample não é out-of-sample

Plotar o Sharpe in-sample de cada teste contra o seu Sharpe out-of-sample torna o sobreajuste visível: o melhor ponto in-sample não está nem perto do melhor ponto out-of-sample. O ranking pelo qual você teria selecionado não se sustenta.

136 testes ≈ 3 apostas independentes

A grade parece ter 136 testes, mas as estratégias são cerca de 55% correlacionadas par a par, então o número efetivo de testes independentes, a razão de participação dos autovalores da matriz de correlação dos retornos dos testes, é cerca de três. É exatamente por isso que o nulo precisa receber a contagem efetiva, não a nominal: contar todos os 136 como independentes subestimaria quão fácil foi encontrar o melhor sorteio.

Fig. 9:Ilustração controlada da grade de MA (136 testes). Testes nominais versus efetivos por instrumento. A grade de 136 pontos colapsa para cerca de três apostas independentes quando se contabiliza a correlação entre testes.

O veredito expresso em anos

O Deflated Sharpe Ratio precifica a inflação como uma probabilidade; o Minimum Track Record Length (MinTRL) e o Minimum Backtest Length (MinBTL) a precificam em tempo. O MinTRL é o comprimento de histórico que seria necessário para que o melhor Sharpe superasse com confiança seu limiar de testes múltiplos; o MinBTL é o comprimento de histórico abaixo do qual se esperaria que uma busca sem habilidade, com aquele número de testes, produzisse por puro acaso um Sharpe tão alto quanto o observado.

O MinTRL é infinito nos três mercados: o melhor Sharpe já está no nível do seu limiar ou abaixo dele, de modo que nenhum histórico finito o torna crível diante dessa barra. O MinBTL é o mesmo veredito deflacionado dito em anos. A busca em cripto precisa de cerca de 4,5 anos de histórico para justificar 50.000 testes, mas rodou sobre aproximadamente 2,5; o forex precisa de cerca de 5,1 anos e rodou sobre aproximadamente 3,7. As buscas são simplesmente amplas demais para o histórico de que dispunham.

Fig. 10:Comprimento de histórico observado versus o comprimento necessário para confiar no melhor de cada busca (escala logarítmica, anos). Cripto e forex ficam aquém de seu MinBTL com N nominal (cerca de 4,5 anos contra 2,5, e 5,1 contra 3,7); somente ações, sobre quase duas décadas de dados, superam sua barra, e ainda assim seu melhor falha no teste deflacionado porque seu limiar é muito alto. O MinTRL é infinito em todos os mercados.
mercadomelhor SRlimiar E[max]histórico (anos)MinTRL (anos)MinBTL (anos)
CriptoALGO2.002.722.48infinite4.49
Ações dos EUAQQQ3.2110.8919.35infinite1.60
ForexUSDJPY1.787.703.71infinite5.12

Os índices de Sharpe são anualizados; o MinBTL usa a contagem nominal de testes. O MinTRL é infinito sempre que o melhor Sharpe está no nível do seu limiar ou abaixo dele. O MinBTL é o veredito do Deflated Sharpe Ratio expresso em anos de histórico necessário: cripto e forex rodaram bem aquém do seu.

Resumo por mercado, ilustração controlada da grade de MA (136 testes)

Valores medianos por mercado para a pequena grade controlada, líquidos de custos, em barras orientadas por informação. melhor SR é o melhor Sharpe anualizado in-sample; E[máx] nulo é a expectativa do False Strategy Theorem para testes sem habilidade; o DSR é o Deflated Sharpe Ratio; a PBO é a Probability of Backtest Overfitting; a última coluna é testes nominais → efetivos.

mercadomelhor SRE[máx] nuloDSRPBOtestes
Cripto (8 perpétuos)0.620.660.440.70136 → 3
Ações (7 ETFs)0.310.440.320.38136 → 3
Forex (8 majors)0.531.060.100.37136 → 3

A consistência entre mercados é o ponto da ilustração: o efeito de testes múltiplos não é uma peculiaridade da cripto; ações e forex também o mostram na grade limpa. E a rodada de cerca de 92.500 estratégias no topo desta página é a mesma lição em escala, buscas reais, com custos integrais, nas três classes de ativos em que até a melhor estratégia isolada entre dezenas de milhares não supera o seu nulo.

Método

  • Uma família estrutural por instrumento: um cruzamento de duas médias móveis varrido sobre uma grade de lookbacks (rápido, lento), 136 testes cada, de modo que a única coisa que varia é a seleção, não a ideia da estratégia.
  • Barras orientadas por informação: dollar bars para cripto e ações (ações dentro do horário regular), tick bars para forex, com custos realistas não nulos aplicados ao giro (cripto 7 bp, ações 2 bp, forex 1 bp por unidade).
  • A série de retornos líquidos por barra de cada teste alimenta o arcabouço, que retorna o melhor Sharpe anualizado in-sample, o Deflated Sharpe Ratio, a Probability of Backtest Overfitting (CSCV, 924 divisões) e o número efetivo de testes independentes.
  • O False Strategy Theorem fornece o nulo: o Sharpe máximo esperado de N testes sem habilidade. Um Sharpe descoberto só é interessante se supera essa barra, e então o DSR o penaliza ainda mais por assimetria, curtose e testes correlacionados.
  • Contagem de testes efetivos via a razão de participação dos autovalores da matriz de correlação dos retornos dos testes: testes correlacionados não são independentes, então o nulo recebe a contagem efetiva, não a nominal.

Notas e limitações

Ambas as rodadas deliberadamente não encontram nada, e essa é a descoberta. A grade controlada (uma família estrutural, 136 testes por instrumento) isola o mecanismo; a rodada multimercado de cerca de 92.500 estratégias mostra que ele sobrevive ao contato com buscas reais, de custos integrais, de milhares de testes correlacionados por instrumento em cripto, ações e forex. A CSCV usa doze blocos (924 combinações). O DSR usa a contagem nominal de testes com a dispersão empírica dos Sharpe dos testes, o que é conservador: alimentá-lo com a contagem efetiva elevaria ligeiramente o DSR, e o veredito "não significativo" se mantém de qualquer forma.

Reprodutibilidade

O arcabouço, seus autotestes e a rodada em escala estão reunidos no repositório complementar, projeto 00 de lopez-de-prado-work-review. A calculadora nesta página é autocontida: a fórmula do False Strategy Theorem e as medianas por mercado estão codificadas no componente, de modo que o mecanismo que ela ilustra se reproduz exatamente a cada carregamento.

Citar

Referências

As fontes primárias do aparato aqui revisado:

Veja também

O tema de disciplina de seleção que percorre este estudo é desenvolvido de forma narrativa em The edge is in the process, e o corpo de trabalho mais amplo está em Research.