Revue de recherche · socle méthodologique · étude 00
Surapprentissage de backtest et le Deflated Sharpe Ratio
Sur environ 92 500 stratégies réelles en crypto, actions et forex, la meilleure ressemble à une étoile, et tient du pile ou face dès qu'on compte les essais
Si vous essayez de nombreuses configurations de stratégie et ne gardez que la meilleure, le Sharpe de backtest du gagnant est gonflé par la sélection et ne vous apprend presque rien. Cette étude construit et vérifie l'appareil quantitatif qui chiffre ce gonflement, le False Strategy Theorem, le Deflated Sharpe Ratio, la Probability of Backtest Overfitting et le comptage des essais effectifs, puis l'applique à trois corpus réels, intégralement chiffrés en coûts, totalisant environ 92 500 stratégies : 50 000 en crypto, 22 500 en actions américaines et 20 000 en forex. Dans chacune de ces classes d'actifs, la meilleure stratégie isolée ne franchit pas l'hypothèse nulle des tests multiples, et le calculateur ci-dessous vous permet de reproduire le mécanisme central dans le navigateur.
Deflated Sharpe Ratio (2014)
Bailey & López de Prado · J. Portfolio Management 40(5)
Code et données
lopez-de-prado-work-review / projects / 00
the claim
Ce que dit López de Prado
- Si vous essayez de nombreuses configurations de stratégie et ne gardez que la meilleure, le Sharpe de backtest du gagnant est gonflé par la sélection et ne vous apprend presque rien, tout Sharpe rapporté doit donc être escompté en fonction du nombre d'essais.
- Il a construit l'appareil pour chiffrer ce gonflement : le False Strategy Theorem (le Sharpe maximal attendu de N essais sans compétence, via le développement d'Euler–Mascheroni), le Deflated Sharpe Ratio, la Probability of Backtest Overfitting (CSCV) et le comptage des essais effectifs.
- Sa démonstration : une marche aléatoire pure balayée sur des milliers de nœuds de paramètres produit un Sharpe annualisé supérieur à 1 à partir du seul bruit, « tout chercheur persévérant pourra toujours trouver un backtest doté du Sharpe ratio souhaité. »
our result
Ce que nous avons trouvé
- Appliqué à trois corpus réels intégralement chiffrés en coûts, environ 92 500 stratégies en crypto (50 000), actions américaines (22 500) et forex (20 000), la meilleure stratégie isolée de chaque classe d'actifs se situe sous son hypothèse nulle du False Strategy Theorem (crypto 2,00 contre 2,72, actions 3,21 contre 10,89, forex 1,78 contre 7,70).
- Le Deflated Sharpe de la meilleure du corpus est de 0,029 en crypto et de fait 0,000 en actions et forex, tous très en deçà du seuil de 0,95 ; rien ne survit à la déflation.
- Le comptage des essais effectifs le confirme : les comptes nominaux d'essais s'effondrent à environ 434 / 39 / 26 paris indépendants. L'illusion n'est pas une particularité de la crypto, elle tient d'un marché à l'autre, et le DSR est le verrou que toute étude ultérieure doit franchir.
Le résultat en trois lignes
~92 500 stratégies · 3 classes d'actifs
La meilleure est sous l'hypothèse nulle partout
Trois corpus réels intégralement chiffrés en coûts, 50 000 stratégies crypto (20 paires), 22 500 stratégies d'actions américaines (9 ETF) et 20 000 stratégies forex (8 devises majeures). Dans chaque classe d'actifs, la meilleure isolée du corpus se situe sous l'hypothèse nulle du False Strategy Theorem : crypto 2,00 contre 2,72, actions 3,21 contre 10,89, forex 1,78 contre 7,70. Ce que l'on obtiendrait par chance dépasse ce qui a été trouvé.
DSR < 0,95
Rien ne survit à la déflation
Le Deflated Sharpe Ratio de la meilleure du corpus est de 0,029 en crypto et de fait 0,000 en actions et forex, tous très en deçà du seuil de 0,95. Même la stratégie la plus forte de chaque marché est statistiquement indiscernable d'un tirage chanceux une fois la sélection honnêtement prise en compte.
N effectif : 434 · 39 · 26
Multimarché, sous verrou du DSR
Agrégés, les 50 000 essais crypto valent environ 434 paris indépendants, les 22 500 essais actions environ 39 et les 20 000 essais forex environ 26 (ratio de participation des valeurs propres). La conclusion est verrouillée sur le Deflated Sharpe Ratio dans les trois classes d'actifs, et non sur un unique backtest.
À grande échelle, environ 92 500 stratégies réelles sur trois classes d'actifs
En crypto, actions et forex pareillement, la meilleure du corpus est sous son hypothèse nulle
L'instrument est construit et autotesté sur une grille propre (ci-dessous), mais le véritable test est à grande échelle, et sur plus d'une classe d'actifs. Trois corpus portent le verdict : 50 000 stratégies crypto optimisées par walk-forward profond sur 20 paires de perpétuels, 22 500 stratégies d'actions américaines sur 9 ETF, et 20 000 stratégies forex sur 8 devises majeures, environ 92 500 stratégies au total. Chacune est chiffrée de façon réaliste : la crypto porte frais, slippage et funding ; actions et forex passent par une couche de réalisme avec spreads selon l'heure de la journée, commission, rollover de change / swap du mercredi triple avec clôture forcée le week-end, et emprunt de titres pour la vente à découvert sur actions.
Dans les trois cas, la meilleure isolée du corpus se situe sous le maximum attendu du False Strategy Theorem pour des essais sans compétence, et n'atteint le seuil de 0,95 du Deflated Sharpe dans aucun. Le Sharpe élevé de la meilleure en actions, 3,21, est une dérive d'ETF indiciels long-beta exploitée par des essais corrélés, toujours très en deçà de son hypothèse nulle de 10,89 (DSR 0,000), les 22 500 essais ne valant qu'environ 39 paris indépendants. L'illusion n'est pas une particularité de la crypto ; elle tient d'une classe d'actifs à l'autre.
| marché | nb strat | meilleur SR | E[max] nulle | DSR | PBO médiane | essais eff. |
|---|---|---|---|---|---|---|
| Crypto20 paires | 50,000 | 2.00 | 2.72 | 0.029 | 0.28 | 434 |
| Actions US9 ETF | 22,500 | 3.21 | 10.89 | 0.000 | 0.00 | 39 |
| Forex8 majeures | 20,000 | 1.78 | 7.70 | 0.000 | 0.005 | 26 |
meilleur SR et E[max] nulle sont annualisés ; le DSR utilise le compte nominal d'essais avec la dispersion empirique des Sharpe d'essais (conservateur). Sur chaque marché, la meilleure isolée est sous son hypothèse nulle du False Strategy Theorem et le Deflated Sharpe est très en deçà du seuil de 0,95.
La crypto en détail, 50 000 stratégies, 20 paires
Le corpus crypto compte 2 500 stratégies optimisées par walk-forward profond sur chacune des 20 paires de perpétuels, 50 000 stratégies au total, structurellement diverses et lues à partir de registres de production par transaction déjà chiffrés en coûts (frais de 5 bp, slippage de 3 bp, funding de 1 bp).
La meilleure du corpus s'annualise à un Sharpe de 2,00. Cela ressemble à une étoile. Mais le False Strategy Theorem indique que le Sharpe maximal attendu de 50 000 essais sans compétence est de 2,72, supérieur à ce qui a été trouvé. Le Deflated Sharpe Ratio de cette meilleure du corpus est de 0,029, face à un seuil de 0,95. Les 50 000 stratégies ne portent que 434 paris indépendants, et la probabilité médiane de surapprentissage de backtest par paire est de 0,28. Même la stratégie la plus forte sur 50 000 tient du pile ou face dès qu'on compte les essais.
stratégies
50 000
2 500 × 20 paires
meilleur Sharpe du corpus
2,00
annualisé, net de coûts
E[max] nulle (N=50k)
2,72
False Strategy Theorem
Deflated Sharpe
0,029
le seuil est 0,95
PBO médiane par paire
0,28
CSCV
essais effectifs
434
sur 50 000
C'est le comptage des essais effectifs qui rend le verdict honnête à cette échelle. Les stratégies d'une même paire sont corrélées, de sorte que les 2 500 essais nominaux par paire ne valent que quelques centaines de paris indépendants ; agrégées sur l'ensemble des 20 paires, les 50 000 stratégies s'effondrent à 434. L'hypothèse nulle reçoit ce compte effectif, compter les 50 000 comme indépendantes ne ferait que rendre la meilleure découverte plus facile à trouver par chance.
Les chiffres ci-dessous sont par paire, directement issus des registres de production. La meilleure d'aucune paire ne franchit sa propre hypothèse nulle après déflation.
| paire | T (barres) | meilleur SR | PBO | essais eff. |
|---|---|---|---|---|
| AAVE | 1,772 | 0.96 | 0.25 | 327 |
| ALGO | 626 | 2.00 | 0.27 | 211 |
| APE | 1,251 | 0.84 | 0.47 | 274 |
| ARB | 626 | 1.60 | 0.50 | 166 |
| ATOM | 626 | 1.88 | 0.32 | 180 |
| AVAX | 1,772 | 1.17 | 0.35 | 332 |
| BCH | 2,085 | 0.84 | 0.14 | 411 |
| BNB | 1,563 | 0.81 | 0.15 | 186 |
| BTC | 2,817 | 0.62 | 0.19 | 234 |
| DOGE | 2,189 | 0.80 | 0.29 | 357 |
| DOT | 626 | 1.92 | 0.48 | 193 |
| ETC | 626 | 1.21 | 0.62 | 173 |
| ETH | 2,921 | 0.90 | 0.22 | 339 |
| LINK | 2,398 | 0.99 | 0.19 | 510 |
| LTC | 2,816 | 0.65 | 0.13 | 445 |
| NEAR | 1,772 | 0.90 | 0.39 | 367 |
| SOL | 1,457 | 1.25 | 0.24 | 427 |
| TRX | 2,607 | 0.77 | 0.27 | 292 |
| UNI | 1,772 | 1.17 | 0.36 | 444 |
| XLM | 626 | 1.75 | 0.49 | 193 |
Meilleur SR est le meilleur Sharpe annualisé in-sample par paire ; essais eff. est le ratio de participation des valeurs propres de la matrice de corrélation des rendements d'essais. Corpus agrégé : meilleur 2,00 contre nulle 2,72, DSR 0,029, 434 essais effectifs.
Actions et forex, le même tableau à grande échelle
Une illustration contrôlée
Le même mécanisme, isolé sur une petite grille propre, une famille structurelle, 136 essais par instrument, de sorte que la seule chose qui varie est la sélection, et non l'idée de stratégie.
Avant le passage multimarché d'environ 92 500 stratégies ci-dessus, l'appareil a été construit et vérifié sur une petite grille délibérément propre : un unique croisement de deux moyennes mobiles balayé sur 136 lookbacks (rapide, lent) par instrument, en crypto, actions et forex. C'est l'illustration contrôlée du même effet que le corpus montre à grande échelle, assez petite pour raisonner sur chaque essai et voir le gagnant se poser sur sa propre barre de chance. À partir d'ici, un résultat n'est « réel » que s'il franchit le Deflated Sharpe Ratio après un comptage honnête des essais.
La barre qu'une découverte doit franchir
Le False Strategy Theorem donne le Sharpe maximal attendu de N essais sans compétence sur T observations. Tout Sharpe cible est atteignable par chance avec assez d'essais, de sorte que la seule question honnête est de savoir si un backtest dépasse sa propre barre de chance. Le calculateur implémente le théorème directement, le développement de la CDF normale inverse avec la correction d'Euler–Mascheroni, et fixe un second panneau aux médianes réelles de l'étude par marché. Faites glisser N et T et regardez la barre monter ; chargez le corpus de 50 000 stratégies pour voir la meilleure des 50 k se poser sous son hypothèse nulle (E[max] ≈ 2,72), ou la petite grille N=136 pour voir le même effet sur l'illustration contrôlée.
Démo, False Strategy Theorem / Deflated Sharpe
Choisissez combien de configurations vous avez essayées (N) et combien d'observations vous avez (T). Le calculateur renvoie le Sharpe que vous devriez vous attendre à rencontrer par la seule chance, la barre qu'un véritable edge doit franchir. Testez ensuite le Sharpe de votre propre backtest face à elle.
| marché | meilleur SR | E[max] nulle | DSR | PBO |
|---|---|---|---|---|
| Crypto (50k · 20 paires) | 2.001 | 2.721 | 0.03 | 0.28 |
| Actions US (22,5k · 9 ETF) | 3.206 | 10.886 | 0.00 | 0.00 |
| Forex (20k · 8 majeures) | 1.779 | 7.701 | 0.00 | 0.01 |
Sur environ 92 500 stratégies réelles intégralement chiffrées en coûts dans trois classes d'actifs, le Sharpe de la meilleure isolée du corpus (rouge) se situe sous sa barre de chance (ambre) partout, crypto 2,00 contre 2,72, actions 3,21 contre 10,89, forex 1,78 contre 7,70, et le Deflated Sharpe n'approche jamais le seuil de 0,95. Chargez le corpus (N=50k) pour tracer le cas de la crypto dans le graphique ci-dessus.
À N=50,000 essais et T=1,700 observations, la barre de chance est de 1.632 annualisée. Votre Sharpe de 2.00 la franchit, nécessaire mais pas suffisant ; le DSR complet pénalise aussi pour l'asymétrie, l'aplatissement et les essais corrélés.
L'instrument a été autotesté face à Monte Carlo : la formule concorde avec la simulation à environ 1e-3 et converge (N=10 : 0,050 contre 0,048 ; N=100 : 0,080 contre 0,080 ; N=1000 : 0,103 contre 0,103). Sur un exemple construit, un gagnant sans compétence se déflate à un DSR de 0,32 tandis qu'un véritable edge par barre se déflate à 0,87, la statistique fait son office.
Dans la petite grille aussi, la meilleure est au niveau de la chance ou en dessous
Sur les trois marchés, le Sharpe in-sample médian de la meilleure-des-136 se situe sous l'attente du False Strategy Theorem pour des essais sans compétence. Le forex est le plus frappant : un Sharpe médian de la meilleure-des-136 de 0,53 face à une hypothèse nulle de 1,06, vous devriez faire mieux que cela par hasard. Des tendances ténues et le spread font de la significativité déflatée du forex la plus basse des trois.
Rien ne survit à la déflation
Le Deflated Sharpe Ratio est la probabilité que le vrai Sharpe du gagnant dépasse le repère du maximum-attendu-sous-l'hypothèse-nulle, après correction du nombre d'essais, de leur dispersion, et de l'asymétrie et de l'aplatissement des rendements. Le DSR médian est de 0,10–0,44 partout, face à un seuil de significativité de 0,95. À ses côtés, la Probability of Backtest Overfitting atteint 0,70 en crypto : la meilleure configuration in-sample a plus de chances que l'inverse d'être sous la médiane out-of-sample.
In-sample n'est pas out-of-sample
Tracer le Sharpe in-sample de chaque essai face à son Sharpe out-of-sample rend le surapprentissage visible : le meilleur point in-sample n'est pas du tout proche du meilleur point out-of-sample. Le classement sur lequel vous auriez sélectionné ne se transpose pas.
136 essais ≈ 3 paris indépendants
La grille donne l'impression de 136 tests, mais les stratégies sont corrélées par paires à environ 55 %, de sorte que le nombre effectif d'essais indépendants, le ratio de participation des valeurs propres de la matrice de corrélation des rendements d'essais, est d'environ trois. C'est précisément pourquoi l'hypothèse nulle doit recevoir le compte effectif, et non le compte nominal : compter les 136 comme indépendants sous-estimerait la facilité avec laquelle le meilleur tirage a été trouvé.
Le verdict exprimé en années
Le Deflated Sharpe Ratio chiffre l'inflation sous forme de probabilité ; le Minimum Track Record Length (MinTRL) et le Minimum Backtest Length (MinBTL) la chiffrent en temps. Le MinTRL est la longueur d'historique qu'il faudrait pour que le meilleur Sharpe franchisse avec confiance son seuil de tests multiples ; le MinBTL est la longueur d'historique en deçà de laquelle une recherche sans compétence, comptant autant d'essais, produirait par simple chance un Sharpe aussi élevé que celui observé.
Le MinTRL est infini dans les trois marchés : le meilleur Sharpe se situe déjà au niveau de son seuil ou en dessous, de sorte qu'aucun historique fini ne le rend crédible face à cette barre. Le MinBTL est le même verdict déflaté, dit en années. La recherche en crypto exige environ 4,5 ans d'historique pour justifier 50 000 essais mais n'a tourné que sur environ 2,5 ; le forex exige environ 5,1 ans et n'a tourné que sur environ 3,7. Les recherches sont tout simplement trop larges pour l'historique dont elles disposaient.
| marché | meilleur SR | seuil E[max] | historique (ans) | MinTRL (ans) | MinBTL (ans) |
|---|---|---|---|---|---|
| CryptoALGO | 2.00 | 2.72 | 2.48 | infinite | 4.49 |
| Actions américainesQQQ | 3.21 | 10.89 | 19.35 | infinite | 1.60 |
| ForexUSDJPY | 1.78 | 7.70 | 3.71 | infinite | 5.12 |
Les ratios de Sharpe sont annualisés ; le MinBTL utilise le nombre nominal d'essais. Le MinTRL est infini chaque fois que le meilleur Sharpe se situe au niveau de son seuil ou en dessous. Le MinBTL est le verdict du Deflated Sharpe Ratio exprimé en années d'historique requis : la crypto et le forex ont tourné bien en deçà du leur.
Synthèse par marché, illustration contrôlée sur grille MA (136 essais)
Valeurs médianes par marché pour la petite grille contrôlée, nettes de coûts, sur des barres pilotées par l'information. meilleur SR est le meilleur Sharpe annualisé in-sample ; E[max] nulle est l'attente du False Strategy Theorem pour des essais sans compétence ; le DSR est le Deflated Sharpe Ratio ; la PBO est la Probability of Backtest Overfitting ; la dernière colonne est essais nominaux → effectifs.
| marché | meilleur SR | E[max] nulle | DSR | PBO | essais |
|---|---|---|---|---|---|
| Crypto (8 perpétuels) | 0.62 | 0.66 | 0.44 | 0.70 | 136 → 3 |
| Actions (7 ETF) | 0.31 | 0.44 | 0.32 | 0.38 | 136 → 3 |
| Forex (8 majeures) | 0.53 | 1.06 | 0.10 | 0.37 | 136 → 3 |
La cohérence entre marchés est tout l'intérêt de l'illustration : l'effet des tests multiples n'est pas une particularité de la crypto ; actions et forex le montrent aussi sur la grille propre. Et le passage d'environ 92 500 stratégies en haut de cette page est la même leçon à grande échelle, des recherches réelles, intégralement chiffrées en coûts, dans les trois classes d'actifs où même la meilleure stratégie isolée parmi des dizaines de milliers ne franchit pas son hypothèse nulle.
Méthode
- Une famille structurelle par instrument : un croisement de deux moyennes mobiles balayé sur une grille de lookbacks (rapide, lent), 136 essais chacun, de sorte que la seule chose qui varie est la sélection, et non l'idée de stratégie.
- Barres pilotées par l'information : dollar bars pour la crypto et les actions (actions dans les heures régulières), tick bars pour le forex, avec des coûts non nuls réalistes appliqués au turnover (crypto 7 bp, actions 2 bp, forex 1 bp par unité).
- La série de rendements nets par barre de chaque essai alimente l'instrument, qui renvoie le meilleur Sharpe annualisé in-sample, le Deflated Sharpe Ratio, la Probability of Backtest Overfitting (CSCV, 924 découpages) et le nombre effectif d'essais indépendants.
- Le False Strategy Theorem fournit l'hypothèse nulle : le Sharpe maximal attendu de N essais sans compétence. Un Sharpe découvert n'a d'intérêt que s'il franchit cette barre, et le DSR le pénalise alors davantage pour l'asymétrie, l'aplatissement et les essais corrélés.
- Comptage des essais effectifs via le ratio de participation des valeurs propres de la matrice de corrélation des rendements d'essais : des essais corrélés ne sont pas indépendants, l'hypothèse nulle reçoit donc le compte effectif, et non le compte nominal.
Notes et limites
Les deux passages ne trouvent délibérément rien, et c'est là le résultat. La grille contrôlée (une famille structurelle, 136 essais par instrument) isole le mécanisme ; le passage multimarché d'environ 92 500 stratégies montre qu'il survit au contact de recherches réelles, intégralement chiffrées en coûts, portant sur des milliers d'essais corrélés par instrument en crypto, actions et forex. La CSCV utilise douze blocs (924 combinaisons). Le DSR utilise le compte nominal d'essais avec la dispersion empirique des Sharpe d'essais, ce qui est conservateur : lui fournir le compte effectif relèverait légèrement le DSR, et le verdict « non significatif » tient dans les deux cas.
Reproductibilité
L'instrument, ses autotests et le passage à grande échelle sont réunis dans le dépôt compagnon, projet 00 de lopez-de-prado-work-review. Le calculateur de cette page est autonome : la formule du False Strategy Theorem et les médianes par marché sont encodées dans le composant, de sorte que le mécanisme qu'il illustre se reproduit à l'identique à chaque chargement.
Citer
Références
Les sources primaires de l'appareil examiné ici :
- Bailey, D. H., & López de Prado, M. (2014). The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting, and Non-Normality. Journal of Portfolio Management, 40(5).
- Bailey, D. H., Borwein, J., López de Prado, M., & Zhu, Q. J. (2017). The Probability of Backtest Overfitting. Journal of Computational Finance, 20(4).
- Bailey, D. H., Borwein, J., López de Prado, M., & Zhu, Q. J. (2014). Pseudo-Mathematics and Financial Charlatanism: The Effects of Backtest Overfitting on Out-of-Sample Performance. Notices of the AMS, 61(5).
- López de Prado, M. (2021). The False Strategy Theorem: A Financial Application of Experimental Mathematics. American Mathematical Monthly, 128(9).
- López de Prado, M. (2019). A Data Science Solution to the Multiple-Testing Crisis in Financial Research. Journal of Financial Data Science, 1(1).
Voir aussi
Le thème de la discipline de sélection qui traverse cette étude est développé de façon narrative dans The edge is in the process, et l'ensemble plus large des travaux se trouve sur Research.

