Revue de recherche · machine learning cross-sectional · étude 15
Cross-Sectional Machine Learning
Exécutez l'appareil identique dans le régime le plus fort du machine learning, en classant toute la coupe transversale à chaque barre au lieu de prévoir la direction d'une seule série, et le premier edge du programme survit à la déflation, atterrissant juste à côté du meilleur archétype statique sans le battre
Chaque résultat de machine learning plus tôt dans cette revue vivait dans le régime le plus faible du ML : prévoir la direction d'une seule série. Il a échoué à la déflation, exactement comme la littérature le prédit. Le test équitable du fil conducteur « rien ne franchit la significativité déflatée » est d'exécuter l'appareil identique de purged-cross-validation, Deflated Sharpe Ratio, Probability of Backtest Overfitting et N-effectif dans le régime le plus fort du ML, la prédiction cross-sectional des rendements, où à chaque barre vous classez tout l'univers et faites tourner le capital de manière neutre au marché vers les meilleurs noms. Le verdict s'inverse, partiellement. L'edge cross-sectional survit à la déflation, mais il approche plutôt qu'il ne bat le meilleur archétype statique de carry/momentum. Cette nuance est le résultat qui mérite d'être publié.
Advances in Financial ML, chap. 7 & 8
López de Prado (2018) · purged CV & feature importance
Code & données
lopez-de-prado-work-review / projects / 15
the claim
Ce que dit López de Prado
- Le machine learning ajoute de la valeur lorsqu'il prédit la coupe transversale des rendements sous une validation appropriée, et bien moins lorsqu'on lui demande de prévoir la direction d'une seule série, la coupe transversale est le régime défendable.
- Tout edge backtesté doit franchir le Deflated Sharpe Ratio face au nombre et à la dispersion des essais, et la Probability of Backtest Overfitting doit être faible pour qu'un classement in-sample signifie quoi que ce soit out-of-sample.
- Sur des données financières tabulaires, les arbres à gradient boosting égalent ou battent les réseaux de neurones profonds plus souvent que l'inverse.
our result
Ce que nous avons trouvé
- La séparation par régime est exactement telle que décrite. Le ML mono-série est un pile ou face ou pire en out-of-sample (PBO 0,62) et rien parmi les ~25 162 stratégies ne survit à la déflation. Le ML cross-sectional a un PBO faible (0,10), une forte persistance du classement in-sample vers out-of-sample (rho +0,78), et franchit la barre du Deflated Sharpe sur chaque horizon pour le modèle de référence (lgbm, 10 sur 10).
- L'edge est réel mais borné : profit factor médian out-of-sample de 1,123, net d'un modèle complet de coûts par exécution. Il atteint mais ne dépasse pas le meilleur archétype structurel statique (environ PF 1,17). Le titre honnête est que l'edge ML ≈ edge statique, aucun ne domine.
- Les arbres ont gagné le face-à-face sur la même tâche : lgbm, catboost et xgb franchissent ou approchent la barre de déflation (23 combinaisons d'arbres sur 30), tandis que deux familles neuronales exécutées sur le panel, le label, le walk-forward et le modèle de coûts identiques perdent de l'argent net de coûts et ne franchissent rien. Le résultat sur données tabulaires est confirmé sur nos propres données, pas seulement cité.
Le résultat en trois lignes
Inversion de régime · même appareil
Le régime ML le plus fort franchit la déflation
La prévision de direction mono-série (ML le plus faible) affiche un PBO de 0,62 et 0 stratégie sur ~25 162 survit à la déflation. Changez uniquement la cible de prédiction pour le classement cross-sectional (ML le plus fort) et l'arbre de référence franchit la barre du Deflated Sharpe sur 10 horizons sur 10, avec un PBO de 0,10 et une persistance du classement IS→OOS rho +0,78.
Edge ≈ statique · aucun ne domine
Réel, chiffré, survit à la déflation, mais borné
Le portefeuille long-short rotatif obtient un profit factor médian out-of-sample de 1,123 sur dix horizons, net de coûts complets par exécution. Cela atteint le meilleur archétype statique de carry/momentum (environ PF 1,17) par une voie différente, moins encombrée, mais ne le bat pas. La valeur du ML ici est la parité, pas un déjeuner gratuit.
Arbres battent réseaux · 23/30 vs 0
Même tâche, mêmes coûts, les arbres gagnent
Trois familles d'arbres à gradient boosting franchissent ou approchent la barre de déflation du False Strategy Theorem (lgbm 10/10, catboost 9/10, xgb 5/10, 23 combinaisons sur 30). Un réseau feed-forward et un réseau récurrent sur le panel, le label, le walk-forward et le modèle de coûts identiques atterrissent tous deux sous le seuil de rentabilité après coûts (PF ≤ 1, Sharpe négatif) et ne franchissent rien.
L'inversion de régime, mono-série vs cross-sectional
Changez uniquement la cible de prédiction, et le premier edge du programme survit à la déflation
Mêmes modèles, même labellisation triple-barrier, même purged walk-forward, même modèle de coûts. La seule chose qui change est la cible de prédiction. La direction mono-série demande à une seule série bruitée si elle monte ou descend ; l'audit du programme a estimé le nombre effectif de paris indépendants à environ 40 sur 25 162 stratégies nominales, et le meilleur in-sample atterrit dans la moitié inférieure out-of-sample 62 % du temps. La déflation tue tout cela.
La coupe transversale pose une question bien plus facile et plus stable, quels noms surperformeront lesquels, et agrège sur un univers large à chaque barre, ce qui moyenne le bruit idiosyncratique et produit un classement qui persiste out-of-sample (rho +0,78). Cette persistance est exactement ce qui lui permet de franchir la barre de déflation. L'inversion est la prédiction de la littérature, observée.
| régime | PBO | survie DSR | rho IS→OOS | PF OOS médian | verdict |
|---|---|---|---|---|---|
| single-series (ML weakest)pooled band, 25,162 strategies | 0.62 | 0 of 25,162 | n/a | ~1.0 | fails deflation |
| cross-sectional (ML strongest)gradient-boosted trees, 10 horizons | 0.10 | 10 of 10 horizons | +0.78 | 1.123 | survives deflation |
PBO via CSCV ; N-effectif via le ratio de participation des valeurs propres ; DSR via le benchmark du False Strategy Theorem, le tout issu de la boîte à outils de déflation du programme. Le PBO en titre et la persistance du classement sont les chiffres canoniques par fenêtre du moteur de rotation dédié (le bon axe d'essais). Le N-effectif est mesuré sur des axes différents (mono-série : environ 40 indépendants sur 25 162 ; cross-sectional : paris d'horizon indépendants au nombre de 10), donc les deux ne sont pas directement comparables. Le meilleur benchmark structurel statique de carry/momentum se situe à environ PF 1,17.
L'edge cross-sectional, horizon par horizon
Un portefeuille long-short rotatif par horizon de prévision
À chaque barre, classez l'univers vivant par un score d'arbre causal par nom, prenez long le quantile supérieur et short le quantile inférieur, neutre au marché, avec les boutons de dimensionnement des paris (quantile, long-only, tilt, throttle de rééquilibrage) ajustés in-sample par fenêtre walk-forward. Dix horizons ont été cherchés ; ils font partie de la même famille d'essais que la barre de déflation comptabilise. L'edge est le plus fort aux horizons courts à moyens et décline doucement à mesure que la période de détention grandit, cohérent avec une coupe transversale de momentum-et-reversal plutôt qu'avec un horizon chanceux. Le modèle de référence (lgbm) franchit le Deflated Sharpe rigoureux par horizon (ajusté pour l'asymétrie et le kurtosis, déflaté contre la famille de dix horizons) sur les dix.
| H (barres) | PF OOS | Sharpe OOS (ann.) | DSR | survit |
|---|---|---|---|---|
| 4 | 1.148 | 3.23 | ~1.00 | yes |
| 6 | 1.127 | 2.79 | ~1.00 | yes |
| 8 | 1.120 | 2.61 | ~1.00 | yes |
| 12 | 1.158 | 2.66 | ~1.00 | yes |
| 24 | 1.149 | 3.62 | ~1.00 | yes |
| 48 | 1.111 | 2.62 | ~1.00 | yes |
| 72 | 1.140 | 3.36 | ~1.00 | yes |
| 120 | 1.107 | 2.56 | ~1.00 | yes |
| 168 | 1.095 | 2.39 | ~1.00 | yes |
| 336 | 1.089 | 2.19 | ~1.00 | yes |
Le Sharpe annualisé utilise l'annualisation par fréquence de barre du moteur lui-même et est indicatif ; les rendements de rotation sont autocorrélés au sein d'une période de détention, donc le nombre effectif d'observations indépendantes, et le Sharpe honnête, sont inférieurs à ce que le décompte brut de barres suggère. Le verdict de déflation et le profit factor ne dépendent pas de ce choix d'annualisation. Chaque horizon est évalué sur environ 42 000 barres out-of-sample.
Le verdict de déflation, famille par famille
La survie cross-sectional n'est pas un artefact de modèle unique. Tout le balayage est traité comme une seule famille de tests multiples. Sous le False Strategy Theorem, le Sharpe maximum attendu qu'un chercheur sans compétence afficherait sur N essais est calculé à partir de la dispersion des estimations réalisées de Sharpe out-of-sample par barre, et une combinaison (famille, horizon) « franchit » seulement si son Sharpe out-of-sample dépasse cette barre. Au nombre d'essais en titre N=40, la barre est un Sharpe annualisé d'environ 1,76.
Cela fait 23 sur 30 combinaisons d'arbre franchissant une véritable barre de tests multiples, contre 0 sur environ 25 162 stratégies mono-série. Les trois familles ont été exécutées de bout en bout sur le même panel honnête vis-à-vis de la survie et le même purged walk-forward, de sorte que la survie est corroborée à travers des implémentations d'arbre indépendantes, pas affirmée à partir d'une seule. (Un PBO recalculé uniquement sur les dix colonnes d'horizon d'un modèle se lit 0,62 par construction, les horizons sont des paris quasi identiques du même modèle, donc cette vérification croisée est rapportée clairement étiquetée et n'est pas le titre ; le PBO canonique par fenêtre est 0,10.)
| famille | horizons franchis (sur 10) | PF OOS médian | verdict |
|---|---|---|---|
| lgbm | 10 of 10 | 1.123 | clears |
| catboost | 9 of 10 | 1.125 | clears (longest falls below) |
| xgb | 5 of 10 | 1.072 | partial |
Arbres versus réseaux de neurones sur la tâche identique
La contre-question équitable est de savoir si un réseau de neurones, étant donné le même panel, le même label de rang cross-sectional vers l'avant, le même purged walk-forward, la même recherche de dimensionnement de rotation et le même modèle de coûts par exécution, fait mieux. Le résultat répété de la littérature est que non. Nous avons testé cela directement plutôt que de l'affirmer : un réseau feed-forward par barre (mlp) et un réseau récurrent par paire (lstm) ont été exécutés sur un accélérateur géré (le panel complet dépasse une carte locale) et notés à partir de leurs ledgers out-of-sample réels contre la même barre du False Strategy Theorem que les arbres ont affrontée.
Ceci est une confirmation propre, sur la même tâche, du résultat tabulaire de la littérature sur nos propres données. Les familles neuronales ne sont pas un quasi-échec qu'un meilleur réglage sauverait ici, elles sont sous le seuil de rentabilité après coûts, tandis que les arbres franchissent une véritable décote de déflation. Les arbres battent les réseaux sur la rotation cross-sectional, sous des coûts et une validation identiques.
| famille | H | PF OOS | Sharpe OOS (ann.) | DSR | verdict |
|---|---|---|---|---|---|
| mlp | 24 | 0.984 | −0.40 | 0.13 | below bar |
| mlp | 72 | 0.982 | −0.44 | 0.11 | below bar |
| mlp | 168 | 0.983 | −0.42 | 0.12 | below bar |
| lstm | 6 | 0.940 | −1.51 | n/a | below bar |
Chaque ligne neuronale est notée à partir de son ledger out-of-sample réel par barre exactement sur l'appareil que les arbres ont utilisé, y compris la même barre du False Strategy. Les familles neuronales restantes (un ensemble gated-recurrent, un ensemble temporal-convolution et un ensemble cross-pair attention) n'ont pas produit de ledger utilisable lors de cette passe et sont enregistrées comme reportées, sans chiffre attaché, plutôt qu'estimées.
Multi-marché, l'edge tient-il hors du crypto ?
L'edge se réplique dans les actions américaines, mais sa significativité déflatée varie avec la largeur et la rotation
La coupe transversale crypto est un panel large de centaines d'instruments liquides. Pour vérifier si l'edge est une propriété de ce seul marché ou de l'idée de rotation, nous avons exécuté la recette identique sur un univers borné et liquide d'actions américaines large-cap, environ 240 noms, une médiane d'environ 245 vivants par barre, des barres journalières ajustées sur environ onze ans. À chaque barre nous classons l'univers vivant par le même score d'arbre causal par nom, faisons tourner long le quantile supérieur et short le quantile inférieur (neutre au marché), ajustons les boutons de rotation in-sample dans chaque fenêtre purged walk-forward, et facturons des coûts réalistes par exécution (médiane 3,4 pb/côté). La famille de modèle est l'arbre à gradient boosting qui a gagné en crypto.
L'edge brut survit au passage aux actions, mais il est plus mince. Le profit factor est dans le même voisinage que le crypto, un profit factor médian out-of-sample d'environ 1,105 sur les cinq horizons (crypto environ 1,123), culminant près de 1,15 à l'horizon de deux semaines, avec les horizons moyens les plus forts et les horizons très courts et très longs les plus faibles. Mais les ratios de Sharpe annualisés sont bien inférieurs à ceux du crypto (environ 0,3 à 0,7 contre environ 2,7 pour le crypto), parce qu'une rotation journalière d'actions a bien moins de rééquilibrages et un échantillon effectif bien plus petit qu'une rotation horaire sur un panel bien plus grand.
| H (jours) | PF OOS | Sharpe OOS (ann.) | DSR | survit |
|---|---|---|---|---|
| 1 | 1.096 | 0.44 | 0.75 | no |
| 5 | 1.105 | 0.53 | 0.83 | no |
| 10 | 1.149 | 0.74 | 0.94 | no |
| 21 | 1.132 | 0.66 | 0.91 | no |
| 63 | 1.060 | 0.29 | 0.59 | no |
Survie. L'univers d'actions est une liste fixe de membres large-cap actuels, donc les noms qui étaient large-cap plus tôt mais ont depuis quitté l'indice (radiations, rachats, rétrogradations) sont absents. Ceci est un léger biais haussier sur la jambe long ; le résultat est conscient de la survie mais pas exempt de survie, et doit être lu comme une borne plutôt supérieure qu'une estimation propre. Les cotations ultérieures n'entrent dans la coupe transversale qu'une fois qu'elles se négocient (gating dans la durée de vie), donc il n'y a pas de look-ahead sur des dates antérieures à la cotation. Une exécution entièrement exempte de survie sur un historique d'appartenance point-in-time est le prolongement naturel.
L'edge ML cross-sectional se réplique partiellement dans les actions américaines : le signe et l'ampleur du profit factor se reportent presque exactement, mais la significativité statistique non, parce que la rotation journalière large-cap a simplement moins d'information indépendante par unité de temps qu'un panel crypto horaire large. Cela affûte plutôt qu'il ne renverse le titre. Le régime cross-sectional est véritablement le régime ML le plus fort dans les deux marchés, il produit un edge réel, chiffré, positif là où la prévision de direction mono-série produit du bruit, mais que cet edge franchisse une décote de tests multiples dépend de la largeur et de la fréquence de rééquilibrage du panel : le panel le plus large et le plus rapide la franchit ; les actions large-cap journalières tombent tout juste en deçà.
Méthode
- Jambe mono-série : le corpus pooled band du programme de 25 162 stratégies de prévision de direction (labels triple-barrier, purged walk-forward, coûts par exécution), noté via la boîte à outils de déflation du programme (PBO via CSCV, N-effectif via le ratio de participation des valeurs propres, DSR via le False Strategy Theorem). Verdict : PBO 0,62, N-effectif environ 40, zéro survivant à la déflation.
- Jambe cross-sectional : un univers large de perpetual-swap honnête vis-à-vis de la survie de 787 paires. À chaque barre, classez l'univers vivant par un score d'arbre causal à gradient boosting par nom et faites tourner un portefeuille long-short neutre au marché vers les quantiles supérieur et inférieur, avec les boutons de dimensionnement des paris ajustés in-sample par fenêtre purged walk-forward. Dix horizons de prévision (4 à 336 barres), modèle complet de coûts par exécution. Données réelles uniquement.
- Comptabilité de déflation : tout le balayage cross-sectional est une seule famille de tests multiples. Le Sharpe maximum attendu sans compétence du False Strategy Theorem est calculé à partir de la dispersion du Sharpe OOS réalisé par barre sur les 30 combinaisons d'arbre achevées ; une combinaison ne franchit que si son Sharpe OOS dépasse cette barre. Le modèle de référence porte en outre un DSR rigoureux par horizon (ajusté pour l'asymétrie et le kurtosis, déflaté contre la famille de dix horizons).
- Familles d'arbres : lgbm, catboost et xgb ont été exécutés de bout en bout sur le panel complet. Random forest et extra-trees ont été coupés comme trop lents et trop gourmands en mémoire à pleine largeur ; les familles linéaires ont été arrêtées par le garde-mémoire en cours de recherche. Celles-ci ne portent aucun résultat et sont enregistrées comme reportées.
- Familles neuronales : un réseau feed-forward par barre (mlp) et un réseau récurrent par paire (lstm) ont été exécutés sur un accélérateur géré sur le panel, le label, le walk-forward, la recherche de dimensionnement et le modèle de coûts identiques, puis notés à partir de leurs ledgers OOS réels contre la même barre du False Strategy. Les ensembles gated-recurrent, temporal-convolution et cross-pair attention n'ont pas produit de ledger utilisable et sont reportés sans chiffre.
- Vérification multi-marché : le moteur cross-sectional non modifié sur un univers borné et liquide d'environ 240 noms large-cap américains, barres journalières ajustées sur environ onze ans (médiane environ 245 vivants par barre), cinq horizons (un jour à un trimestre), coûts réalistes par exécution (médiane 3,4 pb/côté). Conscient de la survie (membres actuels, gating dans la durée de vie) ; une mince exécution smoke bonus FX-et-secteur est conservée séparément.
Notes & évaluation honnête
Ceci comble la seule lacune structurelle du programme, il n'avait aucune couverture cross-sectional, et livre son premier edge ML survivant à la déflation. Le titre honnête est maintenu tout du long : l'edge ML cross-sectional approche mais ne bat pas le meilleur archétype structurel statique (environ PF 1,17). L'affirmation publiable est donc plus forte et plus défendable que « rien ne marche » : le machine learning gagne un edge cross-sectional réel, survivant à la déflation, mais il atterrit à peu près au même endroit où une stratégie statique bien construite de carry/momentum se trouve déjà. Edge ML ≈ edge statique ; aucun ne domine. La valeur du ML ici est la parité par une voie différente, moins encombrée, pas un déjeuner gratuit par rapport à la structure. Là où une statistique est recalculée sur un axe d'essais différent de celui du moteur dédié, le chiffre canonique par fenêtre est le titre et le recalcul est étiqueté comme vérification croisée ; les deux ne sont jamais confondus.
Reproductibilité
Les résultats mono-série et cross-sectional, le tableau de déflation au niveau des familles, les ledgers des familles neuronales, la jambe actions américaines, les figures et la boîte à outils de déflation sont rassemblés dans le projet 15 de lopez-de-prado-work-review. Les scripts d'analyse recalculent DSR, PBO et N-effectif à partir des ledgers conservés et sont idempotents et robustes aux entrées manquantes ; ils lisent les ledgers et n'entraînent rien.
Citer
Références
Les sources primaires du travail passé en revue ici :
- López de Prado, M. (2018). Advances in Financial Machine Learning. Wiley. (Ch. 7 purged cross-validation; Ch. 8 feature importance.)
- Bailey, D. H., & López de Prado, M. (2014). The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting, and Non-Normality. Journal of Portfolio Management, 40(5).
- Bailey, D. H., Borwein, J., López de Prado, M., & Zhu, Q. J. (2017). The Probability of Backtest Overfitting. Journal of Computational Finance, 20(4).
- López de Prado, M. (2019). A Data Science Solution to the Multiple-Testing Crisis in Financial Research. Journal of Financial Data Science, 1(1).
Voir aussi
L'étude compagnon sur la déflation des tests multiples est Backtest Overfitting & the Deflated Sharpe Ratio, la machinerie de labellisation et de purged-cross-validation est dans Labeling & Cross-Validation, le thème de la discipline de sélection traverse The edge is in the process, et le corpus de travail plus large est sur Research.

