← Alpha
Alpha Research · · 13 min de lecture

Les stratégies de trading ont-elles besoin d’une raison économique ?

Soixante perpétuels Binance, deux bras de stratégies appariés sur leur allure en échantillon, et une question : écrire la raison d’abord change-t-il ce qui survit ?

Les praticiens répètent une affirmation si souvent qu’elle est devenue folklore : une stratégie que vous savez expliquer tiendra hors échantillon, celle que vous avez trouvée en cherchant ne tiendra pas. L’affirmation est testable et, à notre connaissance, n’a jamais été testée sur un corpus apparié.

Elle mérite d’être testée parce qu’elle porte beaucoup, décidant si un chercheur passe les six prochains mois à réfléchir à qui se trouve de l’autre côté du trade ou à construire de l’infrastructure de recherche. La plupart des desks ont déjà choisi leur camp, et le plus souvent sans preuve.

Un obstacle explique la rareté du test. La comparaison est presque toujours faite de manière déloyale, parce qu’une stratégie avec un mécanisme écrit et une stratégie trouvée par énumération reçoivent rarement le même budget de recherche, les mêmes coûts, les mêmes instruments ou la même période. Quel que soit le gagnant, le lecteur ne peut pas savoir si c’est la raison qui a compté ou le dispositif.

Cette étude fige tout cela et ne fait varier qu’une chose : le fait qu’un mécanisme économique ait été écrit avant le début de la recherche de paramètres. Soixante perpétuels Binance, dix-sept familles de stratégies réparties entre les deux bras qui comptent, un budget de recherche identique des deux côtés et dix-huit trimestres d’historique hors échantillon, le tout avec des spreads mesurés, de vrais frais d’exchange et le funding observé.

Reproductibilité

La règle d’univers, les définitions de familles, le modèle de coûts à spread mesuré, l’appariement et l’inférence vivent sur leur propre page, pour ne pas encombrer l’argument ici.

Lire la reproductibilité →

Ce que nous avons testé

Deux bras de stratégies passés dans un seul moteur, sur un panel de futures perpétuels Binance margés en USDT, en barres de 30 minutes.

Catalogue, bras C. Huit indicateurs techniques classiques : ATR, EMA, SMA, MACD, PPO, RSI, un niveau statique de RSI et le %K stochastique, chacun comparé à sa propre référence. Aucune affirmation n’est faite sur les raisons pour lesquelles l’un d’eux devrait fonctionner, puisque énumérer le catalogue est précisément la méthode.

Mécanisme d’abord, bras M. Neuf familles dont la règle d’entrée a été spécifiée pour exprimer un mécanisme économique écrit, qui nomme qui se trouve de l’autre côté du trade et pourquoi cette contrepartie traite pour des raisons autres que le profit attendu. Breakout par compression de volatilité, momentum de série temporelle, momentum de session, retournement de week-end, climax de volatilité, force relative contre BTC, gap fade, retournement de range et tendance de Keltner.

Les deux bras sont uniquement prix, ils voient donc la même information. Tous deux tirent leurs variantes d’une même bibliothèque partagée de 35 modificateurs, 11 transformations et 24 filtres de confluence, copiée textuellement depuis le générateur qui a produit les deux corpus d’origine puis hachée, de sorte que l’affirmation d’un vocabulaire commun est vérifiable plutôt qu’asserté. Chaque famille reçoit un budget identique de 945 configurations tentées par contrat et par fenêtre, ce qui laisse la règle d’entrée de base comme seule différence entre les bras.

Un troisième bras, onze familles à mécanisme qui lisent aussi le funding, l’open interest, la base, le flux d’ordres ou le positionnement, est porté comme secondaire enregistré. Il existe pour que « avoir une raison » ne soit pas silencieusement confondu avec « avoir plus de données ».

Pourquoi l’estimande est une différence

Les deux bras étaient censés perdre de l’argent net de coûts, et les deux en ont perdu. Ce n’est pas un problème, car la question n’est pas de savoir quel bras est rentable.

Les stratégies sont appariées à l’intérieur de chaque contrat et de chaque fenêtre sur le Sharpe en échantillon, dans un caliper de 0,05 unité de Sharpe annualisé, de façon gloutonne et sans remise. Deux stratégies qui semblaient aussi bonnes l’une que l’autre en échantillon sont mises face à face, et l’estimande est la différence de ce que chacune a conservé hors échantillon, ce qui fait du résultat une mesure de décroissance différentielle depuis un point de départ commun plutôt qu’une comparaison de performance.

L’appariement ne fonctionne que là où les bras se recouvrent : le recouvrement est donc une condition préalable et non un résultat. C’est aussi la raison pour laquelle aucun élargissement du caliper n’a été nécessaire : 6 812 171 paires appariées à 0,05.

Fig. 1: Sharpe en échantillon de chaque stratégie-fenêtre éligible, par bras. Descriptif : c’est la table de scores complète que lit l’apparieur, pas l’ensemble apparié. Les bras se recouvrent sur toute la plage où le caliper doit travailler.

Univers et coûts

Les contrats éligibles sont cotés en USDT, ont traité chaque jour du trimestre de classement d’octobre à décembre et ne sont ni des produits indiciels ni des doublons de redénomination. 141 contrats qualifient, et l’univers est le top 30 et le bottom 30 par notionnel quotidien médian, qui se séparent d’un facteur 20,0x contre un plancher enregistré de 10.

Les contrats proviennent du listing de l’archive brute et non de la liste actuelle de l’exchange. exchangeInfo ne renvoie que les contrats encore listés, si bien qu’un univers construit à partir de lui supprime silencieusement tout ce qui est mort. Dix-huit fenêtres trimestrielles non chevauchantes courent du 1er janvier 2022 au 30 juin 2026, chacune précédée d’un bloc de 12 mois en échantillon.

Les coûts sont de cinq basis points de frais taker par exécution, un spread mesuré par contrat-mois à partir d’aggTrades comme médiane du rebond entre transactions, chaque exécution payant la moitié du spread mesuré plus encore la moitié de celui-ci en provision de slippage. Le funding est l’événement observé et signé à sa vraie barre de règlement, valorisé au mark price publié, de sorte que les positions longues sont débitées quand le funding est positif.

Mesurer le spread plutôt que le supposer est la seule chose qui garde honnête le résultat de liquidité. Une constante de slippage de 3 bp aurait surfacturé BTCUSDT de plus de cent fois tout en collant à peu près aux contrats les plus fins, ce qui biaise exactement dans le sens du résultat de liquidité et l’aurait fabriqué.

Fig. 2: Spread médian mesuré par contrat, échelle log, coloré selon la strate attribuée à la date de sélection. Survolez une barre pour voir le contrat. Les deux lignes pointillées sont les médianes de strate : 1.597 bp contre 3.738 bp, un rapport de 2,3x.

Résultats

Le contraste primaire enregistré est la différence appariée de rendement net hors échantillon, mécanisme d’abord moins catalogue, agrégée sur les deux strates de liquidité.

D = 223.4 bp, avec un intervalle de confiance apparié à 95 % en clusters de semaines de [98.5, 344.8] basis points de capital fixe, p = 0.0018. L’intervalle est entièrement au-dessus de zéro.

Cette estimation repose sur 6 812 171 paires appariées, réparties sur 250 clusters de fragments de semaine et 1 642 jours de bourse, appariées à un caliper de 0,05 unité de Sharpe annualisé sans aucun élargissement.

Comme contrôle de cohérence, la même quantité calculée depuis les totaux par fenêtre de la table de scores donne 213.1 bp contre 223.4 bp depuis le ledger trade par trade, un écart relatif de 4,6 %. Ce sont deux chemins indépendants vers le même nombre, et ils ne sont pas identiques par construction, puisque le ledger exclut les trades à cheval sur une frontière de fenêtre.

ContrasteEstimationIntervalle à 95 %pp ajusté (BH)
Interaction de liquidité, D_H moins D_L-114.9 bp[-197.0, -16.4]0.01380.0184
Strate de forte liquidité, D_H171.2 bp[32.8, 295.6]0.0140.028
Strate de faible liquidité, D_L278.4 bp[131.4, 410.5]0.00040.0004
Ensemble d’information, bras exogène moins catalogue139.2 bp[-82.1, 361.2]0.21080.8431

Les quatre contrastes secondaires enregistrés partagent une même famille de Benjamini-Hochberg à 5 %. Trois des quatre rejettent après correction.

Fig. 3: Le contraste primaire enregistré et les quatre secondaires, avec leurs intervalles appariés à 95 % en clusters de semaines. Le contraste d’ensemble d’information est celui qui traverse zéro.

Le taux de survie, la part des stratégies appariées au rendement net hors échantillon positif, est de 29,74 % dans le bras catalogue contre 30,93 % dans le bras mécanisme d’abord, soit une différence de 1,19 point de pourcentage.

La décision enregistrée est qu’un mécanisme économique écrit prédit une meilleure rétention hors échantillon. C’est ce que dit le contraste primaire. Quatre réserves bornent sa portée, et la première est de taille.

+223.4
Mécanisme moins catalogue, bp de capital fixe
[98.5, 344.8]
Intervalle apparié à 95 %, bp
6.81M
Paires appariées à un caliper de 0,05
33%
De l’effet reproduit sur un corpus sans drift
7.5e-05
Différence de pente de décroissance
2.3x
Spread mesuré, strate fine contre liquide

Un tiers de l’effet appartient au vocabulaire de règles

Le même pipeline a tourné sur un corpus sans drift, où par construction aucune stratégie ne peut avoir d’avantage et où toute différence entre les bras est l’artefact d’auto-référence décrit dans les limites ci-dessous. Ce corpus a produit une différence appariée de 72.92 bp avec un intervalle de [-15.11, 166.60].

Rapportée aux 223.39 bp [98.52, 344.82] observés, l’estimation ponctuelle de l’artefact représente 33 % de l’effet observé. Sa borne haute de 166.60 bp se situe au-dessus de la borne basse de 98.52 bp de l’effet observé, si bien que les deux intervalles se recouvrent entre 98.52 et 166.60.

Fig. 4: L’effet observé face au même estimande mesuré sur un corpus sans drift, où rien ne peut avoir d’avantage. Tracés sur un seul axe parce que le recouvrement des deux intervalles est justement le sujet.

Dit honnêtement, l’affirmation est plus étroite que la décision. Une différence appariée d’environ 220 basis points a été observée, dont quelque chose comme un tiers est attribuable à une propriété du vocabulaire de règles partagé plutôt qu’à la présence d’un mécanisme économique, et la séparation entre les deux n’est pas nette. L’effet corrigé de l’artefact tourne autour de 150 bp, mais cette soustraction n’a aucun intervalle conjoint derrière elle et doit se lire comme un ordre de grandeur, pas comme une estimation.

C’est un effet de niveau, pas une décroissance plus lente

Régresser le résultat hors échantillon sur le Sharpe en échantillon, sur l’ensemble apparié, donne une pente de 0.0549 [0.0465, 0.0634] pour le bras catalogue et 0.0550 [0.0481, 0.0621] pour le bras mécanisme d’abord. La différence vaut 0.000075 face à des intervalles individuels larges d’environ 0.015, donc la vitesse à laquelle la performance hors échantillon suit la performance en échantillon est indiscernable d’un bras à l’autre.

Fig. 5: À quelle pente le résultat hors échantillon suit le Sharpe en échantillon, par bras, avec des intervalles clusterisés par fenêtre. Les deux se superposent.

Cela compte pour la façon de reformuler le folklore. Les stratégies à mécanisme d’abord n’ont pas décru plus lentement, et appariées à Sharpe égal en échantillon elles ont simplement livré davantage hors échantillon, à pente identique, donc quoi que le mécanisme achète, ce n’est pas une résistance à la décroissance.

L’effet est plus grand là où la liquidité est plus fine

L’interaction entre strates vaut -114.94 bp [-197.04, -16.42] et survit à Benjamini-Hochberg avec un p ajusté de 0.0184. La strate de faible liquidité affiche 278.45 bp contre 171.24 bp pour la strate de forte liquidité, si bien que l’avantage est environ 60 % plus grand parmi les contrats les plus fins.

À lire avec prudence. La strate L est ici du low-mid-cap et non la queue contrainte en capacité, les spreads y sont 2,3 fois plus larges et mesurés plutôt que supposés, et la réserve sur l’artefact ci-dessus vaut pour les deux strates.

Les données exogènes n’ajoutent rien de détectable

Les familles qui lisent le funding, l’open interest, la base, le flux d’ordres et le positionnement par-dessus un mécanisme écrit rendent 139.15 bp [-82.10, 361.24], un intervalle qui traverse zéro avec un p ajusté de 0.843 par Benjamini-Hochberg. Sur ce corpus, ajouter de l’information non-prix à une règle à mécanisme n’a produit aucune amélioration mesurable par rapport à la référence catalogue.

Défauts trouvés avant publication

Six défauts ont été trouvés et corrigés pendant la construction. Chacun est consigné parce que chacun aurait produit un nombre plausible, et l’un d’eux l’a fait : la première analyse achevée a rapporté un résultat positif dans le sens que cette étude suppose, et c’était un artefact d’entrées corrompues.

Le funding était facturé sur des barres de règlement elles-mêmes absentes du panel, où le mark price publié et l’ouverture de barre manquent tous les deux, et la charge devenait non finie. Sur CVXUSDT cette condition survient sur exactement une barre sur 67 608, et a produit 1 092 lignes corrompues. Sur l’ensemble du corpus, 1 238 rendements hors échantillon sur 25 251 675 étaient non finis, ce qui suffit à faire retourner « rien » à toute estimation ponctuelle.

La moitié la plus grave est le garde-fou. L’écrivain de ledger refuse de persister un ledger dont les coûts ne se réconcilient pas, en testant si le résidu dépasse une tolérance. Un résidu non fini échoue à cette comparaison, si bien que chaque ligne empoisonnée a passé le contrôle construit précisément pour attraper de mauvais coûts, et 1,68 milliard de trades ont été certifiés cohérents. Testé ensuite sur une ligne non finie plantée, l’ancien contrôle rapporte un résidu de 1.7e-18 et conclut que le ledger se réconcilie proprement, ce qui est pire que de rater la corruption : il en a tiré une preuve positive de correction.

Ce qui l’a attrapé, c’est un contrôle croisé de cohérence ajouté plus tôt pour d’autres raisons, comparant la différence appariée calculée depuis la table de scores à la même quantité calculée depuis le ledger trade par trade, qui a imprimé une divergence et rendu la corruption visible. C’est le même contrôle rapporté plus haut, 213.1 contre 223.4 bp.

Trois autres défauts méritent d’être nommés parce qu’ils sont faciles à reproduire ailleurs. Les sorties sur cible s’exécutaient à l’ouverture de la barre de sortie plutôt qu’au prix cible, ce qui vaut jusqu’à 12,5 basis points par trade sur un chemin sans drift et dépasse tout le modèle de coûts, et n’agissait que sur les trades gagnants. Les identifiants de stratégie repartaient de zéro pour chaque contrat-famille, si bien que rejoindre les paires appariées à leurs rendements devenait ambigu et transformait 119 178 paires en 8 580 816 lignes. Le bootstrap clusterisait sur les dates de début de fenêtre, ce qui écrasait les fragments de semaine du lundi au dimanche enregistrés en un cluster par fenêtre, 18 au lieu des 250 que portent les données réalisées.

Apparié à Sharpe égal en échantillon, un mécanisme écrit valait environ 220 basis points hors échantillon, et un tiers environ ne valait rien du tout : le même vocabulaire le produit sur des données sans marché dedans.

Limites

  • Les énoncés de mécanisme sont des reconstructions. Les familles à mécanisme ont été écrites par le même chercheur après que le corpus catalogue était déjà connu pour échouer, et leurs mécanismes écrits ont été reconstruits depuis le dossier de conception d’origine plutôt que scellés à l’époque. Le bras M est mécanisme d’abord vis-à-vis de sa propre recherche de paramètres, pas aveugle vis-à-vis du résultat du catalogue. La notation en aveugle des énoncés limite ce biais sans l’éliminer.
  • Un artefact d’auto-référence est présent dans le vocabulaire de règles. Un signal dérivé de la série tradée, combiné à des barrières mises à l’échelle par la volatilité retardée de cette même série, ne rapporte pas zéro sur un corpus sans drift, où les deux bras perdent environ 550 basis points du seul fait de l’artefact. C’est une propriété du vocabulaire et non un défaut du moteur, elle ne disparaît donc pas en corrigeant du code, et c’est la raison pour laquelle un tiers du résultat principal n’est pas attribuable au mécanisme.
  • Les quatre premières fenêtres précèdent la date de sélection. L’univers a été classé sur le dernier trimestre 2022 alors que la période de revendication s’ouvre le 1er janvier 2022, donc quatre fenêtres sur dix-huit tradent un panel choisi en connaissant cette année-là. Les deux bras tradent les mêmes contrats dans les mêmes fenêtres, la différence appariée n’en est donc pas biaisée de façon évidente, mais le panel de ces fenêtres n’est pas point-in-time.
  • Les médianes hors échantillon d’un contrat ont été vues avant le gel. Lors d’un test de fumée du runner, un résumé a imprimé la médiane du rendement net hors échantillon par bras pour le seul BTCUSDT. Ces nombres ont été produits avant la découverte du défaut d’exécution sur cible et sont donc des artefacts, mais le fait est qu’ils ont été vus. L’analyse refuse désormais de tourner hors d’un mode protégé.
  • La strate de faible liquidité n’est pas la queue contrainte en capacité. Le contrat le plus fin de l’univers gelé traitait encore 5,0 M$ par jour sur le trimestre de classement. Tout ce qui est vraiment plus fin a été listé après la date de sélection, donc « faible liquidité » signifie ici low-mid-cap et aucune affirmation sur du capital institutionnel structurellement absent ne repose là-dessus.
  • La profondeur au repos serait un meilleur instrument de liquidité. daily/bookDepth donne le notionnel au repos à bandes fixes depuis le mid sur tout l’historique, ce qui est plus direct qu’un spread dérivé des transactions pour une étude stratifiée par liquidité. Il n’a pas été adopté, parce que la source de coût était déjà enregistrée et validée et qu’une valeur hors échantillon avait déjà été exposée à ce moment-là.

Chaque graphique de cette page est dessiné dans votre navigateur à partir des tables de résultats publiées de l’étude, les mêmes nombres que dans le texte et sur la page de reproductibilité. Il n’y a aucun fichier image derrière.

Méthodologie complète

Sources de données, règle d’univers, bibliothèque de variantes partagée, exécution et modèle de coûts à spread mesuré, boucle walk-forward, appariement, inférence et les vingt gates bloquants, avec extraits de code.

Reproductibilité →