← Alpha
Alpha Research · · 14 min de lecture

L'apprentissage par renforcement peut-il trader la crypto de façon rentable ?

Les 219 exécutions ont toutes perdu de l’argent. Trois des six fonctions de récompense ont dégagé un rendement positif avant coûts et l’ont intégralement reversé, ce qui fait de ce résultat un problème de coûts et non un problème de prévision.

219
exécutions, aucun échec
0
exécutions bénéficiaires
354
contrats, dont 56 retirés
1,00
probabilité de surapprentissage du backtest

Ce que nous avons testé

Donnez à un agent des données à la minute sur un univers de contrats perpétuels Binance USD-M exempt de biais du survivant. Laissez-le choisir les contrats qu’il détient, à l’achat ou à la vente, pour quelle taille, et quand se raviser. Facturez-lui ce que négocier coûte réellement. Gagne-t-il de l’argent ?

La question mérite d’être posée avec soin car la littérature publiée est mince. Les résultats reposent le plus souvent sur un entraînement unique, les coûts sont souvent absents, et la référence retenue est habituellement une position achetée et conservée plutôt qu’un agent aléatoire négociant à la même intensité. Chacun de ces choix flatte la méthode.

L’univers et la décision

354 contrats, dont 56 retirés de la cote avant la fin de l’échantillon et conservés dans l’historique aux dates où ils se sont effectivement négociés. L’univers est reconstruit à la date, en classant par volume en dollars sur les 30 jours strictement antérieurs, les filtres d’éligibilité étant appliqués avant le classement afin qu’ils ne puissent dépendre d’un résultat.

Les décisions sont horaires sur 20 emplacements, à l’achat comme à la vente, plafonnées à 25 % du compte par contrat et à 100 % en brut. Une zone neutre entoure zéro, de sorte que ne rien détenir soit un choix accessible plutôt qu’un équilibre instable.

Ce qui a été figé avant toute lecture de résultat

Validation glissante sur 20 fenêtres : 18 mois d’entraînement, 3 de validation, 3 de test, avec une purge de 7 jours et un embargo d’un jour à chaque frontière. La période hors échantillon va de novembre 2021 à août 2026. La normalisation est ajustée sur les seules lignes d’entraînement, le point de contrôle est choisi sur la validation, et le test n’est touché qu’une fois par configuration.

Les coûts sont portés dans la récompense plutôt que soustraits après coup : 5 points de base de frais preneur et 2 points de base de dérapage de base par exécution, un impact de marché en racine carrée mis à l’échelle par la volatilité réalisée, une participation plafonnée à 5 % du volume négocié de l’intervalle, et le financement aux taux réalisés sur sa véritable barre de règlement.

La règle de notation a été écrite à l’avance : le 25e centile du rendement ajusté du risque hors échantillon sur l’ensemble des points de départ aléatoires, mesuré face à un agent aléatoire négociant à la même rotation. Ce choix de statistique se révèle plus déterminant que tout le reste de l’étude.

Résultats

Non. Les 219 exécutions ont toutes perdu de l’argent, et cinq des six fonctions de récompense font moins bien qu’un agent aléatoire négociant à leur propre intensité. Le meilleur rendement ajusté du risque de toute l’étude revient à un agent aléatoire qui achète et conserve pendant environ 42 jours.

La probabilité de surapprentissage du backtest sur la famille de configurations vaut 1,00, ce qui signifie que le classement en échantillon de ces conceptions n’a transporté aucune information hors échantillon, dans aucune partition, et rien ne survit à la correction pour comparaisons multiples. Ce serait un résultat nul sans relief. Trois constats sous-jacents ne le sont pas.

Un problème de coûts, pas de prévision

Décomposer le résultat de chaque conception entre ce que ses positions ont gagné avant coûts et ce que la négociation a coûté sépare deux échecs très différents.

-40%-20%0%20%Sign of each trade+22.3%-55.6%-34.0%Net profit per trade+7.4%-29.7%-24.8%Log return+2.4%-17.0%-17.6%Volatility-scaled return-1.6%-14.1%-18.9%Return minus drawdown-3.0%-11.6%-17.7%Sharpe directly-10.6%-13.7%-24.7%
Before costsCost paidNet
Fig. 1: Trois conceptions dégagent un rendement positif avant coûts et en reversent entre 2,5 et 7 fois. L'ordre s'inverse : la pire conception en net est la meilleure avant coûts.
Fonction de récompenseAvant coûtsCoûtFinancementNetCoût / gain
Signe de chaque transaction+22,3 %−55,6 %−0,8 %−34,0 %2,5×
Résultat net par transaction+7,4 %−29,7 %−2,6 %−24,8 %4,0×
Rendement logarithmique+2,4 %−17,0 %−3,1 %−17,6 %7,0×
Rendement mis à l’échelle de la volatilité−1,6 %−14,2 %−3,2 %−18,9 %—
Rendement moins perte maximale−3,0 %−11,6 %−3,2 %−17,7 %—
Ratio de Sharpe directement−10,6 %−13,7 %−0,4 %−24,7 %—

Moyenne par trimestre en fraction du capital, huit trimestres hors échantillon, cinq points de départ aléatoires par conception. Le ratio n'est indiqué que lorsque le rendement avant coûts est positif, faute de sens autrement.

Trois des six conceptions ont trouvé un avantage directionnel positif hors échantillon sur huit trimestres. L’ordre s’inverse. La conception qui perd le plus en net est celle qui avait le plus raison sur le sens, d’un facteur trois sur la suivante.

Les deux conceptions en tête du classement net affichent un rendement négatif avant coûts : elles se classent bien en étant peu coûteuses plutôt qu’en ayant raison. C’est le mécanisme derrière une probabilité de surapprentissage de 1,00 : le classement mesure la retenue, et la retenue ne se généralise pas comme une compétence.

La récompense pilote la taille des transactions et non leur fréquence. Les clôtures par heure s’échelonnent entre 9,66 et 10,23 pour les six conceptions, soit un écart de 6 %, tandis que la taille moyenne varie d’un facteur 19. Les conceptions sont également actives et ne diffèrent que par leur timidité.

L’agent qui a le plus perdu est celui qui avait le plus raison sur le sens. Il a simplement reversé son avantage dix-neuf fois.

Indiquer au réseau la forme du problème est l’effet le plus important

Un choix de conception a pesé plus lourd que toutes les autres variables testées. La politique fait passer chacun des 20 contrats par le même petit encodeur et partage une unique tête de décision, de sorte qu’elle ne peut traiter un contrat différemment d’un autre qu’à travers leurs données. L’alternative évidente est un réseau ordinaire qui voit les 1 192 entrées comme un vecteur indifférencié.

-20-15-10-50Shared per-asset encoder ~23k parametersrange -2.17 to -1.08 · turnover 1.3%/h-1.20Flat network, two hidden layers ~375k parametersrange -20.48 to -19.47 · turnover 85.1%/h-20.38Risk-adjusted return, mean across quarters
Fig. 2: Médiane et plage complète sur les points de départ pour chaque politique, même récompense, mêmes huit trimestres, cinq points de départ chacune. Les plages ne se recouvrent pas.

Un écart de 19 points, sans recouvrement entre les plages. À titre de comparaison, la conception de la récompense couvre environ 2 points et le choix des variables ne sépare rien du tout. Le réseau ordinaire n’a pas appris une politique moins bonne : il n’a jamais appris à conserver une position. Il fait tourner 85 % du portefeuille chaque heure et se trouve liquidé sur les huit trimestres.

Face à un vecteur plat, il ne peut découvrir que l’entrée est en réalité 20 contrats par 59 colonnes plus 12 grandeurs de compte ; ses 20 sorties ne partagent donc aucun poids et rien ne relie les données d’un contrat à la position détenue sur ce même contrat. Il porte 16 fois plus de paramètres que la politique à encodeur partagé et perd tout de même de 19 points : il s’agit donc d’indiquer au réseau la structure du problème, et non de la taille du modèle.

Cela fixe le plancher plutôt que de relever le plafond. La politique à encodeur partagé perd encore 89 % du capital et échoue toujours face à un agent aléatoire à sa propre rotation. Sur un simulateur sans coûts, les deux auraient semblé bien plus proches, et une grande part des travaux publiés dans ce domaine ne facture aucun coût.

Le tirage aléatoire domine toutes les comparaisons

Une configuration, un jeu de données, dix points de départ aléatoires : une amplitude de 10 points de rendement ajusté du risque. Sur 40 points de départ, la rotation varie d’un facteur 50 pour la même configuration. C’est assez pour noyer tout effet que l’on souhaiterait mesurer ici.

0%10%20%30%40%123579random starting points used by the study26% at five
Price features onlyEvery feature
Fig. 3: Fréquences exactes sur sous-échantillons, non simulées. Une étude à cinq points de départ de la configuration « prix seuls » annonce une médiane bénéficiaire 26 % du temps alors que dix points de départ donnent une médiane négative.

Un entraînement unique, qui est le mode de publication le plus répandu dans ce domaine, porte un taux de faux positifs de 40 % sur cette configuration. Deux études sur cinq annonceraient une médiane bénéficiaire pour quelque chose qui perd 2,7 points sur dix points de départ. Cela suffit à expliquer le bilan de reproductibilité du domaine sans supposer la moindre malhonnêteté.

-4.00-3.00-2.00-1.000.00Sign of each trade-4.73 to -2.5925th pct -4.30-3.58Net profit per trade-3.18 to -1.0625th pct -2.19-1.83Log return-2.76 to -0.7525th pct -2.67-1.33Volatility-scaled return-2.42 to -0.7025th pct -1.84-1.43Return minus drawdown-2.17 to -1.0825th pct -1.32-1.20Sharpe directly-2.28 to -1.0425th pct -2.16-1.97Risk-adjusted return, mean across quarters
Fig. 4: Médiane et plage complète pour chaque conception sur huit trimestres et cinq points de départ aléatoires. Le rouge signale une conception dont le 25e centile passe sous moins trois, soit la statistique de notation enregistrée plutôt que la médiane.

Rendre le coût lisible n’y change rien

Les coûts étant portés dans la récompense, l’agent est rémunéré net. Une objection consiste à dire qu’un unique nombre agrégé ne peut lui apprendre s’il a perdu sur le sens ou sur les frais, le laissant incapable de comprendre que c’est la négociation qui le pénalise. Les frais représentent entre 1,6 % et 10,2 % d’un mouvement de prix horaire typique : cette attribution doit donc être extraite d’un bruit 10 à 60 fois plus grand que le signal.

VarianteDépartsRotation horaireCoûtAvant coûtsNetp sur la rotation
Référence408,1 %27,2 %+4,2 %−24,9 %—
Coût montré à l’agent1011,0 %28,3 %+1,9 %−25,1 %0,56
Pénalité, 5× le coût réel109,3 %29,9 %+5,6 %−29,0 %0,51
Pénalité, 25× le coût réel404,4 %18,5 %+4,8 %−19,3 %0,087

Deux interventions sur la même fonction de récompense. La pénalité de 25× et la référence comptent chacune 40 points de départ aléatoires, les deux autres en comptent 10. Le test sur la rotation est unilatéral.

Montrer à l’agent ce que sa dernière décision a coûté n’a rien changé de mesurable. Lui infliger une pénalité proportionnelle à ce qu’il venait de négocier, à 25 fois le coût réel, a réduit la rotation de 45 % et les coûts de 8,7 points de capital tout en laissant le rendement avant coûts inchangé, améliorant le net de 5,6 points.

Quatre mesures évoluent ensemble, et c’est la combinaison qui compte : la pénalité a supprimé la négociation qui ne se payait pas, et non celle qui portait l’avantage. Le seuil enregistré à l’avance n’est pourtant pas franchi, et la raison est elle-même le constat : la pénalité abaisse la moitié inférieure de la distribution de rotation et laisse le quartile supérieur intact. Certains points de départ négocient encore 12 % du portefeuille par heure tout en étant facturés vingt-cinq fois le coût réel.

Un signal de coût, si fort soit-il, arrête le négociateur marginal et non le négociateur convaincu. L’expérience suivante est donc structurelle et non économique : plafonner la variation horaire du portefeuille pour rendre la sur-négociation impossible plutôt que coûteuse, puis vérifier si l’avantage avant coûts survit à une rotation que la structure de coûts peut supporter.

Défauts trouvés avant publication

Trois méritent d’être nommés, car chacun aurait produit une réponse fausse et assurée plutôt qu’un plantage.

Un prix fictif servait à régler une rotation vers un emplacement dont le contrat avait changé. L’agent de référence équipondéré annonçait un rendement multiplié par 31 là où le calcul fait à la main donne 1,46. Toutes les exécutions antérieures au correctif ont été écartées.

Une comparaison de variables a été menée alors qu’un jeu de variables plus restreint survivait à la règle de complétude sur davantage de lignes qu’un jeu plus large : les branches reposaient donc sur des échantillons différents et la comparaison mesurait silencieusement la couverture plutôt que l’information. Toutes les branches doivent désormais partager une même signature de comptage de lignes avant toute affirmation.

Une première décomposition de coûts avait été construite en sommant les colonnes du registre des transactions sur les fenêtres et sur les points de départ, ce qui compte double et additionne des fractions de capital qui repartent chacune de un. Le registre est en premier entré, premier sorti et ne retient que le réalisé : sa somme diffère donc légitimement du rendement total par la valorisation de l’inventaire encore ouvert en fin de fenêtre. Les décompositions proviennent désormais des accumulateurs du simulateur.

Un résultat trouvé, publié, puis retiré

Sur cinq points de départ aléatoires, une comparaison de variables a produit +42,5 % sur quatre trimestres hors échantillon, sur des lignes vérifiées identiques et avec un mécanisme plausible ; elle a été rédigée. En portant la même configuration à dix points de départ, sa médiane est passée de +0,56 à −2,67 et son total de +42,5 % à −85,9 %, les cinq premières exécutions constituant la moitié supérieure de la distribution.

Avec les sept jeux de variables à dix points de départ, le classement apparent s’est ensuite inversé, et aucune paire de jeux n’est distinguable après correction des 21 comparaisons. La lecture honnête est que le classement des variables est du bruit à toutes les tailles d’échantillon essayées.

La statistique enregistrée à l’avance a refusé les +42,5 % avant que l’extension n’en explique la raison. C’est l’argument le plus fort de l’étude en faveur de l’écriture préalable du seuil d’acceptation, et il vaut davantage que ne l’aurait valu le résultat.

Limites

Il s’agit de décisions horaires sur une seule plateforme et sous une seule modélisation des coûts : rien n’est dit des horizons plus courts, des autres places, de la tenue de marché ni de ce qu’un vrai pupitre aurait payé. Le chiffre de 22,3 % avant coûts est le moins fiable de la note, car la conception qui le produit négocie 32 % du portefeuille par heure, soit assez profondément dans le modèle d’impact pour que sa propre estimation soit la plus dépendante du modèle des six.

La comparaison de variables ne couvre que quatre fenêtres tardives, l’historique d’intérêt ouvert avant décembre 2021 n’existant pas pour la plupart des contrats. L’agent aléatoire de référence est apparié sur la rotation et non sur la concentration, même si les politiques détiennent en médiane 15 emplacements sur 20 et touchent 35 contrats distincts par fenêtre, de sorte que l’écart de diversification reste faible.

Deux des vingt fenêtres de validation glissante réservées ont été utilisées pour le criblage en contradiction avec le plan initial, ce qui les a consommées et n’en laisse que deux intactes. Une grille de cadence secondaire a été abandonnée faute de temps, de sorte que la question de la cadence repose sur les seuls agents de référence. Rien ici n’est une stratégie, et aucun modèle n’a été exposé à des données en direct.

Méthodologie complète

Sources de données, règle d’univers à la date, espace d’observation et d’action, modèle de coûts et de financement, mécanique de la validation glissante, les six fonctions de récompense, les agents de référence, l’inférence et les contrôles bloquants, avec extraits de code.

Reproductibilité →