返回 López de Prado

研究評論 · cross-sectional 機器學習 · 研究 15

Cross-Sectional Machine Learning

在機器學習最強的體制中執行完全相同的裝置,每根 bar 對整個橫斷面排序,而非預測單一序列的方向,該計畫的第一個 edge 通過了 deflation,落在最佳靜態原型旁邊,但並未超越它

本評論中此前的每一個機器學習結果都活在 ML 最弱的體制裡:預測單一序列的方向。 它未通過 deflation,正如文獻所預測。對「沒有任何東西通過 deflated 顯著性」這條主軸的公平檢驗, 是在 ML 最強的體制中執行完全相同的 purged-cross-validation、Deflated Sharpe Ratio、 Probability of Backtest Overfitting 與 effective-N 裝置,cross-sectional 報酬預測, 其中你每根 bar 對整個宇宙排序,並以市場中性方式將資本輪轉進最佳標的。結論部分翻轉。 cross-sectional 的 edge 通過了 deflation,但它逼近而非擊敗最佳的靜態 carry/momentum 原型。 那層細微差別正是值得發表的結果。

來源

Advances in Financial ML,第 7 & 8 章

López de Prado (2018) · purged CV & feature importance

程式碼與資料

lopez-de-prado-work-review / projects / 15

the claim

López de Prado 的主張

  • 當機器學習在適當驗證下預測報酬的橫斷面時會增添價值,而被要求預測單一序列的方向時價值遠少,橫斷面才是站得住腳的體制。
  • 任何回測 edge 都必須對試驗的數量與離散度通過 Deflated Sharpe Ratio,且 Probability of Backtest Overfitting 必須夠低,in-sample 的排序在 out-of-sample 才有意義。
  • 在表格式金融資料上,gradient-boosted 樹打平或勝過深度神經網路的次數多於相反情況。

our result

我們的發現

  • 體制分裂與所述完全一致。單一序列 ML 在 out-of-sample 是擲硬幣或更差(PBO 0.62),約 25,162 個策略中沒有任何一個通過 deflation。cross-sectional ML 具有低 PBO(0.10)、強勁的 in-sample 對 out-of-sample 排序持續性(rho +0.78),且參考模型(lgbm)在每個 horizon 都通過 Deflated Sharpe 標準(10 之 10)。
  • edge 是真實的,但有界:out-of-sample 中位 profit factor 1.123,已扣除完整的逐筆成交成本模型。它達到但不超過最佳靜態結構原型(約 PF 1.17)。誠實的標題是 ML edge ≈ 靜態 edge,兩者皆不佔主導。
  • 樹在同一任務的對決中勝出:lgbm、catboost 與 xgb 通過或逼近 deflation 標準(30 個樹組合中的 23 個),而在完全相同的 panel、標籤、walk-forward 與成本模型上執行的兩個神經家族,扣除成本後虧損且不通過任何標準。表格式資料的發現是在我們自己的資料上獲得確認,而非僅是引用。

三行看結果

體制翻轉 · 相同裝置

最強的 ML 體制通過 deflation

單一序列方向預測(ML 最弱)記錄 PBO 0.62,約 25,162 個策略中 0 個通過 deflation。僅將預測目標換成 cross-sectional 排序(ML 最強),參考樹便在 10 之 10 個 horizon 通過 Deflated Sharpe 標準,PBO 0.10,IS→OOS 排序持續性 rho +0.78。

edge ≈ 靜態 · 兩者皆不佔主導

真實、含成本、通過 deflation,但有界

輪轉的 long-short 投組在十個 horizon 上獲得 out-of-sample 中位 profit factor 1.123,已扣除完整的逐筆成交成本。這以一條不同、較不擁擠的路徑達到最佳靜態 carry/momentum 原型(約 PF 1.17),但並未擊敗它。ML 在此的價值是同等,而非免費午餐。

樹勝神經網路 · 23/30 vs 0

同任務、同成本,樹勝出

三個 gradient-boosted 樹家族通過或逼近 False Strategy Theorem 的 deflation 標準(lgbm 10/10、catboost 9/10、xgb 5/10, 30 個組合中的 23 個)。在完全相同的 panel、標籤、walk-forward 與成本模型上的一個 feed-forward 與一個 recurrent 神經網路,扣除成本後皆落在損益兩平之下(PF ≤ 1、Sharpe 為負),不通過任何標準。

體制翻轉,單一序列 vs cross-sectional

僅換掉預測目標,該計畫的第一個 edge 便通過 deflation

Fig. 1:在兩種體制上使用相同的 purged-CV、DSR、PBO 與 effective-N 裝置。單一序列方向預測(ML 最弱)具有高 overfitting 機率(PBO 0.62),約 25,162 個策略中 0 個通過 deflation;cross-sectional 輪轉(ML 最強)具有低 PBO(0.10),參考樹在每個 horizon 都通過 Deflated Sharpe 標準。

相同模型、相同 triple-barrier 標籤、相同 purged walk-forward、相同成本模型。 唯一改變的是預測目標。單一序列方向問一條嘈雜的序列它會漲還是跌; 該計畫的稽核將有效的獨立押注數定在 25,162 個名義策略中的約 40 個, 且 in-sample 的最佳者有 62% 的時間落在 out-of-sample 的下半部。deflation 把這一切全殺掉。

橫斷面問一個容易得多、穩定得多的問題,哪些標的會勝過哪些, 並在每根 bar 跨一個寬廣的宇宙進行聚合,這會平均掉特異噪音,產生一個在 out-of-sample 持續的排序(rho +0.78)。正是那份持續性讓它得以通過 deflation 標準。 這個翻轉就是文獻的預測,被觀察到了。

體制PBODSR 存活IS→OOS rhoOOS PF 中位數結論
single-series (ML weakest)pooled band, 25,162 strategies0.620 of 25,162n/a~1.0fails deflation
cross-sectional (ML strongest)gradient-boosted trees, 10 horizons0.1010 of 10 horizons+0.781.123survives deflation

PBO 透過 CSCV;effective-N 透過特徵值參與比率;DSR 透過 False Strategy Theorem 基準, 全部來自該計畫的 deflation 工具組。標題的 PBO 與排序持續性是來自專用輪轉引擎的標準逐窗數字(正確的試驗軸)。 effective-N 在不同的軸上測量(單一序列:25,162 中約 40 個獨立;cross-sectional:10 個獨立 horizon 押注), 因此兩者不可直接比較。最佳靜態結構 carry/momentum 基準位於約 PF 1.17。

cross-sectional 的 edge,逐 horizon 來看

每個預測 horizon 一個輪轉的 long-short 投組

每根 bar,以逐標的的因果樹分數對存活宇宙排序,做多頂部分位、做空底部分位,市場中性, 並將押注規模旋鈕(分位、long-only、tilt、再平衡節流)以 walk-forward 視窗逐窗進行 in-sample 調校。 搜尋了十個 horizon;它們屬於 deflation 標準所計入的同一個試驗家族。edge 在短到中 horizon 最強, 隨持有期增長而緩慢衰減,與 momentum-and-reversal 的橫斷面一致,而非一個僥倖的 horizon。 參考模型(lgbm)在所有十個 horizon 上都通過嚴格的逐 horizon Deflated Sharpe(經偏度與峰度調整,對十 horizon 家族 deflated)。

Fig. 2:cross-sectional lgbm 輪轉,逐 horizon。out-of-sample profit factor 範圍 1.089–1.158,中位數 1.123;edge 在短到中 horizon(H=12 與 H=24)達到高峰,並緩慢衰減至最長 horizon(H=336)。所有十個 horizon 都通過嚴格的 Deflated Sharpe 標準(DSR > 0.95)。
H(bars)OOS PFOOS Sharpe(年化)DSR存活
41.1483.23~1.00yes
61.1272.79~1.00yes
81.1202.61~1.00yes
121.1582.66~1.00yes
241.1493.62~1.00yes
481.1112.62~1.00yes
721.1403.36~1.00yes
1201.1072.56~1.00yes
1681.0952.39~1.00yes
3361.0892.19~1.00yes

年化 Sharpe 使用引擎自身的逐 bar 頻率年化,僅供參考;輪轉報酬在一個持有期內具有自相關, 因此獨立觀測的有效數量,以及誠實的 Sharpe,比原始 bar 計數所暗示的要低。 deflation 結論與 profit factor 不取決於該年化選擇。每個 horizon 在約 42,000 個 out-of-sample bar 上評估。

Fig. 3:按樹家族與 horizon 的 out-of-sample profit factor 與 Sharpe,對照無技能預期最大 Sharpe 標準(False Strategy Theorem,N=40)。lgbm 通過所有十個 horizon,catboost 十之九(僅最長者落於其下),xgb 十之五,30 個樹(家族、horizon)組合中有 23 個通過一個貨真價實的多重檢定標準。

deflation 結論,逐家族來看

cross-sectional 的存活並非單一模型的產物。整個掃描被視為一個多重檢定家族。 在 False Strategy Theorem 之下,一個無技能搜尋者在 N 次試驗中會記錄的預期最大 Sharpe, 是由實現的逐 bar out-of-sample Sharpe 估計值的離散度計算而得,而一個(家族、horizon)組合 唯有其 out-of-sample Sharpe 超過該標準才「通過」。在標題試驗數 N=40 時,該標準為約 1.76 的年化 Sharpe。

那是 30 之 23 個樹組合通過一個貨真價實的多重檢定標準, 相對於 約 25,162 之 0 個單一序列策略。三個家族在同一個尊重存活性的 panel 與同一個 purged walk-forward 上端到端執行,因此存活性是跨獨立樹實作獲得佐證,而非從單一者斷言。 (僅在一個模型的十個 horizon 欄上重新計算的 PBO,按構造讀為 0.62,這些 horizon 是同一模型近乎相同的押注, 因此該交叉檢查以清楚標示的方式回報,且不是標題;標準的逐窗 PBO 為 0.10。)

家族通過的 horizon(共 10)OOS PF 中位數結論
lgbm10 of 101.123clears
catboost9 of 101.125clears (longest falls below)
xgb5 of 101.072partial

在完全相同的任務上樹對神經網路

公平的反問是:一個神經網路在給定相同的 panel、相同的向前 cross-sectional 排序標籤、相同的 purged walk-forward、 相同的輪轉規模搜尋與相同的逐筆成交成本模型下,是否表現更好。文獻反覆的發現是:並沒有。 我們直接檢驗此事而非斷言:一個逐 bar 的 feed-forward 網路(mlp)與一個逐 pair 的 recurrent 網路(lstm) 在一個受管理的加速器上執行(完整 panel 超出本機顯卡),並從其真實的 out-of-sample ledger 對照 樹所面對的同一個 False Strategy Theorem 標準進行評分。

這是文獻表格式發現在我們自己資料上、同任務的乾淨確認。神經家族在此並非更佳調校能挽救的險勝, 它們在扣除成本後低於損益兩平,而樹通過了一個貨真價實的 deflation 折減。 在相同的成本與驗證下,樹在 cross-sectional 輪轉上勝過神經網路。

Fig. 4:神經家族在完全相同的 cross-sectional 任務上。feed-forward 網路(mlp)記錄約 0.98 的 out-of-sample profit factor,年化 Sharpe 為小幅為負;recurrent 網路(lstm)更弱(PF 0.94,Sharpe 明顯為負)。兩者皆不通過三個樹家族通過的 deflation 標準,也都不逼近樹約 1.12 的中位 PF。
家族HOOS PFOOS Sharpe(年化)DSR結論
mlp240.984−0.400.13below bar
mlp720.982−0.440.11below bar
mlp1680.983−0.420.12below bar
lstm60.940−1.51n/abelow bar

每一個神經列都從其真實的逐 bar out-of-sample ledger,完全在樹所用的裝置上評分,包含同一個 False Strategy 標準。 其餘的神經家族(一組 gated-recurrent、一組 temporal-convolution 與一組 cross-pair attention) 在此輪未產出可用的 ledger,記錄為延後,不附帶數字,而非估計。

跨市場,edge 在 crypto 之外是否成立?

edge 在美股中複製,但其 deflated 顯著性隨廣度與週轉而縮放

Fig. 5:美股日度輪轉(約 240 個大型股標的,lgbm)。out-of-sample profit factor 緊隨 crypto(中位約 1.105,在兩週 horizon 處達到約 1.15 的高峰),但五個 horizon 中 0 個達到高於 0.95 的 Deflated Sharpe,最佳者接近(兩週約 0.94,一個月約 0.91)。

crypto 橫斷面是一個由數百個流動工具組成的寬廣 panel。為檢驗 edge 是那單一市場的性質, 還是輪轉構想的性質,我們在一個有界、流動的美國大型股宇宙上執行完全相同的配方,約 240 個標的, 每根 bar 中位約有 245 個存活,調整後的日 bar,跨約十一年。每根 bar 我們以相同的逐標的因果樹分數 對存活宇宙排序,做多頂部分位、做空底部分位(市場中性),在每個 purged walk-forward 視窗內以 in-sample 調校輪轉旋鈕,並收取符合現實的逐筆成交成本(中位 3.4 bp/側)。模型家族是在 crypto 中勝出的 gradient-boosted 樹。

原始 edge 在轉移至股票後存活,但更薄。profit factor 與 crypto 處於同一鄰域,五個 horizon 上的 out-of-sample 中位 profit factor 約為 1.105(crypto 約 1.123),在兩週 horizon 處達到約 1.15 的高峰, 中 horizon 最強,極短與極長 horizon 最弱。但年化 Sharpe ratio 遠低於 crypto(約 0.3 至 0.7,相對於 crypto 約 2.7), 因為日度股票輪轉的再平衡次數遠少,且有效樣本遠小於跨大得多 panel 的小時輪轉。

H(天)OOS PFOOS Sharpe(年化)DSR存活
11.0960.440.75no
51.1050.530.83no
101.1490.740.94no
211.1320.660.91no
631.0600.290.59no

存活性。股票宇宙是一個當前大型股成員的固定清單, 因此先前曾是大型股但此後離開指數的標的(除牌、被收購、降級)並未納入。 這對 long 腿是一個輕微的向上偏誤;結果是存活性已知但非無存活偏誤,應讀作偏上界而非乾淨的估計。 較晚的上市僅在其開始交易後才進入橫斷面(存活期內的 gating),因此對上市前日期沒有 look-ahead。 在一個 point-in-time 成員資格歷史上完全無存活偏誤的執行是自然的後續工作。

cross-sectional ML edge 在美股中部分複製:profit factor 的符號與量級幾乎完全延續, 但統計顯著性沒有,因為日度大型股輪轉每單位時間的獨立資訊就是比寬廣的小時 crypto panel 少。 這使標題更鋒利而非推翻它。cross-sectional 體制在兩個市場中確實是較強的 ML 體制, 它產生一個真實、含成本、為正的 edge,而單一序列方向預測產生噪音, 但該 edge 是否通過多重檢定折減,取決於 panel 的廣度與再平衡頻率:最寬、最快的 panel 通過了; 日度大型股股票則差一點點。

方法

  • 單一序列腿:該計畫的 25,162 個方向預測策略的 pooled band 語料(triple-barrier 標籤、purged walk-forward、逐筆成交成本),透過該計畫的 deflation 工具組評分(PBO 透過 CSCV、effective-N 透過特徵值參與比率、DSR 透過 False Strategy Theorem)。結論:PBO 0.62、effective-N 約 40、零個 deflation 存活者。
  • cross-sectional 腿:一個由 787 個 pair 組成、尊重存活性的寬廣 perpetual-swap 宇宙。每根 bar,以逐標的的 gradient-boosted 因果樹分數對存活宇宙排序,並將一個市場中性的 long-short 投組輪轉進頂部與底部分位,押注規模旋鈕以 purged walk-forward 視窗逐窗 in-sample 調校。十個預測 horizon(4 至 336 bars),完整的逐筆成交成本模型。僅真實資料。
  • deflation 計帳:整個 cross-sectional 掃描是一個多重檢定家族。False Strategy Theorem 的無技能預期最大 Sharpe 由 30 個完成的樹組合上實現的逐 bar OOS Sharpe 之離散度計算而得;一個組合唯有其 OOS Sharpe 超過該標準才通過。參考模型另外帶有一個嚴格的逐 horizon DSR(經偏度與峰度調整,對十 horizon 家族 deflated)。
  • 樹家族:lgbm、catboost 與 xgb 在完整 panel 上端到端執行。Random forest 與 extra-trees 因在完整寬度下慢得不切實際且耗記憶體而被砍掉;線性家族在搜尋中途被記憶體守衛中止。這些不帶結果,記錄為延後。
  • 神經家族:一個逐 bar 的 feed-forward 網路(mlp)與一個逐 pair 的 recurrent 網路(lstm)在完全相同的 panel、標籤、walk-forward、規模搜尋與成本模型上,在一個受管理的加速器上執行,再從其真實的 OOS ledger 對照同一個 False Strategy 標準評分。gated-recurrent、temporal-convolution 與 cross-pair attention 這幾組未產出可用的 ledger,延後且不附帶數字。
  • 跨市場檢驗:未經修改的 cross-sectional 引擎在一個有界、流動的約 240 個美國大型股標的宇宙上,調整後的日 bar,跨約十一年(每根 bar 中位約 245 個存活),五個 horizon(一天至一季),符合現實的逐筆成交成本(中位 3.4 bp/側)。存活性已知(當前成員、存活期內的 gating);另有一個單薄的 FX 與類股 smoke 紅利執行單獨保存。

備註與誠實評估

這封閉了該計畫唯一的結構性缺口,它原本沒有 cross-sectional 涵蓋,並交付其第一個通過 deflation 的 ML edge。 誠實的標題貫穿始終:cross-sectional ML edge 逼近但不擊敗最佳靜態結構原型(約 PF 1.17)。 因此可發表的主張比「沒有任何東西有效」更強、更站得住腳:機器學習贏得了一個真實、通過 deflation 的 cross-sectional edge, 但它落在一個建構良好的靜態 carry/momentum 策略已經所在的大致相同位置。ML edge ≈ 靜態 edge;兩者皆不佔主導。ML 在此的價值是透過一條不同、較不擁擠的路徑達到同等,而非凌駕結構之上的免費午餐。 凡是在不同於專用引擎的試驗軸上重新計算某統計量之處,標準的逐窗數字是標題,而重新計算被標示為交叉檢查;兩者絕不混為一談。

可重現性

單一序列與 cross-sectional 結果、家族層級的 deflation 表、神經家族的 ledger、美股腿、各圖與 deflation 工具組, 皆收錄於 lopez-de-prado-work-review 專案 15。分析腳本從保存的 ledger 重新計算 DSR、PBO 與 effective-N,具冪等性且對缺失輸入穩健;它們讀取 ledger,不訓練任何東西。

引用

參考文獻

此處所評論工作的主要來源:

另見

關於多重檢定 deflation 的姊妹研究是 Backtest Overfitting & the Deflated Sharpe Ratio,標籤與 purged-cross-validation 的機制在 Labeling & Cross-Validation,選擇紀律的主題貫穿 The edge is in the process, 更廣泛的研究主體在 Research