訓練模型該用多長的歷史資料?
每一個walk-forward流程在第一個fold跑起來之前,都得先回答這個問題。大多數團隊憑習慣決定。我們選擇直接測試。
每一個walk-forward流程,在第一個fold跑起來之前,都必須先回答一個問題:訓練該用多少歷史資料。太少,模型會追逐雜訊;太多,又會拖進一個已經不再適用的市場狀態。大多數團隊憑習慣而非證據來決定,通常就是第一次實驗時湊巧用的那個窗口,而且從此再也沒有重新檢視過。
我們想要一個經過測試而非假設出來的直接答案。更長的回看期真的會產生更好的模型,還是只是看起來比較嚴謹?答案是否取決於市場、模型家族,或是重新訓練的頻率?另外,不論哪個訓練長度在預測上勝出,扣除真實的價差、手續費、滑價與資金費率之後,它在損益線上是否也同樣勝出?
本文說明我們如何在兩個截然不同的資產類別、三種模型家族與六種訓練長度上進行這項測試,以及我們發現了什麼。
這篇筆記背後的每一個資料集、雜湊值、公式與資料洩漏檢查,都放在獨立的一頁,才不會擠壓這裡的論述空間。
我們測試了什麼
我們在六種不同的回看窗口上訓練同樣的模型,從一個日曆月到兩年不等,並在訓練窗口結束後的下一根K棒上評估每一種設定。為了確保比較結果不是單一評估方式造成的偶然,每個訓練長度都在三種不同的樣本外排程下評分:固定一個月測試、固定三個月測試,以及長度為訓練長度三分之二的測試窗口——後者是部分從業者用來讓訓練/測試比例隨窗口變長而大致維持不變的經驗法則。
測試範圍涵蓋兩個行為截然不同的市場:一籃子美國大型股,以及一籃子流動性良好的Binance永續合約,各自以兩種K棒頻率取樣。三種模型家族並行訓練:一個正則化線性模型、一個梯度提升樹集成模型,以及一個小型神經網路,全部使用相同的、純粹由價格與成交量構建的技術特徵集。任何模型都不曾把成本、手續費或資金費率的數字當作輸入;這些只在後續的損益階段才會出現。
每一種訓練長度、市場、頻率與模型的組合,都在大約三年半的樣本外歷史中以walk-forward方式向前推進,全程按排程重新訓練,因此這絕不是單一快照的結果。每個窗口內的模型選擇使用固定的訓練/驗證切分與鎖定的超參數網格,因此沒有任何訓練長度會在搜尋預算上比其他長度更佔優勢。整個執行總共累積了5,868個滾動模型窗口與176,040次配置嘗試。
接著,我們把每個窗口勝出的配置轉換成真實部位:買進預測最強的標的、放空最弱的標的,並以系統化交易台會採取的方式進行部位規模設定與執行,每筆成交都扣除實測價差、真實交易所手續費、滑價與帶正負號的資金費率。這一步把「預測得好的模型」與「會賺錢的模型」區分開來,兩者並不是同一件事。
結果
更長的訓練歷史幾乎在所有情況下都帶來更好的預測。在固定一個月的排程下,彙總排序IC從一個月訓練時的0.0068上升到24個月訓練時的0.0173,增幅主要集中在三個月以內,並在二到六個月之間出現一段淺平台。三個月排程呈現相同的模式,從0.0063上升到0.0143。
在固定一個月與三個月排程下,24個月贏得每一次固定窗口比較;在三分之二排程下,24個月與三個月在跨格勝出數上打平,六個月的中位數也十分接近24個月。將市場、時間框架、模型與排程共36個格子在彙總預測IC上加總計算,24個月是明確的整體贏家,三個月遠遠排在第二位,其餘較短的長度則瓜分剩下的勝場。
整體加總結果掩蓋了一些細節。在以Benjamini-Hochberg方法校正多重比較之後,較短的窗口仍在少數個別格子中勝過24個月,依排程不同約有二到四格。24個月在任何一格都沒有顯著地更差。整體結果之所以成立,是因為長窗口勝出的幅度更大、次數更多,而非因為它在每一格都獲勝。
加密貨幣與股票給出了不同的答案。加密貨幣是最清楚的案例:在固定排程下,24個月在兩種頻率與三種模型家族的每一次彙總IC比較中都勝出,最高IC達到0.0526。股票則從未收斂到單一答案:在固定窗口的股票格子中,三個月贏得一半,而股票的最佳IC僅達0.0129,只是加密貨幣最佳結果的一小部分。如果你只打算在一個市場上訓練一個模型,這是值得記住的結論:「用更長的歷史」在加密貨幣中幾乎是一條定律,在股票中則只是一個溫和許多的預設值。
這一切都沒能撐過交易成本。我們把每個窗口的預測轉換成真實的多空部位組合,在下一根K棒開盤進場、同一根K棒收盤出場,並計入真實成本。
加密貨幣的成本達到每筆入選部位3.7基點,相對於0.05基點的毛損益;股票成本達到0.8基點,相對於0.03基點的毛損益。而預測表現最好的訓練長度並沒有拯救經濟效益,因為成本差距從未小到足以讓預測品質產生實質影響。
我們進行的180組「較短長度對比24個月」的淨損益比較中,在校正多重檢定之後,沒有一組在任一方向上能與零區分開來。訓練歷史長度會改變預測品質,但不會把這個特定的「下一根K棒排序」策略變成一個能獲利的策略。
訓練歷史長度確實是影響預測品質的真實槓桿,但不是能把一個不具經濟效益的策略變成獲利策略的槓桿。預測結果與交易結果是兩個不同的發現,這項研究提醒我們應該持續分開報告這兩者。
我們針對這項結果進行的每一項資料洩漏、時間對齊與完整性檢查全部通過;確切的檢查內容與數字都在 可重現性頁面。
限制
- 此結果描述的是這20檔固定樣本標的在約3.5年這段固定窗口中的表現,並非對任一資產類別整體的宣稱。
- 加密貨幣全天候交易,股票則有隔夜跳空。兩個市場共用同一套訓練與測試日曆,但K棒的經濟特性並不相同。
- 加密貨幣樣本中有一個標的在樣本期間中途停止交易,我們選擇保留而非剔除,以避免存活者偏誤,這也讓該面板刻意呈現不規則的樣貌。
- 此經濟性結果專屬於固定部位權重、下一根K棒的多空排序規則。不同的持有期間、執行方式或投資組合構建方式都需要另行測試。
- 在本次測試的選項範圍內,24個月是最強的預設值,但並非數學上的最優解;較短的窗口在部分個別格子中依然勝出。
本頁每一張圖表都是在你的瀏覽器中,根據研究的真實結果數據即時繪製而成,與文字內容及可重現性頁面所引用的是同一批數字,背後沒有任何圖片檔案。
資料、樣本範圍、特徵公式、模型網格、walk-forward流程、成本模型與每一項資料洩漏檢查,附雜湊值與程式碼片段。

