corpus
「160 萬個策略」究竟意味著什麼。
對最常見,也最合理,的第一反應的回應: 「這不是研究,這是資料探勘。」
這項質疑有其道理。只要自由度夠多,任何東西都能擬合到任何東西上。所以在對投資組合、優勢或穩健性過濾器做出任何主張之前,本頁先做那件枯燥的工作:說明 corpus 如何構建(機密部分仍保持機密)、展示其內部幾何結構的樣貌,並逐步走過捕捉族群兩個面向的兩個視覺成品,族層級結構與變體層級結構。
corpus 維度
這項質疑
資料探勘的批判大致如下:如果你回測一百萬個策略,分布的右尾必然會因純粹的運氣,包含一些在樣本內印出巨大獲利因子的策略。挑出那些,任何回測看起來都很棒,直到實盤交易,擬合便蒸發殆盡。
這項批判在精神上是正確的,而事實上 本工作在策略層級同意它。文章 優勢在於流程 便以這項發現開篇,於一個可重現的 12 市場加密 corpus 上:橫跨 533,638 個策略與 4,400 萬個滾動前推策略視窗,一個策略在某一視窗的獲利因子與下一視窗之間的等級相關性為 ρ ≈ 0.02,且逐市場的 ρ 從不超過 0.04。此 corpus 中沒有任何個別策略具有可信的 OOS 優勢。
那麼族群有何用?論證在接下來兩節中展開,而其後的兩段影片則是視覺證據。
corpus 如何構建
corpus 中的每一個策略都是一條完整指定、確定性的規則:一個指標族、一組參數化、一套進出邏輯,以及一個風險報酬機制。沒有任何東西是挖掘出來的。沒有任何東西是手工挑選的。基底是以下要素的結構化乘積:
- 30 個資產/時間框架分割,加密主流(BTC、ETH、BNB、SOL)、大型山寨幣(DOGE、XRP、LTC、AVAX、LINK、BCH、DOT、TRX)、約 15 個中型市值(APE、ATOM、ICP、NEAR、ALGO、HBAR、ARB、SUI、APT、ZEC …),以及三個外匯配對(AUDUSD、USDCAD、USDCHF)。外匯被保留作為跨資產類別的穩健性檢核。
- 八個指標族 涵蓋趨勢、動量、均值回歸與波動率,EMA、SMA、MACD、PPO、RSI、RSI 水準交叉、Stochastic %K、ATR。
- 各族的變體族群。 每個基礎族都透過一組統計與數學函數的批次擴展為一個變體族群,套用於原始指標序列的轉換,以及以結構化方式將進場條件附加於第二訊號之上的合流子集。 確切的構造予以保留。 本頁的實證成品旨在證明:無論構造為何,所產生的族群都具有所主張的幾何性質。
- 滾動前推最佳化 橫跨多個回看時段,使每個策略在滑動的 IS / OOS 視窗下被評估,而非在價格歷史的某一任意切片上。
沒有任何子集被移除。沒有任何分割被「保留為那個好的」。全部三十個資產/時間框架都在同一流程、同一程式碼、同一提交下被評估。
關於可重現性。 SSRN 工作論文 附帶一個可重現性套件,但它重現的是 由論文中出現的策略所衍生的彙總:IS / OOS 分布、過濾器曲線診斷、投資組合統計,以及圖表資料。策略 corpus 本身為專有,且 不 對外釋出。Python、Rust 與 R 從相同的原始價格歷史交叉驗證相同的已發表彙總;它們並不重新生成 corpus。
想以公開方法論對同一基底做族群層級的解讀,請見實驗室筆記中關於 族群 Sharpe 密度 與 IS–OOS Sharpe 差距分解 的內容。
幾何結構,一張圖說盡
對一個策略 corpus 你能做的最有資訊量的事,就是計算其配對相關性矩陣。如果「一百萬個策略」其實只是同一策略的偽裝,那個矩陣會在 ρ = 1 附近飽和。它沒有。下方的直方圖是橫跨近 30,000 個策略(按 30 個資產分割分層抽樣)的配對相關性分布,約 4.5 億個配對。
想對同一矩陣做 Marchenko–Pastur 解讀,有多少特徵值是訊號 vs 隨機矩陣虛無,請見 strategy-rmt。想看跨資產類比(橫跨 9 資產宇宙的滾動相關性立方體),請見 strategy-corrcube。
有效維度
整個池的平均絕對相關性為 0.123。中位數 0.072。僅 2.84% 的配對越過 |ρ| = 0.5。同資產內的平均(0.163),如你所料,略高於跨資產的平均(0.122),但兩者都遠未接近「全是同一筆交易」的上限。
以線性代數的術語來說,此 corpus 具有非常高的 有效維度:該族群所跨越的近乎正交報酬方向,遠多於其表面規模所暗示的。因此,自此池抽取的投資組合,能取用的張成集遠比一個「每個策略都是同一想法換皮」的 corpus 更為豐富。兩項實證後果直接隨之而來:
- 個別策略看起來像雜訊(巨大的特異性變異、薄弱的 IS→OOS 可預測性),正是因為每一個都捕捉了報酬空間中一個微小而獨特的切片。
- 自同一池抽取的投資組合行為大不相同,它們的特異項相互抵銷,結構性成分存留。這是 優勢在於流程 的實證樞紐,而這些投資組合的宇宙飽和行為在 strategy-robust-portfolio 中另行研究。
想看同一族群的正式嵌入視角,在 90 維度量向量上的 PCA + UMAP,請見 strategy-manifold。下方的兩段影片,是在單一資產 SOL/USDT 1H 上、使用公開揭露指標族的視覺示範。
族層級,績效曲面
八個基礎族,作為 3D 績效地景。
一個資產,SOL/USDT,1H K 棒。對每個指標族,該族的每一組參數組合都在同一滾動前推流程下被評估,所得的績效曲面被渲染為一片 3D 地景。這些是原始、未經最佳化的曲面,未套用過濾、未事後選擇、未挑揀。你在下方看到的,是每個族在本研究室任何方法論被引入之前所生成的族群。
如何讀一片曲面
在每一片曲面中,兩個水平軸(X 與 Y)是策略參數,在族內定義一個策略的可調旋鈕。垂直軸(Z)是策略績效,此處概括為滾動前推所選的樣本內視窗上的 Sharpe 比率。鏡頭環繞,讓你能從各角度檢視曲面。
重要的是 形狀,而非任一單一峰值。那種直覺式的解讀,平滑的山脊 = 穩定的盆地,尖銳的尖峰 = 脆弱且可能過擬合,在 strategy-surface-stability 中被實證檢驗,那是一項在此 corpus 上的預先註冊研究。頭條結果是 負面的:在微結構擾動下的樣本內平滑度 並非 在所測試三個資產分割(SOL 1h、DOGE 30m、BTC 30m)上下一視窗 OOS Sharpe 的族群層級預測因子。彙總效應與零無法區分(f² = 0.0002),且逐資產的符號在 DOGE 與 BTC 之間翻轉。ATR 是該模式 確實 在試點與複現間一致成立的唯一一族;動量族的行為恰好相反。策略層級的 Sharpe 差距分解是 strategy-overfitting 的主題;我們在 這裡 想傳達的,只是這個視覺事實:八個族在同一資產上產生八種明顯不同的幾何結構,那幾何結構是否能預測 OOS 技能,是一個獨立的實證問題,並有一個獨立的(且大致為虛無的)答案。
自然的後續問題是:兩個在形狀上看起來相似的族,是否其實是同一筆交易的偽裝。下方的圖回答了這一點。
以及它們之間的相關性
曲面上方的 8 × 8 面板,是在同一段 SOL/USDT 1H 切片上、每個族進場事件的滾動配對相關性。每個族被化約為單一時間序列,多頭 = +1、空頭 = −1、其餘為 0,而熱圖是這些事件序列在滾動視窗上的配對 Pearson 相關性。對角線依構造為 1;我們在意的是非對角線格子。
將相關性影片逐幀鎖定於八段曲面影片的用意在於,你能 同時觀看兩者:隨著價格走過切片,曲面雲變形,相關性格子也位移。兩個短暫共享同一市場狀態的族會在熱圖上發亮;兩個具有結構性不同時點邏輯的族則會保持暗淡,無論曲面看起來如何。格子壓倒性地保持冷色,非對角線的平均相關性在整段切片中保持接近零。八個族並非冗餘。這個想法的跨資產版本,同樣的 9 資產滾動相關性立方體,正是 strategy-corrcube 的整個主題。
變體層級,各族內部的族群結構
各族內部,變體族群。
上一節將一個族呈現為單一的績效曲面。本節將每個族展開。每族中,那組專有的統計與數學函數批次將基礎指標擴展為一個結構化的變體族群,拆分為兩個互補的子集,原始指標 + 轉換 與 原始指標 + 合流。下方的每段影片,都是某一族在 SOL/USDT 1H 上變體族群的即時 PCA 佈局,並在共同移動的策略之間繪製邊。
如何讀一張變體圖
圖表機制,明確說明如下:
- 節點 = 策略。每個節點是該族擴展(轉換側或合流側)所產生的單一變體。佈局中沒有任何東西編碼變體的構造;僅編碼其 行為。
- 位置 = 該族中每對變體之間滾動 1,000 K 棒相關性矩陣的前 2 個主成分負荷。具體而言:在每一幀我們構成 C = corr(R_{t-999:t}),其中 R 為各變體的進場事件序列,取其前兩個特徵向量,並將每個變體置於其負荷處。滾動視窗隨後前進一個 bar,佈局重新計算。
- Procrustes 對齊 + EMA 平滑 套用於跨幀的負荷上。沒有這一步,每次 PCA 重擬合都可能翻轉基底並任意旋轉雲團;有了它,雲團 漂移 而非跳躍,視覺運動反映的是相關性流形中真實的結構變化,而非簿記性的人為偽影。
- 邊 連接 |ρ| ≥ 0.20 的配對。藍綠 = 正、紅 = 負;粗細與不透明度隨 |ρ| 縮放。門檻是一個旋鈕,調低它,圖會變成一團毛球;調高它,只剩最強的共動者留存。
- 側欄 = 三條追蹤族群凝聚力的時間序列:AVG |ρ|、MEDIAN |ρ|,以及高於門檻的配對百分比。觀察它們在市場狀態連貫的區段中上升,並在狀態破裂時再度下降。
拓撲透鏡:每一幀的相關性矩陣可轉化為一個度量(d_ij = √(2(1−ρ_ij))),而該度量在變體族群上誘導出一個 Vietoris–Rips 複形。在圖上群聚的節點對應於橫跨過濾尺度而存留的 0-cycle;1-cycle 的出現與消解則追蹤該族中的市場狀態轉換。同一套機制的持續性條碼處理,在完整 corpus 而非單一族上,存於 strategy-tda;使用 90 維度量向量的正式 PCA + UMAP 嵌入則在 strategy-manifold。
正確解讀這些圖很重要:佈局是一個高得多維相關性流形的 2D 投影。在投影中看起來相近的兩個節點,在完整空間中未必相近;它們是在最大變異的兩個方向上相近。邊才是真相的守護者,一條邊表示這兩個變體在底層空間中確實共動,無論它們在螢幕上落於何處。
這些片段背後的渲染與分析腳本,存於本研究室內部的 SOL 策略專案;專有部分(尤其是變體構造批次)並不在工具鏈的公開部分中。
所有族,疊加
上方的合併面板是每一個被視覺化族中的每一個變體,置於一個共同的 2D 佈局中。每個族帶有一種顏色。重點不在於某一族勝出,重點在於這些族佔據投影相關性流形中 不同的區域。不同族的變體不會匯聚成單一團塊;它們各守自己的鄰域,僅在市場狀態交叉時出現短暫重疊。
那種分離,正是高有效維度在 組成 層級上的樣貌,而不只是平均相關性的層級。該池不僅在平均上不相關;它在結構上是異質的。因此,一個橫跨各族抽樣的穩健性過濾器,是從真正不同的子流形中抽取,而非從不同角度切割一片同質的雲。這正是使族群層級評估成為一個有別於個別策略搜尋的問題之所在。
簡而言之
「數以千計的策略」本身並非一項研究主張。它是一個評估基底的規模。該基底以窮舉方式構建,確定性、無挑揀,而其內部幾何由低配對相關性主導,而非冗餘。3D 曲面那一節顯示,八個基礎族不是同一個族出現八次。變體圖那一節顯示,一個族內的變體族群本身就有結構,且跨各族其結構保持分離。這個組合正是使族群層級評估成為一個有別於個別策略搜尋的問題之所在,也正是使 優勢在於流程 的投資組合層級發現變得非平凡之所在。
對本頁分析有所貢獻或延伸的實驗室筆記:
- strategy-rmt,相關性矩陣的 Marchenko–Pastur 與平行分析特徵譜,即上方直方圖的正式版本。
- strategy-manifold,從 90 維度量向量對族群進行 PCA + UMAP 嵌入。
- strategy-tda,同一相關性距離複形上的持續性條碼,但在完整 corpus 上。
- strategy-corrcube,跨資產滾動相關性立方體;此處所示變體層級結構的資產層級類比。
- strategy-stats,族群層級的 Sharpe 密度與 (μ, σ, t) 散佈;上方維度計數器背後的輔助函式庫。
- strategy-overfitting,將 IS–OOS Sharpe 差距的變異數分解為選擇偏差、參數選擇雜訊與殘餘。
- strategy-robust-portfolio,對自同一池抽取投資組合的宇宙飽和分析。
若你仍未被說服,SSRN 可重現性套件 隨附工作論文中的每一項彙總與每一張圖。執行它,並記得,能重現的是對 corpus 進行操作的 分析,而非 corpus 本身。
優勢在於流程
本頁存在所要支撐的那篇文章,一個策略族群的用途何在,附四個互動模擬與七張圖。可由每日 PnL 重現。
工作論文,SSRN
策略內置換檢定對前推選擇的預測價值。重現分析彙總,而非 corpus 本身。
實驗室
十二個開源 M-models。最直接觸及 corpus 的幾個連結於上方。

