SSRN 論文籌備中
本評析十二項研究的完整論文正在為 SSRN 籌備中。下方的研究與結果均已完成。
研究評析 · López de Prado
López de Prado, 重現與評析
從零開始重現並大規模延伸 Marcos López de Prado 的方法,涵蓋加密貨幣、美國股票與外匯,每一項實證主張都以 Deflated Sharpe Ratio 把關
這是一個從零開始建立的重現與延伸計畫,圍繞 Marcos López de Prado 在 Advances in Financial Machine Learning 及其相關論文中的方法展開,資訊驅動的 K 線、分數階差分、金融標記與交叉驗證、ensemble 與特徵重要性、投資組合建構、因果因子、預測性特徵,以及押注規模設定。每項研究先在受控的基準上重現原始主張,接著在涵蓋加密貨幣、美國股票與外匯的真實、計入完整成本、無前視偏誤的資料上大規模重跑,並以 Deflated Sharpe Ratio 對每一項實證結論把關。
誠實的主線很簡單: 幾乎沒有任何結果能在任何地方通過 deflated 顯著性 ,而這正是 López de Prado 的核心論點,同時他的若干 方法論 主張卻能乾淨地重現:活動時鐘確實使尾部變薄、分數階差分確實保留了記憶性、bagging 確實能在 boosting 無法奏效之處實現泛化,而一個混淆因子確實能憑空製造出一個因子。這些是方法論上的結果,而非獲利上的結果,全程都是以此方式呈現。
評析,以數字呈現
程式碼與資料
github.com/DaruFinance/lopez-de-prado-work-review
12 項研究 · 3 類資產
每項主張皆經 deflated
真實、計入完整成本、無前視偏誤的資料
各項研究
元策略組織
流水線模式,專業化、可分離的研究角色,加上對每一次嘗試的強制揭露,作為對單打獨鬥式回測搜尋的結構性解方。
回測過度擬合與 Deflated Sharpe Ratio
在涵蓋加密貨幣、股票與外匯的約 92,500 個真實策略中,表現最佳者在任何市場都未能勝過其多重檢定的虛無假設。
資訊驅動的 K 線
美元 / 成交量 / tick K 線在三個市場都使報酬高斯化,取決於粒度,且股票需要處理交易時段。
分數階差分
固定寬度的分數階差分與價格水準維持約 0.98 的相關性,而單純報酬僅約 0.01。
標記與交叉驗證
k-fold 的洩漏隨標記時程與 fold 大小之比而擴大;meta-labeling 是精準度濾網,而非 alpha。
預測性特徵
結構性斷點 / 熵 / 微結構特徵帶有微弱訊號,無法在計入成本與 deflation 後存活;一個廉價代理變數可匹敵昂貴的訂單流資料。
Ensemble 與特徵重要性
bagging 在 40 檔工具的 100% 上比 boosting 泛化能力高約 4.8×;MDI 有替代偏誤,MDA 沒有。
交易規則與押注規模
押注規模設定使周轉率下降 80–87%,但未增添 deflated 後的優勢;Triple-Penance AR(1) 回撤控制才是經驗證的勝出之處。
投資組合建構:HRP、NCO 與去雜訊
HRP / NCO 在樣本外變異數上勝過原始 Markowitz;去雜訊的價值是 q = T/N 的函數。
因果因子投資
一個混淆因子會使一個虛無因子在 100% 的情況下看似顯著;後門調整可修正此問題,而能存活的真實因子寥寥無幾。
樣本唯一性與序列自助法
重疊的 triple-barrier 標記使觀測值非 IID;唯一性加權與序列自助法在訓練前還原有效樣本數。
橫斷面 ML
在單一序列 ML 失效之處,樹模型在橫斷面上通過了 deflation:lgbm 在 10 個時程中的 10 個上通過 Deflated Sharpe,是本計畫首個通過 DSR 的 ML 優勢,逼近但未能勝過最佳的靜態原型。
貫穿此計畫的選擇紀律主題,與 The edge is in the process 以及 Research 中更廣泛的成果背後的主題如出一轍。

