實驗室

M/02 · Higher Criticism + Model-X Knockoffs

具 FDR 控制的稀疏訊號偵測

以 Higher Criticism 進行全域稀疏訊號篩檢,並搭配 Model-X knockoffs 在策略族群上做受控 FDR 的變數選擇。

數學原理

Higher Criticism

假設你從 p 個假設檢定中觀測到 p 個雙尾 p 值 。在全域虛無下,這些順序統計量的分布等同於 p 個 i.i.d. Uniform(0,1) 變數的順序統計量,其第 j 個期望值為 j/(p+1)。Higher Criticism 統計量將經驗 CDF 與其均勻期望相比較,並以虛無下二項分布的變異數加以標準化:

其中 α 通常取為 1/2。Donoho & Jin(2004)證明,在「稀少且微弱」的對立假設下,一個稀疏比例 p−β 的非虛無項、其效應量為 ,HC 在那條任何閾值法則都無法跨越的偵測邊界上是漸近最優的。作為附帶好處,argmax j* 提供了一個由資料驅動的切點:拒絕最小的 j* 個 p 值。

Model-X knockoffs

對於 p 個具已知聯合分布的特徵 X1, …, Xp,一個 Model-X knockoff 矩陣 X̃ 滿足兩個條件:

  • 成對可互換性(pairwise exchangeability):對任意子集 S ⊆ {1,…,p}
  • 與反應變數的條件獨立性

為原始變數建構任一特徵重要性統計量 Zj,並為其 knockoff 建構 Z̃j(例如 lasso 係數、迴歸 z 值)。knockoff 統計量為

在虛無下,Wj 的正負號為對稱且可互換。knockoff 濾波器選取使下式成立的最小閾值 t:

並選出 S = {j : Wj ≥ t}。Candes 等人(2018)的定理 3.4 隨即給出對修正後偽發現率的有限樣本控制

實例演算

p = 200 個特徵;k = 10 個為真正的非虛無、效應 A = 3.0;其餘 190 個為純 N(0, 1)。比較三種程序:

  • 天真的 |z| > 1.96:選出約 14 個特徵(10 個真 + 約 4 個虛無),但隨 p 增大,偽發現比例會以 2.5% × p / k 暴增。
  • Higher Criticism:選出最小的 j* 個 p 值,其中 j* = argmax HC。在 A = 3 的稀疏訊號下,j* 會落在接近真實 k 處。
  • q = 0.10 的 knockoff 濾波器:選出約 9 個特徵,預期 ≤ 1 個偽發現。

下方的示範會即時重新生成這個實驗。請注意,當 A → 0(訊號微弱)時,knockoff 濾波器會正確地回傳空集合,而非捏造選取結果,這是任何天真的閾值法則都不具備的性質。

Demo: Higher Criticism vs Model-X Knockoffs

p features, k true non-nulls with effect size A. Knockoffs control FDR at level q; HC chooses a data-driven threshold from the empirical p-value process.

p (features)200
k (true non-nulls)10
A (signal strength)3.0
q (target FDR)0.10
seed=11
|z|>1.96 (naive)
selected19
true positives9
false positives10
FDP52.6%
power90.0%
Higher Criticism
HC*3.50
argmax j43
selected43
FDP76.7%
power100.0%
Knockoffs @ q=0.10
threshold t
selected0
true pos0
false pos0
FDP0.0%
power0.0%
08152331-4.6-3.1-1.50.01.53.14.6W_j = |Z_j| − |Z̃_j|

Histogram of W statistics. Amber overlay = true non-nulls. The vertical green line is the knockoff threshold +t; everything to the right is selected. Note that under H0, W is symmetric about 0, that’s what makes the FDR control work.

圖表

Fig. 1:BTC 樣本外策略池上的 knockoff W 統計量 Wⱼ = |Zⱼ| − |Z̃ⱼ|。Z 由真實 Sharpe 乘以 √n_trades 並經 MAD 標準化建構而成;Z̃ 為一個正負號對稱的高斯 knockoff。琥珀色虛線是達成 FDR 目標 q = 0.10 的資料驅動 τ;所選策略即為 τ 右側的全部。
Fig. 2:Higher-Criticism HCⱼ = √p · (j/p − p₍ⱼ₎)/√((j/p)(1−j/p)) 掃過同一 BTC 池中排序後 p 值的秩 j。HC* 為 j ∈ [1, p/2] 上的最大值。虛線/點線為 HC* 在 uniform-pᵢ 虛無下的 95% 與 99% 分位數,該虛無由同維度的 400 次模擬重抽建構而成。

為何這對系統性策略至關重要

一個在單一資產上具 p = 38,000 個參數組合的策略池,在任何未經調整的閾值下都會產生數千個名目上顯著的 t 統計量。金融界的標準補救方式一向是 Bonferroni(過於保守,扼殺真實訊號)或 BH-FDR(在獨立性下正確,但在任意相依下失效)。Knockoffs 正是為交易策略池實際呈現的相依結構而設計:它們共用市場資料、指標家族、參數鄰域。

搭配使用:先在策略池上執行 Higher Criticism。若 HC* 低於其漸近虛無分位數,便停下,在此稀疏度下不存在可偵測的訊號。若 HC* 高於該分位數,再執行 knockoffs,在受控 FDR 下萃取出負責的特徵。

可重現性

DaruFinance / hc-knockoffs

R · 開源參考實作

最小調用

library(hc.knockoffs)

# Z: vector of per-strategy z-scores, length p
hc <- higher_criticism(Z)
hc$HC_star      # global statistic
hc$selected     # indices below the HC threshold

# Model-X knockoffs at FDR q = 0.10
sel <- knockoff_filter(Z, q = 0.10, method = "gaussian")
sel$tau         # data-dependent threshold
sel$selected    # selected feature indices

參考文獻

  1. [1]Donoho, D. & Jin, J. (2004). Higher criticism for detecting sparse heterogeneous mixtures. Annals of Statistics 32(3), 962–994.
  2. [2]Barber, R. F. & Candes, E. J. (2015). Controlling the false discovery rate via knockoffs. Annals of Statistics 43(5), 2055–2085.
  3. [3]Candes, E., Fan, Y., Janson, L. & Lv, J. (2018). Panning for gold: Model-X knockoffs for high-dimensional controlled variable selection. JRSS-B 80(3), 551–577.
  4. [4]Benjamini, Y. & Hochberg, Y. (1995). Controlling the false discovery rate: a practical and powerful approach to multiple testing. JRSS-B 57(1), 289–300.