M/02 · Higher Criticism + Model-X Knockoffs
具 FDR 控制的稀疏訊號偵測
以 Higher Criticism 進行全域稀疏訊號篩檢,並搭配 Model-X knockoffs 在策略族群上做受控 FDR 的變數選擇。
數學原理
Higher Criticism
假設你從 p 個假設檢定中觀測到 p 個雙尾 p 值 。在全域虛無下,這些順序統計量的分布等同於 p 個 i.i.d. Uniform(0,1) 變數的順序統計量,其第 j 個期望值為 j/(p+1)。Higher Criticism 統計量將經驗 CDF 與其均勻期望相比較,並以虛無下二項分布的變異數加以標準化:
其中 α 通常取為 1/2。Donoho & Jin(2004)證明,在「稀少且微弱」的對立假設下,一個稀疏比例 p−β 的非虛無項、其效應量為 ,HC 在那條任何閾值法則都無法跨越的偵測邊界上是漸近最優的。作為附帶好處,argmax j* 提供了一個由資料驅動的切點:拒絕最小的 j* 個 p 值。
Model-X knockoffs
對於 p 個具已知聯合分布的特徵 X1, …, Xp,一個 Model-X knockoff 矩陣 X̃ 滿足兩個條件:
- 成對可互換性(pairwise exchangeability):對任意子集 S ⊆ {1,…,p},
- 與反應變數的條件獨立性:
為原始變數建構任一特徵重要性統計量 Zj,並為其 knockoff 建構 Z̃j(例如 lasso 係數、迴歸 z 值)。knockoff 統計量為
在虛無下,Wj 的正負號為對稱且可互換。knockoff 濾波器選取使下式成立的最小閾值 t:
並選出 S = {j : Wj ≥ t}。Candes 等人(2018)的定理 3.4 隨即給出對修正後偽發現率的有限樣本控制
實例演算
p = 200 個特徵;k = 10 個為真正的非虛無、效應 A = 3.0;其餘 190 個為純 N(0, 1)。比較三種程序:
- 天真的 |z| > 1.96:選出約 14 個特徵(10 個真 + 約 4 個虛無),但隨 p 增大,偽發現比例會以 2.5% × p / k 暴增。
- Higher Criticism:選出最小的 j* 個 p 值,其中 j* = argmax HC。在 A = 3 的稀疏訊號下,j* 會落在接近真實 k 處。
- q = 0.10 的 knockoff 濾波器:選出約 9 個特徵,預期 ≤ 1 個偽發現。
下方的示範會即時重新生成這個實驗。請注意,當 A → 0(訊號微弱)時,knockoff 濾波器會正確地回傳空集合,而非捏造選取結果,這是任何天真的閾值法則都不具備的性質。
Demo: Higher Criticism vs Model-X Knockoffs
p features, k true non-nulls with effect size A. Knockoffs control FDR at level q; HC chooses a data-driven threshold from the empirical p-value process.
Histogram of W statistics. Amber overlay = true non-nulls. The vertical green line is the knockoff threshold +t; everything to the right is selected. Note that under H0, W is symmetric about 0, that’s what makes the FDR control work.
圖表
為何這對系統性策略至關重要
一個在單一資產上具 p = 38,000 個參數組合的策略池,在任何未經調整的閾值下都會產生數千個名目上顯著的 t 統計量。金融界的標準補救方式一向是 Bonferroni(過於保守,扼殺真實訊號)或 BH-FDR(在獨立性下正確,但在任意相依下失效)。Knockoffs 正是為交易策略池實際呈現的相依結構而設計:它們共用市場資料、指標家族、參數鄰域。
搭配使用:先在策略池上執行 Higher Criticism。若 HC* 低於其漸近虛無分位數,便停下,在此稀疏度下不存在可偵測的訊號。若 HC* 高於該分位數,再執行 knockoffs,在受控 FDR 下萃取出負責的特徵。
可重現性
DaruFinance / hc-knockoffs
R · 開源參考實作
最小調用
library(hc.knockoffs)
# Z: vector of per-strategy z-scores, length p
hc <- higher_criticism(Z)
hc$HC_star # global statistic
hc$selected # indices below the HC threshold
# Model-X knockoffs at FDR q = 0.10
sel <- knockoff_filter(Z, q = 0.10, method = "gaussian")
sel$tau # data-dependent threshold
sel$selected # selected feature indices
參考文獻
- [1]Donoho, D. & Jin, J. (2004). Higher criticism for detecting sparse heterogeneous mixtures. Annals of Statistics 32(3), 962–994.
- [2]Barber, R. F. & Candes, E. J. (2015). Controlling the false discovery rate via knockoffs. Annals of Statistics 43(5), 2055–2085.
- [3]Candes, E., Fan, Y., Janson, L. & Lv, J. (2018). Panning for gold: Model-X knockoffs for high-dimensional controlled variable selection. JRSS-B 80(3), 551–577.
- [4]Benjamini, Y. & Hochberg, Y. (1995). Controlling the false discovery rate: a practical and powerful approach to multiple testing. JRSS-B 57(1), 289–300.

