M/02 · Higher Criticism + Knockoffs Model-X
Detecção de sinais esparsos com controle de FDR
Higher Criticism para triagem global de sinais esparsos, combinado com knockoffs Model-X para seleção de variáveis com FDR controlado em populações de estratégias.
A matemática
Higher Criticism
Suponha que você observe p p-valores bilaterais de p testes de hipótese. Sob o nulo global, as estatísticas de ordem se distribuem como as estatísticas de ordem de p variáveis Uniformes(0,1) i.i.d., com j-ésimo valor esperado j/(p+1). A estatística Higher Criticism compara a CDF empírica à sua expectativa uniforme, escalada pela variância de uma binomial sob o nulo:
com α tipicamente tomado como 1/2. Donoho & Jin (2004) mostram que sob a alternativa raro-e-fraco, uma fração de esparsidade p−β de não-nulos com tamanho de efeito , HC é assintoticamente ótimo na fronteira de detecção que nenhuma regra de limiar consegue cruzar. Como benefício adicional, o argmax j* fornece um corte orientado por dados: rejeite os menores j* p-valores.
Knockoffs Model-X
Para p features X1, …, Xp com distribuição conjunta conhecida, uma matriz knockoff Model-X X̃ satisfaz duas condições:
- Intercambialidade par-a-par: para qualquer subconjunto S ⊆ {1,…,p},
- Independência condicional da resposta:
Construa qualquer estatística de importância de feature Zj para a variável original e Z̃jpara seu knockoff (e.g. coeficientes lasso, z-scores de regressão). A estatística de knockoff é
Sob o nulo, o sinal de Wj é simétrico e intercambiável. O filtro de knockoff escolhe o menor limiar t tal que
e seleciona S = {j : Wj ≥ t}. O Teorema 3.4 de Candes et al. (2018) então fornece controle em amostra finita da taxa modificada de falsas descobertas
Exemplo trabalhado
p = 200 features; k = 10 verdadeiramente não-nulas com efeito A = 3,0; as 190 restantes são puro N(0, 1). Compare três procedimentos:
- Ingênuo |z| > 1,96: seleciona ~14 features (10 verdadeiras + ~4 nulas) mas conforme p cresce a proporção de falsas descobertas explode em 2,5% × p / k.
- Higher Criticism: seleciona os menores j* p-valores onde j* = argmax HC. Com sinal esparso a A = 3, j* cai perto do verdadeiro k.
- Filtro de knockoff a q = 0,10: seleciona ~9 features, esperado ≤ 1 falsa descoberta.
O demo abaixo regenera o experimento ao vivo. Observe que, conforme A → 0 (sinal fraco), o filtro de knockoff corretamente retorna o conjunto vazio em vez de fabricar seleções, uma propriedade que nenhuma regra de limiar ingênua possui.
Demo: Higher Criticism vs Model-X Knockoffs
p features, k true non-nulls with effect size A. Knockoffs control FDR at level q; HC chooses a data-driven threshold from the empirical p-value process.
Histogram of W statistics. Amber overlay = true non-nulls. The vertical green line is the knockoff threshold +t; everything to the right is selected. Note that under H0, W is symmetric about 0, that’s what makes the FDR control work.
Figuras
Por que isso importa para estratégias sistemáticas
Um pool de estratégias com p = 38.000 combinações de parâmetros em um único ativo produzirá vários milhares de estatísticas-t nominalmente significativas sob qualquer limiar não ajustado. O remédio padrão em finanças tem sido Bonferroni (conservador demais, mata sinais reais) ou BH-FDR (correto sob independência, quebrado sob dependência arbitrária). Knockoffs são projetados para a estrutura de dependência que pools de estratégias de trading de fato exibem: compartilham dados de mercado, famílias de indicadores, vizinhanças de parâmetros.
Uso combinado: rode Higher Criticism no pool primeiro. Se HC* estiver abaixo de seu quantil nulo assintótico, pare, não há sinal detectável nessa esparsidade. Se HC* estiver acima, rode knockoffs para extrair as features responsáveis com FDR controlado.
Reprodutibilidade
DaruFinance / hc-knockoffs
R · implementação de referência open-source
Invocação mínima
library(hc.knockoffs)
# Z: vector of per-strategy z-scores, length p
hc <- higher_criticism(Z)
hc$HC_star # global statistic
hc$selected # indices below the HC threshold
# Model-X knockoffs at FDR q = 0.10
sel <- knockoff_filter(Z, q = 0.10, method = "gaussian")
sel$tau # data-dependent threshold
sel$selected # selected feature indices
Referências
- [1]Donoho, D. & Jin, J. (2004). Higher criticism for detecting sparse heterogeneous mixtures. Annals of Statistics 32(3), 962–994.
- [2]Barber, R. F. & Candes, E. J. (2015). Controlling the false discovery rate via knockoffs. Annals of Statistics 43(5), 2055–2085.
- [3]Candes, E., Fan, Y., Janson, L. & Lv, J. (2018). Panning for gold: Model-X knockoffs for high-dimensional controlled variable selection. JRSS-B 80(3), 551–577.
- [4]Benjamini, Y. & Hochberg, Y. (1995). Controlling the false discovery rate: a practical and powerful approach to multiple testing. JRSS-B 57(1), 289–300.

