Revisão de pesquisa · aprendizado de máquina cross-sectional · estudo 15
Cross-Sectional Machine Learning
Rode o aparato idêntico no regime mais forte do aprendizado de máquina, ordenando toda a seção transversal a cada barra em vez de prever a direção de uma série, e o primeiro edge do programa sobrevive à deflação, chegando exatamente ao lado do melhor arquétipo estático sem superá-lo
Todo resultado de aprendizado de máquina anterior nesta revisão viveu no regime mais fraco do ML: prever a direção de uma única série. Ele falhou na deflação, exatamente como a literatura prevê. O teste justo do fio condutor “nada passa na significância deflacionada” é rodar o aparato idêntico de purged-cross-validation, Deflated Sharpe Ratio, Probability of Backtest Overfitting e N-efetivo no regime mais forte do ML, previsão cross-sectional de retornos, onde a cada barra você ordena todo o universo e rotaciona capital de forma neutra ao mercado para os melhores nomes. O veredito se inverte, parcialmente. O edge cross-sectional sobrevive à deflação, mas se aproxima em vez de superar o melhor arquétipo estático de carry/momentum. Essa nuance é o resultado que vale a pena publicar.
Advances in Financial ML, Cap. 7 & 8
López de Prado (2018) · purged CV & feature importance
Código & dados
lopez-de-prado-work-review / projects / 15
the claim
O que diz López de Prado
- O aprendizado de máquina agrega valor quando prevê a seção transversal de retornos sob validação adequada, e muito menos quando lhe pedem para prever a direção de uma única série, a seção transversal é o regime defensável.
- Qualquer edge de backtest deve passar no Deflated Sharpe Ratio contra o número e a dispersão de tentativas, e a Probability of Backtest Overfitting deve ser baixa para que uma ordenação in-sample signifique algo out-of-sample.
- Em dados financeiros tabulares, árvores com gradient boosting empatam ou superam redes neurais profundas com mais frequência do que o contrário.
our result
O que encontramos
- A divisão por regime é exatamente como descrita. O ML de série única é cara-ou-coroa ou pior out-of-sample (PBO 0,62) e nada das ~25.162 estratégias sobrevive à deflação. O ML cross-sectional tem PBO baixo (0,10), forte persistência de ranking in-sample para out-of-sample (rho +0,78), e passa na barra do Deflated Sharpe em todo horizonte para o modelo de referência (lgbm, 10 de 10).
- O edge é real, mas limitado: profit factor mediano out-of-sample de 1,123, líquido de um modelo completo de custo por execução. Ele alcança, mas não supera, o melhor arquétipo estrutural estático (cerca de PF 1,17). A manchete honesta é que edge de ML ≈ edge estático, nenhum domina.
- As árvores venceram o confronto na mesma tarefa: lgbm, catboost e xgb passam ou se aproximam da barra de deflação (23 de 30 combinações de árvores), enquanto duas famílias neurais rodadas no painel, rótulo, walk-forward e modelo de custo idênticos perdem dinheiro líquido de custos e não passam em nada. O achado de dados tabulares é confirmado em nossos próprios dados, não apenas citado.
O resultado em três linhas
Inversão de regime · mesmo aparato
O regime mais forte do ML passa na deflação
A previsão de direção de série única (ML mais fraco) registra PBO 0,62 e 0 de ~25.162 estratégias sobrevivem à deflação. Troque apenas o alvo de previsão para ordenação cross-sectional (ML mais forte) e a árvore de referência passa na barra do Deflated Sharpe em 10 de 10 horizontes, com PBO 0,10 e persistência de ranking IS→OOS rho +0,78.
Edge ≈ estático · nenhum domina
Real, com custos, sobrevive à deflação, mas limitado
O portfólio long-short rotativo obtém um profit factor mediano out-of-sample de 1,123 ao longo de dez horizontes, líquido de custos completos por execução. Isso alcança o melhor arquétipo estático de carry/momentum (cerca de PF 1,17) por uma rota diferente e menos lotada, mas não o supera. O valor do ML aqui é paridade, não almoço grátis.
Árvores batem redes · 23/30 vs 0
Mesma tarefa, mesmos custos, árvores vencem
Três famílias de árvores com gradient boosting passam ou se aproximam da barra de deflação do False Strategy Theorem (lgbm 10/10, catboost 9/10, xgb 5/10, 23 de 30 combinações). Uma rede feed-forward e uma rede recorrente no painel, rótulo, walk-forward e modelo de custo idênticos terminam ambas abaixo do break-even após custos (PF ≤ 1, Sharpe negativo) e não passam em nada.
A inversão de regime, série única vs cross-sectional
Troque apenas o alvo de previsão, e o primeiro edge do programa sobrevive à deflação
Mesmos modelos, mesma rotulagem triple-barrier, mesmo purged walk-forward, mesmo modelo de custo. A única coisa que muda é o alvo de previsão. A direção de série única pergunta a uma série ruidosa se ela sobe ou desce; a auditoria do programa colocou o número efetivo de apostas independentes em cerca de 40 das 25.162 estratégias nominais, e a melhor in-sample cai na metade inferior out-of-sample 62% das vezes. A deflação mata tudo isso.
A seção transversal faz uma pergunta muito mais fácil e estável, quais nomes vão superar quais, e agrega ao longo de um universo amplo a cada barra, o que dilui o ruído idiossincrático e produz uma ordenação que persiste out-of-sample (rho +0,78). Essa persistência é exatamente o que permite passar na barra de deflação. A inversão é a previsão da literatura, observada.
| regime | PBO | sobrevivência DSR | rho IS→OOS | PF OOS mediano | veredito |
|---|---|---|---|---|---|
| single-series (ML weakest)pooled band, 25,162 strategies | 0.62 | 0 of 25,162 | n/a | ~1.0 | fails deflation |
| cross-sectional (ML strongest)gradient-boosted trees, 10 horizons | 0.10 | 10 of 10 horizons | +0.78 | 1.123 | survives deflation |
PBO via CSCV; N-efetivo via razão de participação de autovalores; DSR via o benchmark do False Strategy Theorem, tudo do conjunto de ferramentas de deflação do programa. O PBO de manchete e a persistência de ranking são os números canônicos por janela do motor de rotação dedicado (o eixo de tentativas correto). O N-efetivo é medido em eixos diferentes (série única: cerca de 40 independentes de 25.162; cross-sectional: apostas de horizonte independentes de 10), então os dois não são diretamente comparáveis. O melhor benchmark estrutural estático de carry/momentum fica em cerca de PF 1,17.
O edge cross-sectional, horizonte a horizonte
Um portfólio long-short rotativo por horizonte de previsão
A cada barra, ordene o universo vivo por um score causal de árvore por nome, fique long no quantil superior e short no inferior, neutro ao mercado, com os knobs de dimensionamento de aposta (quantil, long-only, tilt, throttle de rebalanceamento) ajustados in-sample por janela walk-forward. Dez horizontes foram buscados; eles fazem parte da mesma família de tentativas que a barra de deflação contabiliza. O edge é mais forte em horizontes curtos a médios e decai suavemente conforme o período de manutenção cresce, consistente com uma seção transversal de momentum-e-reversão em vez de um horizonte de sorte. O modelo de referência (lgbm) passa no rigoroso Deflated Sharpe por horizonte (ajustado por assimetria e curtose, deflacionado contra a família de dez horizontes) em todos os dez.
| H (barras) | PF OOS | Sharpe OOS (anual.) | DSR | sobrevive |
|---|---|---|---|---|
| 4 | 1.148 | 3.23 | ~1.00 | yes |
| 6 | 1.127 | 2.79 | ~1.00 | yes |
| 8 | 1.120 | 2.61 | ~1.00 | yes |
| 12 | 1.158 | 2.66 | ~1.00 | yes |
| 24 | 1.149 | 3.62 | ~1.00 | yes |
| 48 | 1.111 | 2.62 | ~1.00 | yes |
| 72 | 1.140 | 3.36 | ~1.00 | yes |
| 120 | 1.107 | 2.56 | ~1.00 | yes |
| 168 | 1.095 | 2.39 | ~1.00 | yes |
| 336 | 1.089 | 2.19 | ~1.00 | yes |
O Sharpe anualizado usa a anualização por frequência de barra do próprio motor e é indicativo; os retornos de rotação são autocorrelacionados dentro de um período de manutenção, então o número efetivo de observações independentes, e o Sharpe honesto, são menores do que a contagem bruta de barras sugere. O veredito de deflação e o profit factor não dependem dessa escolha de anualização. Cada horizonte é avaliado ao longo de cerca de 42.000 barras out-of-sample.
O veredito de deflação, família a família
A sobrevivência cross-sectional não é um artefato de modelo único. Toda a varredura é tratada como uma família de testes múltiplos. Sob o False Strategy Theorem, o Sharpe máximo esperado que um buscador sem habilidade registraria ao longo de N tentativas é computado a partir da dispersão dos estimativas realizados de Sharpe out-of-sample por barra, e uma combinação (família, horizonte) “passa” apenas se seu Sharpe out-of-sample exceder essa barra. Na contagem de tentativas de manchete N=40 a barra é um Sharpe anualizado de cerca de 1,76.
Isso é 23 de 30 combinações de árvore passando em uma barra genuína de testes múltiplos, contra 0 de cerca de 25.162 estratégias de série única. As três famílias foram rodadas ponta a ponta no mesmo painel honesto quanto a sobrevivência e no mesmo purged walk-forward, então a sobrevivência é corroborada em implementações de árvore independentes, não afirmada a partir de uma só. (Um PBO recalculado apenas sobre as dez colunas de horizonte de um modelo lê 0,62 por construção, os horizontes são apostas quase idênticas do mesmo modelo, então esse cross-check é reportado claramente rotulado e não é a manchete; o PBO canônico por janela é 0,10.)
| família | horizontes que passam (de 10) | PF OOS mediano | veredito |
|---|---|---|---|
| lgbm | 10 of 10 | 1.123 | clears |
| catboost | 9 of 10 | 1.125 | clears (longest falls below) |
| xgb | 5 of 10 | 1.072 | partial |
Árvores versus redes neurais na tarefa idêntica
A contrapergunta justa é se uma rede neural, dado o mesmo painel, o mesmo rótulo de ranking cross-sectional para a frente, o mesmo purged walk-forward, a mesma busca de dimensionamento de rotação e o mesmo modelo de custo por execução, se sai melhor. O achado repetido da literatura é que não. Testamos isso diretamente em vez de afirmá-lo: uma rede feed-forward por barra (mlp) e uma rede recorrente por par (lstm) foram rodadas em um acelerador gerenciado (o painel completo excede uma placa local) e pontuadas a partir de seus ledgers out-of-sample reais contra a mesma barra do False Strategy Theorem que as árvores enfrentaram.
Esta é uma confirmação limpa, na mesma tarefa, do achado tabular da literatura em nossos próprios dados. As famílias neurais não são um quase-acerto que melhor ajuste resgataria aqui, elas estão abaixo do break-even após custos, enquanto as árvores passam por um corte genuíno de deflação. As árvores batem as redes na rotação cross-sectional, sob custos e validação idênticos.
| família | H | PF OOS | Sharpe OOS (anual.) | DSR | veredito |
|---|---|---|---|---|---|
| mlp | 24 | 0.984 | −0.40 | 0.13 | below bar |
| mlp | 72 | 0.982 | −0.44 | 0.11 | below bar |
| mlp | 168 | 0.983 | −0.42 | 0.12 | below bar |
| lstm | 6 | 0.940 | −1.51 | n/a | below bar |
Cada linha neural é pontuada a partir de seu ledger out-of-sample real por barra exatamente sobre o aparato que as árvores usaram, incluindo a mesma barra do False Strategy. As famílias neurais restantes (um conjunto recorrente com gating, um conjunto de convolução temporal e um conjunto de atenção entre pares) não produziram um ledger utilizável nesta passagem e são registradas como adiadas, sem número anexado, em vez de estimadas.
Multimercado, o edge se mantém fora do cripto?
O edge se replica em ações dos EUA, mas sua significância deflacionada escala com amplitude e giro
A seção transversal de cripto é um painel amplo de centenas de instrumentos líquidos. Para verificar se o edge é uma propriedade desse único mercado ou da ideia de rotação, rodamos a receita idêntica em um universo limitado e líquido de ações de large-cap dos EUA, cerca de 240 nomes, uma mediana de aproximadamente 245 vivos por barra, barras diárias ajustadas ao longo de aproximadamente onze anos. A cada barra ordenamos o universo vivo pelo mesmo score causal de árvore por nome, rotacionamos long no quantil superior e short no inferior (neutro ao mercado), ajustamos os knobs de rotação in-sample dentro de cada janela purged walk-forward, e cobramos custos realistas por execução (mediana 3,4 bp/lado). A família de modelo é a árvore com gradient boosting que venceu no cripto.
O edge bruto sobrevive à mudança para ações, mas é mais fino. O profit factor está na mesma vizinhança do cripto, um profit factor mediano out-of-sample de cerca de 1,105 ao longo dos cinco horizontes (cripto cerca de 1,123), atingindo pico perto de 1,15 no horizonte de duas semanas, com os horizontes médios mais fortes e os horizontes muito curtos e muito longos mais fracos. Mas os Sharpe ratios anualizados são muito menores do que os do cripto (cerca de 0,3 a 0,7 versus os cerca de 2,7 do cripto), porque uma rotação diária de ações tem muito menos rebalanceamentos e uma amostra efetiva muito menor do que uma rotação horária sobre um painel muito maior.
| H (dias) | PF OOS | Sharpe OOS (anual.) | DSR | sobrevive |
|---|---|---|---|---|
| 1 | 1.096 | 0.44 | 0.75 | no |
| 5 | 1.105 | 0.53 | 0.83 | no |
| 10 | 1.149 | 0.74 | 0.94 | no |
| 21 | 1.132 | 0.66 | 0.91 | no |
| 63 | 1.060 | 0.29 | 0.59 | no |
Sobrevivência. O universo de ações é uma lista fixa de membros large-cap atuais, então nomes que foram large-cap antes mas que desde então saíram do índice (deslistagens, aquisições, rebaixamentos) estão ausentes. Isso é um leve viés de alta na perna long; o resultado é consciente da sobrevivência, mas não livre de sobrevivência, e deve ser lido como um limite quase-superior em vez de uma estimativa limpa. Listagens posteriores entram na seção transversal apenas quando passam a ser negociadas (gating dentro do span de vida), então não há look-ahead sobre datas pré-listagem. Uma execução totalmente livre de sobrevivência sobre um histórico de composição point-in-time é o follow-up natural.
O edge de ML cross-sectional se replica parcialmente em ações dos EUA: o sinal e a magnitude do profit factor se transferem quase exatamente, mas a significância estatística não, porque a rotação diária de large-cap simplesmente tem menos informação independente por unidade de tempo do que um painel amplo de cripto horário. Isso afia em vez de derrubar a manchete. O regime cross-sectional é genuinamente o regime de ML mais forte em ambos os mercados, produz um edge real, com custos, positivo, onde a previsão de direção de série única produz ruído, mas se esse edge passa por um corte de testes múltiplos depende da amplitude e da frequência de rebalanceamento do painel: o painel mais amplo e mais rápido passa; ações large-cap diárias ficam por pouco aquém.
Método
- Perna de série única: o corpus pooled band do programa de 25.162 estratégias de previsão de direção (rótulos triple-barrier, purged walk-forward, custos por execução), pontuado através do conjunto de ferramentas de deflação do programa (PBO via CSCV, N-efetivo via razão de participação de autovalores, DSR via o False Strategy Theorem). Veredito: PBO 0,62, N-efetivo cerca de 40, zero sobreviventes da deflação.
- Perna cross-sectional: um universo amplo de perpetual-swap honesto quanto a sobrevivência de 787 pares. A cada barra, ordene o universo vivo por um score causal de árvore com gradient boosting por nome e rotacione um portfólio long-short neutro ao mercado para os quantis superior e inferior, com os knobs de dimensionamento de aposta ajustados in-sample por janela purged walk-forward. Dez horizontes de previsão (4 a 336 barras), modelo completo de custo por execução. Apenas dados reais.
- Contabilidade de deflação: toda a varredura cross-sectional é uma família de testes múltiplos. O Sharpe máximo esperado sem habilidade do False Strategy Theorem é computado a partir da dispersão do Sharpe OOS realizado por barra ao longo das 30 combinações de árvore concluídas; uma combinação passa apenas se seu Sharpe OOS exceder essa barra. O modelo de referência adicionalmente carrega um rigoroso DSR por horizonte (ajustado por assimetria e curtose, deflacionado contra a família de dez horizontes).
- Famílias de árvore: lgbm, catboost e xgb rodaram ponta a ponta no painel completo. Random forest e extra-trees foram cortados como impraticavelmente lentos e pesados em memória na largura completa; as famílias lineares foram interrompidas pelo guarda de memória no meio da busca. Estas não carregam resultado e são registradas como adiadas.
- Famílias neurais: uma rede feed-forward por barra (mlp) e uma rede recorrente por par (lstm) foram rodadas em um acelerador gerenciado no painel, rótulo, walk-forward, busca de dimensionamento e modelo de custo idênticos, depois pontuadas a partir de seus ledgers OOS reais contra a mesma barra do False Strategy. Os conjuntos recorrente com gating, de convolução temporal e de atenção entre pares não produziram um ledger utilizável e são adiados sem número.
- Verificação multimercado: o motor cross-sectional não modificado em um universo limitado e líquido de cerca de 240 nomes large-cap dos EUA, barras diárias ajustadas ao longo de aproximadamente onze anos (mediana cerca de 245 vivos por barra), cinco horizontes (um dia a um trimestre), custos realistas por execução (mediana 3,4 bp/lado). Consciente da sobrevivência (membros atuais, gating dentro do span de vida); uma fina execução smoke bônus de FX e setor é guardada separadamente.
Notas & avaliação honesta
Isto fecha a única lacuna estrutural do programa, ele não tinha cobertura cross-sectional, e entrega seu primeiro edge de ML que sobrevive à deflação. A manchete honesta é mantida ao longo de tudo: o edge de ML cross-sectional se aproxima, mas não supera o melhor arquétipo estrutural estático (cerca de PF 1,17). A afirmação publicável é, portanto, mais forte e mais defensável do que “nada funciona”: o aprendizado de máquina conquista um edge cross-sectional real, que sobrevive à deflação, mas chega a aproximadamente o mesmo lugar onde uma estratégia estática bem construída de carry/momentum já se encontra. Edge de ML ≈ edge estático; nenhum domina. O valor do ML aqui é paridade por uma rota diferente e menos lotada, não um almoço grátis sobre a estrutura. Onde uma estatística é recalculada em um eixo de tentativas diferente do motor dedicado, o número canônico por janela é a manchete e o recálculo é rotulado como cross-check; os dois nunca são confundidos.
Reprodutibilidade
Os resultados de série única e cross-sectional, a tabela de deflação a nível de família, os ledgers das famílias neurais, a perna de ações dos EUA, as figuras e o conjunto de ferramentas de deflação estão reunidos no projeto 15 de lopez-de-prado-work-review. Os scripts de análise recalculam DSR, PBO e N-efetivo a partir dos ledgers guardados e são idempotentes e robustos a entradas faltantes; eles leem ledgers e não treinam nada.
Citar
Referências
As fontes primárias do trabalho revisado aqui:
- López de Prado, M. (2018). Advances in Financial Machine Learning. Wiley. (Ch. 7 purged cross-validation; Ch. 8 feature importance.)
- Bailey, D. H., & López de Prado, M. (2014). The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting, and Non-Normality. Journal of Portfolio Management, 40(5).
- Bailey, D. H., Borwein, J., López de Prado, M., & Zhu, Q. J. (2017). The Probability of Backtest Overfitting. Journal of Computational Finance, 20(4).
- López de Prado, M. (2019). A Data Science Solution to the Multiple-Testing Crisis in Financial Research. Journal of Financial Data Science, 1(1).
Veja também
O estudo complementar sobre deflação de testes múltiplos é Backtest Overfitting & the Deflated Sharpe Ratio, a maquinaria de rotulagem e purged-cross-validation está em Labeling & Cross-Validation, o tema da disciplina de seleção atravessa The edge is in the process, e o corpo de trabalho mais amplo está em Research.

