← Alpha
Alpha Research · · 11 min de leitura

Dados tick a tick preveem retornos melhor do que OHLC?

900 símbolo-dias de trades e quotes de ações dos EUA em nanossegundos, contra as mesmas barras reduzidas a abertura, máxima, mínima e fechamento. Mesmos folds, mesmos modelos, mesmas sementes.

Dados de trades e quotes em nanossegundos são caros, pesados e lentos de trabalhar. Um único símbolo-dia de ações dos EUA chega como um CSV comprimido com dezenas de milhões de linhas, uma amostra modesta de cinco nomes chega a 86,6 GB comprimidos, e tudo o que vem depois exige um orçamento de engenharia diferente do que uma pasta de barras de um minuto exige.

Quem paga esse preço está comprando uma crença: a de que a microestrutura dentro do tape carrega informação que abertura, máxima, mínima e fechamento jogam fora. Essa crença raramente é testada como uma comparação controlada.

Microestrutura obviamente descreve o estado do mercado, já que spread, profundidade, mix de agressores e desequilíbrio de fluxo de ordens são literalmente medidas dele, mas descrever o presente é uma afirmação diferente de prever o futuro. A pergunta mais estreita, e a que uma mesa precisa responder antes de assinar um contrato de dados, é se as colunas extras sobrevivem em uma previsão de retorno out-of-sample, em um horizonte que alguém realmente operaria.

Montamos a comparação de modo que a resposta não dependesse de uma escolha arbitrária. Dois datasets são construídos a partir do mesmo tape filtrado e avaliados nas mesmas barras, nos mesmos folds, com os mesmos modelos e as mesmas sementes, diferindo em exatamente uma coisa: se as colunas derivadas do tape estão presentes.

Reprodutibilidade

O schema do fornecedor, as duas armadilhas dentro deste feed, todas as fórmulas e todos os testes de vazamento ficam em uma página própria, para não atrapalharem o argumento aqui.

Ler a reprodutibilidade →

O que testamos

Três braços foram ajustados em um desenho pareado. O braço B é o baseline OHLC, 53 features que são todas funções de abertura, máxima, mínima e fechamento. O braço A é o B mais tudo o que se deriva do tape em nanossegundos, 204 features no total, o que faz dele um superconjunto estrito, de modo que qualquer diferença entre os dois é atribuível ao conteúdo informacional e não a uma escolha diferente de modelagem.

O braço T, com 156 features, carrega o tape mais a geometria bruta das barras sem nenhum dos indicadores técnicos do B e responde se o conjunto clássico de indicadores ainda merece lugar quando a microestrutura está disponível.

O universo é de cinco tickers escolhidos para cobrir nível de preço, regime de spread e taxa de mensagens em vez de tamanho: AAPL, SPY, JPM, XOM e F. Esse último nome importa mais do que o valor de mercado sugere, porque a cerca de US$ 12 por ação um centavo de tick vale 8,3 pontos-base, enquanto o mesmo centavo no SPY vale 0,22, e cobrir essa faixa é o que permite ao corte transversal testar uma explicação mecânica mais adiante.

Três blocos de 60 pregões consecutivos foram tirados de anos diferentes e regimes de volatilidade diferentes: fevereiro a abril de 2019, fevereiro a abril de 2022 e fevereiro a abril de 2024. Isso dá 900 símbolo-dias de trades e quotes Algoseek em nanossegundos, 86,6 GB comprimidos, reconstruídos em uma grade de um minuto do pregão regular.

Cinco horizontes de previsão foram avaliados nessa grade para que nenhuma conclusão dependa de um único prazo: 1 barra, 60 barras, 390 barras (um pregão inteiro), 1.950 barras (uma semana) e 8.190 barras (um mês). O alvo é sempre o log-retorno futuro do fechamento da barra, escolhido porque os dois braços conseguem observá-lo, ao passo que um alvo no ponto médio do NBBO daria ao braço A uma quantidade que o braço B não consegue construir.

Três implementações de gradient boosting foram treinadas lado a lado, LightGBM, XGBoost e CatBoost, todas sob uma única configuração deliberadamente regularizada, fixada antes da rodada a partir da razão sinal-ruído do alvo. A validação é um walk-forward expansivo com purga dentro de cada símbolo-bloco, descartando as últimas h barras de cada janela de treino para que um alvo sobreposto não alcance a janela de teste.

Duas coisas na base de evidências precisavam de correção antes que qualquer comparação pudesse ser lida. Alvos sobrepostos de h barras não fornecem n observações independentes, e cinco tickers cuja correlação média par a par de retornos de uma hora é 0,32 não fornecem cinco séries independentes, o que pelo argumento padrão de variância deixa 2,19.

Todo resultado carrega então um tamanho amostral efetivo corrigido, com a significância julgada contra uma hipótese nula empírica construída ao rotacionar circularmente o alvo dentro de cada símbolo-bloco. Essa rotação destrói a correspondência entre features e alvo preservando todas as distribuições marginais e toda a estrutura de correlação.

Resultados

No horizonte de 1 minuto o tape vence de forma decisiva. O rank IC out-of-sample agrupado praticamente dobra, de cerca de 0,045 só com OHLC para cerca de 0,103 com o tape, e o braço A supera o braço B em todas as 36 células pareadas, cobrindo três blocos, quatro folds e três famílias de modelo, com p de Wilcoxon de 2,9e-11.

HorizonteIC, braço AIC, braço BNula, percentil 95A menos BA vencep de Wilcoxon
1 minuto0.100 a 0.1070.043 a 0.0480.014+0.05736 de 362.9e-11
1 hora0.012 a 0.0250.016 a 0.0360.096 a 0.108-0.00113 de 360.52
1 dia0.029 a 0.0360.015 a 0.0300.15 a 0.20+0.04424 de 360.052
1 semana0.152 a 0.1590.092 a 0.0960.23 a 0.30+0.06121 de 360.23
1 mêsnão testávelnão testáveln/dn/dn/dn/d

Rank IC agrupado por horizonte. As faixas cobrem as três famílias de modelo, então nada aqui depende de qual biblioteca é usada. Um mês não tem linha: sua janela de teste é mais curta que o próprio horizonte de previsão.

Fig. 1: Rank IC out-of-sample agrupado por horizonte. A terceira barra é o percentil 95 da nula de rotação, tomado como o maior entre as nulas dos dois braços naquele horizonte. Só em um minuto algum braço a supera.

Os intervalos de bootstrap de 95% em um minuto nem chegam perto de se sobrepor, com A em [0.095, 0.104] contra B em [0.039, 0.048] no LightGBM, e contra uma nula de rotação cuja média de IC é 0,002 com desvio padrão de 0,008 o valor observado de 0,100 fica a cerca de 12 desvios padrão de distância.

Passado um minuto, nada sobrevive. Em uma hora o IC observado de 0,022 cai exatamente sobre a média da nula de 0,022, e nenhum braço supera a própria nula em qualquer horizonte além de um minuto, enquanto a diferença pareada de um dia de +0,044 fica em p = 0,052 com 24 observações efetivas, o que é sugestivo e nada além disso.

Fig. 2: A diferença pareada principal, uma barra por horizonte. As barras esmaecidas são horizontes cujo tamanho amostral efetivo não sustenta um teste: as barras grandes de uma semana e um mês não são resultados.

Dado o tape, a engenharia convencional de OHLC não acrescenta nada mensurável. O braço T fica entre 0,101 e 0,107 em um minuto contra 0,100 a 0,107 do braço A, ou seja, todo o aparato de RSI, MACD, Bollinger, Estocástico e Donchian não contribui com nenhuma habilidade incremental out-of-sample quando a microestrutura está presente.

Só dois dos cinco horizontes podem ser testados

Corrigir pela sobreposição dos alvos e pelas 2,19 séries efetivas dá o tamanho amostral honesto por fold, e ele desaba rápido.

HorizonteObservações efetivas por foldVeredito
1 minuto9,408testável
1 hora156testável
1 dia24sem poder estatístico
1 semana4.3não testável
1 mês0.1não testável

Observações efetivas por fold, depois de corrigir pela sobreposição dos alvos e pela correlação entre tickers.

A janela de teste de um mês é mais curta que o próprio horizonte de previsão, 390 barras contra um alvo de 8.190 barras, de modo que todo alvo dentro dela aponta essencialmente para o mesmo instante futuro. Sua aparente acurácia direcional de 70% e seu grande delta pareado positivo são artefatos de uma única observação sobreposta, então semana e mês são reportados como não testáveis em vez de como evidência fraca.

A vantagem de um minuto acompanha o tamanho do tick

Em um minuto a vantagem se mantém nos cinco nomes, vencendo de 94% a 100% das células em cada um, mas é a ordenação que carrega o achado.

TickerPreçoUm tick em bpsIC, braço AIC, braço BDiferençaCélulas que A vence
F~$128.30.2110.137+0.074100%
XOM~$1001.00.0840.007+0.076100%
JPM~$1500.670.0730.015+0.05897%
AAPL~$1700.590.0460.010+0.03694%
SPY~$4500.220.0440.007+0.03797%

Rank IC em um minuto por ticker, do maior tick relativo para o menor.

Fig. 3: A previsibilidade acompanha o tick como fração do preço de forma quase monotônica, de F com 8,3 bps por tick até SPY com 0,22.

Essa não é a assinatura de uma vantagem preditiva, e sim da discretização mecânica dos preços, e em uma hora as diferenças por ticker trocam de sinal entre os nomes, que é o que o ruído faz.

O que os modelos realmente usam

A atribuição SHAP dentro do braço A em um minuto coloca 79,7% do peso em colunas do tape, e o topo da lista é inequívoco: a_micro_minus_close_bps sozinho leva 12,3%, seguido de a_q_micro_close_bps com 6,5%, a_micro_minus_mid_bps com 2,2%, a_t_vwap_bps com 2,1%, a_q_mid_tw_bps com 1,9% e a_q_mid_close_bps com 1,8%.

Todas as seis medem uma única quantidade, a saber, a que distância o último trade impresso está de uma estimativa de valor justo. O que o modelo aprendeu é que uma impressão abaixo do microprice tende a ser seguida por um fechamento mais alto e vice-versa, e isso é o bid-ask bounce observado diretamente, não previsto.

Passado um minuto, a atribuição migra para quantidades lentas: momentum sobre 1.950 barras, volatilidade realizada, assimetria dos retornos e médias móveis de spread e de participação de odd lots. Nenhum desses horizontes supera a própria nula, então isso descreve o que as árvores agarraram in-sample e nada sobre conteúdo preditivo.

Fig. 4: Onde as árvores ajustadas colocam o peso dentro do braço A. Em um minuto o tape leva 79,7% da atribuição; depois disso a divisão volta a ficar próxima de meio a meio, em horizontes que nunca superam a própria nula.

Nada disso vale dinheiro

Seja qual for o valor estatístico do sinal de um minuto, ele é menor que o custo de agir sobre ele.

BraçoBruto, bps por barraCusto, bps por barraCusto de equilíbrioSharpe brutoSharpe líquido
A, OHLC + TAQ0.43 a 0.470.931.00 bps+16 a +18-17 a -19
B, só OHLC0.17 a 0.190.800.51 bps+6.5 a +7.1-23
T, só TAQ0.44 a 0.460.940.98 bps+16 a +17-18

A verificação econômica em um minuto, operando o sinal da previsão. As faixas cobrem as três famílias de modelo.

O spread efetivo médio da amostra, medido a partir do tape e não assumido, é de 1,60 ponto-base. Lido em termos brutos, o braço A produz um Sharpe anualizado perto de 17, um número que deveria provocar suspeita antes de provocar um term sheet, já que o sinal troca de lado em cerca de 45% das barras e cada troca paga esse spread.

Fig. 5: O que cada braço ganha por barra, o que poderia pagar e o que o tape diz que o mercado de fato cobra. O tape praticamente dobra o custo suportável e ainda assim fica abaixo do spread.
900
Símbolo-dias de TAQ em nanossegundos
36 / 36
Células pareadas que o tape vence em um minuto
2.9e-11
p de Wilcoxon no teste pareado de um minuto
1.60
Spread efetivo medido, bps
1.00
Bps que o braço do tape pode pagar
-17
Sharpe líquido do braço do tape

A coluna de custo de equilíbrio carrega o resumo honesto. O tape praticamente dobra o que a estratégia pode pagar, de 0,51 para 1,00 ponto-base, contra um mercado que cobra 1,60, então as duas representações perdem dinheiro no líquido enquanto o tape perde menos.

Dados de trades e quotes em nanossegundos localizam o preço de transação atual em relação ao valor justo com muito mais precisão do que o OHLC, e essa precisão decai em cerca de um minuto. Para execução, market making e análise de custo de transação, esse minuto é o jogo inteiro. Para previsão direcional em qualquer horizonte além dele, com esta evidência, o OHLC não abre mão de nada.

O resultado negativo além de um minuto merece tanto peso quanto o positivo em um minuto, e é o mais surpreendente dos dois. Cerca de 150 features derivadas do tape, cobrindo desequilíbrio de fluxo de ordens, mix de agressores, spreads cotados e efetivos, profundidade, desvio do microprice, intensidade de cotação, lambda de Kyle, spread de Roll, markouts, participação de odd lots e concentração de venues, produziram um IC out-of-sample que caiu sobre a média da nula em uma hora.

Seja o que for que o feed de nanossegundos saiba sobre a hora seguinte, três implementações de gradient boosting bem regularizadas não conseguiram extrair isso destas features nesta amostra.

Todos os testes de vazamento, causalidade e nula que rodamos contra este resultado passaram, incluindo dois bugs nos próprios testes que encontramos e corrigimos antes da rodada reportada; as verificações exatas e seus números estão na página de reprodutibilidade.

Limitações

  • Apenas dois dos cinco horizontes carregam evidência independente suficiente para um teste. Semana e mês são reportados como não testáveis, e estendê-los adequadamente exige anos de histórico contínuo em vez de blocos de 60 dias.
  • Cinco tickers formam um corte transversal pequeno e correlacionado, com correlação média par a par de retornos de uma hora de 0,32. O desenho cobre nível de preço e regime de tick de propósito, que foi o que tornou visível a ordenação por tick, embora um universo mais amplo testasse essa ordenação em vez de apenas sugeri-la.
  • O alvo usa o fechamento negociado e não o ponto médio, escolhido para que os dois braços pudessem observá-lo, mas o fechamento é justamente a quantidade que carrega o bounce, e um alvo no ponto médio provavelmente reduziria bastante a vantagem de um minuto.
  • Todas as impressões fora de bolsa foram removidas pelo único rótulo de venue FINRA que este feed carrega, o que descarta cerca de metade do volume consolidado em alguns nomes, então um desenho que as mantivesse poderia chegar a conclusões diferentes sobre features ligadas a liquidez.
  • Os hiperparâmetros foram fixados a priori e nunca ajustados, o que protege contra viés de seleção mas deixa nenhum dos braços na sua melhor configuração possível.
  • O modelo de custo cobra o spread efetivo medido mais meio ponto-base de taxas, sem modelar impacto de mercado, posição na fila, execuções parciais ou latência, todos os quais pioram o quadro em vez de melhorá-lo.
  • Todo número se apoia na reconstrução consolidada do SIP de um único fornecedor, e duas propriedades específicas desse feed tiveram de ser estabelecidas empiricamente antes que qualquer coisa pudesse ser calculada.

Todo gráfico desta página é desenhado no seu navegador a partir das tabelas de resultado reais do estudo, os mesmos números reportados no texto e na página de reprodutibilidade. Não há arquivos de imagem por trás deles.

Metodologia completa

Procedência dos dados, as duas armadilhas deste feed, fórmulas das features, o laço de walk-forward, a nula de rotação, o modelo de custo e todos os testes de vazamento, com trechos de código.

Reprodutibilidade →