Dados tick a tick preveem retornos melhor do que OHLC?
900 símbolo-dias de trades e quotes de ações dos EUA em nanossegundos, contra as mesmas barras reduzidas a abertura, máxima, mínima e fechamento. Mesmos folds, mesmos modelos, mesmas sementes.
Dados de trades e quotes em nanossegundos são caros, pesados e lentos de trabalhar. Um único símbolo-dia de ações dos EUA chega como um CSV comprimido com dezenas de milhões de linhas, uma amostra modesta de cinco nomes chega a 86,6 GB comprimidos, e tudo o que vem depois exige um orçamento de engenharia diferente do que uma pasta de barras de um minuto exige.
Quem paga esse preço está comprando uma crença: a de que a microestrutura dentro do tape carrega informação que abertura, máxima, mínima e fechamento jogam fora. Essa crença raramente é testada como uma comparação controlada.
Microestrutura obviamente descreve o estado do mercado, já que spread, profundidade, mix de agressores e desequilíbrio de fluxo de ordens são literalmente medidas dele, mas descrever o presente é uma afirmação diferente de prever o futuro. A pergunta mais estreita, e a que uma mesa precisa responder antes de assinar um contrato de dados, é se as colunas extras sobrevivem em uma previsão de retorno out-of-sample, em um horizonte que alguém realmente operaria.
Montamos a comparação de modo que a resposta não dependesse de uma escolha arbitrária. Dois datasets são construídos a partir do mesmo tape filtrado e avaliados nas mesmas barras, nos mesmos folds, com os mesmos modelos e as mesmas sementes, diferindo em exatamente uma coisa: se as colunas derivadas do tape estão presentes.
O schema do fornecedor, as duas armadilhas dentro deste feed, todas as fórmulas e todos os testes de vazamento ficam em uma página própria, para não atrapalharem o argumento aqui.
O que testamos
Três braços foram ajustados em um desenho pareado. O braço B é o baseline OHLC, 53 features que são todas funções de abertura, máxima, mínima e fechamento. O braço A é o B mais tudo o que se deriva do tape em nanossegundos, 204 features no total, o que faz dele um superconjunto estrito, de modo que qualquer diferença entre os dois é atribuível ao conteúdo informacional e não a uma escolha diferente de modelagem.
O braço T, com 156 features, carrega o tape mais a geometria bruta das barras sem nenhum dos indicadores técnicos do B e responde se o conjunto clássico de indicadores ainda merece lugar quando a microestrutura está disponível.
O universo é de cinco tickers escolhidos para cobrir nível de preço, regime de spread e taxa de mensagens em vez de tamanho: AAPL, SPY, JPM, XOM e F. Esse último nome importa mais do que o valor de mercado sugere, porque a cerca de US$ 12 por ação um centavo de tick vale 8,3 pontos-base, enquanto o mesmo centavo no SPY vale 0,22, e cobrir essa faixa é o que permite ao corte transversal testar uma explicação mecânica mais adiante.
Três blocos de 60 pregões consecutivos foram tirados de anos diferentes e regimes de volatilidade diferentes: fevereiro a abril de 2019, fevereiro a abril de 2022 e fevereiro a abril de 2024. Isso dá 900 símbolo-dias de trades e quotes Algoseek em nanossegundos, 86,6 GB comprimidos, reconstruídos em uma grade de um minuto do pregão regular.
Cinco horizontes de previsão foram avaliados nessa grade para que nenhuma conclusão dependa de um único prazo: 1 barra, 60 barras, 390 barras (um pregão inteiro), 1.950 barras (uma semana) e 8.190 barras (um mês). O alvo é sempre o log-retorno futuro do fechamento da barra, escolhido porque os dois braços conseguem observá-lo, ao passo que um alvo no ponto médio do NBBO daria ao braço A uma quantidade que o braço B não consegue construir.
Três implementações de gradient boosting foram treinadas lado a lado, LightGBM, XGBoost e CatBoost, todas sob uma única configuração deliberadamente regularizada, fixada antes da rodada a partir da razão sinal-ruído do alvo. A validação é um walk-forward expansivo com purga dentro de cada símbolo-bloco, descartando as últimas h barras de cada janela de treino para que um alvo sobreposto não alcance a janela de teste.
Duas coisas na base de evidências precisavam de correção antes que qualquer comparação pudesse ser lida. Alvos sobrepostos de h barras não fornecem n observações independentes, e cinco tickers cuja correlação média par a par de retornos de uma hora é 0,32 não fornecem cinco séries independentes, o que pelo argumento padrão de variância deixa 2,19.
Todo resultado carrega então um tamanho amostral efetivo corrigido, com a significância julgada contra uma hipótese nula empírica construída ao rotacionar circularmente o alvo dentro de cada símbolo-bloco. Essa rotação destrói a correspondência entre features e alvo preservando todas as distribuições marginais e toda a estrutura de correlação.
Resultados
No horizonte de 1 minuto o tape vence de forma decisiva. O rank IC out-of-sample agrupado praticamente dobra, de cerca de 0,045 só com OHLC para cerca de 0,103 com o tape, e o braço A supera o braço B em todas as 36 células pareadas, cobrindo três blocos, quatro folds e três famílias de modelo, com p de Wilcoxon de 2,9e-11.
| Horizonte | IC, braço A | IC, braço B | Nula, percentil 95 | A menos B | A vence | p de Wilcoxon |
|---|---|---|---|---|---|---|
| 1 minuto | 0.100 a 0.107 | 0.043 a 0.048 | 0.014 | +0.057 | 36 de 36 | 2.9e-11 |
| 1 hora | 0.012 a 0.025 | 0.016 a 0.036 | 0.096 a 0.108 | -0.001 | 13 de 36 | 0.52 |
| 1 dia | 0.029 a 0.036 | 0.015 a 0.030 | 0.15 a 0.20 | +0.044 | 24 de 36 | 0.052 |
| 1 semana | 0.152 a 0.159 | 0.092 a 0.096 | 0.23 a 0.30 | +0.061 | 21 de 36 | 0.23 |
| 1 mês | não testável | não testável | n/d | n/d | n/d | n/d |
Rank IC agrupado por horizonte. As faixas cobrem as três famílias de modelo, então nada aqui depende de qual biblioteca é usada. Um mês não tem linha: sua janela de teste é mais curta que o próprio horizonte de previsão.
Os intervalos de bootstrap de 95% em um minuto nem chegam perto de se sobrepor, com A em [0.095, 0.104] contra B em [0.039, 0.048] no LightGBM, e contra uma nula de rotação cuja média de IC é 0,002 com desvio padrão de 0,008 o valor observado de 0,100 fica a cerca de 12 desvios padrão de distância.
Passado um minuto, nada sobrevive. Em uma hora o IC observado de 0,022 cai exatamente sobre a média da nula de 0,022, e nenhum braço supera a própria nula em qualquer horizonte além de um minuto, enquanto a diferença pareada de um dia de +0,044 fica em p = 0,052 com 24 observações efetivas, o que é sugestivo e nada além disso.
Dado o tape, a engenharia convencional de OHLC não acrescenta nada mensurável. O braço T fica entre 0,101 e 0,107 em um minuto contra 0,100 a 0,107 do braço A, ou seja, todo o aparato de RSI, MACD, Bollinger, Estocástico e Donchian não contribui com nenhuma habilidade incremental out-of-sample quando a microestrutura está presente.
Só dois dos cinco horizontes podem ser testados
Corrigir pela sobreposição dos alvos e pelas 2,19 séries efetivas dá o tamanho amostral honesto por fold, e ele desaba rápido.
| Horizonte | Observações efetivas por fold | Veredito |
|---|---|---|
| 1 minuto | 9,408 | testável |
| 1 hora | 156 | testável |
| 1 dia | 24 | sem poder estatístico |
| 1 semana | 4.3 | não testável |
| 1 mês | 0.1 | não testável |
Observações efetivas por fold, depois de corrigir pela sobreposição dos alvos e pela correlação entre tickers.
A janela de teste de um mês é mais curta que o próprio horizonte de previsão, 390 barras contra um alvo de 8.190 barras, de modo que todo alvo dentro dela aponta essencialmente para o mesmo instante futuro. Sua aparente acurácia direcional de 70% e seu grande delta pareado positivo são artefatos de uma única observação sobreposta, então semana e mês são reportados como não testáveis em vez de como evidência fraca.
A vantagem de um minuto acompanha o tamanho do tick
Em um minuto a vantagem se mantém nos cinco nomes, vencendo de 94% a 100% das células em cada um, mas é a ordenação que carrega o achado.
| Ticker | Preço | Um tick em bps | IC, braço A | IC, braço B | Diferença | Células que A vence |
|---|---|---|---|---|---|---|
| F | ~$12 | 8.3 | 0.211 | 0.137 | +0.074 | 100% |
| XOM | ~$100 | 1.0 | 0.084 | 0.007 | +0.076 | 100% |
| JPM | ~$150 | 0.67 | 0.073 | 0.015 | +0.058 | 97% |
| AAPL | ~$170 | 0.59 | 0.046 | 0.010 | +0.036 | 94% |
| SPY | ~$450 | 0.22 | 0.044 | 0.007 | +0.037 | 97% |
Rank IC em um minuto por ticker, do maior tick relativo para o menor.
Essa não é a assinatura de uma vantagem preditiva, e sim da discretização mecânica dos preços, e em uma hora as diferenças por ticker trocam de sinal entre os nomes, que é o que o ruído faz.
O que os modelos realmente usam
A atribuição SHAP dentro do braço A em um minuto coloca 79,7% do peso em colunas do tape, e o topo da lista é inequívoco: a_micro_minus_close_bps sozinho leva 12,3%, seguido de a_q_micro_close_bps com 6,5%, a_micro_minus_mid_bps com 2,2%, a_t_vwap_bps com 2,1%, a_q_mid_tw_bps com 1,9% e a_q_mid_close_bps com 1,8%.
Todas as seis medem uma única quantidade, a saber, a que distância o último trade impresso está de uma estimativa de valor justo. O que o modelo aprendeu é que uma impressão abaixo do microprice tende a ser seguida por um fechamento mais alto e vice-versa, e isso é o bid-ask bounce observado diretamente, não previsto.
Passado um minuto, a atribuição migra para quantidades lentas: momentum sobre 1.950 barras, volatilidade realizada, assimetria dos retornos e médias móveis de spread e de participação de odd lots. Nenhum desses horizontes supera a própria nula, então isso descreve o que as árvores agarraram in-sample e nada sobre conteúdo preditivo.
Nada disso vale dinheiro
Seja qual for o valor estatístico do sinal de um minuto, ele é menor que o custo de agir sobre ele.
| Braço | Bruto, bps por barra | Custo, bps por barra | Custo de equilíbrio | Sharpe bruto | Sharpe líquido |
|---|---|---|---|---|---|
| A, OHLC + TAQ | 0.43 a 0.47 | 0.93 | 1.00 bps | +16 a +18 | -17 a -19 |
| B, só OHLC | 0.17 a 0.19 | 0.80 | 0.51 bps | +6.5 a +7.1 | -23 |
| T, só TAQ | 0.44 a 0.46 | 0.94 | 0.98 bps | +16 a +17 | -18 |
A verificação econômica em um minuto, operando o sinal da previsão. As faixas cobrem as três famílias de modelo.
O spread efetivo médio da amostra, medido a partir do tape e não assumido, é de 1,60 ponto-base. Lido em termos brutos, o braço A produz um Sharpe anualizado perto de 17, um número que deveria provocar suspeita antes de provocar um term sheet, já que o sinal troca de lado em cerca de 45% das barras e cada troca paga esse spread.
A coluna de custo de equilíbrio carrega o resumo honesto. O tape praticamente dobra o que a estratégia pode pagar, de 0,51 para 1,00 ponto-base, contra um mercado que cobra 1,60, então as duas representações perdem dinheiro no líquido enquanto o tape perde menos.
Dados de trades e quotes em nanossegundos localizam o preço de transação atual em relação ao valor justo com muito mais precisão do que o OHLC, e essa precisão decai em cerca de um minuto. Para execução, market making e análise de custo de transação, esse minuto é o jogo inteiro. Para previsão direcional em qualquer horizonte além dele, com esta evidência, o OHLC não abre mão de nada.
O resultado negativo além de um minuto merece tanto peso quanto o positivo em um minuto, e é o mais surpreendente dos dois. Cerca de 150 features derivadas do tape, cobrindo desequilíbrio de fluxo de ordens, mix de agressores, spreads cotados e efetivos, profundidade, desvio do microprice, intensidade de cotação, lambda de Kyle, spread de Roll, markouts, participação de odd lots e concentração de venues, produziram um IC out-of-sample que caiu sobre a média da nula em uma hora.
Seja o que for que o feed de nanossegundos saiba sobre a hora seguinte, três implementações de gradient boosting bem regularizadas não conseguiram extrair isso destas features nesta amostra.
Todos os testes de vazamento, causalidade e nula que rodamos contra este resultado passaram, incluindo dois bugs nos próprios testes que encontramos e corrigimos antes da rodada reportada; as verificações exatas e seus números estão na página de reprodutibilidade.
Limitações
- Apenas dois dos cinco horizontes carregam evidência independente suficiente para um teste. Semana e mês são reportados como não testáveis, e estendê-los adequadamente exige anos de histórico contínuo em vez de blocos de 60 dias.
- Cinco tickers formam um corte transversal pequeno e correlacionado, com correlação média par a par de retornos de uma hora de 0,32. O desenho cobre nível de preço e regime de tick de propósito, que foi o que tornou visível a ordenação por tick, embora um universo mais amplo testasse essa ordenação em vez de apenas sugeri-la.
- O alvo usa o fechamento negociado e não o ponto médio, escolhido para que os dois braços pudessem observá-lo, mas o fechamento é justamente a quantidade que carrega o bounce, e um alvo no ponto médio provavelmente reduziria bastante a vantagem de um minuto.
- Todas as impressões fora de bolsa foram removidas pelo único rótulo de venue
FINRAque este feed carrega, o que descarta cerca de metade do volume consolidado em alguns nomes, então um desenho que as mantivesse poderia chegar a conclusões diferentes sobre features ligadas a liquidez. - Os hiperparâmetros foram fixados a priori e nunca ajustados, o que protege contra viés de seleção mas deixa nenhum dos braços na sua melhor configuração possível.
- O modelo de custo cobra o spread efetivo medido mais meio ponto-base de taxas, sem modelar impacto de mercado, posição na fila, execuções parciais ou latência, todos os quais pioram o quadro em vez de melhorá-lo.
- Todo número se apoia na reconstrução consolidada do SIP de um único fornecedor, e duas propriedades específicas desse feed tiveram de ser estabelecidas empiricamente antes que qualquer coisa pudesse ser calculada.
Todo gráfico desta página é desenhado no seu navegador a partir das tabelas de resultado reais do estudo, os mesmos números reportados no texto e na página de reprodutibilidade. Não há arquivos de imagem por trás deles.
Procedência dos dados, as duas armadilhas deste feed, fórmulas das features, o laço de walk-forward, a nula de rotação, o modelo de custo e todos os testes de vazamento, com trechos de código.

