Estratégias de trading precisam de uma razão econômica?
Sessenta perpétuos da Binance, dois braços de estratégias pareados pelo quão bem pareciam dentro da amostra e uma pergunta: escrever a razão antes muda o que sobrevive?
Os profissionais repetem uma afirmação tantas vezes que ela virou folclore: uma estratégia que você consegue explicar aguenta fora da amostra, e uma que você achou procurando não aguenta. A afirmação é testável e, até onde sabemos, nunca foi testada num corpus pareado.
Vale testar porque ela sustenta muita coisa, decidindo se um pesquisador passa os próximos seis meses pensando em quem está do outro lado do trade ou construindo infraestrutura de busca. A maioria das mesas já escolheu um lado, e normalmente sem evidência.
Um obstáculo explica por que o teste é raro. A comparação quase sempre é feita de forma injusta, porque uma estratégia com mecanismo escrito e outra achada por enumeração raramente recebem o mesmo orçamento de busca, os mesmos custos, os mesmos instrumentos ou o mesmo período. Ganhe quem ganhar, o leitor não consegue distinguir se o que importou foi a razão ou o arranjo.
Este estudo fixa tudo isso e varia uma coisa só: se um mecanismo econômico foi escrito antes de a busca de parâmetros começar. Sessenta perpétuos da Binance, dezessete famílias de estratégias divididas entre os dois braços que importam, orçamento de busca idêntico nos dois lados e dezoito trimestres de histórico fora da amostra, tudo sobre spreads medidos, taxas reais de corretora e funding observado.
A regra do universo, as definições de família, o modelo de custos com spread medido, o pareamento e a inferência ficam em página própria, para não atravancar o argumento aqui.
O que testamos
Dois braços de estratégias rodando no mesmo motor, sobre um painel de futuros perpétuos da Binance margeados em USDT, em barras de 30 minutos.
Catálogo, braço C. Oito indicadores técnicos conhecidos: ATR, EMA, SMA, MACD, PPO, RSI, um nível estático de RSI e o %K estocástico, cada um comparado contra a própria referência. Nada se afirma sobre por que algum deles deveria funcionar, porque enumerar o catálogo é o método em si.
Mecanismo primeiro, braço M. Nove famílias cuja regra de entrada foi especificada para expressar um mecanismo econômico escrito, que nomeia quem está do outro lado do trade e por que essa contraparte negocia por razões diferentes de lucro esperado. Rompimento por compressão de volatilidade, momentum de série temporal, momentum de sessão, reversão de fim de semana, clímax de volatilidade, força relativa contra o BTC, gap fade, reversão de range e tendência de Keltner.
Os dois braços são apenas de preço, então enxergam a mesma informação. Ambos tiram suas variantes de uma única biblioteca compartilhada de 35 modificadores, 11 transformações e 24 filtros de confluência, copiada tal e qual do gerador que produziu os dois corpora originais e hasheada, de modo que a afirmação de que os braços compartilham um vocabulário é verificável em vez de alegada. Cada família recebe um orçamento idêntico de 945 configurações tentadas por contrato e por janela, o que deixa a regra base de entrada como a única coisa que separa os braços.
Um terceiro braço, de onze famílias de mecanismo que também leem funding, open interest, basis, fluxo de ordens ou posicionamento, é carregado como secundário registrado. Ele existe para que "ter uma razão" não seja silenciosamente confundido com "ter mais dados".
Por que o estimando é uma diferença
Esperava-se que os dois braços perdessem dinheiro líquido de custos, e os dois perderam. Isso não é um problema, porque a pergunta não é qual braço é lucrativo.
As estratégias são pareadas dentro de cada contrato e janela pelo Sharpe dentro da amostra, num caliper de 0,05 unidades de Sharpe anualizado, de forma gulosa e sem reposição. Duas estratégias que pareciam igualmente boas dentro da amostra são colocadas frente a frente, e o estimando é a diferença no que cada uma manteve fora da amostra, o que torna o resultado uma medição de decaimento diferencial a partir de um mesmo ponto de partida em vez de uma comparação de desempenho.
O pareamento só funciona onde os braços se sobrepõem, então a sobreposição é uma precondição e não um resultado. É também a razão de nenhum alargamento do caliper ter sido necessário: 6.812.171 pares casaram em 0,05.
Universo e custos
Contratos elegíveis são cotados em USDT, negociados em todos os dias do trimestre de ranqueamento de outubro a dezembro e não são produtos de índice nem duplicatas de redenominação. 141 contratos qualificam, e o universo é o top 30 e o bottom 30 por notional diário mediano, que se separam por uma razão de 20,0x contra um piso registrado de 10.
Os contratos vêm da listagem do arquivo bruto e não da lista de contratos atual da corretora. O exchangeInfo devolve apenas contratos listados hoje, então um universo construído a partir dele apaga silenciosamente tudo o que morreu. Dezoito janelas trimestrais não sobrepostas vão de 1 de janeiro de 2022 a 30 de junho de 2026, cada uma precedida por um bloco de 12 meses dentro da amostra.
Os custos são cinco basis points de taxa taker por execução, spread medido por contrato-mês a partir do aggTrades como a mediana do repique entre negócios, e cada execução paga metade do spread medido mais metade disso de novo como provisão de slippage. O funding é o evento observado e sinalizado na barra real de liquidação, valorado pelo mark price publicado, então posições compradas são debitadas quando o funding é positivo.
Medir o spread em vez de assumi-lo é o que mantém o resultado de liquidez honesto. Uma constante de slippage de 3 bp teria cobrado do BTCUSDT mais de cem vezes a mais enquanto batia aproximadamente com os contratos mais finos, o que enviesa exatamente na direção do resultado de liquidez e o teria fabricado.
Resultados
O contraste primário registrado é a diferença pareada no retorno líquido fora da amostra, mecanismo primeiro menos catálogo, agrupada nos dois estratos de liquidez.
D = 223.4 bp, com intervalo de confiança pareado de 95% com clusters semanais de [98.5, 344.8] basis points de capital fixo, p = 0.0018. O intervalo fica inteiramente acima de zero.
A estimativa se apoia em 6.812.171 pares casados, em 250 clusters de fragmentos de semana e 1.642 dias de negociação, pareados a um caliper de 0,05 unidades de Sharpe anualizado sem necessidade de alargamento.
Como verificação de consistência, a mesma quantidade calculada a partir dos totais por janela da tabela de scores dá 213.1 bp contra 223.4 bp do ledger por trade, uma diferença relativa de 4,6%. Os dois são caminhos independentes para o mesmo número e não são idênticos por construção, porque o ledger exclui trades que cruzam a fronteira de uma janela.
| Contraste | Estimativa | Intervalo de 95% | p | p ajustado (BH) |
|---|---|---|---|---|
| Interação de liquidez, D_H menos D_L | -114.9 bp | [-197.0, -16.4] | 0.0138 | 0.0184 |
| Estrato de alta liquidez, D_H | 171.2 bp | [32.8, 295.6] | 0.014 | 0.028 |
| Estrato de baixa liquidez, D_L | 278.4 bp | [131.4, 410.5] | 0.0004 | 0.0004 |
| Conjunto de informação, braço exógeno menos catálogo | 139.2 bp | [-82.1, 361.2] | 0.2108 | 0.8431 |
Os quatro contrastes secundários registrados compartilham uma família de Benjamini-Hochberg a 5%. Três dos quatro rejeitam após a correção.
A taxa de sobrevivência, a fração de estratégias pareadas com retorno líquido positivo fora da amostra, é de 29,74% no braço catálogo contra 30,93% no braço mecanismo primeiro, uma diferença de 1,19 ponto percentual.
A decisão registrada é que um mecanismo econômico escrito prevê maior retenção fora da amostra. É isso que o contraste primário diz. Quatro ressalvas delimitam até onde isso vai, e a primeira é grande.
Um terço do efeito pertence ao vocabulário de regras
O mesmo pipeline rodou sobre um corpus sem drift, onde por construção nenhuma estratégia pode ter vantagem e qualquer diferença entre os braços é o artefato de autorreferência descrito nas limitações abaixo. Esse corpus produziu uma diferença pareada de 72.92 bp com intervalo de [-15.11, 166.60].
Contra os 223.39 bp [98.52, 344.82] observados, a estimativa pontual do artefato responde por 33% do efeito observado. Seu limite superior de 166.60 bp fica acima do limite inferior de 98.52 bp do efeito observado, de modo que os dois intervalos se sobrepõem na faixa de 98.52 a 166.60.
Dito com honestidade, a afirmação é mais estreita que a decisão. Observou-se uma diferença pareada de cerca de 220 basis points, da qual algo como um terço é atribuível a uma propriedade do vocabulário de regras compartilhado e não à presença de um mecanismo econômico, e a separação entre os dois não é limpa. O efeito ajustado pelo artefato fica em torno de 150 bp, mas essa subtração não tem intervalo conjunto por trás e deve ser lida como ordem de grandeza, não como estimativa.
É um efeito de nível, não um decaimento mais lento
Regredir o resultado fora da amostra sobre o Sharpe dentro da amostra no conjunto pareado dá uma inclinação de 0.0549 [0.0465, 0.0634] para o braço catálogo e 0.0550 [0.0481, 0.0621] para o braço mecanismo primeiro. A diferença é de 0.000075 contra intervalos individuais de cerca de 0.015 de largura, então a velocidade com que o desempenho fora da amostra acompanha o desempenho dentro da amostra é indistinguível entre os braços.
Isso importa para como o folclore deve ser reescrito. Estratégias com mecanismo primeiro não decaíram mais devagar, e pareadas com Sharpe igual dentro da amostra simplesmente entregaram mais fora da amostra com a mesma inclinação, então seja lá o que o mecanismo compra, não é resistência ao decaimento.
O efeito é maior onde a liquidez é mais fina
A interação entre os estratos é de -114.94 bp [-197.04, -16.42], sobrevivendo ao Benjamini-Hochberg com p ajustado de 0.0184. O estrato de baixa liquidez mostra 278.45 bp contra 171.24 bp no estrato de alta liquidez, então a vantagem é cerca de 60% maior entre os contratos mais finos.
Leia com cuidado. O estrato L aqui é de baixa-média capitalização e não a cauda restrita por capacidade, os spreads lá são 2,3 vezes mais largos e medidos em vez de assumidos, e a ressalva do artefato acima vale para os dois estratos.
Dados exógenos não acrescentam nada detectável
As famílias que leem funding, open interest, basis, fluxo de ordens e posicionamento em cima de um mecanismo escrito devolvem 139.15 bp [-82.10, 361.24], um intervalo que atravessa o zero com p ajustado de 0.843 por Benjamini-Hochberg. Neste corpus, acrescentar informação não-preço a uma regra com mecanismo não produziu melhora mensurável sobre a linha de base do catálogo.
Defeitos encontrados antes da publicação
Seis defeitos foram encontrados e corrigidos durante a construção. Cada um está registrado porque cada um teria produzido um número plausível, e um deles produziu: a primeira análise concluída reportou um resultado positivo na direção que este estudo hipotetiza, e era artefato de dados corrompidos.
O funding estava sendo cobrado em barras de liquidação que faltavam no painel, onde tanto o mark price publicado quanto a abertura da barra estão ausentes, e a cobrança virou não-finita. No CVXUSDT essa condição ocorre em exatamente uma barra de 67.608, e produziu 1.092 linhas corrompidas. No corpus inteiro, 1.238 retornos fora da amostra de 25.251.675 eram não-finitos, o suficiente para fazer toda estimativa pontual devolver nada.
A metade mais séria é a proteção. O escritor do ledger se recusa a persistir um ledger cujos custos não fecham, testando se o resíduo excede uma tolerância. Um resíduo não-finito falha essa comparação, então cada linha envenenada passou pelo teste construído justamente para pegar custos ruins, e 1,68 bilhão de trades foram certificados como fechando. Testado depois com uma linha não-finita plantada, o teste antigo reporta resíduo de 1.7e-18 e conclui que o ledger fecha limpo, o que é pior do que deixar passar: produziu evidência positiva de correção a partir da corrupção.
O que pegou o problema foi uma verificação cruzada de consistência adicionada antes por outros motivos, comparando a diferença pareada calculada da tabela de scores contra a mesma quantidade calculada do ledger por trade, que imprimiu uma divergência e tornou a corrupção visível. Essa verificação é a mesma reportada acima como 213.1 contra 223.4 bp.
Outros três defeitos merecem nome porque são fáceis de reproduzir em qualquer lugar. Saídas no alvo estavam sendo executadas na abertura da barra de saída em vez de no preço-alvo, o que vale até 12,5 basis points por trade num caminho sem drift e é maior que todo o modelo de custos, e agia só sobre trades vencedores. Os ids de estratégia recomeçavam do zero a cada contrato-família, então juntar os pares casados de volta aos seus retornos casava de forma ambígua e transformou 119.178 pares em 8.580.816 linhas. O bootstrap estava agrupando pelas datas de início de janela, o que colapsava os fragmentos de semana de segunda a domingo registrados em um cluster por janela, 18 em vez dos 250 que os dados realizados carregam.
Pareado com Sharpe igual dentro da amostra, um mecanismo escrito valeu cerca de 220 basis points fora da amostra, e mais ou menos um terço disso não valeu nada: o mesmo vocabulário produz esse pedaço em dados sem mercado nenhum dentro.
Limitações
- As descrições de mecanismo são reconstruções. As famílias de mecanismo foram escritas pelo mesmo pesquisador depois de o corpus de catálogo já ser conhecido por falhar, e seus mecanismos escritos foram reconstruídos do registro original de projeto em vez de selados na época. O braço M é mecanismo primeiro em relação à própria busca de parâmetros, não cego em relação ao resultado do catálogo. A avaliação cega das descrições limita isso sem eliminar.
- Há um artefato de autorreferência no vocabulário de regras. Um sinal derivado da série negociada, combinado com barreiras escaladas pela volatilidade defasada dessa mesma série, não ganha zero num corpus sem drift, onde os dois braços perdem cerca de 550 basis points só pelo artefato. É uma propriedade do vocabulário e não um defeito do motor, então não desaparece corrigindo código, e é a razão de um terço do resultado principal não ser atribuível ao mecanismo.
- As quatro primeiras janelas antecedem a data de seleção. O universo foi ranqueado no último trimestre de 2022 enquanto o período de reivindicação abre em 1 de janeiro de 2022, então quatro de dezoito janelas negociam um painel escolhido com conhecimento daquele ano. Os dois braços negociam os mesmos contratos nas mesmas janelas, então a diferença pareada não fica obviamente enviesada por isso, mas o painel dessas janelas não é point-in-time.
- As medianas fora da amostra de um contrato foram vistas antes do freeze. Durante um teste de fumaça do runner, um resumo imprimiu a mediana do retorno líquido fora da amostra por braço apenas para o BTCUSDT. Esses números foram produzidos antes de o defeito de execução no alvo ser encontrado e portanto são artefatos, mas o registro é que foram vistos. A análise agora se recusa a rodar fora de um modo protegido.
- O estrato de baixa liquidez não é a cauda restrita por capacidade. O contrato mais fino do universo congelado ainda negociava US$ 5,0M por dia no trimestre de ranqueamento. Tudo genuinamente mais fino foi listado depois da data de seleção, então "baixa liquidez" aqui significa baixa-média capitalização e nenhuma afirmação sobre capital institucional estruturalmente ausente se apoia nisso.
- A profundidade em repouso seria um instrumento melhor de liquidez. O
daily/bookDepthdá o notional em repouso em bandas fixas a partir do meio ao longo de todo o histórico, o que é mais direto que um spread derivado de negócios para um estudo estratificado por liquidez. Não foi adotado, porque a fonte de custo já estava registrada e validada e um valor fora da amostra já tinha sido exposto até lá.
Todo gráfico desta página é desenhado no seu navegador a partir das tabelas de resultado publicadas do estudo, os mesmos números reportados no texto e na página de reprodutibilidade. Não há arquivos de imagem por trás deles.
Fontes de dados, a regra do universo, a biblioteca de variantes compartilhada, execução e o modelo de custos com spread medido, o loop walk-forward, pareamento, inferência e os vinte gates bloqueantes, com trechos de código.

