← Alpha
Alpha Research · · 12 min de leitura

Um universo mais amplo e menos líquido melhora um book sistemático?

Trinta perpétuos da Binance no lugar de seis, descendo até contratos que negociam um duzentésimo do notional diário do Bitcoin. Todo o resto mantido fixo.

A maioria dos books sistemáticos negocia um punhado de instrumentos. O motivo costuma ser prático em vez de pensado: os dados eram fáceis de obter, os contratos são líquidos, e ninguém voltou para perguntar quanto aquele universo estava custando. Dois argumentos empurram na direção contrária. O primeiro é diversificação: um book de trinta sleeves fracamente correlacionados deveria carregar um Sharpe melhor do que um de seis. O segundo é aglomeração: os majors são vasculhados por todo mundo que tem um terminal, enquanto a ponta fina da exchange não é, então qualquer vantagem que reste deveria estar lá embaixo.

Os dois são testáveis, e são afirmações diferentes. Uma é sobre a aritmética da média. A outra é sobre onde o sinal mora. Um estudo que amplia o universo e reporta apenas o Sharpe do portfólio não consegue dizer qual das duas se moveu.

Então pegamos um conjunto de regras clássicas de trading que já perde dinheiro nos seis perpétuos mais líquidos da Binance, demos a ele mais vinte e quatro contratos, e não mudamos mais nada. As mesmas seis famílias de estratégia, as mesmas grades de parâmetros congeladas, o mesmo cronograma walk-forward, os mesmos custos, os mesmos catorze trimestres fora da amostra.

Reprodutibilidade

A receita exata por trás de cada número daqui, incluindo as regras de morte de contrato, a escada de custo e todas as verificações de vazamento, vive em sua própria página.

Ler a reprodutibilidade →

O que testamos

O universo é o rank 1 ao 30 por notional diário mediano negociado entre outubro e dezembro de 2022, entre os perpétuos da Binance margens em USDT com pelo menos dois anos de histórico genuíno de volume negociado até o fim de 2022. Os ranks 1 a 6 são exatamente os seis mercados do estudo anterior que este estende, o que é a primeira evidência de que a regra de ranqueamento foi reimplementada fielmente. O eixo de rank cobre um fator de 205 em notional negociado, do Bitcoin no topo até contratos girando cerca de US$ 34 milhões por dia na base.

Seis famílias estruturais de estratégia rodam em cada mercado: tendência por EMA, breakout de Donchian, momentum de série temporal, reversão por RSI, fade de bandas de Bollinger e breakout por compressão de volatilidade. Cada família carrega uma lista congelada de sessenta e quatro configurações numéricas, gerada uma única vez e reutilizada em todo mercado e toda janela, então nenhum mercado ganha uma busca mais ampla que outro. Trinta mercados por seis famílias dão 180 sleeves, cada um com seu próprio loop walk-forward, e cada sleeve carrega o mesmo capital fixo esteja negociando ou parado.

O cronograma é o herdado: doze meses dentro da amostra, três meses fora, avançando um trimestre por vez, catorze trimestres completos fora da amostra cobrindo janeiro de 2023 até junho de 2026. A seleção dentro de cada janela lê apenas o bloco dentro da amostra e nunca toca em Sharpe. Um sleeve que não consegue apresentar uma configuração elegível numa janela fica em caixa naquela janela em vez de ser descartado, o que impede que contratos finos se filtrem silenciosamente para fora da amostra.

Duas partições do mesmo ranking congelado fazem o trabalho. Quatro faixas, ranks 1 a 6, 7 a 14, 15 a 22 e 23 a 30, perguntam se a economia por sleeve varia com a liquidez. Seis degraus aninhados, os 6, 10, 15, 20, 25 e 30 primeiros mercados, perguntam o que a amplitude sozinha faz com o book. Nenhuma das partições foi escolhida depois de ver qualquer coisa.

A medida primária é a expectativa líquida por sleeve fora da amostra dos vinte e quatro mercados adicionados menos os seis incumbentes, em pontos-base por sleeve-dia vivo, com intervalos de um bootstrap pareado agrupado por semana. Um sleeve-dia vivo é um dia em que o contrato estava de fato negociando, o que importa porque quatro dos contratos adicionados foram liquidados compulsoriamente pela Binance dentro do período fora da amostra. Esses sleeves ficam em caixa a partir da liquidação, o capital nunca é realocado para os sobreviventes, e dias mortos nunca entram no denominador, então a morte de um contrato não pode favorecer o grupo adicionado diluindo-o em direção a zero.

Os custos são cobrados em cada fill: cinco pontos-base de taxa taker e dois de slippage, em cada mercado do rank 1 ao 30. Esse tratamento plano é deliberadamente otimista na ponta fina, e a especificação diz isso, e é por isso que ela também registra de antemão um modelo adverso obrigatório que cobra 2, 4, 6 e 8 pontos-base de slippage por faixa e reseleciona cada configuração sob esses custos.

A pergunta de amplitude foi registrada como um modelo, não como uma comparação. O Sharpe do portfólio de um book de sleeves igualmente ponderados deveria ser o Sharpe médio por sleeve vezes a raiz quadrada de N / (1 + (N-1) rho), onde rho é a correlação média realizada entre pares. Tanto a previsão quanto o valor realizado são calculados dentro das mesmas réplicas de bootstrap, então a diferença entre eles carrega um intervalo e a escada pode ser julgada contra sua própria teoria em vez de apenas descrita.

Resultados

Sob o modelo de custo primário não há efeito mensurável de rank de liquidez. A expectativa líquida por sleeve dos vinte e quatro adicionados menos os seis incumbentes é de -1.046 pontos-base por sleeve-dia vivo, com intervalo de 95% de -2.996 a +0.934. Os dois grupos perdem: os incumbentes a -4.574 e os mercados adicionados a -5.620.

Sob o modelo de custo adverso registrado o intervalo fica inteiramente abaixo de zero, em -3.471 com intervalo de -5.444 a -1.515, e os mercados adicionados caem para -8.046. Esse é o segundo dos três veredictos registrados: ampliar o universo para baixo em liquidez piora o book. Em qual leitura acreditar depende inteiramente do que você acha que custa negociar um contrato que gira US$ 34 milhões por dia.

Fig. 1: Os vinte e quatro adicionados menos os seis incumbentes, expectativa líquida por sleeve, sob cada modelo de custo registrado. Dois intervalos cruzam o zero e o do modelo obrigatório com slippage escalado por rank não cruza. Passe o mouse numa linha para ver seu intervalo.

A decomposição, não a manchete

Resultado bruto, taxa, slippage e funding são colunas separadas no ledger de trades e reconciliam com o líquido exatamente, então a diferença entre os dois grupos se divide sem resíduo.

Fig. 2: Onde a diferença está. Sob o modelo primário o termo bruto é essencialmente zero e o rombo é giro; sob o modelo com slippage escalado por rank a diferença de taxa colapsa e quase tudo migra para o slippage.

Em -0.009, o termo bruto sob o modelo primário diz algo específico. Em base por sleeve, essas regras extraem essencialmente a mesma vantagem crua de um contrato de rank trinta em liquidez e do Bitcoin. Cada ponto-base do rombo é o custo de colher isso. O slippage é plano em dois pontos-base por fill em todos os mercados nesse modelo, então uma conta maior de slippage não pode significar fills piores, apenas mais deles.

Sob o modelo adverso a diferença de taxa colapsa para -0.006, porque a resseleção corta o giro nos mercados finos quase exatamente o suficiente para igualar as taxas, e a diferença migra para o slippage em -2.949. O bruto cai para -0.501 porque as configurações de menor giro que o otimizador agora prefere capturam menos vantagem crua.

Ordenado por liquidez, o bruto sobe e o custo sobe mais rápido

Fig. 3: Economia por sleeve por faixa de liquidez, modelo de custo primário. Os oito contratos mais finos carregam a maior expectativa bruta e o maior custo, e toda faixa termina líquida negativa.

Os oito contratos mais finos mostram quatro vezes a expectativa bruta por sleeve dos seis mais líquidos, +2.422 contra +0.597. É tentador ler isso como o argumento da aglomeração aparecendo como quantidade medida, e ele não sustenta o peso. Passado pelo próprio bootstrap pareado agrupado por semana do estudo, a diferença bruta T4 menos T1 é +1.825 com intervalo de 95% de -0.826 a +4.493 e p = 0.184, que contém zero. A especificação afirma de antemão que este desenho não consegue resolver diferenças abaixo de aproximadamente 2 pontos-base por dia, o que coloca 1.825 abaixo da linha, e a comparação não é membro da família secundária registrada, que é definida sobre o líquido e não sobre o bruto.

Ela também falha num teste mais duro. Sob o modelo de custo adverso, em que as configurações são resselecionadas porque custos por fill mais altos mudam quais parâmetros vencem, a expectativa bruta da T4 cai de +2.422 para +0.997 enquanto a T1 permanece em +0.597. Um padrão que cai pela metade quando você reprecifica os fills nunca foi uma propriedade dos instrumentos.

O custo é a parte do quadro que não é frágil. Ele sobe monotonicamente nas quatro faixas, de 5.17 pontos-base por sleeve-dia na T1 para 6.74 na T4, e faz isso sob qualquer um dos modelos de custo.

TesteModelo de custo primárioModelo de custo adverso
Sharpe(30) menos Sharpe(6)-1.066, p 0.0278, não rejeitado-2.430, p 0.0002, rejeitado
T2 menos T1-2.438, p 0.0362, não rejeitado-3.381, p 0.0034, rejeitado
T3 menos T1-1.006, p 0.4364, não rejeitado-2.962, p 0.0122, rejeitado
T4 menos T1+0.258, p 0.8409, não rejeitado-4.080, p 0.0018, rejeitado

A família secundária registrada, corrigida em conjunto por Benjamini-Hochberg a 5%. Sob o modelo de custo primário nada sobrevive à correção. Sob o modelo adverso os quatro rejeitam, e todos apontam na mesma direção.

A amplitude fez exatamente o que a estrutura de correlação dizia que faria

Fig. 4: A escada de amplitude e seu modelo registrado. O Sharpe realizado cai de -2.384 com seis mercados para -3.450 com trinta, e o modelo multiplicador prevê a mesma queda apenas a partir da estrutura de correlação medida.
Fig. 5: A diferença para o modelo em cada degrau, com seu intervalo pareado de 95%. Todo intervalo contém zero, então a amplitude entregou o multiplicador que sua estrutura de correlação implica e nem uma unidade a mais.

É por isso que a escada cai. Os sleeves já estavam quase ortogonais com seis mercados, com correlação média entre pares de 0.011, então o multiplicador de diversificação já era 5.08 e a raiz quadrada côncava já havia achatado. Adicionar vinte e quatro mercados o moveu apenas para 7.60. Um multiplicador escala o Sharpe sem conseguir mudar seu sinal, então aplicado a uma expectativa por sleeve que permanece negativa em todo degrau, um multiplicador maior torna o Sharpe do book mais negativo, que é precisamente o que a escada mostra. Todo degrau tem retorno líquido acumulado negativo, então nenhum deles melhorou sob qualquer leitura. Eles perderam a taxas diferentes.

A especificação registrou um contrafactual que separa as duas causas possíveis. Segure cada sleeve adicionado na média e na volatilidade por sleeve dos incumbentes mantendo a estrutura de correlação realizada dos 180 sleeves, e o book de trinta mercados teria marcado -3.572 contra os -3.450 reais. Dividir a deterioração de Sharpe de -1.066 nessa base dá -1.188 para o multiplicador de amplitude agindo sobre uma média por sleeve negativa contra +0.122 para a expectativa dos próprios instrumentos adicionados, que puxa muito levemente para o outro lado. O resíduo é exatamente zero, e o intervalo do componente de amplitude, de -1.778 a -0.649, exclui zero.

A escada cai porque tirar a média de mais apostas perdedoras afia a perda, não porque os novos instrumentos fossem piores.

A história do giro em dois números

Fig. 6: Os fills sobem mais de cinco vezes ao longo da escada enquanto a exposição bruta média fica perto de um quarto do capital. Passe o mouse num degrau para ver os dois números.

A restrição que amarra já estava visível no book de seis mercados, onde o bruto somou 7.63% do capital do sleeve contra 66.05% de taxas, slippage e funding ao longo do período fora da amostra. Ampliar o universo não mudou essa aritmética. Comprou mais instrumentos para pagá-la.

Por fill os dois grupos são quase indistinguíveis: os seis incumbentes perdem 6.248 pontos-base contra 6.408 dos mercados adicionados. O que difere é o número de fills, 33,657 contra 148,881.

180
Sleeves em walk-forward, 30 mercados por 6 famílias
-1.046
Adicionados menos incumbentes, bp por sleeve-dia vivo
0.011
Correlação média entre pares com seis mercados
0 / 14
Trimestres lucrativos com vinte mercados ou mais
66.05%
Custo pago contra 7.63% de bruto, book de seis mercados
205x
Amplitude de notional do eixo de rank

O registro por janela é ainda mais direto. Com vinte mercados ou mais, nenhum dos catorze trimestres fora da amostra foi lucrativo, enquanto com seis apenas um foi, e remover a melhor janela piora o resultado acumulado em vez de melhorá-lo, porque não há janela boa carregando nada. Quem estiver lendo isto como rota para um book ao vivo deveria ler os níveis em vez das diferenças, porque todo braço perde. O bootstrap agrupado por semana ao longo de 184 semanas coloca o resultado semanal médio em -0.633 com intervalo de -0.824 a -0.434, que exclui zero.

O que isto descarta e o que não descarta

Descarta a afirmação que o estudo foi construído para testar, a de que a amplitude de instrumentos era a restrição que amarrava. Ir de seis mercados para trinta, sobre uma base de capital fixa e com todo o resto constante, moveu a expectativa líquida por sleeve por um valor cujo intervalo cruza o zero sob o modelo de custo primário e fica inteiramente abaixo de zero sob o adverso, enquanto moveu o Sharpe do portfólio na direção errada por um motivo que uma fórmula de uma linha explica inteiramente.

Se instrumentos menos cobertos guardam mais vantagem é uma questão separada que este estudo não resolve, porque a diferença bruta que ele mede não é distinguível de zero na resolução para a qual o desenho foi pré-registrado. O que ele estabelece é o lado do custo, e esse lado é inequívoco.

Adendo: a culpa era do modelo de custo?

Tudo acima repousa em cobrar cada fill como taker, cinco pontos-base de taxa mais dois de slippage adverso, em entradas, stops, take-profits, reversões e saídas por tempo igualmente. Foi um conservadorismo deliberado e foi declarado como tal, e é a maior premissa isolada do trabalho. Se ela estiver errada, o nulo acima é um artefato dela.

Ela está errada num ponto específico. Um take-profit não é uma ordem a mercado. É uma ordem limitada descansando no book, e em perpétuos USD-M da Binance um fill maker paga dois pontos-base em vez de cinco e executa no próprio preço limite em vez de atravessá-lo, então não carrega slippage adverso. De 91,277 trades fora da amostra, 17,970 saem num take-profit, que são 19.7% e o único fill nesta arquitetura que descansa no book.

Reprecificar essas saídas à taxa maker, mantendo cada configuração exatamente como foi selecionada, move o book de trinta mercados de -64.68% para -59.69%. Cinco pontos percentuais, recuperados sem mudar nada além do que as saídas são cobradas. Não é isso que você recebe. O retorno líquido é o que o otimizador walk-forward pontua, então tornar um tipo de saída mais barato muda qual configuração vence o bloco de parâmetros de nove meses. Rerodar a seleção registrada sob o modelo de custo corrigido dá -63.12%.

Fig. 7: O que a correção promete contra o que sobrevive. A economia mecânica é de +5.00 pontos percentuais; a economia realizada é de +1.57.

O otimizador devolve 69% da correção assim que pode responder a ela. A parte marcante é quão pouco precisa mudar para isso. Ao longo de 2,520 decisões de seleção, exatamente 105 mudam, ou seja 4.2%, e esses 4.2% destroem 3.43 dos 5.00 pontos percentuais.

O otimizador não está se comportando de forma perversa. Ele faz o que um take-profit mais barato deveria fazê-lo fazer, com a fração realizada de saídas no alvo subindo de 19.687% para 20.778%, então ele se inclina para o fill recém-barateado. Ele simplesmente não é pago por se inclinar, porque as configurações que parecem melhores dentro da amostra sob o objetivo corrigido transferem pior para fora da amostra do que as que pareciam melhores sob o objetivo errado.

Uma correção de modelo de custo não pode ser avaliada reprecificando um book fixo, porque um book fixo não é o que a estratégia teria feito sob os custos corrigidos.

Isso também significa que o instinto usual está de cabeça para baixo. Descobrir que seu modelo de custo é duro demais parece uma boa notícia esperando para ser coletada, e a maior parte dela não era coletável.

Sob preços por tipo de ordem a medida primária vai de -1.046 para -0.993 pontos-base por sleeve-dia vivo, um intervalo que ainda cruza o zero, então nenhum veredicto muda. Todo degrau da escada de amplitude permanece negativo sob os dois modelos de custo. Corrigir a maior premissa de custo do trabalho, no único ponto em que ela está genuinamente errada, move um buraco de sessenta e cinco pontos em um ponto e meio.

Limitações

  • Uma venue, um tipo de contrato, um conjunto de estratégias. Seis famílias de regras clássicas de tendência, breakout, momentum e reversão à média em barras horárias, então um efeito de rank medido sob esse conjunto é uma afirmação sobre esse conjunto. Contratos finos não pagarem melhor sob essas regras não estabelece que nada paga melhor lá, e o resultado bruto aponta para o outro lado.
  • O período fora da amostra é compartilhado com o estudo de seis mercados que veio antes. A contribuição dos incumbentes é uma quantidade conhecida, não uma descoberta. A informação genuinamente inédita são os vinte e quatro mercados adicionados, e é por isso que a medida primária é uma diferença dominada por eles.
  • Os custos escalados por rank são declarados, não calibrados. O estimador pretendido era degenerado em dados horários de perpétuos, e sua única fonte de validação começa dentro do período fora da amostra, então rotear por ela teria vazado. Nenhuma fonte de cotações tick a tick disponível aqui cobre a janela dentro da amostra para esses contratos, então uma escada de custo propriamente calibrada não estava disponível de forma alguma.
  • A verificação do modelo carrega um viés declarado. A correlação é calculada sobre séries diárias de sleeve que são exatamente zero em cerca de três quartos dos sleeve-dias, porque um sleeve fica parado a maior parte do tempo. Esses zeros deprimem mecanicamente a correlação, o que eleva o multiplicador e torna o Sharpe previsto mais negativo. O viés corre na mesma direção da conclusão de que o realizado acompanha o previsto, então as estimativas pontuais devem ser lidas com isso em mente.
  • Um rascunho anterior liderava com o padrão bruto por faixa como achado positivo. Uma reconferência da implementação a partir do código-fonte, sem recorrer ao texto escrito, estabeleceu que o contraste contém zero, não faz parte do conjunto registrado de medidas, e então mostrou que ele não sobrevive à sua própria sensibilidade registrada. Aquele rascunho também descrevia uma sensibilidade obrigatória como se ela tivesse sido rodada quando não tinha, e rodá-la mudou o veredicto. Ambos ficam registrados em vez de silenciosamente corrigidos, porque a falha aconteceu na etapa de escrita depois de uma análise correta, o que o pré-registro sozinho não pega.

Todo gráfico desta página é desenhado no seu navegador a partir das tabelas de resultado guardadas do estudo, os mesmos números reportados no texto e na página de reprodutibilidade. Não há arquivos de imagem por trás deles.

Metodologia completa

Construção do universo, morte de contrato, o loop walk-forward, a escada de custo, inferência, a verificação do modelo de amplitude, todas as verificações de vazamento e o método do adendo.

Reprodutibilidade →