Eugen Soloviov
Trading-systems engineer
Trading-systems engineer building bots since 2017: cross-exchange arbitrage (connected up to 30 venues), cointegration-based pairs arbitrage across spot and futures, scalping, news and sentiment-driven strategies, trend algorithms, and portfolio management and balancing algorithms. Also builds sub-millisecond order execution, big-data warehouses, backtesting engines, AI agents, and trading interfaces (incl. open-source profitmaker.cc). Stack: JS/TS, Python, Rust/Zig/Go, DevOps, backend, frontend, architecture.
Articles
TWAP vs VWAP vs POV: como escolher um benchmark de execução (e saber quando cada um te engana)
TWAP, VWAP e POV são apostas sobre uma previsão de volume. Dissecamos as premissas ocultas de cada scheduler, construímos curvas de volume intradiário para cripto, e comparamos os três lado a lado sobre dados de L2 reproduzidos.
Almgren-Chriss Sem Rodeios: Execução Ótima que Você Consegue Implementar em uma Tarde
Derivação completa do modelo de execução ótima de Almgren-Chriss: impacto linear, a trajetória sinh/cosh, a fronteira eficiente e código Python funcional para calibrar eta, gamma e sigma a partir de dados de L2 e trades da Binance.
O Negativo Honesto: Dezenas de Milhares de Backtests, Cinco Majors, Nenhuma Vantagem Robusta
O ponto culminante do arco de busca-e-overfitting, e ele termina em um resultado negativo — o correto. Uma busca de timeframe duplo em um único símbolo no ETHUSDT encontrou uma configuração que valia +16,35% out-of-sample e +2,62% em um holdout intocado; o Deflated Sharpe Ratio, considerando ~37.000 tentativas, deflacionou-o para 0,00. Uma passagem cross-instrument sobre cinco majors (ETH/BTC/SOL/BNB/XRP, ~1,18M de barras de 1m cada), selecionando pela mediana out-of-sample, o mata de vez: DSR duplo 0,24 / PBO 0,264, DSR triplo 0,14 / PBO 0,327 — ambos falham nos limiares. O campeão é lucrativo em 1 de 5 símbolos e negativo no restante. É para isso que serve o aparato anti-overfitting: para impedir você de embarcar o melhor do ruído como alfa.
Provando a Ausência de Look-Ahead em Backtests Multi-Timeframe: Perturbe o Futuro, Prove que o Passado Não Pode Vê-lo
Backtests multi-timeframe vazam o futuro através de uma barra de timeframe superior ainda em formação, cujo fechamento final ainda não existe. Não se chega à confiança por revisão de código — é preciso testar. Reproduzimos exatamente a regra de barra fechada do bot ao vivo e depois provamos a ausência de vazamento com uma sonda de futuro deslocado: perturbamos cada barra futura e verificamos que todo sinal e trade passado permanece bit a bit inalterado. 25/25 verificações de paridade, e a sonda tem dentes.
Quando a GPU Compensa: O Roofline do Sweep de Parâmetros, Onde um 167x de Manchete É na Verdade 27x de Algoritmo Vezes 6.2x de Hardware
A vantagem da GPU sobre a CPU cresce com o tamanho do batch — de 54.5x com um combo por chamada até 359.6x com 61 na nossa pré-computação de indicadores multi-timeframe — porque um sweep pequeno não consegue amortizar o overhead de lançamento de kernel e de transferência. Decompomos um 167x de manchete em uma vitória algorítmica de 27x que também ajuda a CPU e uma vitória de hardware de 6.2x, mostramos que a vantagem verdadeira GPU-vs-melhor-CPU é de apenas 3.2x em single-timeframe e 6.2x em multi, e damos um guia de decisão sobre quão largo um sweep precisa ser antes que valha a pena apostar em uma GPU.
A Armadilha de Precisão da GPU: Como um Backtest em fp32 na Apple Metal Retorna Lixo Silenciosamente
A GPU Metal da Apple não tem float64. Portar um backtest vetorizado para ela de forma ingênua faz a tentadora WMA por soma de prefixos estourar o fp32 — erro relativo máximo de 211× — mas ainda assim ele roda e devolve números com aparência plausível. A correção não é mais precisão; é uma formulação diferente: uma convolução direta por janela, segura em fp32 até 8×10⁻⁷ e 55.9× mais rápida que o numba de thread única. A armadilha, a aritmética por trás dela, e como provar que você não caiu nela.
O Portão de Fidelidade: o Backtest do Grosseiro ao Fino Engana Você Mais Rápido, a Menos que o Proxy Barato Classifique Como o Caro
A busca drill-down / multi-fidelidade (ASHA, eliminação sucessiva, Hyperband) filtra milhares de configs de forma barata e promove apenas os sobreviventes para a avaliação completa e cara. É um ganho de velocidade genuíno — mas colapsa silenciosamente se a classificação de baixa fidelidade discordar da de alta fidelidade. Medimos a correlação de ranking por dobra: em uma dobra, o ρ de Spearman pode ser 0.03 (classifica quase aleatoriamente), subindo para 0.43, 0.67, 0.78, 0.91 à medida que as dobras se acumulam. A correção é um portão obrigatório — meça ρ(barato, completo) primeiro, e eleve automaticamente a fidelidade mínima para o primeiro degrau em que ρ ≥ 0.5.
Busca Aleatória vs. Busca Inteligente: o Cruzamento é o Custo de Avaliação, Não o Algoritmo
Quando um backtest é barato, o Sobol embaralhado e burro vence em throughput bruto — samplers inteligentes (TPE, CMA-ES, ASHA) pagam uma taxa de ask/tell em Python que os derruba em 20x, fazendo com que avaliem muito menos pontos no mesmo tempo de relógio e percam. Torne cada avaliação cara (multi-TF + folds de walk-forward) e o cruzamento se inverte. Medimos os dois regimes, e por que a fidelidade de rank por fold (ρ@1 subindo de 0.03→0.43) é a pré-condição para que o pruning valha a pena.
O espaço de parâmetros de dois eixos: por que a maior parte do seu sweep deveria ser quase gratuita
Nem todos os parâmetros custam o mesmo para pesquisar. Os parâmetros de uma estratégia dividem-se num eixo caro (indicadores — recalculados sobre toda a série) e num eixo barato (limiares de decisão — uma passagem O(n) sobre sinais pré-calculados). Como os indicadores são invariantes aos limiares, calculam-se uma vez e percorrem-se milhares de configurações de limiares a ~5.600 cfg/s — cerca de 1.600 vezes mais barato do que recalcular por configuração. Uma reavaliação do custo da maldição da dimensionalidade.
O imposto do framework: quando sua biblioteca de backtest é mais lenta que um loop ingênuo de pandas
Comparamos oito motores de backtest em uma mesma varredura de parâmetros idêntica — 150k barras, 80 combinações de cruzamento de HMA, com a paridade de número de operações travada em 2707. Dois dos frameworks orientados a eventos mais populares ficaram mais lentos que um loop de pandas escrito à mão, enquanto um motor vetorizado/compilado rodou o mesmo trabalho cerca de 13,000× mais rápido. Um estudo sobre a sobrecarga por barra que as bibliotecas populares nunca foram feitas para amortizar.
The Probability of Backtest Overfitting: Did Your Search Beat a Coin Flip?
The Deflated Sharpe Ratio prices the winning strategy; PBO prices the search that picked it. Combinatorially Symmetric Cross-Validation runs C(16,8) = 12,870 train/test splits over a 1000x200 performance matrix and asks: does the in-sample winner land in the bottom half out of sample? The catch almost everyone misses — PBO's null is 0.5, not 1. On 200 zero-edge strategies the best in-sample annualized Sharpe of 1.98 collapses to 0.06 out of sample and PBO = 0.476: a coin flip, fully overfit. Plant a real edge (annualized Sharpe 2.38) and PBO drops to 0.001, the in-sample 3.73 surviving to an out-of-sample 2.34. A moving-average grid on a pure random walk has no out-of-sample skill either — PBO 0.463 averaged over 60 matrices, statistically indistinguishable from the null — and on one representative matrix the mirage is vivid: a best in-sample Sharpe of 2.33 collapses to a median out-of-sample -0.22, PBO 0.573, a 63% chance of a loss.
O imposto IPC: coloque o motor de backtest atrás de um socket e perca 13% — quase nada disso é do socket
Portamos um kernel de backtest numba linha por linha para Rust e o chamamos através de uma fronteira de processo de quatro formas, com um portão de equivalência confirmando PnL idêntico até a última operação. Enviar toda a série de preços de 1,2 MB por um socket Unix custa ~2 ms — cerca de 0,1% do trabalho. Codificar o mesmo payload em JSON custa 1348x mais que bytes brutos, chamadas tagarelas por combinação reenviam os dados 80 vezes, e um padrão de chamada por barra pagaria 2,1 s de IPC pura em um trabalho de 2,0 s. A fronteira é barata; o imposto está em como você a atravessa.