← Retour aux articles
February 19, 2026
5 min de lecture

Détection d'anomalies pour protéger les bots de trading : du Z-Score au Transformer

Détection d'anomalies pour protéger les bots de trading : du Z-Score au Transformer
#algo trading
#anomaly detection
#machine learning
#risk management
#Isolation Forest
#LOF
#spoofing

Quiconque a déjà fait tourner un bot de trading sur des exchanges crypto connaît cette sensation : le bot fonctionne parfaitement pendant une semaine, puis efface le bénéfice d'une semaine entière en 30 secondes. Un flash crash sur un exchange. Un faux mur dans le carnet d'ordres. Une cascade de liquidations. Ou l'exchange a simplement renvoyé des données inexploitables.

Toutes ces situations ont un point commun : ce sont des anomalies. Et si votre bot ne sait pas les reconnaître, il en deviendra tôt ou tard la victime.

Ce qui constitue une anomalie dans le trading crypto

Avant de traquer les anomalies, il faut s'entendre sur ce que l'on cherche. L'apprentissage automatique distingue trois types, et les trois se produisent quotidiennement sur les marchés crypto.

Les anomalies ponctuelles — des événements isolés qui s'écartent fortement de la norme. Une bougie avec un volume 50 fois supérieur à la moyenne. Le spread BTC/USDT sur Binance bondissant à 0,5 %. Pour un bot de market making, chacun de ces événements est un piège potentiel : entrer en position à un faux prix ou subir un slippage qui dévore toute la marge.

Les anomalies collectives — une série d'événements qui semblent normaux pris isolément, mais qui signalent un problème dans leur ensemble. L'exemple classique est le spoofing : quelqu'un place et annule de gros ordres à cours limité sur plusieurs minutes. Chaque ordre pris individuellement est ordinaire, mais le schéma « placer-annuler-placer-annuler » avec un ratio ordre/transaction de 100:1 est une manipulation — et un bot qui s'appuie sur la profondeur du carnet d'ordres tradera sur une liquidité inexistante.

Les anomalies contextuelles — une valeur normale dans le mauvais contexte. Un volume d'échange de Bitcoin typique de la session de Londres, mais observé à 3 heures du matin UTC un dimanche. Sans prise en compte du contexte, ces anomalies sont invisibles — et ce sont elles qui échappent le plus souvent aux détecteurs de base.

Types d'anomalies dans le trading Visualisation des trois principaux types d'anomalies dans les données de trading : pics ponctuels, motifs collectifs et déviations contextuelles.

Bruit vs anomalie : le problème du contexte

Une anomalie n'est pas simplement une « donnée étrange ». C'est une déviation qui porte de l'information. Il est crucial de distinguer :

  • Le bruit : des fluctuations aléatoires qui font partie du régime normal du marché.
  • La dérive (drift) : un glissement graduel des conditions de marché (par exemple, le passage d'une nuit à faible volatilité à une matinée active).
  • L'anomalie : une violation soudaine du schéma attendu.

Types de variation des données Déterminer la différence entre un bruit inoffensif, une dérive persistante et des anomalies dangereuses est un défi clé pour tout détecteur.

Des méthodes simples qui résolvent 80 % des problèmes

Tout ne doit pas être résolu avec des réseaux de neurones. Trois détecteurs de base suffisent pour la plupart des bots de trading.

Z-Score : filtre rapide des extrêmes

Le Z-Score indique de combien d'écarts-types la valeur actuelle s'éloigne de la moyenne glissante. Il se calcule en microsecondes et fonctionne sur n'importe quelle unité de temps.

Nous l'utilisons pour trois tâches : le filtrage des volumes anormaux (Z-Score > 3 — signal pour élargir les spreads ou suspendre les cotations), la surveillance du spread (un élargissement anormal du bid-ask précède souvent des mouvements brusques) et le taux de financement des futures (des valeurs extrêmes annoncent une probable cascade de liquidations).

Méthode statistique du Z-Score Le Z-Score identifie les événements extrêmes en mesurant de combien d'écarts-types un point est éloigné de la moyenne. Les valeurs dépassant ±3σ sont traitées comme des valeurs aberrantes dans la plupart des systèmes de trading.

Limite importante : les marchés crypto ont des distributions à queues épaisses (fat tails). Un événement qui, selon la loi normale, devrait se produire une fois par million d'années (6σ) survient tous les mois en crypto. Le Z-Score est donc un filtre d'anomalies grossier, pas un verdict final.

Level Shift Detector : quand le marché change de régime

Nous prenons deux fenêtres glissantes consécutives et comparons leurs moyennes. Si l'écart dépasse un seuil — un décalage de niveau (level shift) s'est produit. Les stratégies de market making profitent d'un marché stable et perdent lors des mouvements brusques. Un Level Shift Detector sur le volume et la volatilité avertit d'un changement de régime plusieurs minutes avant qu'il ne devienne évident dans le prix.

Nous l'appliquons à plusieurs métriques simultanément : taille moyenne des transactions, profondeur du carnet d'ordres sur les 5 premiers niveaux, nombre de transactions par unité de temps. Si le Level Shift se déclenche sur au moins deux métriques — le bot passe en mode défensif.

Volatility Shift Detector : pressentir la tempête

Une approche similaire, mais on compare des écarts-types plutôt que des moyennes. Une hausse brutale de la volatilité est un signal pour revoir les paramètres. Un schéma intéressant : une volatilité anormalement basse précède souvent un mouvement explosif. Le Volatility Shift Detector capte les deux cas — la compression et l'expansion.

Détection des changements de régime Les détecteurs Level Shift et Volatility Shift sont essentiels pour identifier les « changements de régime » — des bouleversements structurels soudains du comportement du marché qui nécessitent des paramètres de trading différents.

HBOS : analyse multidimensionnelle rapide

Lorsqu'il faut surveiller plus de 10 indicateurs simultanément sans le coût d'un ML complexe, HBOS (Histogram-Based Outlier Selection) est le meilleur choix. Il suppose l'indépendance des variables et construit un histogramme pour chacune. Le score d'anomalie est le produit des densités inverses sur tous les histogrammes.

Principe de l'algorithme HBOS HBOS est nettement plus rapide que les méthodes basées sur la distance comme LOF, ce qui le rend adapté au filtrage haute fréquence de vecteurs d'état multidimensionnels.

Apprentissage automatique : quand les statistiques ne suffisent plus

Les méthodes de base travaillent avec un indicateur à la fois. Mais les vraies anomalies se manifestent souvent par une combinaison inhabituelle d'indicateurs : le volume est normal, le spread est normal, mais volume + spread + vitesse de variation du prix + déséquilibre du carnet d'ordres ensemble — sont anormaux. C'est là que le ML devient nécessaire.

Hiérarchie de la détection d'anomalies par ML Un paysage structuré des méthodes de détection d'anomalies : des algorithmes classiques non supervisés aux architectures de deep learning.

Isolation Forest : le meilleur équilibre pour la production

De toutes les méthodes de détection d'anomalies par ML, l'Isolation Forest s'adapte le mieux aux systèmes de trading. L'algorithme construit un ensemble d'arbres de décision qui partitionnent aléatoirement l'espace des variables. Les points anormaux, étant « rares et différents », sont isolés en moins de divisions.

Pourquoi l'Isolation Forest ? Il ne nécessite pas de données étiquetées — étiqueter les anomalies sur les marchés crypto est pratiquement impossible puisque chaque flash crash est unique. Une inférence rapide de l'ordre de la milliseconde rend possible une utilisation quasi temps réel. Et, point crucial pour la production : les prédictions peuvent être expliquées via les valeurs SHAP — vous ne savez pas seulement qu'un moment est anormal, vous comprenez pourquoi.

Sur des données Bitcoin, l'Isolation Forest a détecté non seulement des anomalies évidentes comme le pic de volatilité lorsque Tesla a rejeté les paiements en BTC en 2021, mais aussi des anomalies subtiles — des périodes où les mouvements de prix n'étaient pas soutenus par le volume, indiquant une manipulation externe. Lors de l'analyse du spoofing, SHAP montre que les indicateurs clés sont des cotations déséquilibrées du carnet d'ordres et une activité d'annulation anormalement élevée.

Concept de l'Isolation Forest L'algorithme Isolation Forest fonctionne en partitionnant l'espace de façon aléatoire : les valeurs aberrantes sont isolées en nettement moins de divisions que les points situés dans des clusters denses.

LOF : le meilleur choix pour la surveillance multi-exchange

Le Local Outlier Factor évalue le caractère anormal d'un point en comparant sa densité locale à celle de ses voisins. Une étude (Springer, 2024) comparant LOF, Isolation Forest et One-Class SVM sur des données de cryptomonnaies a conclu que LOF était le plus efficace — il a trouvé de vraies anomalies avec le moins de faux positifs, tout en restant stable aussi bien sur Bitcoin que sur Dogecoin.

Pourquoi LOF est-il important pour une infrastructure multi-exchange ? Les données de différents exchanges ont une « densité » différente — Binance voit des milliers de transactions par seconde, un exchange de niche en voit des dizaines. Les méthodes globales comme le Z-Score produiront des faux positifs sur les exchanges de niche ou manqueront les anomalies sur les grands. LOF s'adapte au contexte local.

Visualisation de l'algorithme LOF LOF compare la densité locale d'un point à celle de ses voisins. Cela lui permet de trouver des valeurs aberrantes « localement » anormales même si elles sont cohérentes avec les motifs globaux des données.

La limite est la complexité quadratique par rapport au nombre de points. Pour des données temps réel au niveau du tick, c'est trop lent, mais pour des agrégats à la minute sur plus de 100 exchanges — c'est idéal.

Autoencodeurs : analyse approfondie du carnet d'ordres

Un autoencodeur est un réseau de neurones qui compresse les données en une représentation compacte puis les reconstruit. Entraîné sur des données « normales », une erreur de reconstruction élevée signale alors une anomalie.

Pour l'analyse du carnet d'ordres, c'est l'outil le plus puissant. Un carnet d'ordres avec 20 niveaux de bid et 20 niveaux d'ask est un vecteur de 40 dimensions qui se met à jour des centaines de fois par seconde. Un LSTM Autoencoder prend en compte non seulement l'état actuel, mais aussi la dynamique — comment le carnet d'ordres a évolué sur les N derniers ticks. L'approche hybride « LSTM Autoencoder + One-Class SVM » sépare les responsabilités : le réseau de neurones se charge de l'extraction des variables, le ML classique de la prise de décision. Le principal inconvénient est le coût de calcul : l'inférence temps réel nécessite un GPU.

Architecture en goulot d'étranglement de l'autoencodeur Les autoencodeurs apprennent une représentation « latente » compressée des données normales. Les anomalies ne se reconstruisent pas avec précision, ce qui produit un score d'erreur élevé utilisé pour la détection.

Architecture en cascade : tout assembler

Aucune méthode ne résout à elle seule tous les problèmes. Les méthodes rapides manquent les anomalies complexes. Les méthodes précises sont trop lentes pour le temps réel. La solution est une architecture en cascade où chaque couche suivante rattrape ce que la précédente a laissé passer.

Architecture de protection en cascade Architecture de détection d'anomalies multicouche : des limites strictes à la milliseconde jusqu'à l'analyse de deep learning en arrière-plan.

Couche 1 — Fast Path (moins de 1 ms). Z-Score sur le volume, le spread et la variation de prix. Vérification de persistance. Limites strictes. En cas de déclenchement — suspension immédiate du trading. Cette couche protège contre les flash crashes, les erreurs d'API et les manipulations grossières. Implémentée dans la boucle principale du bot, sans dépendances externes.

Couche 2 — Near Real-Time (1–100 ms). Isolation Forest sur des variables combinées. Détecteurs Level Shift et Volatility Shift. En cas de déclenchement — changement de mode de trading, ajustement des paramètres. Fonctionne dans un thread parallèle.

Couche 3 — Analyse en arrière-plan (1–60 secondes). LOF sur des données multi-exchange. LSTM Autoencoder sur les états du carnet d'ordres. Analyse des résidus de la décomposition saisonnière. En cas de déclenchement — alertes, ajustements des paramètres de la stratégie.

Couche 4 — Analyse par lots (horaire/quotidienne). DBSCAN pour la détection de wash trading. PCA pour la surveillance de la corrélation inter-exchanges. Réentraînement complet des modèles. Sortie — rapports, mises à jour des modèles, recalibrage des seuils pour les couches précédentes.

Chaque couche fonctionne de manière indépendante. Si la couche 3 tombe en panne — les couches 1 et 2 continuent de protéger le bot. La tolérance aux pannes et la dégradation gracieuse (graceful degradation) sont des propriétés obligatoires de toute infrastructure de trading.

Recommandations pratiques

Quelques leçons tirées de la production.

Commencez simple. Z-Score + Level Shift + Volatility Shift peuvent être implémentés en une journée. Cela couvre la majorité des scénarios de perte dus à des conditions de marché anormales. Le cluster de GPU pourra venir plus tard.

Le paramètre contamination est l'hyperparamètre le plus important. Dans l'Isolation Forest, il définit la proportion attendue d'anomalies. Pour les marchés crypto, nous utilisons 0,01–0,05 selon la paire et l'exchange. Trop bas — vous manquez de vraies anomalies. Trop haut — les faux positifs paralysent le trading.

Des seuils adaptatifs plutôt que fixes. Les marchés crypto sont non stationnaires. Un seuil qui fonctionnait en janvier générera des faux positifs en mars. Utilisez l'EWMA pour mettre à jour les seuils, ou réentraînez périodiquement les modèles sur une fenêtre glissante.

Journalisez toutes les anomalies. Même si vous ne réagissez pas automatiquement — sauvegardez l'étiquette avec son contexte. En un mois, vous disposerez d'un jeu de données pour entraîner des modèles supervisés et analyser quelles anomalies ont précédé les pertes.

Testez sur des incidents réels. Constituez une collection d'anomalies historiques : le flash crash de mai 2021, la cascade de liquidations de FTX, l'effondrement de LUNA. Faites passer chaque nouveau détecteur par ces scénarios. S'il n'attrape pas les incidents connus — il est inutile.

Et ensuite

Trois directions à surveiller.

Les modèles à base de Transformer pour les carnets d'ordres. Des recherches récentes montrent qu'un Transformer autoencoder + OC-SVM sur des données de Limit Order Book surpasse nettement toutes les approches précédentes pour la détection de spoofing. Un Staged Sliding Window Transformer sur des données EUR/USD haute fréquence (315 millions d'enregistrements) a atteint une exactitude de 0,93, un F1 de 0,91 et une AUC-ROC de 0,95 — nettement mieux que Random Forest, LSTM et CNN.

Transformer pour le LOB Les architectures Transformer à attention multi-têtes se révèlent exceptionnellement performantes pour identifier des motifs temporels complexes dans les données de Limit Order Book haute fréquence.

Les GANs pour la génération d'anomalies synthétiques. L'un des principaux défis est le manque de données étiquetées. Les GANs peuvent générer des scénarios de manipulation réalistes pour entraîner des modèles supervisés. Il existe déjà des architectures atteignant une exactitude de 94,7 % avec une latence inférieure à 3 ms et un débit de 150 000 transactions par seconde.

GAN pour les anomalies de trading Les réseaux antagonistes génératifs (GANs) peuvent être utilisés pour enrichir les jeux de données en créant des anomalies synthétiques réalistes, résolvant le problème critique de la rareté des étiquettes dans le trading.

La Change Point Detection (CPD). Au lieu de se contenter de chercher des valeurs aberrantes, la CPD se concentre sur l'identification du moment exact où les propriétés statistiques du signal ont changé. C'est essentiel pour basculer entre les régimes de market making (par exemple, du retour à la moyenne au suivi de tendance).

Change Point Detection La Change Point Detection identifie les changements structurels dans les données de séries temporelles, mettant en évidence la frontière entre différents régimes de marché.

Les anomalies ne sont pas une fonctionnalité optionnelle. C'est le fondement sans lequel le trading algorithmique devient un jeu de hasard. Et plus tôt vous le construirez, moins le marché aura de leçons coûteuses à vous donner.

Références

  1. Anomaly detection in cryptocurrency markets using Isolation Forest
  2. LOF: Identifying local outliers in high dimensional space
  3. Isolation Forest for Anomaly Detection (Sklearn Documentation)
  4. PyOD: A Comprehensive Python Toolbox for Outlier Detection
  5. Transformer-based models for Limit Order Book anomaly detection
  6. Ethical Issues and Market Manipulation in Cryptocurrency

Citation

@software{soloviov2026anomalydetectionalgotrading,
  author = {Soloviov, Eugen},
  title = {Anomaly Detection for Trading Bot Protection: From Z-Score to Transformer},
  year = {2026},
  url = {https://marketmaker.cc/en/blog/post/anomaly-detection-algotrading},
  version = {0.1.0},
  description = {Which anomaly detection methods actually work in crypto algo trading, how to build a cascading protection architecture, and why this is the foundation without which algo trading becomes gambling.}
}
blog.disclaimer

Authors

Eugen Soloviov
Eugen Soloviov

Trading-systems engineer

Trading-systems engineer building bots since 2017: cross-exchange arbitrage (connected up to 30 venues), cointegration-based pairs arbitrage across spot and futures, scalping, news and sentiment-driven strategies, trend algorithms, and portfolio management and balancing algorithms. Also builds sub-millisecond order execution, big-data warehouses, backtesting engines, AI agents, and trading interfaces (incl. open-source profitmaker.cc). Stack: JS/TS, Python, Rust/Zig/Go, DevOps, backend, frontend, architecture.

Newsletter

Gardez une longueur d'avance sur le marché

Abonnez-vous à notre newsletter pour des insights exclusifs sur le trading IA, des analyses de marché et des mises à jour de la plateforme.

Nous respectons votre vie privée. Désabonnement possible à tout moment.