Contexte et objectifs
L’été 2026, un stagiaire de Jane Street, Kavish, a exploré la génération d’événements de marché à l’aide d’un modèle de diffusion autoregressive. Le jeu de données provient de quatre années d’actions américaines, chaque ligne contenant un horodatage, un prix, un type d’événement (trade, order, cancel, etc.) et d’autres attributs. L’objectif était de produire, de façon séquentielle, non seulement le prix prédit mais aussi le timing et le type d’événement, afin d’obtenir des simulations plus riches que les simples prévisions ponctuelles.
Architecture du modèle
Le système repose sur une architecture encodeur‑diffuseur inspirée de Autoregressive Image Generation without Vector Quantization. Un transformeur encodeur masqué causalement génère un vecteur latent pour chaque position de la séquence. Deux têtes sont attachées : une tête « event‑kind » qui prédit, via une distribution binaire, si l’événement suivant est un trade ou une mise à jour du meilleur bid‑ask (BBO) ; et une tête de diffusion qui génère les variables continues (prix, temps écoulé, etc.) en conditionnant le latent et le type d’événement grâce à AdaLN. En phase d’inférence, seul le latent du dernier événement alimente la tête d’événement, puis la tête de diffusion produit les caractéristiques continues du prochain événement.
DDPM versus flow matching
Kavish a comparé deux paramétrisations classiques : le DDPM (Denoising Diffusion Probabilistic Model) et le flow‑matching. Le DDPM utilise un planning cosinus de 1 000 pas, comme recommandé dans Improved DDPM, et la génération suit la procédure DDIM. Cette configuration a conduit à des trajectoires de débruitage instables : 88‑95 % des valeurs générées dépassaient 8 écarts‑types de la moyenne pour les sept cibles continues, créant des filaments roses visibles dans les visualisations. Augmenter le nombre de pas de génération réduisait l’incrément par pas, mais ne résolvait pas complètement le problème. En revanche, le flow‑matching, qui prédit la vitesse le long d’une interpolation linéaire entre bruit et donnée, a produit des trajectoires quasi‑droites et a convergé avec peu d’étapes, éliminant les explosions observées avec le DDPM.
Gestion des discontinuités et limites
Le principal défi identifié est la nature hybride du marché : les espaces d’action sont discrets (type d’événement, pas de prix) tandis que les variables comme le prix ou le timing possèdent une granularité quasi‑continue. Les tentatives de lissage des masses ponctuelles ou de discrétisation partielle des cibles ont montré que la diffusion entièrement continue ne capture pas la « jaggedness » des données réelles, notamment les pics de « pennying » et les rafales d’arrivées d’ordres à des instants ronds. Le passage au flow‑matching a atténué ces problèmes, mais aucune solution complète n’a encore été validée. Les auteurs soulignent que des approches hybrides, combinant diffusion pour les dimensions continues et modèles explicites pour les variables discrètes, pourraient constituer la prochaine étape.