Présentation
Inception Labs a annoncé la mise à disposition de Mercury 2.5, le dernier modèle de langage basé sur la diffusion. Le communiqué le décrit comme le « most capable diffusion LLM on the market », avec une taille de modèle supérieure à tout précédent diffusion‑LLM connu. Le produit conserve le même profil de service à faible latence et à coût réduit que la version 2.
Améliorations techniques
Le gain principal annoncée est une hausse de 40 % de l’intelligence par rapport à Mercury 2, évaluée à l’aide de retours clients et de cas d’échec en production. La vitesse d’inférence atteint 1 107 tokens par seconde sur des GPU NVIDIA grand public, ce qui confirme que l’architecture diffusion ne sacrifie pas le débit. Le contexte a été porté à 260 000 tokens, élargissant la capacité de traitement de séquences longues sans fragmentation.
Le modèle est facturé à 0,20 $ par million de tokens d’entrée et 0,75 $ par million de tokens de sortie, avec une offre de lancement à 0,04 $ et 0,15 $ respectivement, soit une remise de 80 %. Cette tarification repose sur la token‑efficiency inhérente aux modèles diffusion, qui génèrent plus d’information par token que les architectures traditionnelles.
Performances en production
Des entreprises utilisent déjà Mercury 2.5 dans des agents de recherche, des pipelines RAG et des agents vocaux. OpenCall rapporte une latence médiane de 170 ms pour les réponses vocales, et une réduction du P99 de plusieurs minutes à une seconde après migration. Le P50 est passé de 0,4 s à moins de 0,2 s, même avec des appels de raisonnement parallèles.
Dans le domaine du code, Augment Code a déplacé la compaction de contexte vers Mercury 2.5, ce qui a baissé la latence de 150 s à 27 s (‑82 %) et réduit le coût de 90 % tout en maintenant la qualité. Les résumés d’appels d’outils sont générés en moins d’une seconde, ce qui montre la viabilité du modèle pour des flux de travail à forte intensité de requêtes.
Limites et perspectives
Malgré les améliorations, le modèle reste limité par la taille maximale de contexte (260 K tokens) qui peut devenir un goulot d’étranglement pour des documents très longs. Le prix, même réduit, reste proportionnel au volume de tokens, ce qui peut pénaliser les charges très intensives. Enfin, la dépendance à l’infrastructure NVIDIA implique que les gains de vitesse ne se traduiront pas sur des GPU d’autres fournisseurs sans optimisation supplémentaire.
Inception Labs indique déjà travailler sur un nouveau modèle, plus grand, qui viserait à conserver la rapidité et l’efficacité token‑wise de la diffusion tout en augmentant la capacité de raisonnement. La prochaine version devrait donc pousser la frontière entre performance et coût, mais nécessitera des avancées en entraînement distribué et en optimisation d’inférence.