Présentation du mode Ultrafast
OpenAI a déployé aujourd’hui le mode Ultrafast pour le modèle GPT‑6.1 Sol, accessible via l’API, Codex et ChatGPT Work. Le service promet une vitesse d’exécution jusqu’à 8 fois supérieure à celle du mode Sol Standard tout en offrant une intelligence comparable à la gamme Astra. La tarification annoncée est de 12 $ par million de jetons d’entrée et 60 $ par million de jetons de sortie, ce qui place le coût d’utilisation au centre des décisions d’intégration.
Décodage spéculatif, principe technique
Le décodage spéculatif repose sur deux modèles : un petit modèle « draft » génère une séquence de jetons probable, tandis qu’un modèle plus grand vérifie simultanément cette séquence lors d’un même passage avant. Cette architecture permet d’évaluer plusieurs jetons en parallèle, réduisant la latence lorsque la taille du lot est inférieure au nombre optimal de jetons. L’avantage disparaît à très haut débit, où le calcul supplémentaire peut être gaspillé parce que le temps de déplacement en mémoire devient le facteur limitant.
Impact sur les charges de travail d’entreprise
Le mode Ultrafast cible les scénarios où chaque milliseconde compte : recherche en temps réel, assistance à la programmation, orchestration d’agents multi‑étapes. Un facteur de vitesse de 8× peut réduire les temps de réponse de dizaines de secondes à quelques secondes, améliorant l’expérience utilisateur. Toutefois, le coût plus élevé du débit de sortie (60 $ / M) nécessite une analyse de rentabilité, notamment pour les applications générant de longs textes ou du code.
Limites et perspectives
Le décodage spéculatif dépend de la précision du modèle draft ; les erreurs obligent le modèle principal à intervenir, ce qui augmente le temps de calcul et la consommation mémoire, les deux modèles devant cohabiter. Par ailleurs, Google a présenté le Gemini universal agent, capable de gérer des flux de travail complexes avec contexte persistant et orchestration multi‑agents, mais aucune donnée de performance n’est fournie. L’interopérabilité entre le Gemini agent et le mode Ultrafast reste donc à explorer, tout comme l’impact environnemental d’une double charge de modèle.