Présentation des nouveaux modèles

OpenAI a annoncé GPT-6 Sol et GPT-6 Luna comme alternatives à GPT-6 Astra. Les deux modèles visent à réduire le coût d’inférence tout en conservant les améliorations apportées à la génération de code, la factualité, l’utilisation d’outils informatiques et les tâches professionnelles. L’annonce précise que Sol et Luna sont « plus rapides » et « plus abordables », sans fournir de chiffre de latence ou de tarif exact.

Architecture et optimisations techniques

Les deux variantes utilisent une combinaison de prompt caching améliorée et de techniques de quantification qui augmentent le taux de hit du cache. OpenAI indique que les nouveaux caches offrent des réductions de coût lorsqu’un préfixe partagé est réutilisé dans les trente minutes suivant son premier appel. Cette approche repose sur la conservation de sous‑séquences de tokens en mémoire GPU, ce qui évite de recomposer les mêmes calculs de décodage.

Parallèlement, le modèle Claude Opus 5.5 d’Anthropic, présenté dans le même bulletin, atteint des performances similaires à Claude Fable 5.1 tout en consommant 40 % d’énergie de calcul en moins que la version précédente Opus 5. Le gain provient d’une optimisation du pipeline de décodage et d’une utilisation accrue du cache d’inférence.

Évaluation et performances comparatives

Le benchmark SWE‑Bench Pro V2 a été mis à jour avec 642 tâches provenant de 11 dépôts. Les scores publiés montrent que les modèles de pointe, dont GPT‑6 Astra, restent au‑dessus de la moyenne, mais que les modèles plus petits, comme les versions antérieures de Claude, chutent à environ 23 % de réussite sur le jeu de données public. Cette baisse reflète la complexité accrue du benchmark, qui inclut davantage de scénarios multi‑fichiers et de langues.

Dans le cadre de l’évaluation de la robustesse, Anthropic a soumis Opus 5.5 à un audit comportemental automatisé, où il a obtenu le meilleur résultat de l’entreprise à ce jour. OpenAI, de son côté, a publié des métriques de prompt caching indiquant un taux de hit moyen supérieur à 70 % sur les charges de travail typiques.

Implications et limites

Les gains de coût et de vitesse ouvrent la porte à une adoption plus large dans les environnements de production où les dépenses d’inférence sont un facteur limitant. Cependant, l’absence de chiffres précis sur la latence et le prix rend difficile l’estimation du retour sur investissement pour les entreprises. De plus, la performance réduite des modèles plus petits sur SWE‑Bench Pro V2 suggère que les économies de calcul peuvent s’accompagner d’une perte de capacité dans des tâches complexes.

Enfin, la présentation d’OpenAI au Conseil de sécurité de l’ONU, annoncée dans le même communiqué, souligne que les avancées techniques s’accompagnent de préoccupations réglementaires croissantes, notamment en matière de sécurité et de gouvernance des modèles de grande taille.