Contexte et objectifs
Anthropic a présenté Opus 5.5, la dernière itération de son modèle grand public, tandis qu’OpenAI a lancé les variantes GPT‑6 Sol et Luna. Les deux entreprises ne visent pas de nouvelles capacités spectaculaires mais une amélioration de l’efficacité énergétique et financière, afin de rendre les modèles de pointe plus accessibles aux clients d’entreprise qui évaluent chaque centime dépensé en inference.
Tarification et gains d’efficacité
Anthropic annonce un prix de $4 pour les tokens d’entrée et $20 pour les tokens de sortie, soit 20 % de moins que le tarif d’Opus 5. Le coût des lectures de cache, qui représentent la majorité des dépenses en tâches d’agentic et de codage, chute à $0,20 par million de tokens, 60 % moins cher que précédemment. En outre, Opus 5.5 génère les réponses plus de 30 % plus rapidement que son prédécesseur, et Anthropic estime une économie globale d’environ 40 % pour des charges de travail typiques grâce à une réduction du nombre de tokens consommés.
OpenAI propose, pour GPT‑6 Sol, un tarif de $2 par million de tokens d’entrée et $10 pour les tokens de sortie. La version Luna, orientée vitesse et faible coût, est facturée à $0,10 (entrée) et $0,50 (sortie) par million de tokens. Ces prix représentent une réduction d’environ 50 % par rapport aux modèles de la génération précédente, tout en conservant les mêmes méthodes d’entraînement que GPT‑6 Astra.
Performances comparatives
Les benchmarks internes d’Anthropic montrent qu’Opus 5.5 dépasse GPT‑6 Astra sur certains tests de codage et de travail de connaissance, bien que l’écart reste modeste. OpenAI indique que Sol et Luna offrent “quelques points de pourcentage” d’amélioration sur leurs prédécesseurs selon les jeux de données évalués, tout en coûtant moitié prix. Aucun changement architectural majeur n’est détaillé ; les deux acteurs semblent optimiser les pipelines d’inférence (quantisation, parallélisation) et le traitement du cache pour réduire le nombre de passes de calcul.
Implications pour les déploiements d’entreprise
Pour les organisations, la baisse du prix du token se traduit directement en réduction du budget d’API, surtout dans les scénarios à forte consommation comme la génération de code, les assistants de cybersécurité ou les analyses biologiques. La rapidité accrue d’Opus 5.5 et le coût ultra‑bas de Luna permettent d’envisager des boucles de feedback en temps réel, où le modèle peut être invoqué plusieurs fois sans exploser les dépenses.
Ces modèles conservent toutefois les mêmes garde‑fous que leurs versions antérieures : les requêtes jugées « à haut risque » sont redirigées vers des modèles plus anciens, limitant ainsi l’exposition à des réponses potentiellement non alignées. La stratégie de prix bas s’accompagne donc d’un contrôle de la surface d’attaque, mais ne résout pas les problèmes d’alignement ou de fuite de données qui restent inhérents aux grands modèles de langage.