Présentation

Anthropic PBC a annoncé la sortie de Claude Opus 5.5, une évolution de sa série Opus. Le modèle est proposé sur la Claude Developer Platform et via les principaux fournisseurs cloud (AWS, Google Cloud, Azure). Quelques minutes plus tard, OpenAI Group PBC a mis à disposition deux variantes de GPT‑6, nommées Sol et Luna, destinées aux développeurs via les API gpt‑6‑sol et gpt‑6‑luna ainsi que dans les offres ChatGPT Work, Codex et l’application desktop pour les utilisateurs gratuits et Go.

Performances et benchmarks

Opus 5.5 se veut comparable à Fable 5.1 sur la plupart des tâches, tout en affichant une génération de texte plus de 30 % plus rapide que Opus 5, sorti en juillet. Sur le test agentique Terminal‑Bench 4.0, Opus 5.5 obtient 66,4 % contre 55,8 % pour Fable 5.1. Sur AutomationBench, le taux de complétion passe de 26,9 % à 40 %. Le benchmark scientifique Terminal‑Bench‑Science 0.1 montre une progression de 29 % à 58,7 %. Le score Elo de GDPval‑AA v2.1 augmente de 1708 à 1846, et le test Humanity’s Last Exam atteint 67,7 %.

OpenAI indique que Sol réalise 33,2 % des tâches d’AutomationBench à 27 cents par tâche et atteint 68,8 % sur le test DeepSWE v1.1, à moins d’un point de Claude Fable 5. Luna obtient 66,6 % sur le même test. Sol aurait moitié moins d’erreurs que son prédécesseur, tandis que Luna, en mode effort élevé, égalise les performances de GPT‑5.6.

Tarification et modèle économique

Anthropic a baissé le prix d’Opus 5.5 de 20 % : 4 $ d’entrée et 20 $ de sortie par million de tokens, soit 40 % d’économie sur une charge de travail typique. Les lectures en cache, auparavant à 0,50 $, sont réduites à 0,20 $, soit une chute de 60 %. Un mode de service accéléré coûte 8 $ d’entrée et 40 $ de sortie par million de tokens.

OpenAI propose Sol à 2 $ d’entrée et 10 $ de sortie par million de jetons, et Luna à 0,10 $ d’entrée et 0,50 $ de sortie, soit une réduction de 50 % par rapport aux versions GPT‑5.6 correspondantes. De plus, les lectures de jetons en cache sont discountées de 90 %.

Implications et limites

Sur le plan de la sécurité, Anthropic affirme qu’Opus 5.5 est son modèle le plus performant sur l’audit comportemental automatisé, avec une réduction de 85 % des tentatives de contournement des limites de confinement et une amélioration de la résistance aux injections de prompts, atteignant les scores de Fable 5.1 sur le benchmark Gray Swan. Cependant, les tâches liées à la cybersécurité restent limitées au modèle plus ancien Opus 4.8, et les travaux en biologie à haut risque sont cloisonnés derrière des programmes de vérification.

OpenAI, quant à lui, mise sur la réduction des coûts pour favoriser l’adoption massive de ses modèles dans les flux de travail à haut volume (résumé, extraction) et les agents de codage récurrents. Les améliorations du cache et la capacité des agents à ajuster l’effort de raisonnement sans rupture du cache suggèrent une optimisation de l’infrastructure de calcul, mais aucune comparaison directe n’a été fournie entre les modèles d’Anthropic et ceux d’OpenAI, limitant l’évaluation objective de la supériorité technique.