Présentation
Le 22 septembre 2026, Anthropic a publié Opus 5.5, le nouveau sommet de la gamme Claude. Cette version succède à Opus 5, sortie le 24 juillet 2026, et se place au-dessus de Sonnet (niveau intermédiaire) et Haiku (niveau économique). L’annonce précise que le modèle a été conçu pour les tâches de codage et de travail de connaissance, où il dépasse le modèle plus volumineux Fable sur plusieurs benchmarks.
Performances et coûts
Opus 5.5 affiche une amélioration de la vitesse d’inférence, reflétant une réduction du calcul nécessaire pour le servir. Cette optimisation se traduit par un tarif de 20 $ par million de tokens de sortie, contre 25 $ pour la version précédente, soit une baisse de 20 %. Le texte indique que « d’autres métriques connaissent des baisses de prix similaires », ce qui rend le modèle plus accessible pour les applications à forte consommation de texte. En outre, les tests internes montrent que le modèle atteint des scores supérieurs à Fable sur des tâches informelles que ce dernier n’a pas pu résoudre, confirmant une progression tant en précision qu’en efficacité énergétique.
Sécurité et alignement
Anthropic a appliqué les mêmes garde-fous que pour le modèle Fable, limitant l’usage du modèle dans la découverte d’exploits de programmes compilés ou la conception d’armes biologiques. Cette restriction s’appuie sur les capacités de Mythos en biologie et cybersécurité, indiquant que Opus 5.5 possède un niveau de compétence comparable dans ces domaines. Le processus de formation en sécurité reste « largement similaire » aux versions antérieures, incluant des tests d’alignement et des évaluations externes réalisées par METR et Frontier Design. Le PDG Dario Amodei a souligné, dans un post interne, la nécessité de « ralentir le rythme des avancées pour laisser le temps aux mécanismes de prévention des risques de se développer », ce qui oriente la feuille de route de la société vers une progression contrôlée.
Perspectives et limites
Les annonces de la même période prévoient le lancement de Sonnet 5.5 et Haiku 5.5 dans les semaines à venir, avec des améliorations de performances analogues. Toutefois, la description reste vague sur les changements architecturaux sous‑jacents, limitant l’évaluation précise des gains de calcul. De plus, bien que les benchmarks indiquent une supériorité à Fable, les données chiffrées (latence, FLOPs, taille du modèle) ne sont pas publiées, ce qui empêche une comparaison quantitative exhaustive. Enfin, la dépendance aux garde‑fous externes soulève la question de la flexibilité d’utilisation dans des contextes de recherche avancée où les restrictions pourraient freiner l’innovation.