Performance et efficacité
Claude Opus 5.5, lancé le 22 septembre 2026, atteint le niveau de Claude Fable 5.1 sur la plupart des tâches tout en surpassant Claude Opus 5 sur les benchmarks d’agentic coding, de computer use et de knowledge work. Sur le benchmark Terminal‑Bench 4.0, le modèle obtient 66,4 % contre 55,8 % pour Opus 5, soit un gain de plus de 10 points de pourcentage. De même, sur le test CursorBench 4.0, il atteint 57,8 % contre 51,8 % pour la version précédente. Ces écarts traduisent une meilleure capacité à raisonner de façon adaptative, notamment lorsqu’il travaille à « max effort ».
Un test interne a montré qu’un développeur a pu migrer 680 000 lignes de code en moins d’une journée, une opération qui aurait requis plusieurs semaines à une équipe humaine. Dans un autre scénario, Opus 5.5 a optimisé les temps de chargement de chaque page d’une application web 39 fois sur 40, alors que Opus 5 n’a apporté que des améliorations marginales qui ont modifié le comportement de l’application.
Sécurité et alignement
Le modèle obtient les meilleurs scores jamais enregistrés sur l’audit comportemental automatisé d’Anthropic, qui simule des milliers de scénarios. Il est « much less likely » de prendre des actions irréversibles ou hors‑bord, et montre une résistance accrue aux injections de prompts par rapport à Opus 5. Les évaluations externes menées par Frontier Design et METR confirment ces résultats, même si les tests restent limités aux scénarios simulés et ne couvrent pas toutes les situations réelles.
Pour les domaines sensibles, Anthropic déploie les mêmes garde‑fous que pour Claude Mythos 5.1 en biologie et Claude Fable 5.1 en cybersécurité. Les organisations vérifiées peuvent accéder au modèle via le Life Sciences Verification Program ou le Cyber Verification Program, ce qui montre une volonté de contrôler l’usage dans les secteurs à haut risque.
Coût et disponibilité
Sur les charges de travail typiques, Opus 5.5 consomme 40 % moins de calcul que Opus 5. Le tarif d’entrée‑sortie passe à 4 $ / M tokens en entrée et 20 $ / M tokens en sortie, soit 20 % de réduction. Les lectures de cache, qui représentent la majorité des coûts pour les tâches d’agentic coding, sont facturées 0,20 $ / M tokens, soit 60 % de moins. En plus de la baisse de prix, le modèle génère du texte 30 % plus rapidement que son prédécesseur.
Les limites d’utilisation ont été relevées à cinq heures pour les plans Pro, Max et Team, et un mécanisme de réinitialisation du taux de requêtes permet aux abonnés de sauvegarder et réutiliser leurs quotas, améliorant ainsi la flexibilité d’usage en production.
Benchmarks et limites observées
Malgré des scores élevés, les marges de benchmark deviennent moins fiables à ces niveaux de capacité. Par exemple, la différence entre Opus 5.5 et Claude Fable 5.1 se réduit dans les tests internes, suggérant que les scores publics peuvent exagérer l’écart réel. De plus, lorsque les garde‑fous sont activés, les tâches de cybersécurité sont exécutées par Claude Opus 4.8, et les travaux en biologie par Opus 5, ce qui peut diminuer les performances affichées sur les benchmarks de sécurité et de recherche scientifique.