Présentation du modèle
Claude Sonnet 5.5, publié le 28 septembre 2026, constitue la deuxième génération de la famille Sonnet d’Anthropic. Il se positionne comme un complément plus rapide et moins cher à Claude Opus 5.5, tout en restant dédié aux tâches bien définies telles que la correction de bugs, la rédaction de documents ou la création de présentations. Le prix affiché reste identique à celui du modèle précédent : 2 $ par million de tokens d’entrée, 10 $ par million de tokens de sortie et 0,20 $ par million de tokens en cache, mais le modèle consomme généralement moins de tokens pour atteindre le même résultat.
Performances et coûts
Sur le benchmark Terminal‑Bench 4.0, dédié aux tâches de codage agentique, Sonnet 5.5 obtient un score de 70,6 %, contre 10,3 % pour Sonnet 5 et 66,4 % pour Opus 5.5. Cette progression représente une amélioration de plus de 60 points absolus, soit un facteur de sept fois la performance précédente. Sur le test GDPval‑AA, qui mesure la productivité dans des scénarios de travail réels, Sonnet 5.5 se situe à deux points en dessous d’Opus 5.5, confirmant qu’il reste légèrement moins performant sur les tâches très complexes.
Les évaluations de FrontierCode et CursorBench illustrent également cet écart de coût‑efficacité. À effort élevé, Sonnet 5.5 dépasse le meilleur score de Sonnet 5 pour environ un quinzième du coût par tâche, tandis qu’à effort faible il bat le même score pour moins d’un dixième du coût. Sur le benchmark AA‑Briefcase v1.1, dédié aux travaux de connaissance à long terme, le modèle atteint son meilleur score à effort moyen avec un coût d’environ un neuvième de celui de Sonnet 5.
Sécurité et alignement
Anthropic indique que Sonnet 5.5 satisfait ou dépasse Sonnet 5 sur la plupart des mesures d’alignement automatisées. Le modèle intègre les mêmes garde‑fous biologiques que son prédécesseur et, pour la première fois dans la gamme Sonnet, il bénéficie de protections cybernétiques comparables à celles d’Opus 5.5. Ces garde‑fous ciblent un ensemble restreint de requêtes à haut risque, sans impacter les demandes courantes de développement logiciel ou de sciences de la vie.
Analyse des limites et perspectives
Malgré une vitesse supérieure de plus de 30 % et une réduction de coût jusqu’à 30 % par tâche, Sonnet 5.5 reste inférieur à Opus 5.5 sur les travaux nécessitant un jugement soutenu et une créativité ouverte. Les scores de Humanity’s Last Exam et de Chartography montrent que le modèle excelle avec des outils, mais que son rendement diminue lorsqu’il doit raisonner sans assistance externe. De plus, les données publiées se limitent aux benchmarks internes et à quelques comparaisons externes ; aucune information détaillée sur l’architecture du modèle (taille du réseau, nombre de paramètres) n’est fournie, ce qui empêche une évaluation complète de la scalabilité ou de la consommation énergétique.
En résumé, Claude Sonnet 5.5 représente une avancée notable en termes de rapidité et d’efficacité économique pour les tâches bien définies, tout en conservant un niveau de sécurité robuste. Son positionnement comme « fast‑track » aux côtés d’Opus 5.5 le rend pertinent pour les flux de travail à haut volume, mais les utilisateurs qui recherchent la profondeur de raisonnement devront rester sur les modèles plus lourds.