Présentation du modèle
Anthropic a présenté Claude Sonnet 5.5, le nouveau maillon de la gamme intermédiaire de la famille Claude. Conçu pour les tâches quotidiennes – génération de documents, résumés, manipulation de feuilles de calcul ou correction de bugs – il succède à Sonnet 5 tout en conservant le même tarif de $2 / Mio de tokens d’entrée, $10 / Mio de tokens de sortie et $0,20 / Mio de lectures cache. Le modèle repose sur la même architecture de base que le modèle phare Opus 5.5, ce qui facilite la migration des charges de travail existantes.
Améliorations de performance et de coût
Selon les chiffres fournis par Anthropic, Sonnet 5.5 génère du texte plus de 30 % plus rapidement que son prédécesseur, ce qui se traduit par une réduction de la latence perçue lors d’interactions en temps réel. En pratique, les premiers tests de Zendesk indiquent une accélération de 20 % du traitement des tickets, avec moins d’erreurs de décision. Le gain de vitesse s’accompagne d’une optimisation du nombre de tokens consommés : le même travail nécessite moins de jetons, rendant le modèle 30 % moins cher en coût effectif.
Capacités de sécurité et de conformité
Sonnet 5.5 introduit un watermarking invisible intégré au texte généré, destiné à faciliter la détection d’IA conformément à l’AI Act de l’Union européenne. Cette couche de marquage n’altère pas la lisibilité du texte, mais augmente la probabilité de repérer les contenus synthétiques. En outre, le modèle hérite de garde-fous cybernétiques similaires à ceux des modèles Mythos‑class, capables de bloquer ou de rediriger les requêtes portant sur la cybersécurité, la biologie ou d’autres sujets sensibles, tout en restant transparent pour les usages de développement logiciel et de sciences de la vie.
Évaluation technique et limites
Sur le benchmark Terminal‑Bench 4.0, dédié à l’évaluation de compétences en codage agentique, Sonnet 5.5 obtient un score de 70,6 % contre 10,3 % pour la version précédente, illustrant une progression majeure dans la compréhension et la génération de code. Sur le test GDPval‑AA, il se situe à deux points en dessous d’Opus 5.5, ce qui indique une légère marge d’amélioration sur les tâches professionnelles complexes. Le modèle a également été le premier de la série Sonnet à réussir le défi « Pokémon Red », un test de compréhension à long terme basé uniquement sur des captures d’écran, démontrant une capacité accrue d’interprétation visuelle.