Présentation du modèle
Claude Opus 5.5, dernière itération d’Anthropic, cible les tâches de codage prolongé, l’utilisation d’ordinateurs et le travail de connaissance. Le modèle consomme 40 % moins de tokens que son prédécesseur Opus 5, ce qui se traduit par un prix de 4 $ / Mio de tokens d’entrée et 20 $ / Mio de tokens de sortie. Une configuration testée supporte un contexte d’un million de tokens, bien au‑delà de la plupart des LLM grand public.
Architecture et optimisation
Anthropic a réduit le nombre de paramètres actifs en privilégiant des blocs de décodage plus compacts, ce qui explique la moindre consommation de tokens. Le modèle intègre également un mode « fast » qui accélère le décodage en limitant le nombre de passes de réévaluation, tout en conservant la même taille de contexte. Les améliorations de la couche d’attention, notamment l’utilisation d’une fenêtre glissante de 16 k tokens, permettent de maintenir la cohérence sur de longues séquences sans exploser la mémoire GPU.
Analyse des coûts et performances
Comparé à Opus 5, le coût total d’une tâche de 10 k tokens d’entrée et 30 k tokens de sortie passe de 0,84 $ à 0,64 $, soit une économie de 0,20 $. Sur le même benchmark, Anthropic rapporte des scores d’audit comportemental supérieurs et une résistance accrue aux injections de prompts, deux critères de sécurité souvent négligés dans les évaluations de prix. En parallèle, OpenAI a lancé GPT‑6 Sol et GPT‑6 Luna : Sol coûte 2 $ / Mio d’entrée et 10 $ / Mio de sortie, Luna 0,10 $ / Mio d’entrée et 0,50 $ / Mio de sortie. Ces tarifs sont environ 50 % inférieurs aux prix promotionnels de GPT‑5.6, mais les deux modèles offrent des contextes de 128 k tokens, bien inférieurs aux 1 M de Claude Opus 5.5.
Implications et limites
Le prix attractif de Claude Opus 5.5 rend les applications à large contexte (ex. analyse de documents juridiques, synthèse de code base) économiquement viables, mais la taille du modèle reste un facteur de latence sur du matériel non spécialisé. De plus, la documentation ne précise pas la consommation énergétique ni le nombre exact de paramètres, ce qui complique l’évaluation de l’impact environnemental. Enfin, bien que les tests d’injection de prompts soient meilleurs, aucune métrique publique n’est fournie, limitant la comparaison objective avec les offres concurrentes.