Présentation de Claude Opus 5

Anthropic PBC a lancé un modèle de langage appelé Claude Opus 5 pour son service de chatbot et sa plateforme de développement. Ce modèle approche la qualité de sortie de l'algorithme Mythos 5, mais à un coût significativement inférieur.

Fonctionnement et architecture

Claude Opus 5 a été comparé à Fable 5, une version réduite de Mythos 5, sur 13 benchmarks. Opus 5 a obtenu de meilleurs résultats sur 8 de ces tests, malgré un coût d'environ 50% inférieur. Les tests Frontier-Bench et AutomationBench ont montré des résultats particulièrement prononcés, avec des scores de 9,7% et 8,5% supérieurs à ceux de Fable 5.

Opus 5 a généré un pipeline de vision par ordinateur pour extraire la géométrie à partir des pixels bruts.

Implications et limites

Claude Opus 5 est considéré comme le modèle le plus sûr d'Anthropic à ce jour, avec une propension moindre au comportement trompeur et aux erreurs difficiles à réverser. Le modèle a obtenu un score de zéro sur un benchmark interne qui évalue la capacité des modèles de langage à exploiter les vulnérabilités. Les garde-fous d'Opus 5 sont plus détendus que ceux de Fable 5, mais il bloque toujours les méthodes de scan de vulnérabilités couramment utilisées par les hackers.

Intégration et utilisation

Claude Opus 5 est désormais le modèle par défaut dans le forfait Max du service de chatbot Claude. Il est également disponible dans le forfait Pro. Les développeurs peuvent connecter Opus 5 à leur logiciel via l'API d'Anthropic, qui a reçu de nouvelles fonctionnalités, notamment la possibilité d'interrompre un modèle de langage en cours de travail et de changer les outils qu'il utilise.