Présentation de Claude Opus 5

Claude Opus 5 est un modèle réfléchi et proactif qui se rapproche de l'intelligence de frontière de Claude Fable 5 à moitié prix.

Sur les évaluations de codage et de travail de connaissance comme Frontier-Bench et GDPval-AA, Opus 5 est le nouvel état de l'art, bien qu'il reste derrière Mythos 5 sur les tâches de cybersécurité.

Performances et coût

Claude Opus 5 offre des performances nettement améliorées pour le même coût que son prédécesseur, Opus 4.8.

Les graphiques montrent comment les performances changent en fonction du paramètre d'effort du modèle, que les clients peuvent utiliser pour optimiser l'intelligence ou conserver des jetons pour des résultats plus rapides et moins chers.

Opus 5 excelle sur les tâches d'ingénierie logicielle de valeur.

Par exemple, sur Frontier-Bench v0.1, Opus 5 dépasse tous les autres modèles et plus que double les performances d'Opus 4.8 à un coût inférieur par tâche.

Évaluations et résultats

Sur ARC-AGI 3, une évaluation où le modèle doit résoudre des problèmes nouveaux, le score d'Opus 5 est trois fois supérieur à celui du modèle suivant.

Sur Zapier AutomationBench, qui mesure la capacité des modèles à compléter des tâches commerciales de début à fin, le taux de réussite d'Opus 5 est d'environ 1,5 fois supérieur à celui du modèle suivant pour le même coût par tâche.

Utilisation et résultats

Claude Opus 5 est capable de produire des sorties visuelles beaucoup plus fortes.

Les utilisateurs ont trouvé de nombreux exemples de l'agent et de la minutie d'Opus 5 lors des évaluations et des tests de premier accès.

Exemple de code pour la reconstruction d'une pièce de machine en 3D à partir d'un dessin

Claude Opus 5 est une amélioration significative par rapport à Opus 4.8 pour les flux de travail de recherche financière.

Il se distingue par sa capacité de raisonnement numérique, son travail de table et sa pensée critique plus aiguë où la précision est importante.