Présentation de la mise à jour
Le benchmark Artificial Analysis Intelligence Index passe à la version 4.2 après huit mois d’activité depuis la version 4.0. Cette itération introduit deux évaluations internes – AA‑Briefcase et GDP.pdf – et augmente la part des jeux de données privés à 40 % du poids total, soit le double de la version 4.1. L’objectif déclaré est de rapprocher l’index des scénarios réels tout en limitant les possibilités de manipulation des scores par les laboratoires.
Nouveaux jeux de tests et méthodologie
AA‑Briefcase mesure la capacité agentique sur des projets de plusieurs semaines, chaque projet comportant des milliers de fichiers sources. La notation combine un ruban d’évaluation et un classement pair‑à‑pair pour juger la réussite vérifiable, la qualité analytique et la présentation. GDP.pdf, fourni par Surge AI, exige la synthèse d’informations réparties sur 4 592 pages de PDF, couvrant dix domaines. Les réponses sont comparées à 1 275 critères atomiques ; le taux All‑pass ne compte qu’un succès complet sur l’ensemble des critères.
Le poids des jeux privés passe à 40 % grâce à l’inclusion d’AA‑Briefcase, AA‑Omniscience et des solutions CritPt. Cette hausse réduit la capacité des équipes à optimiser leurs modèles sur des jeux publics, car les données privées restent inaccessibles. Le système de notation a été révisé : le prompt de grading a été enrichi, les ambiguïtés des clés de réponse corrigées, et l’échelle Elo ré‑ancrée pour stabiliser les scores lors de l’ajout de nouveaux modèles.
Résultats des modèles et implications
Claude Fable 5.1 d’Anthropic occupe la première place, suivi de GPT‑6 Astra d’OpenAI qui dépasse GPT‑5.6 Sol de 4 points d’Index et gagne environ 85 points Elo sur le test AA‑Briefcase. Sur le benchmark GDP.pdf, GPT‑6 Astra atteint 33,2 % de taux All‑pass, devançant GPT‑5.6 Sol (28,2 %) et Claude Fable 5.1 (26,2 %). Le tableau des coûts par tâche montre Anthropic, OpenAI, Meta et Z.AI sur le front de Pareto, indiquant que ces laboratoires offrent le meilleur compromis entre performance et dépense.
La supériorité de GPT‑6 Astra en efficacité de tokens se traduit par une consommation moindre pour un niveau d’intelligence comparable, ce qui peut influencer les décisions d’intégration dans des services à grande échelle où le coût du token reste un facteur économique majeur.
Perspectives et limites
La progression vers 40 % de jeux privés améliore la résistance au «gaming», mais elle restreint la transparence : les chercheurs externes ne peuvent pas reproduire les scores sans accès aux jeux détenus. L’absence de publication détaillée des critères de notation empêche une évaluation indépendante de la robustesse des jugements. De plus, la focalisation sur des tâches longues et documentaires pourrait favoriser les modèles optimisés pour la mémoire de contexte, au détriment d’autres capacités comme le raisonnement symbolique.
Les équipes annoncent déjà des travaux sur la version 5, avec une part encore plus élevée de jeux privés et des itérations de grading supplémentaires. La trajectoire montre une volonté d’affiner la mesure de l’intelligence artificielle tout en consolidant la barrière d’accès aux données d’évaluation.