Contexte et objectifs
L’Institut britannique de sécurité de l’IA (AISI) a rejoint la coalition EvalEval pour rendre les résultats de benchmark reproductibles. L’objectif déclaré est de fournir, via les Evaluation Cards, l’ensemble des métadonnées nécessaires à la re‑exécution d’évaluations, afin de réduire les coûts de recomputation et d’améliorer la transparence scientifique.
Infrastructure et schéma Every Eval Ever
EvalEval propose le schéma partagé Every Eval Ever (EEE), qui normalise la description des jeux de données, des modèles et des protocoles d’évaluation. AISI a intégré ce format dans son pipeline, en s’appuyant sur les outils internes OptStop (optimisation du nombre d’étapes d’inférence) et HiBayES (modélisation hiérarchique bayésienne des scores). Le schéma EEE encode, pour chaque exécution, le nombre de tokens consommés, le protocole de feedback (oracle ou pas) et les paramètres d’hyper‑optimisation, ce qui permet de comparer des runs qui diffèrent uniquement par ces variables.
Résultats publiés et analyse technique
AISI a publié les cartes d’évaluation pour cinq benchmarks majeurs : HealthBench, FrontierMath, Humanity's Last Exam, SWE‑Bench et Pro Terminal‑Bench 2.0. Les cartes couvrent six modèles de pointe : Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT‑5, GPT‑5.2 et GPT‑5.4. Deux évaluations cybernétiques supplémentaires – Cyber CTFs et The Last Ones – sont également incluses, avec un jeu de modèles partiellement recouvert.
Les courbes présentées dans le papier « How Inference Compute Shapes Frontier LLM Evaluation » montrent, pour chaque modèle, la part cumulative de tâches résolues en fonction du nombre de tokens dépensés. Lorsque le modèle reçoit un feedback de correction après chaque tentative, la courbe s’étend, indiquant que le même budget de tokens peut résoudre davantage de tâches grâce à l’apprentissage en ligne. Par exemple, Claude Opus 4.6 atteint 70 % de réussite sur Humanity's Last Exam avec 1 M de tokens sous feedback oracle, contre 55 % sans feedback.
Ces résultats illustrent l’impact direct du protocole d’évaluation sur les scores publiés : un même modèle peut afficher des performances très variables selon la politique de feedback et la granularité du comptage de tokens. La disponibilité des paramètres exacts dans les Evaluation Cards permet aux chercheurs de reproduire ces courbes et d’isoler l’effet de chaque facteur.
Implications et limites
La diffusion ouverte de ces cartes crée des points de référence vérifiables, facilitant les méta‑analyses et la calibration des nouvelles métriques. Cependant, la portée reste limitée aux modèles et benchmarks listés ; d’autres domaines (vision, multimodal) ne sont pas encore couverts. De plus, la dépendance à un feedback oracle soulève la question de la généralisabilité des scores à des scénarios réels où aucune correction n’est disponible. Enfin, la reproductibilité dépend de la persistance des artefacts d’infrastructure (versions exactes d’OptStop, de HiBayes et du code d’évaluation), dont la documentation reste partielle.