Contexte et objectif de l’évaluation
Le rapport InnovationEval, publié le 7 octobre 2026, vise à mesurer la capacité d’une IA à concevoir de façon autonome une innovation en apprentissage automatique comparable à une avancée humaine récente. L’évaluation s’appuie sur la comparaison avec un article scientifique ouvert portant sur la self‑distillation en mode on‑policy, choisi pour sa pertinence dans les laboratoires d’IA de pointe.
Méthodologie end‑to‑end
Le test impose à l’agent IA de couvrir l’ensemble du cycle de recherche : génération d’idées, implémentation, expérimentation, analyse des résultats et itération jusqu’à atteindre un seuil de performance fixé par le papier de référence. Cette contrainte élimine les évaluations qui se limitent à la simple combinaison de techniques existantes, comme le soulignent les auteurs en citant les limites de benchmarks tels que Crux Evals ou ResearchGym.
Pour garantir la faisabilité, les chercheurs ont reproduit le protocole humain, incluant le budget de calcul estimé à « des milliers de dollars » de temps GPU. Cette information chiffrée permet de comparer directement les dépenses humaines et les ressources consommées par les modèles testés.
Résultats sur les modèles de pointe
Les expériences ont été menées avec Claude Fable 5 et GPT‑5.6 Sol. Aucun des deux modèles n’a démontré de mémorisation du sujet lorsqu’on les a interrogés sans accès à la recherche, ce qui indique que les performances observées ne proviennent pas d’une simple récupération de données d’entraînement. Malgré l’accès à plusieurs milliers de dollars de GPU, les deux IA n’ont pas réussi à dépasser les métriques du papier humain, soulignant une difficulté persistante à générer des innovations réellement nouvelles.
Le rapport note également que le nombre d’essais est limité, chaque tentative nécessitant un budget de calcul important. Cette contrainte réduit la robustesse statistique des conclusions et explique pourquoi les résultats se basent sur un petit échantillon d’exécutions.
Analyse des limites et perspectives
Deux limites majeures sont identifiées : d’une part, l’évaluation repose sur un seul domaine de recherche (post‑training), ce qui ne reflète pas la diversité des activités de R&D en IA ; d’autre part, l’absence d’un système de notation entièrement automatisé complique la comparaison objective entre essais. Les auteurs envisagent d’étendre la méthodologie à d’autres tâches et d’augmenter le nombre de runs afin de réduire l’incertitude liée aux variations de performance.
En conclusion, InnovationEval fournit les premiers indicateurs quantifiables d’une IA capable de mener un projet de recherche complet, mais les résultats montrent que les modèles actuels, même les plus avancés, restent incapables de remplacer l’ingéniosité humaine dans la génération d’innovations majeures.