Présentation de MirrorCode

MirrorCode est un benchmark conçu pour tester les capacités des modèles d'IA à reimplémenter des programmes entiers, sans accès au code source original. Les tâches de MirrorCode consistent à reproduire exactement les sorties d'un programme original, en passant des tests de bout en bout, y compris des tests retenus.

Fonctionnement de MirrorCode

MirrorCode se distingue des autres benchmarks de génie logiciel par son évaluation à grande échelle et son caractère cheat-resistant. Les modèles d'IA disposent d'un budget d'inférence important pour tenter de résoudre les tâches, qui peuvent prendre des semaines pour un humain. Les modèles sont également soumis à des tests de bout en bout qu'ils n'ont pas vus pendant leur développement, afin d'éviter les tricheries.

Capacités de l'IA

L'IA peut déjà résoudre certaines tâches de MirrorCode, malgré leur difficulté. Par exemple, le modèle Claude Opus 4.7 a réimplémenté avec succès le toolkit bioinformatique gotree, composé de ~16 000 lignes de code Go et de plus de 40 commandes, en 14 heures et pour un coût de 251 $. Cela représente une avancée significative par rapport à la capacité d'un humain à accomplir la même tâche, qui prendrait probablement entre 2 et 17 semaines.

Limites et résultats

Il est important de noter que les résultats de MirrorCode pourraient être influencés par la contamination des données, les modèles d'IA ayant probablement vu les codebases originales lors de leur pré-entraînement. Cependant, les résultats suggèrent que les capacités mesurées par MirrorCode pourraient se généraliser à une base de code non vue. Les auteurs de MirrorCode publient régulièrement une liste des meilleurs scores, qui montrent que l'IA peut réimplémenter des programmes entiers avec une grande précision, mais qu'il reste encore des défis à relever pour atteindre une perfection totale.

gotree: ~16 000 lignes de Go et 40+ commandes

Le code source de MirrorCode et de 22 des 25 programmes cibles est ouvert, avec les trois autres cibles retenues comme ensemble de test privé.