Introduction aux benchmarks d'IA
Les benchmarks d'IA sont essentiels pour mesurer les progrès des modèles et guider les décisions de déploiement. Cependant, ces benchmarks atteignent rapidement un plateau, rendant difficile la différenciation des modèles et diminuant leur valeur à long terme.
Étude de la saturation des benchmarks
Dans cette étude, nous définissons la saturation des benchmarks et l'analysons à travers 60 benchmarks de modèles de langage en utilisant 14 propriétés liées à la saturation. Nous constatons que près de la moitié de nos benchmarks présentent une saturation, avec des taux qui augmentent avec l'âge.
Facteurs influençant la saturation
Nous trouvons que la résilience à la saturation est impactée par la curation d'experts, et non par les données de test publiques. Nos résultats suggèrent que les choix de conception peuvent prolonger la longévité des benchmarks et informer des approches d'évaluation plus durables.
Implications et limites
Les résultats de cette étude ont des implications importantes pour la communauté de l'IA, car ils soulignent la nécessité de développer des benchmarks plus robustes et plus durables. Cependant, les limites de cette étude incluent le fait que nous n'avons analysé que les benchmarks de modèles de langage, et que d'autres types de benchmarks pourraient présenter des caractéristiques différentes.