Présentation du leaderboard ARC-AGI
Le leaderboard ARC-AGI-3 évalue les modèles d'intelligence artificielle (IA) en fonction de leur capacité à s'adapter à des environnements interactifs nouveaux. Les versions précédentes, ARC-AGI-1 et 2, mesuraient l'intelligence fluide passive, tandis que la version 3 met l'accent sur l'adaptation en temps réel.
Interprétation des données
Le graphique présente la relation entre le coût par tâche et la performance, qui est une mesure clé de l'efficacité. Les lignes de tendance des systèmes de raisonnement montrent comment le temps de raisonnement affecte la performance, généralement en présentant un comportement asymptotique à mesure que le temps de réflexion augmente.
Les modèles de langage standard, tels que GPT-4.5 et Claude 3.7, sont représentés par des points uniques, démontrant les performances brutes du modèle sans capacités de raisonnement supplémentaires. Les systèmes Kaggle, quant à eux, représentent des méthodes efficaces spécifiquement conçues pour le défi ARC Prize, opérant sous des contraintes computationnelles strictes.
Politique de vérification
La politique de vérification est disponible sur le site officiel. Seuls les systèmes nécessitant moins de 10 000 $ pour fonctionner sont affichés. Les résultats marqués de « preview » sont non officiels et peuvent être basés sur des tests incomplets.
Implications et limites
Les résultats du leaderboard ARC-AGI-3 mettent en évidence l'importance de l'efficacité dans la conception des modèles d'IA. Les systèmes qui peuvent résoudre des problèmes de manière efficace avec un minimum de ressources sont considérés comme plus intelligents. Cependant, les limites de la méthodologie de test et les contraintes computationnelles doivent être prises en compte lors de l'interprétation des résultats.
Modèles de langage standard : GPT-4.5, Claude 3.7
Systèmes Kaggle : competition-grade submissions