Présentation du benchmark ARC‑AGI‑3

ARC‑AGI‑3 mesure l’intelligence agentique à travers des environnements abstraits au tour‑par‑tour. Les agents doivent explorer, modéliser, fixer des objectifs et planifier leurs actions sans instructions explicites. Quatre composantes sont évaluées : exploration, modélisation, définition d’objectifs et planification/exécution. Les humains résolvent 100 % des niveaux, ce qui fournit une référence de performance et de coût énergétique (≈0,067 ¢ par partie).

Architecture et mécanismes de GPT‑6 Astra

Le modèle utilise deux harnais différents. Le harnais « Standard » autorise le modèle à conserver des notes choisies pendant l’épisode, ce qui a permis d’atteindre 62,7 % de réussite pour un coût de 26 000 $ sur la version semi‑privée. Le harnais « Provider Adapter » préserve l’état de raisonnement opaque entre les requêtes et applique une compression des notes, ce qui porte le score à 99,9 % pour 19 000 $. Cette compression réduit la taille du contexte tout en maintenant la cohérence des plans sur de longues séquences.

Game state: L8: hub q2 (8↓). Lengths: 14=1…
Multi-step plans: extend8 to3; retract10 to2; shorten8 to1
Controls: 9−=(39,4), rotate=(49,18)
Turn 5: P=(24,20), empty, facing west

Ces extraits illustrent la notation algébrique compacte que le modèle génère en temps réel : il encode positions, rotations et séquences d’actions dans une syntaxe quasi‑programmation, créant ainsi un langage spécifique au domaine (DSL) qui sert de modèle interne.

Analyse des performances

Sur la base de 500 participants humains, le « human baseline » a été fixé à la médiane du nombre d’actions par niveau. Astra a utilisé moins d’actions que ce baseline sur 96 % des niveaux et a réduit le nombre moyen d’actions de 51,7 % par niveau. Cette amélioration dépasse la simple capacité de complétion : elle montre une efficacité d’apprentissage comparable à celle d’un humain expérimenté.

Le coût économique de l’évaluation humaine était de 12,78 $ par partie (115 $ pour 90 minutes + 5 $ par partie). En comparaison, le coût d’Astra varie entre 19 000 $ et 26 000 $ pour l’ensemble du benchmark, soit un investissement d’ordre de grandeur supérieur, mais sans frais récurrents de rémunération. Le calcul de l’énergie cérébrale (≈0,067 ¢ par partie) souligne que la différence de coût provient surtout du temps humain, pas de la consommation énergétique.

Limites et perspectives

Les résultats restent conditionnés aux deux harnais testés ; d’autres stratégies de gestion de contexte pourraient modifier le ratio coût/performances. De plus, la notation DSL, bien que dense, reste opaque : l’absence de transparence empêche une validation formelle du modèle interne. Enfin, le benchmark ne mesure pas la généralisation hors‑domaine, ce qui laisse ouverte la question de la transférabilité des compétences acquises.