Performances sur la tâche du bol

Sur vingt essais, GPT‑6 Astra a réussi à déposer le bloc rouge dans le bol dans dix‑neuf cas, soit un taux de succès de 95 %. Chaque essai a duré en moyenne 2,5 minutes, contre 6,8 minutes pour Claude Fable 5.1 et 6,8 minutes également pour Fable 5. Le coût moyen par exécution était de 0,94 $, alors que les deux modèles concurrents ont coûté respectivement 2,12 $ et 2,12 $. Cette combinaison de rapidité et de moindre dépense indique une amélioration substantielle du raisonnement séquentiel et de la planification d’actions.

Le critère de sélection des essais les plus performants repose sur le stade d’avancement le plus élevé, puis sur la durée la plus courte. Les horloges affichent le temps réel écoulé, les pauses de réflexion étant exclues, ce qui met en avant la capacité de GPT‑6 Astra à générer des plans d’action plus concis tout en conservant la précision nécessaire à la manipulation physique.

Résultats sur la tâche du puzzle

Pour la tâche plus complexe consistant à insérer une pièce ronde bleue dans une rainure circulaire, Astra n’a complété l’insertion que deux fois sur vingt essais, identique au score de Fable 5.1 (2/20) et largement supérieur à Fable 5 (1/20). Les deux modèles atteignent la même étape finale avant de s’arrêter, ce qui suggère une limitation commune dans la compréhension fine de la géométrie de l’objet ou dans la coordination fine du bras robotique. Le coût moyen par essai était de 1,36 $, légèrement inférieur au 2,18 $ des modèles concurrents, reflétant une utilisation plus parcimonieuse des tokens malgré un taux de réussite similaire.

Le fait que les deux modèles s’arrêtent au même stade indique que le goulot d’étranglement provient probablement du niveau de perception sensorielle ou du contrôle de force, plutôt que du module de génération de langage. La différence de coût montre que GPT‑6 Astra exploite davantage le cache interne d’OpenAI, réduisant le nombre de tokens facturés.

Analyse des coûts et de l’infrastructure

Les coûts indiqués sont basés sur les tarifs listés par les fournisseurs. OpenAI a automatiquement mis en cache environ 20 % des entrées d’Astra, mais cette économie n’est pas prise en compte dans le calcul affiché, ce qui signifie que le coût réel de GPT‑6 Astra est probablement inférieur à 0,94 $ pour la tâche du bol et à 1,36 $ pour le puzzle. En revanche, les modèles Anthropic n’ont pas bénéficié de ce cache, ce qui gonfle leurs coûts relatifs.

Les essais d’Astra ont été exécutés deux jours après ceux de Fable, sur un rig différent pour la tâche du bol (rig‑3 indisponible). Cette variation d’infrastructure peut introduire des différences de latence, de calibration du bras ou de conditions d’éclairage, affectant potentiellement les performances mesurées.

Limites méthodologiques

Le protocole de notation repose sur un évaluateur humain connaissant le modèle testé, ce qui expose les scores à un biais cognitif inconscient. De plus, les objets ont été réinitialisés manuellement entre chaque essai, introduisant une variabilité non contrôlée dans la position initiale et la friction des surfaces. Tous les modèles ont fonctionné avec un niveau de « effort de raisonnement » moyen, ce qui ne reflète pas les performances maximales possibles sous des réglages plus intensifs.

Enfin, l’absence d’interleaving des essais entre les modèles empêche une comparaison directe en temps réel, surtout pour la tâche du bol où les conditions du rig diffèrent. Ces facteurs limitent la généralisation des résultats et soulignent la nécessité de protocoles d’évaluation plus rigoureux pour les futurs benchmarks de manipulation robotique.