Présentation du benchmark DrivingBench
DrivingBench est une plateforme d’évaluation qui confie à un modèle de langage le contrôle direct d’une Toyota Corolla via les commandes set_motion (direction du volant, accélération, freinage) et stop_now. Le test se déroule sur un tracé de cônes où la trajectoire doit rester à moins de 4 m du centre. La progression est mesurée comme le pourcentage du centre du parcours parcouru avant une éventuelle collision, et le temps d’arrivée correspond à la durée entre la première commande acceptée et la fin du dernier engagement.
Performances de GPT‑6 Astra
Sur le tableau de bord, GPT‑6 Astra a réalisé 100 % de progression en 5 minutes 22 secondes, avec 24 commandes acceptées. Le coût total s’élève à 6,6 M de tokens pour 7,74 $. En comparaison, Claude Fable n’a atteint que 45 % du parcours avec 8 commandes, 2,1 M de tokens et 1,64 $, tandis que Grok et GPT‑5.6 Sol restent en dessous de 12 % de progression, avec des coûts nettement inférieurs mais aucune finition. Ces écarts montrent que la capacité à générer des séquences de contrôle plus longues et cohérentes se traduit directement par une progression supérieure, mais au prix d’une consommation de tokens et d’un coût plus élevés.
Analyse technique des contraintes d’interaction
Le modèle opère dans un « chat continu » où chaque tentative partage le même contexte. Cette contrainte impose que le modèle conserve l’état du véhicule entre les appels set_motion, ce qui explique le nombre limité de commandes (24) pour couvrir l’ensemble du circuit. Chaque appel implique une latence réseau et un calcul de tokenisation qui s’ajoute au budget global. Le seuil de 4 m autour du centre impose une marge d’erreur stricte ; toute dérive supérieure entraîne une collision et stoppe la progression, ce qui rend la précision de la génération de texte critique.
Implications et limites du test
Bien que GPT‑6 Astra réussisse à piloter physiquement une Corolla, le test reste confiné à un environnement contrôlé : le tracé est fixe, les obstacles sont limités à des cônes, et les capteurs du véhicule ne sont pas exploités par le modèle. L’absence de perception visuelle ou lidar signifie que le modèle dépend entièrement des instructions pré‑définies du benchmark. De plus, le coût en tokens (plus de 6 M) rend l’approche peu viable pour un usage en temps réel à grande échelle. Enfin, la sécurité n’est pas évaluée ; une collision entraîne simplement l’arrêt de la mesure de progression, sans analyse des conséquences physiques.