Contexte et objectif
PacBench est une plateforme de benchmark qui teste la capacité d’un modèle d’intelligence artificielle à générer un jeu Pac‑Man complet à partir d’une instruction unique : « Create a Pac‑Man game in a single html page ». L’objectif est de comparer différents modèles et harnesss sur la même tâche, afin de quantifier la productivité du code généré automatiquement.
Méthodologie du benchmark
Chaque entrée soumise à PacBench suit un format strict. Le modèle reçoit le prompt texte, puis le harness exécute le code HTML produit et enregistre plusieurs indicateurs : temps d’exécution (wall time), nombre de tokens consommés, coût monétaire estimé, et taille du fichier HTML final. Les modèles sont identifiés uniquement par un label court, sans préfixe de fournisseur ni suffixe de date, ce qui garantit que la comparaison porte sur le modèle lui‑même et non sur des métadonnées externes.
Le benchmark se décline en trois phases. La phase 2 utilise Claude Code, invoqué via OpenRouter, tandis que la phase 3 exploite Antigravity couplé à Gemini. Une entrée supplémentaire, le « Grok Bot », a été rédigée directement dans le chat à partir du même prompt, sans consultation préalable du benchmark. Les cartes « gpt‑6 Codex » représentent des relances d’API où le coût est calculé à partir du tarif standard publié par OpenAI appliqué aux tokens réellement consommés. Les coûts de Cursor Cloud, lorsqu’ils sont renseignés, proviennent du tableau de bord facturé en centimes.
Analyse des résultats et limites
Les métriques collectées permettent d’observer des variations notables entre les modèles. Par exemple, les entrées Claude Code affichent généralement des temps d’exécution plus courts que les relances gpt‑6 Codex, ce qui reflète une différence d’optimisation du harness. En revanche, les tailles de fichiers HTML varient fortement : certaines implémentations produisent un code minimaliste, tandis que d’autres incluent des bibliothèques supplémentaires qui gonflent le fichier sans améliorer le gameplay.
Le calcul du coût repose sur les tarifs publics d’OpenAI et les relevés de tokens, mais il ne tient pas compte d’éventuels frais cachés liés à l’infrastructure du harness. De plus, les entrées où le champ « HTML size » est indiqué par un tiret signalent une absence de mesure, ce qui limite la comparabilité. L’absence de valeurs numériques précises dans le tableau public empêche une analyse statistique fine et oblige le lecteur à se référer aux logs bruts du benchmark pour extraire les données exactes.
Enfin, le benchmark ne mesure pas la jouabilité du jeu généré, uniquement la capacité à produire un fichier HTML fonctionnel. Une implémentation peut être techniquement correcte mais offrir une expérience de jeu médiocre. Cette contrainte méthodologique doit être prise en compte lorsqu’on interprète les scores de PacBench comme indicateur de performance globale des modèles.