Présentation du test

Le site Jev Pong compare la réactivité de quatre modèles d’intelligence artificielle dans le cadre d’une partie d’Atari Pong. Chaque modèle reçoit la même question à chaque échange : la décision qui déplace la balle d’un pas. Le temps de réponse détermine la vitesse de déplacement du ballon, ce qui rend la latence directement observable.

Architecture de Jev versus modèles de chat

Jev, développé par TypeSafe AI, est présenté comme un modèle à décision typée. Contrairement aux modèles de chat (Gemini, Claude Haiku, GPT‑5.6), il ne génère pas de texte libre mais renvoie une valeur binaire (déplacement haut/bas). Cette contrainte réduit le nombre de tokens à traiter, élimine la phase de génération de texte et supprime la surcharge de décodage, ce qui explique la différence de temps de calcul.

Analyse des performances

Les mesures affichées sur la page montrent que Jev répond en 227 ms en moyenne, avec un p95 de 400 ms et 4,40 décisions par seconde. Les modèles de chat affichent des latences bien supérieures : Gemini (3,8 decisions/s, 3 167 ms moyenne, p95 7 438 ms), Claude Haiku (0,40 decisions/s, 2 483 ms moyenne, p95 8 358 ms) et GPT‑5.6 (0,28 decisions/s, 3 529 ms moyenne, p95 10 350 ms). La différence d’ordre de grandeur (plus de 10 fois) se traduit dans le jeu par une balle qui avance à chaque tick pour Jev, alors que les balles contrôlées par les modèles de chat avancent de façon saccadée, voire restent immobiles pendant plusieurs secondes.

Implications pour les jeux en temps réel

Dans un environnement où chaque milliseconde compte, la latence du modèle devient le facteur limitant du gameplay. Un modèle de décision typée comme Jev permet d’intégrer l’IA directement dans la boucle de rendu sans introduire de files d’attente perceptibles. Les modèles de chat, conçus pour la génération de texte riche, ne sont pas adaptés à ce type de contrainte temporelle ; ils nécessitent soit une pré‑calcul des actions, soit une architecture hybride où la décision est déléguée à un composant plus rapide. Cette expérience souligne que le choix de l’architecture d’IA doit être aligné sur les exigences de réactivité du produit final.