Principe du benchmark
Jevman propose un test automatisé où chaque modèle d’IA reçoit le labyrinthe de Pac‑Man sous forme de JSON à chaque intersection et doit choisir une direction. Six modèles différents ont été confrontés à 100 parties chacun, soit un total de 600 parties, contre les fantômes classiques du jeu d’arcade. Chaque partie se termine dès que le joueur perd les trois vies ou atteint la limite de 5 minutes. Aucun des jeux n’a approché cette borne ; le plus long a duré 2 minutes 24 secondes.
Mécanique de décision et contraintes temporelles
Le protocole impose un délai de 2 secondes pour chaque réponse. Si le modèle dépasse ce seuil, le système applique une règle de secours simple, comptabilisée comme un « backup move ». La réponse attendue est un vecteur de probabilités pour les quatre directions possibles (haut, bas, gauche, droite). Pac‑Man sélectionne la direction avec la probabilité maximale, sauf si le délai est dépassé.
{
"maze": [...],
"pellets": [...],
"ghosts": [{"x":12,"y":5,"state":"chase"}],
"odds": true
}
// Réponse attendue du modèle
{
"up": 0.10,
"down": 0.05,
"left": 0.70,
"right": 0.15
}Méthodologie d’évaluation et métriques
Le classement repose sur la moyenne des scores obtenus sur les 100 parties, avec une marge d’erreur de 95 % (±2 écarts‑type). Deux modèles dont les intervalles se chevauchent sont considérés comme ex‑aequo. Le high score correspond au meilleur résultat d’une partie unique. Chaque partie est enregistrée intégralement ; le système de CI réexécute les parties soumises via pull‑request pour vérifier la reproductibilité du score.
Ouverture, reproductibilité et limites
Le projet est publié sous licence AGPL‑3.0 et accepte tout modèle accessible via un point d’accès HTTP, qu’il s’agisse d’un modèle hébergé, d’un fine‑tune ou d’une instance locale. Le dépôt GitHub fournit un exemple d’endpoint de 34 lignes pour démarrer rapidement. La procédure d’intégration se résume à trois étapes : (1) exposer le modèle, (2) lancer la commande de benchmark qui impose les règles de temps et de vie, (3) soumettre un pull‑request. Le benchmark est limité aux fantômes scriptés classiques et ne teste pas les comportements adaptatifs avancés, ce qui restreint la portée des conclusions à des scénarios de décision à information complète et temps réel.