Présentation

Une équipe de chercheurs de Carnegie Mellon, MIT, NYU et Stanford a développé une intelligence artificielle nommée Ataraxos. Lors d’une série de 20 parties en ligne, le programme a battu Pim Niemeijer, considéré comme le meilleur joueur de Stratego, avec un score de quinze victoires, une défaite et quatre égalités. Le défi était de taille : Stratego est un jeu d’information imparfaite où chaque joueur possède 40 pièces dont l’identité reste cachée jusqu’à la rencontre sur le plateau.

Architecture et apprentissage

Ataraxos repose sur deux réseaux de neurones. Le premier apprend une politique de jeu en s’entraînant par auto‑jeu pendant 163 millions de parties. Le second, appelé belief model, prédit la disposition probable des pièces adverses à partir des mouvements observés. Cette prédiction permet de réduire l’explosion combinatoire : alors que le nombre de configurations possibles dépasse un décillion, le modèle ne considère que des arrangements plausibles, ce qui rend le calcul de scénarios futurs tractable.

Le processus d’ajustement du réseau a été modulé dans le temps. Au début de l’entraînement, les mises à jour étaient importantes pour explorer rapidement l’espace de stratégies ; à mesure que le modèle convergait, les ajustements sont devenus plus fins afin d’éviter les oscillations typiques des algorithmes d’auto‑jeu sur des jeux à information cachée.

Contrairement à DeepNash, qui ne disposait pas de phase de recherche avant chaque coup, Ataraxos intègre une recherche de type Monte‑Carlo Tree Search (MCTS) alimentée par les hypothèses du belief model. Chaque coup est évalué sur plusieurs configurations échantillonnées, puis le mouvement offrant le meilleur résultat moyen est sélectionné.

Performances et implications

Le coût matériel de l’entraînement a été limité à 16 GPU et à quelques milliers de dollars, bien en dessous des dépenses de plusieurs millions de dollars nécessaires à DeepNash (qui a utilisé 1 024 puces spécialisées pendant deux à trois mois). Cette différence de budget montre que, grâce à la combinaison d’un belief model et d’une stratégie d’ajustement progressive, il est possible d’atteindre un niveau de jeu supérieur sans infrastructure massive.

Sur le plan tactique, Ataraxos a introduit des comportements de bluff que les humains peinent à reproduire. Par exemple, il place souvent son drapeau derrière deux bombes dans un coin, une configuration rarement observée chez les joueurs humains. Cette approche a modifié le « metagame » des compétitions récentes, les participants adaptant leurs stratégies pour contrer les placements inattendus de l’IA.

Les limites restent liées à la nature probabiliste du belief model : si le modèle estime incorrectement la disposition des pièces, les décisions subséquentes peuvent être sous‑optimales. De plus, la longueur moyenne d’une partie (jusqu’à 2 000 coups) impose une charge de calcul importante pour chaque recherche, même avec l’échantillonnage.