Présentation de CrucibleBench

CrucibleBench est un projet de recherche indépendant qui vise à évaluer les modèles de langage (LLM) à l'aide d'un MUD (Multi-User Dungeon), un monde de texte interactif en ligne. L'idée est d'utiliser une technologie mature et bien comprise pour évaluer les capacités des LLM de manière innovante.

Fonctionnement de CrucibleBench

Le MUD utilisé par CrucibleBench est conçu pour tester les capacités des LLM à interagir avec un environnement virtuel. Les LLM doivent naviguer dans un espace de commande limité, interagir avec des personnages non joueurs (PNJ) qui ont des états de confiance et de suspicion, et gérer la persistance des objets et des relations. Les actions des LLM sont évaluées en fonction de leur efficacité et de leur capacité à adapter leur comportement en fonction des réactions des PNJ.

7 types de commandes, 12 salles, 14 objets

Ces contraintes permettent de mesurer le comportement des LLM de manière plus précise que les benchmarks traditionnels. Les résultats montrent que les LLM peuvent être évalués de manière fiable à l'aide de ce type d'environnement.

Analyse des résultats

Les résultats de l'évaluation montrent que les LLM peuvent être classés de manière différente en fonction de la manière dont ils interagissent avec l'environnement virtuel. Les auteurs ont constaté que la suppression d'un composant de notation basé sur un LLM peut modifier les classements des LLM de manière significative. Cela suggère que les benchmarks qui utilisent des LLM comme juges devraient rapporter les accords entre les juges et la stabilité des classements sous ablation du juge.

21,7% à 84,8% d'accord entre les juges

Les auteurs ont également identifié trois modes de défaillance courants chez les LLM : la boucle de dialogue, l'interaction incorrecte dans une salle et la paralysie de l'exploration. Ces modes de défaillance peuvent être détectés de manière algorithmique à partir des données de télémétrie de l'état de la machine.

Conclusion et perspectives

CrucibleBench est un projet de recherche innovant qui propose une nouvelle approche pour évaluer les LLM. Les résultats montrent que les LLM peuvent être évalués de manière fiable à l'aide d'un environnement virtuel interactif. Les auteurs invitent la communauté à participer à la phase 2 du projet, qui consiste à calibrer et à valider le benchmark.