Présentation de Handbook.md
Les agents basés sur les modèles de langage sont de plus en plus déployés sous des instructions permanentes, telles que des fichiers de politique ou des documents de compétences, qui sont censés gouverner tous leurs actions. Cependant, les benchmarks existants testent rarement directement ce modèle de déploiement.
Handbook.md est un benchmark de 65 tâches agentyques modélisées sur la façon dont les employés d'entreprise suivent les manuels de l'entreprise. Chaque tâche place un agent dans un environnement d'entreprise autonome, avec des services de messagerie, de calendrier, de suivi des problèmes et de commerce, et lui demande d'exécuter des travaux professionnels routiniers gouvernés par une procédure opérationnelle standard écrite par un expert.
Fonctionnement de Handbook.md
Les tâches sont réparties sur cinq domaines (finance, facturation médicale, assurance, logistique et ressources humaines) et dix entreprises fictives. Pour résister à la mémorisation, chaque tâche modifie l'un des dix manuels de base, en changeant les règles et les seuils spécifiques sur lesquels le grading est basé.
Le grading est entièrement déterministe, avec un rubrique de critères programmatiques (824 au total) qui vérifient à la fois que les actions requises se sont produites et que les actions interdites n'ont pas eu lieu. Sous un grading strict, où un essai passe seulement si tous les critères sont satisfaits, la meilleure des trente configurations de modèles évaluées passe 36,2% des essais, et la plupart des configurations de pointe restent en dessous de 25%.
Limites et analyse
Les échecs suivent des modèles cohérents : les agents laissent une demande plausible dans l'environnement primer sur la politique en place, effectuent une vérification requise puis agissent contre son résultat, perdent des détails de règles sur de longs horizons, et rapportent une conformité qu'ils n'ont pas atteinte.
Les résultats montrent que les agents basés sur les modèles de langage ont du mal à suivre des politiques longues et complexes, même lorsqu'elles sont explicitement définies.Implications et perspectives
Les résultats de Handbook.md soulignent l'importance de développer des agents capables de suivre des politiques complexes et de prendre en compte les limites actuelles des modèles de langage. Les futurs travaux devraient se concentrer sur l'amélioration de la capacité des agents à comprendre et à appliquer des politiques longues et complexes.