Contexte et objectifs

Microsoft et Hugging Face ont publié ThinkingBox, un benchmark qui ne mesure plus la qualité d’une réponse textuelle mais la fiabilité des effets secondaires d’un agent IA. L’objectif est de détecter les écarts entre les appels d’outils déclarés et les modifications réelles dans la base de données, car un agent peut annoncer une résolution tout en laissant un ticket dans un état incorrect.

Méthodologie du benchmark

Chaque scénario reproduit un flux métier complet (ex. suivi de livraison, remboursement) dans un environnement isolé appelé MCP. L’agent interagit avec des services via Typesense, les serveurs MCP et un serveur OpenEnv. Après chaque exécution, un grader compare l’état final de la base à la cible attendue. Le processus est automatisé : 507 tâches, chacune exécutée 20 fois à partir d’un état initial identique, générant 10 140 exécutions. Le code de test fourni, par exemple

sandbox_external_retail_group1.py:test_case_ST003_006
, illustre la vérification d’un champ de statut de ticket.

Les métriques publiées sont :

pass@1 : proportion de tentatives réussies au premier essai.
pass@20 : proportion de tâches résolues au moins une fois sur 20 essais.
observed 20/20 : nombre de tâches qui ont réussi les 20 essais consécutifs.

Résultats et analyse

Sur 121 680 essais valides couvrant 12 modèles LLM, 79 853 ont échoué aux vérifications exécutables. Parmi ces échecs, 67,24 % se sont terminés sans erreur apparente, avec un appel d’outil qui a modifié l’état. Les contrôles ont néanmoins détecté :

• Valeurs de champ incorrectes dans 77,61 % des cas.
• Effets secondaires non prévus dans 43,30 %.
• Effets requis manquants dans 25,36 %.

Ces chiffres montrent que la plupart des agents semblent fonctionner correctement du point de vue du dialogue, mais la majorité introduit des incohérences de persistance.

En termes de performances, le modèle propriétaire Claude Opus 5.5 obtient le meilleur pass@1 global à 67,16 %, légèrement supérieur à Claude Opus 5 (66,50 %). Parmi les modèles ouverts, Kimi‑K3 se démarque avec 57,37 %, proche du GPT‑6 Astra (58,31 %). La variation entre domaines est notable : le même modèle atteint 80,97 % en retail mais seulement 8,30 % en assurance automobile, illustrant la sensibilité aux spécificités de chaque flux métier.

Implications et limites

ThinkingBox révèle que la répétabilité est un critère essentiel : un modèle qui réussit une fois ne garantit pas la même fiabilité sur les exécutions suivantes. Les métriques pass@20 et observed 20/20 offrent une vision plus réaliste de la robustesse opérationnelle. Cependant, le benchmark reste limité aux scénarios implémentés dans l’environnement MCP et ne couvre pas les interactions multi‑agents ou les effets hors base de données (ex. appels réseau). Les auteurs invitent la communauté à étendre les tests à d’autres outils et à publier leurs propres traces pour enrichir la base de référence.