Contexte et métriques

Les évaluations classiques des agents LLM utilisent la mesure Mean@k, qui calcule la moyenne du taux de réussite sur k exécutions. Sur le benchmark AppWorld, un agent ReAct basé sur GPT‑4.1 affiche un Mean@5 de 77,4 %. Cette valeur masque toutefois la proportion de tâches où l’agent réussit systématiquement les k essais. Le même agent obtient un Pass^5 de 53,0 %, soit un écart de cohérence de 24,4 points de pourcentage. Sur les tâches les plus difficiles, cet écart atteint 30 %.

Analyse du problème de cohérence

Chaque décision d’un agent LLM résulte d’une distribution de probabilité sur les tokens suivants. Lorsque la distribution est « sharp », la masse se concentre sur un token dominant et les variations de calcul (flottants, batching) n’inversent pas le choix. En revanche, une distribution « flat » répartit la probabilité sur plusieurs tokens proches, rendant le résultat sensible à de légères perturbations. Une chaîne de dizaines de décisions flat augmente la probabilité qu’au moins une étape bascule, expliquant l’écart observé entre Mean@k et Pass^k. Le problème persiste même avec un décodage greedy et une température 0, car les variations de probabilité surviennent au niveau du modèle hébergé.

Diagnostic avec le Consistency Analyzer

L’outil Consistency Analyzer introduit par ALTK‑Evolve exploite un seul trajet enregistré. Il re‑échantillonne chaque point de décision en appelant le modèle k fois (par défaut k=5) et mesure la dispersion des sorties. Cette procédure nécessite une requête supplémentaire par décision, sans besoin de vérité terrain. Les points où la variance dépasse un seuil sont identifiés comme « flip‑prone », c’est‑à‑dire susceptibles de changer de décision entre deux exécutions identiques.

Amélioration via les consignes de cohérence

Les diagnostics sont transformés en consistency guidelines, qui sont injectées lors de l’inférence grâce au pipeline ALTK‑Evolve. L’application de ces consignes réduit l’écart de cohérence de 24,4 pp à 12,0 pp, soit une diminution de moitié. Le gain se décompose en +16,0 pp pour les tâches identiques (same‑task Pass^5) et +13,0 pp pour les tâches similaires, tout en maintenant le Mean@5 à 77,4 %. Aucun compromis sur la précision moyenne n’est observé, ce qui confirme que la cohérence peut être renforcée indépendamment de la capacité brute du modèle.