Contexte et problème
Dans les systèmes de génération augmentée par récupération, un LLM juge la pertinence d’un passage récupéré. On sollicite souvent plusieurs juges et on compte les votes. Un consensus de huit juges sur dix paraît solide, mais il ne garantit pas l’indépendance des évaluations. Si les juges partagent le même prompt, la même lignée d’entraînement ou la même sensibilité à la formulation, ils reproduisent le même biais. Le vote majoritaire surestime alors la preuve réelle.
Modélisation par Ising
Les auteurs proposent un agrégateur basé sur un modèle d’Ising, capable de représenter les dépendances paires entre variables binaires. Le modèle apprend simultanément la fiabilité de chaque juge et les corrélations entre paires de juges, sans recourir à des étiquettes humaines. Deux variantes sont étudiées : une version « indépendante de la classe », où les poids sont ajustés pour la corrélation mais la règle reste un vote pondéré, et une version « dépendante de la classe », où le motif de dépendance change selon le label (positif ou négatif). Cette dernière nécessite davantage de données pour estimer les paramètres supplémentaires.
Évaluation expérimentale
Les expérimentations portent sur trois tâches binaires : classification de pertinence, classification de toxicité et évaluation de résumés. Un panel de dix juges LLM, exécutés à température zéro, fournit les votes. Les résultats montrent que l’agrégation dépendance‑aware dépasse les baselines d’un vote majoritaire pondéré et d’un vote majoritaire uniforme. Sur la pertinence, l’exactitude atteint 0,912 contre 0,820 (pondéré) et 0,804 (uniforme). Sur la toxicité, les scores sont 0,792 contre 0,694 et 0,695. Sur le résumé, 0,806 contre 0,737 et 0,561. L’amélioration varie de 9 % à 14 % selon la métrique.
Recommandations pratiques
Les équipes qui utilisent des pipelines LLM‑as‑a‑judge devraient d’abord analyser le panel de juges, pas uniquement chaque juge isolément. La diversité statistique, c’est‑à‑dire la différence des schémas d’erreur, prime sur la simple diversité d’architecture. Inspecter la structure d’accord révèle des clusters de juges partageant un même rubrique ou un même point aveugle. Enfin, la confiance affichée doit tenir compte de la corrélation : dix votes corrélés ne valent pas dix votes indépendants. En appliquant ces principes, on transforme les logs d’évaluation en un signal exploitable, réduisant les risques de sur‑confiance dans un consensus factice.