Présentation du problème
Les modèles de langage (LLM) sont souvent sollicités pour générer un score de confiance pour leurs réponses. Cependant, cette approche est considérée comme inutile et sans validité scientifique. Les LLM ne peuvent pas évaluer de manière fiable leur propre confiance, car leur fonctionnement interne est complexe et difficile à interpréter.
Fonctionnement des LLM
Les LLM utilisent des mécanismes quasi-cognitifs pour générer des réponses, mais ces mécanismes ne sont pas suffisamment compris pour permettre une évaluation de la confiance. Les recherches sur l'interprétabilité des LLM ont montré que les modèles peuvent avoir une certaine conscience de leur propre état, mais cela est loin d'être suffisant pour évaluer la confiance.
Problèmes avec les scores de confiance
Les scores de confiance sont souvent présentés sous forme de nombre flottant entre 0 et 100, mais cela ne reflète pas la complexité du fonctionnement des LLM. Les scores de confiance peuvent être ambigus et ne reflètent pas nécessairement la confiance dans la correction de la réponse, la cohérence de la réponse ou la capacité du modèle à répondre à la demande de l'utilisateur.
Limites des LLM
Les LLM ne peuvent pas évaluer de manière fiable leur propre confiance, car leur fonctionnement interne est complexe et difficile à interpréter. Les recherches sur l'auto-correction des LLM ont montré que les modèles peuvent avoir du mal à corriger leurs propres erreurs sans feedback externe. Les scores de confiance ne sont pas une mesure fiable de la confiance, mais plutôt une « vibe » qui ne reflète pas la complexité du fonctionnement des LLM.