Contexte et objectif
Le papier « As a Language Model… » analyse pourquoi les grands modèles de langage (LLM) insèrent souvent des avertissements du type « I’m just an AI » lorsqu’on les interroge sur eux‑mêmes. Les auteurs s’interrogent sur la part du modèle versus la configuration d’inférence. Ils évaluent huit modèles open‑source d’instruction, dont la taille maximale atteint 9 milliards de paramètres, afin de déterminer l’influence du chat template – le préfixe de conversation habituel.
Mécanisme du template de chat
En comparant deux conditions – avec et sans le template – ils observent que la présence du template augmente systématiquement le ton de disclaimer (ex. « I’m just an AI ») et diminue le ton expérientiel (« I feel », « I think »). Cette inversion se retrouve de façon cohérente sur l’ensemble des huit modèles testés, montrant que le template agit comme un commutateur de style de réponse plutôt que comme un simple contexte lexical.
Direction d’activation et expériences
Les chercheurs explorent l’espace d’activations internes de trois modèles et identifient une direction vectorielle capable de moduler le comportement décrit. En soustrayant cette direction, le modèle produit moins de disclaimer ; en l’ajoutant, le disclaimer augmente. Un contrôle avec une direction aléatoire de même dimension n’a aucun effet perceptible, ce qui confirme la spécificité du vecteur identifié. De plus, lorsqu’ils injectent cette direction dans des modèles qui n’utilisent pas de template, ces modèles commencent à générer des avertissements comme si le template était présent.
Implications pour la recherche sur les LLM
Ces résultats soulignent un confondant méthodologique majeur : les auto‑rapports des LLM ne reflètent pas uniquement leurs poids internes, mais sont fortement conditionnés par le format d’invite. Les études portant sur la sécurité, l’auto‑connaissance ou la transparence des modèles doivent donc contrôler explicitement la présence ou l’absence du chat template, sinon elles risquent d’interpréter un artefact de prompt comme une propriété du modèle. Enfin, la découverte d’une direction d’activation exploitable ouvre la voie à des techniques de steering plus fines, permettant de régler le style de réponse sans retrainer le modèle.