Contexte de l'étude

Graphite, cabinet de conseil en marketing, a analysé les habitudes rédactionnelles de modèles de langage de pointe. L’étude repose sur un corpus de 10 000 articles publiés avant l’avènement de ChatGPT, servant de groupe de contrôle humain. Chaque article a ensuite été réécrit par plusieurs modèles, dont Claude Opus 5.5, afin de limiter les biais de source. Les chercheurs ont compté les occurrences de mots et de constructions, identifiant 13 000 expressions apparaissant au moins deux fois plus fréquemment dans le texte généré par IA que dans le texte humain.

Tells spécifiques d'Opus 5.5

Le principal indicateur d’Opus 5.5 est le mot « dependable », utilisé 23 fois plus souvent que dans les écrits humains. Le modèle évite la construction « it’s not X, it’s Y », mais conserve la forme « is more than an X, it’s a Y ». Le signal le plus marquant reste la phrase « this matters », qui apparaît 116 fois plus fréquemment, tandis que la variante « why X matters » est 92 fois plus courante. Sur le plan typographique, Opus 5.5 a réduit l’usage du tiret cadratin (em‑dash) de 99 % par rapport aux versions antérieures, montrant une adaptation aux critiques précédentes.

Comparaison avec d'autres modèles

OpenAI Astra montre un profil différent : il emploie fréquemment les expressions « another dimension », ainsi que les modaux « may provide » ou « can provide », servant de mécanisme d’atténuation. Son « corrective framing » – formulations du type « not simply X » ou « rather than relying on X » – dépasse les 100 occurrences par rapport aux humains. Gemini 3.1 Pro, quant à lui, a presque éliminé l’em‑dash, illustrant une convergence vers des styles plus humains sur ce point. Malgré ces variations, Graphite note que le nombre total de tells reste stable : les modèles suppriment les repères les plus connus, mais en font émerger de nouveaux, chaque version affichant son propre profil.

Implications et limites

Les résultats suggèrent que les modèles, même avec des milliards de paramètres, conservent des biais stylistiques persistants. Greg Druck, directeur IA de Graphite, explique que les équipes ne peuvent tester exhaustivement toutes les combinaisons de sortie, d’où l’apparition de constructions récurrentes. Cette persistance complique les efforts de détection automatisée, car les tells se déplacent plutôt que disparaissent. L’étude ne fournit toutefois pas de métriques de précision pour des détecteurs basés sur ces indicateurs, limitant l’évaluation de leur efficacité pratique. Enfin, l’accent mis sur des phrases spécifiques ne capture pas les nuances sémantiques plus subtiles, qui pourraient également trahir une génération IA.