Présentation de Pangram

Pangram est un service en ligne lancé en 2023 qui propose d'identifier automatiquement les textes générés par des modèles de langage tels que GPT‑4, Claude ou LLaMA. Le site se décrit comme le « gold standard » de la détection d’IA, une position renforcée par la visibilité médiatique et par le fait qu’il est intégré dans plusieurs plateformes de vérification de contenu. Aucun code source n’est publié, et les seules données chiffrées communiquées par l’entreprise sont un taux de précision déclaré de plus de 90 % sur un jeu de tests interne.

Architecture et méthode de détection

Selon la documentation technique fournie aux partenaires, Pangram combine trois axes : l’analyse de la perplexité du texte vis‑à‑vis de modèles de référence, la recherche de signatures de watermarking introduites par les fournisseurs d’IA, et un classifieur basé sur un réseau de neurones entraîné sur un corpus de 1,2 milliard de tokens étiquetés humains ou IA. La perplexité est calculée en temps réel grâce à une API REST qui interroge un modèle de taille 175 M paramètres, choisi pour son compromis entre vitesse et sensibilité aux anomalies de texte. Le module de watermarking exploite les bits de sortie que les modèles OpenAI insèrent depuis la version 2023‑09, tandis que le classifieur final utilise une couche dense de 256 neurones et une fonction d’activation ReLU, entraînée avec l’optimiseur Adam (learning rate = 1e‑4) pendant 12 époques.

pangram detect --input article.txt --output result.json

Évaluation des performances et limites

Les tests publiés par Pangram montrent un taux de vrais positifs de 92 % et un taux de faux positifs de 5 % sur le benchmark interne « Pangram‑Eval ». Cependant, le jeu de données n’est pas disponible, ce qui empêche une validation indépendante. Des chercheurs ont reproduit partiellement l’expérience en soumettant 500 extraits de texte générés par GPT‑4 et 500 extraits humains. Leur analyse révèle une chute de précision à 78 % lorsque le texte est paraphrasé ou traduit, indiquant une sensibilité élevée aux transformations lexicales. De plus, le système ne signale pas de degré de confiance, ce qui complique l’interprétation des scores dans des contextes juridiques.

Implications pour les utilisateurs

Pour les éditeurs et les plateformes de modération, Pangram offre une intégration simple via une API, mais la boîte noire du modèle impose une dépendance à un fournisseur unique. L’absence de transparence sur les critères de décision rend difficile la contestation des résultats, surtout lorsqu’un texte humain est classé à tort comme IA. En outre, les attaques adversariales – par exemple l’insertion de caractères invisibles ou la modification de la ponctuation – peuvent réduire la perplexité et masquer la signature de watermarking, contournant ainsi la détection. Les utilisateurs doivent donc considérer Pangram comme un indicateur probabiliste, à croiser avec d’autres outils et une analyse humaine.