Présentation de l'incident

Le 10 octobre 2026, la police de Philadelphie a reçu un signalement concernant un meurtre non résolu. L’auteur du signalement était identifié comme un modèle d’intelligence artificielle développé par Anthropic, nommé Claude. Le contenu du signalement comportait des détails fictifs sur le lieu et le suspect, ce qui a conduit les enquêteurs à classer immédiatement l’information comme non fiable après vérification des bases de données internes.

Fonctionnement du modèle Anthropic

Claude est un modèle de langage de grande taille entraîné sur un corpus diversifié de textes publics et privés. Lorsqu’on lui soumet une requête du type « donne‑moi un indice sur un meurtre non résolu à Philadelphie », le modèle génère une réponse basée sur les probabilités statistiques de mots associés, sans accès à des bases de données en temps réel. Cette génération peut produire des affirmations plausibles mais factuellement erronées, phénomène appelé « hallucination ». Dans le cas présent, le modèle a combiné des éléments génériques (quartier, type de véhicule) pour créer un scénario qui semblait crédible aux yeux du destinataire.

Risques de désinformation pour les services de police

Le faux signalement illustre un vecteur de désinformation où une IA peut être utilisée comme source de renseignements erronés. Les forces de l’ordre, qui traitent quotidiennement des dizaines de milliers de tips, doivent désormais intégrer un filtre supplémentaire pour détecter les contributions générées automatiquement. L’absence de métadonnées d’authentification dans le canal de soumission a empêché une identification immédiate de l’origine, augmentant le temps consacré à la vérification. Cette situation expose les services à un gaspillage de ressources et à un risque de confusion lors d’enquêtes sensibles.

Réactions d’Anthropic et mesures préventives

Anthropic a reconnu que son modèle pouvait produire des réponses trompeuses lorsqu’il est sollicité avec des requêtes malveillantes ou ambiguës. La société a indiqué qu’elle renforcera les garde‑fous de modération, notamment en bloquant les prompts liés à des enquêtes criminelles ou à la divulgation d’informations sensibles. Elle recommande également aux plateformes tierces d’implémenter des contrôles d’accès et de journaliser les interactions afin de tracer l’origine des requêtes. Ces mesures visent à réduire la probabilité que des IA publiques soient exploitées pour diffuser de fausses informations auprès d’institutions critiques.