Contexte réglementaire et déploiement
Le règlement européen sur l’IA (article 50(2) du AI Act) impose aux fournisseurs de systèmes générant du texte synthétique d’apposer une marque lisible par machine. En réponse, Anthropic a annoncé que les prochains modèles Claude incorporeront un watermark invisible basé sur SynthID-Text de Google DeepMind. Le watermark est appliqué au niveau du modèle et se retrouve dans toutes les réponses délivrées via l’API Claude, y compris lorsqu’elles sont utilisées comme composant de raisonnement d’un agent autonome.
Mécanisme du watermark SynthID-Text
SynthID-Text utilise un tournament sampling : chaque token est comparé à plusieurs candidats dans une série de « layers », le gagnant étant choisi selon un score qui intègre un bruit aléatoire issu d’une clé secrète. La configuration non‑distortionnaire préserve, en moyenne, la distribution originale des logits, mais chaque clé fixe modifie la sélection de tokens à l’échelle d’une génération individuelle. Dans l’étude, le processeur SynthIDTextWatermarkLogitsProcessor de HuggingFace a été employé avec 30 layers, une longueur n‑gram de 5, une table de sampling de 2^16 et un historique de contexte de 1 024 tokens.
Effet mesuré sur le refus et l’appel d’outils
Deux expériences ont été menées en design apparié. L’appel d’outils a été évalué sur le benchmark BFCL v4 (AST à tour unique) tandis que le comportement de refus a été testé sur 200 requêtes dangereuses de HarmBench et 100 requêtes bénignes de JailbreakBench, avec et sans injection de prompt. Chaque item a été généré avec et sans watermark à température identique, même graine et même lot. Les résultats montrent un « sampling drift » : le même token, biaisé par le watermark, conduit parfois à un refus différent ou à un appel d’outil avec des arguments modifiés. L’effet dépend du modèle (Claude 2 vs Claude 3) et de la clé utilisée, et peut s’annuler dans les scores agrégés lorsque les dérives s’opposent.
Implications pour la sécurité des agents IA
Le drift observé signifie que la protection de provenance introduit une surface d’attaque supplémentaire. Un refus affaibli sous watermark devient critique lorsqu’un agent peut exécuter des actions via des outils, car une mauvaise sélection de token peut modifier la fonction appelée ou ses paramètres. Bien que Dathathri et al. n’aient détecté aucune dégradation de qualité sur près de vingt millions de réponses Gemini, la sensibilité aux clés et aux configurations montre que la robustesse du watermark doit être évaluée au niveau de l’application, pas seulement du texte. Les développeurs sont donc incités à tester leurs agents avec plusieurs clés, à surveiller les divergences entre exécutions watermarked et non‑watermarked, et à envisager des mécanismes de validation des arguments générés indépendamment du modèle.