Contexte et enjeux de la bio‑sécurité

Les outils d’intelligence artificielle permettent aujourd’hui de concevoir des protéines aux fonctions variées, de la dégradation du plastique aux inhibiteurs de venins. Cette puissance créative s’accompagne d’un risque : les mêmes algorithmes peuvent générer des toxines ou modifier des protéines virales. Les méthodes classiques d’identification de séquences dangereuses ne détectent pas les protéines issues d’IA, car aucune caractéristique distinctive n’a été définie. Google DeepMind propose donc une solution de marquage (watermarking) afin de distinguer les protéines issues de sources fiables.

Mécanisme du filigrane SynthIDBio

Le filigrane repose sur la technologie SynthID, déjà utilisée pour marquer du texte ou des images générés par IA. Dans le cas des protéines, une variante appelée SynthIDBio intervient pendant la phase de conception de ProteinMPNN, l’outil de design le plus répandu, développé par le laboratoire de David Baker. ProteinMPNN fonctionne en deux étapes : il génère d’abord une configuration de squelette (backbone), puis il place les chaînes latérales (side chains) amino‑acides une à une, en respectant les contraintes de stabilité et de fonction.

SynthIDBio utilise une clé cryptographique et l’historique des acides déjà choisis pour proposer, à chaque position, un acide qui encode le filigrane. Si la proposition est compatible avec la stabilité du squelette, ProteinMPNN l’accepte ; sinon elle est rejetée. Ainsi, le filigrane n’est introduit que dans des sites où plusieurs acides chimiquement similaires (par ex. leucine, isoleucine, valine) sont interchangeables, garantissant que la fonction protéique n’est pas altérée.

Détection et robustesse du marquage

Le filigrane est distribué de façon aléatoire le long de la séquence, ce qui empêche une suppression simple par édition ponctuelle. Pour le détecter, il faut connaître la clé et analyser la fréquence d’apparition des acides préconisés par SynthIDBio sur l’ensemble de la protéine. Une différence statistiquement significative par rapport à la distribution attendue indique la présence du filigrane. Cette méthode résiste aux transformations classiques (extraction, synthèse) car le signal est intégré dans la séquence même, pas dans une métadonnée externe.

Évaluation fonctionnelle et limites

Les auteurs ont testé le système sur des protéines de taille typique (environ 500 résidus) et ont constaté que les séquences marquées conservaient leur activité enzymatique ou de liaison. Cependant, la capacité du filigrane à être inséré dépend de la tolérance locale aux substitutions ; dans les régions critiques où chaque acide est indispensable, le marquage est impossible. De plus, la méthode repose sur la disponibilité du modèle ProteinMPNN et sur la connaissance de la clé, ce qui limite son usage aux chercheurs autorisés. Enfin, aucune donnée publique n’est encore fournie sur le taux de faux positifs ou négatifs lors de la détection, ce qui laisse une marge d’incertitude quant à son déploiement à grande échelle.