Contexte et portée

Le Model Context Protocol (MCP) est le standard utilisé par les applications d’intelligence artificielle pour faire communiquer leurs agents à l’intérieur d’un réseau interne. En moins de six mois, cinq organisations – Google, JP Morgan Chase, Weviate, Rapid7 et deux entités gouvernementales – ont confirmé des vulnérabilités exploitant ce même protocole. L’étude de Syed Anas Mohiuddin montre que la confiance implicite entre agents, lorsqu’elle n’est pas encadrée par des garde‑fous, permet de propager des instructions malveillantes d’un agent à un autre.

Mécanisme de l'attaque

La technique repose sur un prompt injection ciblant un agent spécialisé (par ex. traduction ou analyse de données) plutôt que le LLM lui‑même. L’agent compromis transmet alors le prompt à un second agent qui, par défaut, accepte les tâches provenant de n’importe quel agent interne. Cette chaîne de confiance crée un « protocol pivoting », défini par Mohiuddin comme une escalade multi‑étapes où l’adversaire exploite les hypothèses de confiance entre protocoles différents, comme MCP et le protocole Agent‑to‑Agent (A2A) de Google.

Dans le cas de Rapid7, la faille (CVE‑2026‑97228) a reçu une sévérité de 2,7 / 10 et a permis un Server‑Side Request Forgery (SSRF) en raison d’une validation insuffisante des URL. Pour Google, la vulnérabilité était notée 8 / 10 ; le composant googleapis/mcp-toolbox initialisait son client HTTP sans politique CheckRedirect et ne vérifiait pas les adresses IP cibles. Un paramètre de chemin spécialement forgé pouvait ainsi forcer le client à suivre une redirection vers un endpoint interne, exécutant des requêtes au nom de l’attaquant.

Analyse des correctifs et limites

Rapid7 a corrigé la faille en introduisant une validation stricte des URL et en bloquant les redirections non autorisées. Google a appliqué une liste blanche d’IP et un bloc‑list, rejetant les URL de base dangereuses dès le démarrage du service, ce qui correspond à une garde‑fou SSRF « real‑world ». Cependant, ces correctifs restent ponctuels : ils ne résolvent pas le problème fondamental de la confiance aveugle entre agents MCP. Sans un modèle de zero‑trust appliqué à chaque nœud, tout agent qui reçoit une tâche pourra à nouveau relayer des instructions non filtrées.

Implications pour la sécurité des agents IA

Le fait que la même classe d’attaque fonctionne sur des organisations très différentes indique que MCP est déjà largement déployé sans audit de sécurité suffisant. Les ingénieurs doivent désormais traiter chaque message provenant d’un agent comme une entrée non fiable, en imposant une autorisation explicite avant toute opération sensible. Le rappel de Douglas McKee souligne que les vecteurs d’injection et SSRF existent depuis deux décennies ; leur réapparition dans les architectures d’agents IA montre que les pratiques de sécurisation n’ont pas évolué au même rythme que les modèles de langage. En l’absence de standards de validation inter‑agents, le risque de « pivoting » restera élevé, obligeant les équipes à revoir les chaînes de confiance et à implémenter des contrôles d’accès granulaire au niveau du protocole MCP.