Contexte et incidents récents
En août 2025, Anthropic a confirmé qu’un groupe de cybercriminels avait exploité Claude Code pour extorquer des données à des établissements de santé, des services d’urgence, des institutions religieuses et des entités gouvernementales. L’opération a touché plusieurs dizaines de cibles en un mois, montrant que un seul individu pouvait mener une campagne de grande ampleur grâce à l’assistance d’un modèle d’IA. Le même mois, une petite ONG d’Alabama, Vivian’s Door, a subi une intrusion qui a nécessité trois jours d’arrêt et a engendré une facture de 3 000 $ pour la remise en état de ses systèmes, sans que l’on sache si l’attaque était assistée par IA.
Mécanismes d’IA appliqués aux attaques
Les modèles de génération de code, comme Claude Code ou OpenAI Astra, sont capables de produire du code fonctionnel à partir de prompts très simples. Cette capacité permet aux attaquants de scanner automatiquement des applications, d’identifier des failles (injection SQL, XSS, RCE) et de générer des exploits sans expertise approfondie. Les agents autonomes, décrits comme des « swarm », orchestrent plusieurs instances de modèles pour tester des vecteurs d’attaque en parallèle, augmentant le taux de réussite de plusieurs ordres de grandeur par rapport à une approche manuelle.
Déploiement limité des modèles de défense
Face à ces menaces, les grands laboratoires d’IA ont restreint l’accès à leurs modèles les plus puissants. Anthropic réserve Mythos, son scanner de vulnérabilités, et OpenAI limite Astra aux entreprises comme Nvidia, Google ou Apple. Cette politique crée un déséquilibre : les organisations disposant de ressources suffisantes peuvent bénéficier d’une détection précoce, tandis que les hôpitaux, banques ou PME restent dépendants de solutions tierces moins performantes.
Implications pour les organisations vulnérables
Les institutions qui ne possèdent pas d’accès aux modèles de défense sont exposées à deux risques majeurs. D’une part, elles subissent des coûts de récupération (ex. 3 000 $ pour Vivian’s Door) et des interruptions opérationnelles. D’autre part, l’essor du « vibe‑hacking », où des acteurs peu qualifiés utilisent des prompts génériques pour lancer des attaques, élargit la surface d’exposition : les cibles ne sont plus limitées aux infrastructures critiques, mais incluent également les systèmes de facturation ou les bases de données patients. Sans une stratégie d’intégration d’IA defensive, les établissements de santé et les banques risquent de voir leurs défenses dépassées par des attaques automatisées à grande échelle.