Programme de vérification cyber (CVP)
Anthropic a annoncé le 7 octobre 2026 le déploiement du Cyber Verification Program (CVP), un dispositif à trois niveaux – Defense Access, Red Team Access et Specialized Access – qui autorise les équipes de sécurité certifiées à interroger les modèles Claude Opus 5.5, Claude Sonnet 5.5 et Claude Mythos 5.1 avec des garde‑fous réduits. Chaque niveau propose un jeu de restrictions : le niveau Defense bloque la plupart des requêtes potentiellement dangereuses, le niveau Red Team supprime ces blocages pour autoriser les tests d’intrusion, et le niveau Specialized retire quasiment toutes les protections pour un petit groupe d’organisations vérifiées.
Évaluation des garde‑fous sur Claude Opus 5.5
Selon le benchmark CyScenarioBench, les garde‑fous du niveau Defense ont bloqué 46 sur 50 tâches soumises à Claude Opus 5.5, alors que le même modèle en mode Red Team n’a bloqué aucune tâche et a complété 34 sur 50 requêtes, soit le même taux que lorsqu’aucune protection n’est appliquée. En l’absence de CVP, chaque tâche était immédiatement bloquée dès le premier prompt. Ces chiffres illustrent l’impact direct des filtres : ils limitent la capacité d’exploitation en mode défense mais permettent une liberté totale aux équipes de red‑team, ce qui expose le même modèle à un usage potentiellement offensif.
Quantité et gravité des vulnérabilités découvertes
Le projet Glasswing, initiative interne d’Anthropic, a recensé 129 000 vulnérabilités vérifiées entre avril et juillet 2026, auxquelles s’ajoutent 5 500 découvertes supplémentaires via le scanning open‑source d’avril à octobre 2026. Parmi ces 134 500 failles, plus de 33 000 sont classées critiques ou hautes. Anthropic estime que ce chiffre représente un sous‑compte, car il provient d’un échantillon limité de partenaires ; l’impact réel pourrait être cinq fois supérieur. Une analyse de VulnCheck a toutefois montré que seulement 2 sur 300 vulnérabilités (0,67 %) découvertes par Glasswing ont été exploitées en conditions réelles : CVE‑2026‑26980 (injection SQL dans Ghost CMS) et CVE‑2026‑61500 (forgery de session dans Rejetto HTTP File Server).
Limites et risques liés à l’utilisation de l’IA
Les données de Veracode indiquent que 44 % des tâches de génération de code par IA introduisent une vulnérabilité de sécurité, avec un taux de réussite de validation de 56 % – une évolution marginale par rapport à 55 % précédemment. Cette stagnation montre que l’augmentation du volume de code produit par IA ne se traduit pas automatiquement par une amélioration de la qualité sécuritaire. De plus, la capacité d’Anthropic à fournir des correctifs automatisés peut créer de nouvelles failles, comme le démontrent les incidents signalés par 1Password et Veracode. Ainsi, même si l’accès élargi aux modèles Claude renforce les capacités de détection et de réponse, il nécessite une supervision humaine stricte et des processus de validation rigoureux pour éviter que les outils d’IA ne deviennent eux‑mêmes des vecteurs de risque.