Présentation du programme

Anthropic PBC a annoncé le 6 octobre 2026 la refonte de son Cyber Verification Program en trois niveaux d’accès distincts. Le dispositif, initialement limité par des classificateurs conservateurs intégrés aux modèles grand public, vise à libérer progressivement les capacités offensives tout en conservant un contrôle strict sur les usages à risque. Le nouveau cadre intègre Project Glasswing, qui depuis avril fournit à Claude Mythos un accès privilégié à des organisations de sécurité critiques, et étend ce privilège à 150 nouvelles entités en juin.

Architecture des trois niveaux

Le premier niveau, Defense Access, s’adresse aux équipes de réponse aux incidents, aux analystes de malware et aux chercheurs universitaires disposant d’un historique de vulnérabilités signalées. Les modèles Claude Opus 5.5, Claude Sonnet 5.5 et Claude Mythos 5.1 sont tous disponibles, mais les classificateurs bloquent en temps réel toute requête qui s’apparente à une mise en œuvre de ransomware ou à d’autres actions offensives. Le deuxième niveau, Red Team Access, autorise les tests d’intrusion et les exercices de red‑team sur des systèmes explicitement autorisés. À ce stade, les blocages sont fortement réduits, mais les chercheurs indépendants restent exclus. Le niveau supérieur, Specialized Access, ne comporte que peu de restrictions et ne s’adresse qu’aux organisations approuvées pour tester des infrastructures critiques telles que les réseaux électriques ou les télécoms. Ces entités sont évaluées conjointement avec le gouvernement américain et bénéficient d’une transition directe depuis Project Glasswing sans nouvelle approbation pour les modèles déjà déployés.

Évaluation technique et résultats du benchmark

Anthropic a validé les trois niveaux à l’aide du benchmark CyScenarioBench, qui comporte 10 scénarios d’opérations cyber offensives exécutés cinq fois chacun, soit 50 exécutions. En l’absence de programme, chaque tentative était bloquée dès le premier prompt. En Defense Access, 46 sur 50 runs ont été interrompus à un moment donné, confirmant l’efficacité des filtres conservateurs. En Red Team Access, aucun blocage n’a été enregistré et le modèle a achevé 34 exécutions, soit un taux de réussite de 68 %, comparable au taux de 67,6 % observé sans aucune protection. Ces chiffres démontrent que la libération progressive des capacités n’entraîne pas de perte de performance, tout en maintenant un contrôle ciblé aux niveaux inférieurs.

Impact opérationnel et limites

Depuis le lancement de Project Glasswing, les partenaires ont signalé 129 000 vulnérabilités vérifiées entre avril et juillet, auxquelles s’ajoutent 5 500 découvertes issues du scan de code open‑source d’Anthropic jusqu’en octobre, portant le total à plus de 134 500 failles. Plus de 33 000 de ces vulnérabilités sont classées critiques ou à haute sévérité. Ces données proviennent de 33 rapports partenaires ; Anthropic estime que l’impact réel pourrait être multiplié par cinq, bien que la société ne fournisse pas de méthodologie de calcul. Les organisations inscrites doivent accepter la rétention des données afin qu’Anthropic surveille les usages abusifs. Un mécanisme appelé Enterprise Frontier Safeguards, prévu pour la fin de l’année, permettra aux clients éligibles de stocker ces logs dans leur propre infrastructure cloud. Le programme est accessible via la Claude Platform, Google Vertex AI, Microsoft Foundry et, sur AWS Bedrock, uniquement pour les clients couverts par les safeguards. Malgré ces avancées, la dépendance à des évaluations gouvernementales pour le niveau Specialized Access et l’exclusion actuelle des chercheurs indépendants du tier Red Team constituent des contraintes notables pour la communauté de recherche en cybersécurité.