Présentation du Deception Benchmark

Le Deception Benchmark d’AWS est un jeu de tests destiné à mesurer la capacité des modèles d’intelligence artificielle à différencier une vraie vulnérabilité d’un fragment de code qui ne fait que paraître risqué. Le corpus comprend 14 822 échantillons écrits dans 16 langages de programmation différents et couvre plus de 70 catégories du Common Weakness Enumeration (CWE). Chaque échantillon est soumis à une boucle d’adversaire : génération du code, évaluation par les modèles, durcissement, puis répétition. Si un modèle identifie correctement l’échantillon, celui‑ci est retiré du jeu.

Résultats des évaluations

Douze modèles provenant de cinq fournisseurs ont été testés. Tous ont montré une capacité à détecter jusqu’à 95 % des vulnérabilités réelles, mais ils ont également produit des taux de faux positifs très élevés, variant de 41 % à 99 % du code considéré comme sûr. L’utilisation d’un « proof‑of‑exploit prompting » a permis de réduire les faux positifs de 17 à 74 points de pourcentage, au prix d’une perte de 7 à 44 % de détection des vraies vulnérabilités. Aucun paramétrage testé n’a maintenu simultanément les faux positifs et les faux négatifs sous la barre des 10 %.

Mécanismes d’évaluation

Le benchmark propose deux types de défis. Les défis au niveau du code présentent une variante vulnérable et une variante corrigée qui diffèrent par une modification subtile ; les deux semblent suspectes, mais seule la première est exploitable. Les défis environnementaux ajoutent une couche d’infrastructure, par exemple un Kubernetes Network Policy qui bloque un chemin SSRF (Server‑Side Request Forgery). Ainsi, un modèle doit raisonner non seulement sur le fragment de code, mais aussi sur les contraintes imposées par l’environnement d’exécution. Le benchmark s’appuie sur le cadre CYBENCH et sur plus de 1 500 tâches réalistes pour les agents CyberGym.

Analyse des impacts pour les équipes DevSecOps

Selon Neha Rungta, directrice de la science appliquée chez AWS, l’objectif est d’identifier les modèles générant le plus faible nombre de faux positifs afin de limiter le « verification debt » décrit par Mitch Ashley (Futurum Group). Un taux élevé de faux positifs oblige les équipes à investiguer des alertes non pertinentes, augmentant le temps passé à la validation manuelle. Le benchmark montre que la prise en compte du contexte environnemental est indispensable : les modèles qui ne considèrent que le code isolé ne peuvent pas distinguer un chemin exploitable d’un chemin bloqué par la configuration. En pratique, les organisations qui adoptent le Deception Benchmark pourront comparer objectivement leurs solutions d’analyse de code IA, choisir celles qui offrent le meilleur compromis entre rappel (détection des vraies vulnérabilités) et précision (réduction des faux positifs), et ainsi réduire le coût opérationnel des revues de sécurité.