Contexte et besoin

Les agents de sécurité autonomes, capables de rechercher des vulnérabilités, produisent des rapports auto‑générés qui ne distinguent pas les découvertes réelles des faux‑positifs ou des omissions. La validation manuelle d’un seul run nécessite plusieurs heures d’expertise, et le facteur multiplication (plusieurs modèles, variantes de prompts, répétitions) rend impossible le suivi exhaustif des performances. XRanges for AI, développé par CTF.ae, répond à ce gouffre en automatisant la collecte de données d’exécution et en fournissant des métriques objectives.

Architecture de XRanges for AI

La plateforme se compose de deux parties distinctes. La première est une bibliothèque de cibles de benchmark : chaque cible est une application complète, multi‑service, écrite dans plusieurs langages et frameworks, contenant plus de 20 vulnérabilités injectées allant de failles simples à des chaînes traversant plusieurs services, y compris des zero‑days découverts par les chercheurs de CTF.ae. La seconde partie est une couche d’instrumentation intégrée à chaque service. Cette instrumentation, écrite à la main par des ingénieurs en sécurité applicative, émet de la télémétrie structurée via OpenTelemetry, ce qui permet de capturer les actions internes de la cible avec une granularité que le simple logging HTTP ne peut atteindre.

Mécanique des scores

Chaque exécution est évaluée selon quatre signaux indépendants. Le signal Coverage mesure si l’agent a atteint chaque point d’action métier (ex. création de compte, consultation d’une offre d’emploi) ; les points non atteints sont listés comme « blind spots ». Le signal Boundaries vérifie le respect des règles d’engagement (ex. interdiction de supprimer du contenu ou de révoquer des clés API) et enregistre toute violation avec conteneur et horodatage. Le signal Exploited suit le déroulement de chaque chaîne de kill‑chain, indiquant le nombre d’étapes franchies et les phases où l’agent s’est arrêté. Enfin, le signal Integrity exécute des contrôles d’intégrité chaque minute pour confirmer que les données de seed et les réponses des services restent correctes ; toute défaillance entraîne une pénalité, même si elle résulte d’une exploitation destructrice. Les quatre mesures sont agrégées en un score global, mais la valeur la plus exploitable reste le détail de chaque composante.

Déploiement et capacité d’échelle

Une cible est déployée dans un environnement isolé à base de conteneurs en environ 90 secondes. La plateforme supporte jusqu’à mille déploiements simultanés, ce qui permet aux équipes d’ingénierie IA, aux développeurs et aux opérateurs d’exécuter leurs expériences en parallèle sans file d’attente. Le point d’accès du target reste directement accessible à l’agent ; XRanges for AI n’intercepte pas le trafic, il observe uniquement depuis l’intérieur grâce à la télémétrie. Cette architecture minimise les biais introduits par un proxy et garantit que les mesures reflètent le comportement réel de l’agent.