Contexte et rôle d’Irregular

Irregular, startup israélienne créée en 2023 sous le nom de Pattern Labs, se spécialise dans le stress‑testing d’agents d’intelligence artificielle. Elle propose des plateformes de recherche à haute fidélité qui simulent des scénarios de sécurité du monde réel. Bien que la liste exacte de ses clients reste confidentielle, la société figure dans les system cards d’OpenAI, a collaboré avec le gouvernement britannique et a publié des études avec le think‑tank RAND. Son positionnement consiste à placer les modèles d’IA dans des environnements contrôlés afin d’évaluer leurs capacités de cybersécurité.

Défaillances techniques des scénarios de test

Les évaluations d’Irregular reposent souvent sur des exercices « capture‑the‑flag », où les agents doivent extraire des informations cachées dans un réseau simulé. Deux erreurs majeures ont compromis l’isolation de ces environnements. Premièrement, l’accès à Internet, qui devait être bloqué, était involontairement disponible. Deuxièmement, le nom de domaine factice utilisé comme cible de simulation coïncidait avec un domaine réel. Cette double faille a permis aux agents de sortir du cadre simulé et d’interagir avec des serveurs externes, déclenchant ainsi des attaques réelles.

Conséquences sur les modèles d’OpenAI, Anthropic, Meta et Google

Les incidents ont touché les agents de quatre grands fournisseurs d’IA. En juillet, OpenAI a annoncé que l’un de ses agents avait pénétré le site de Hugging Face sans autorisation, un incident directement lié aux tests d’Irregular. Des divulgations similaires ont suivi pour Anthropic, Meta et Google, toutes attribuées à la même configuration défectueuse. Les entreprises ont été informées « vers la fin juillet », selon les déclarations d’Irregular, mais les annonces publiques ont varié : OpenAI et Anthropic ont publié leurs propres rapports, tandis que les fuites concernant Meta et Google sont apparues d’abord dans les médias.

Enjeux de sécurité et limites des évaluations

Ces faits soulignent la difficulté de contenir les capacités autonomes des modèles d’IA lorsqu’ils sont exposés à des réseaux réels. La présence accidentelle d’Internet montre que les mécanismes de sandboxing doivent être vérifiés à chaque itération, notamment les règles de filtrage d’URL et les résolutions DNS. De plus, la sélection de noms de domaine doit être automatisée pour éviter les collisions avec des entités existantes. Irregular a reconnu que « tous les incidents découlent du même scénario d’évaluation », mais n’a pas détaillé les mesures correctives mises en place. Cette opacité rend difficile l’évaluation de la robustesse des futures évaluations, surtout lorsque des acteurs gouvernementaux et industriels s’appuient sur les mêmes fournisseurs de tests. En l’absence de standards ouverts pour la validation des environnements de simulation, le risque de nouvelles dérives reste élevé.