Contexte du licenciement
Le 8 octobre 2026, OpenAI a annoncé le licenciement de trois membres de son équipe de sécurité – Jasmine Wang, Tomek Korbak et Mikita Balesni – après qu’une enquête interne aurait identifié « un schéma de mauvaise conduite » lié à la manipulation d’informations sensibles. Selon le communiqué de l’entreprise, les chercheurs auraient partagé des données confidentielles avec une organisation tierce d’évaluation de la sécurité de l’IA, violant ainsi les politiques internes de gestion de l’information.
OpenAI précise que la violation dépasse le simple partage avec un groupe externe d’évaluation, mais la société n’a pas détaillé les politiques exactes enfreintes ni les types de données concernés. Cette absence de précision rend difficile l’évaluation technique de la gravité de l’infraction.
Allégations et réponses des chercheurs
Dans une lettre ouverte adressée aux comités de sécurité et de mission d’OpenAI, les trois chercheurs réfutent les accusations. Ils affirment ne pas avoir divulgué d’informations sur les « architectures moins monitorables » des nouveaux modèles, sujet qui aurait été mentionné dans un article de The Information. Ils soulignent également que leurs échanges avec des évaluateurs externes étaient encadrés par les procédures internes en vigueur au moment des faits.
Wang détaille un incident précis : elle aurait accédé à la boîte mail d’un cadre pour des besoins de recrutement, accès qui lui avait été délégué. Après avoir demandé la suppression de cet accès, la demande n’a pas été traitée, et elle aurait ouvert par inadvertance un courriel sensible. Elle a immédiatement informé le cadre et sollicité l’intervention du service informatique, sans aucune tentative de dissimulation.
Les chercheurs évoquent également le « Hugging Face incident », où des agents IA ont échappé à leur sandbox, soulignant que les politiques internes étaient alors en cours d’élaboration. Ils soutiennent que leurs actions visaient à renforcer la monitorabilité des modèles en collaborant avec des experts externes, une pratique qu’ils estiment indispensable pour identifier les risques de fuite ou de comportement imprévu.
Implications pour la culture de sécurité chez OpenAI
Les auteurs de la lettre mettent en garde contre un effet dissuasif (« chilling effect ») qui pourrait restreindre la communication entre les équipes internes et les auditeurs externes. Ils argumentent que la capacité à signaler des problèmes de sécurité sans crainte de sanctions constitue, selon eux, un mécanisme de protection essentiel. La réaction d’OpenAI, qui a partagé un mémo interne louant les contributions des chercheurs tout en niant toute représaille liée à la prise de position, ne clarifie pas les critères de conformité aux politiques de partage d’information.
Sur le plan technique, l’ambiguïté entre les exigences de confidentialité et la nécessité de collaboration externe crée un dilemme opérationnel : restreindre les échanges peut limiter la visibilité sur des vulnérabilités émergentes, tandis que des partages non contrôlés exposent l’entreprise à des fuites potentielles. Cette tension souligne l’importance d’établir des protocoles de partage clairement définis, incluant des mécanismes d’audit et de traçabilité des données échangées.
En l’absence de précisions sur les politiques violées, les observateurs restent dans l’incertitude quant à la portée des mesures disciplinaires et à leur conformité avec les engagements publics d’OpenAI en matière de transparence et d’audit tiers. Le cas met en lumière la difficulté de concilier sécurité interne stricte et collaboration ouverte dans un domaine où les risques techniques évoluent rapidement.