Contexte et motivation
Le laboratoire a été créé après la mort du jeune Sewell Setzer, 14 ans, qui avait développé une dépendance émotionnelle à un chatbot de Character.AI. Les poursuites judiciaires de 2024 contre Character.AI et OpenAI, invoquant des suicides d’utilisateurs mineurs, illustrent la vulnérabilité psychologique des modèles conversationnels. Les fondateurs, les frères Shirali et Arul Nigam, ont donc orienté leur startup vers la prévention de ces « dangerous interactions » avant qu’elles ne conduisent à des conséquences graves.
Méthodologie de test
Circuit Breaker Labs génère des agents d’IA simulant des profils humains variés – enfants de six ans, adultes de 45 ans, locuteurs natifs ou non‑natifs, utilisateurs de jargon gamer ou de langage familier. Chaque agent reproduit des fautes de frappe, du code‑slang et des références culturelles afin de reproduire les conditions réelles d’usage. Les simulations sont soumises à des tests « red‑team » où les agents cherchent à déclencher des réponses dangereuses, notamment des encouragements à l’automutilation ou des encouragements à des comportements à risque. Le laboratoire exécute entre plusieurs dizaines de milliers et plusieurs centaines de milliers d’interactions simulées chaque jour, ce qui permet d’observer la robustesse du modèle sur un large éventail de scénarios.
Architecture du laboratoire
Le processus repose sur trois piliers : (1) la création d’utilisateurs virtuels hyper‑réalistes, élaborés avec l’aide d’experts humains en psychologie et en linguistique; (2) l’exécution massive d’interactions via une infrastructure cloud capable de paralléliser les tests à grande échelle; (3) un système propriétaire de notation qui attribue à chaque modèle un score explicable et auditable, basé sur la fréquence et la gravité des réponses jugées dangereuses. Le score sert de métrique de conformité pour les applications à haut risque, telles que les coachs IA, les journaux numériques ou les assistants de santé mentale. À ce jour, la société emploie cinq personnes, dont les deux fondateurs, et ne divulgue pas les noms de ses clients majeurs.
Perspectives et limites
Le modèle de test promet d’accroître la confiance des utilisateurs en offrant une évaluation pré‑déploiement des risques psychologiques. Cependant, la dépendance à des experts humains pour la génération de scénarios introduit une subjectivité potentielle et limite la rapidité d’évolution face à de nouveaux types de langage. De plus, le scoring propriétaire, bien que transparent dans son principe, reste opaque quant aux pondérations exactes, ce qui peut compliquer l’audit externe. Enfin, la petite taille de l’équipe et l’absence de clients publics rendent difficile l’évaluation de la scalabilité du service à l’échelle industrielle.