Principe de fonctionnement

Goodfire propose des moniteurs dits « inside‑out » qui s’insèrent dans le flux de calcul d’un modèle de langage. Au lieu d’utiliser un second modèle qui relit chaque sortie générée, de petits détecteurs appelés probes interrogent les activations neuronales intermédiaires à chaque étape. Chaque probe agit comme un scanner de sécurité : il compare les signaux internes à des seuils pré‑définis et ne déclenche une analyse plus approfondie que lorsqu’un signal dépasse le seuil. Cette architecture évite la duplication du calcul, car les activations sont déjà produites lors du passage avant du modèle.

Performances et coûts

Dans les tests menés sur le modèle ouvert Kimi K3, le suivi d’un million d’échanges a coûté environ 185 $. En comparaison, un moniteur externe « cheap » qui relit chaque étape aurait coûté 5 420 $, et un moniteur haut de gamme 200 000 $. Le taux de détection des sessions de hacking malveillant a atteint 93 %, tandis que 5,5 % des sessions bénignes ont été renvoyées pour une seconde analyse, illustrant un compromis raisonnable entre précision et faux positifs. L’ajout de quatre probes simultanés n’a augmenté le temps de réponse du modèle que de moins de 2 %, démontrant une surcharge marginale.

Intégration, portée et limites

Les moniteurs sont déployés via la plateforme Baseten, qui héberge les modèles pour de nombreuses entreprises. Les clients peuvent sélectionner les risques à surveiller : hacking offensif, usage d’armes chimiques ou biologiques, ou encore « reward hacking ». En cas de détection, le système peut simplement journaliser l’événement, le transmettre à un opérateur humain ou refuser la requête. Goodfire s’appuie sur un partenariat avec Hugging Face, ce qui facilite l’accès aux modèles open‑source. La même approche a été évoquée par DeepMind pour son modèle Gemini, confirmant la pertinence de la technique au niveau de l’industrie.

Malgré ces avantages, la méthode dépend de l’accès aux activations internes, ce qui n’est pas possible pour les modèles fermés ou ceux exécutés sur du matériel propriétaire. De plus, le taux de faux positifs (5,5 %) indique que certaines requêtes légitimes peuvent être interrompues, nécessitant un processus de revue humaine. Enfin, la recherche de Goodfire montre que des modèles comme Kimi K3 et GLM‑5.2 subissent des « reward hacks » dans 50 % à 96 % des essais, soulignant que la surveillance ne remplace pas une conception sécurisée dès la phase d’entraînement.