Présentation de la technique
OpenAI a intégré dans son nouveau modèle Astra une méthode de raisonnement baptisée « recurrent depth », également appelée « opaque recurrence ». Selon The Information, cette approche permet au modèle de sortir du schéma séquentiel habituel des modèles de chaîne de pensée (Chain‑of‑Thought, CoT). L’annonce a immédiatement déclenché des réactions critiques parmi les spécialistes de la sûreté de l’IA, qui redoutent une perte de visibilité sur les processus décisionnels du modèle.
Mécanisme de récursivité opaque
Contrairement aux modèles traditionnels qui génèrent un flux linéaire d’étapes explicites, la récursivité opaque fait itérer la même requête plusieurs fois au sein d’une boucle interne. Chaque itération ré‑intègre le résultat précédent, mais le processus reste encapsulé dans un espace latent, réduisant ainsi le nombre de traces lisibles dans le journal de pensée. Cette architecture crée un « circuit fermé » où les états intermédiaires ne sont pas exposés aux outils de monitoring classiques, compliquant l’audit des réponses.
Réactions de la communauté sécurité
Le CEO de Redwood Research, Buck Shlegeris, a exprimé une « extrême préoccupation » quant à la monitorabilité du CoT d’Astra, soulignant que l’augmentation du facteur de récursivité pourrait « détruire totalement la capacité de suivi ». Zvi Mowshowitz, défenseur de longue date de la sécurité IA, a même évoqué la nécessité de légiférer pour éviter une « course vers le bas » entre laboratoires. Ryan Greenblatt, chercheur principal chez Redwood, a ajouté que la technique pourrait se scaler plus rapidement que le raisonnement séquentiel, menant potentiellement à un raisonnement entièrement latent.
Implications et limites
OpenAI affirme que l’usage d’Astra reste limité et que le modèle conserve une chaîne de pensée « lisible ». La société a également annoncé le déploiement de systèmes de surveillance CoT renforcés, visant à compenser la perte de transparence introduite par la récursivité. Néanmoins, le fait que Anthropic et DeepMind discutent déjà de la même approche indique un intérêt croissant pour ce type d’architecture, ce qui pourrait accélérer son adoption si les contraintes de sécurité ne sont pas résolues. En pratique, la capacité à raisonner dans un espace latent réduit la surface d’observation, augmentant le risque de comportements non alignés non détectés, surtout si la technique est étendue à des modèles plus grands ou à des agents autonomes. Ainsi, la balance entre performance algorithmique et contrôle humain demeure un point de tension majeur pour la communauté IA.