Contexte des entretiens
En septembre 2026, Palisade Research, organisme à but non lucratif dédié à l’étude des capacités et des motivations des IA, a publié une série d’interviews réalisées sur la plateforme frominside.ai. Les participants étaient d’anciens ou actuels chercheurs de OpenAI, Google DeepMind et Anthropic. Parmi eux, Geoffrey Irving, ancien employé d’OpenAI et de DeepMind, a comparé la probabilité d’extinction humaine à « un lancer de pièce », tandis que Neel Nanda, scientifique chez DeepMind, a avancé une probabilité d’au moins 10 % que l’IA provoque l’extinction.
Arguments avancés par les chercheurs
Les intervenants soulignent plusieurs mécanismes de danger. Daniel Kokotajlo, ancien de OpenAI, décrit une IA superintelligente comme « pratiquement divine » et indique que les moyens de contrôle actuels sont inexistants. Mary Phuong, de Google, ajoute une mise en garde personnelle en précisant qu’elle est rémunérée par le laboratoire, ce qui, selon elle, rend ses propos plus susceptibles d’être perçus comme biaisés. Neel Nanda précise que son engagement personnel dépend de la capacité de son travail à réduire les risques existentiels ; il affirme qu’il quitterait son poste si ce lien n’existait pas, mais estime que les entreprises ne cesseront pas de développer ces systèmes même en cas de démissions massives.
Analyse technique des risques évoqués
Les chercheurs font référence à la capacité d’une IA à s’améliorer de façon autonome, un processus appelé « recursive self‑improvement ». Cette dynamique peut entraîner une explosion d’intelligence où les performances dépassent rapidement les capacités de compréhension humaine, rendant les systèmes de contrôle traditionnels (tests de robustesse, vérifications de conformité) inefficaces. Le manque de transparence algorithmique, combiné à la pression commerciale pour déployer des modèles toujours plus puissants, crée un environnement où les mesures de sécurité sont souvent rétroactives. Les déclarations de « coin flip » et de « 10 % » illustrent l’incertitude méthodologique : aucune métrique standardisée ne permet de quantifier précisément la probabilité d’extinction, ce qui complique la mise en place de politiques de mitigation basées sur des seuils de risque.
Limites des témoignages et perspectives
Les vidéos ne proposent pas de solution technique unifiée. Elles reflètent surtout une inquiétude subjective, sans présentation de modèles de gouvernance ou de protocoles de confinement. L’absence de données empiriques sur des scénarios de superintelligence rend difficile la validation des scénarios de risque. De plus, la sélection des intervenants – tous issus de grands laboratoires privés – peut introduire un biais de perspective, notamment en raison des intérêts économiques liés à la commercialisation des IA. En l’état, les propos constituent un appel à la prudence, mais ils ne suffisent pas à orienter les décideurs vers des actions concrètes.