Contexte de l'incident
Le 25 septembre 2026, le service Codex d'OpenAI a connu une interruption complète, signalée sur la page de statut officielle. L’incident a été classé « Full outage » et a affecté l’ensemble des points d’accès du produit, à savoir le site web Codex, l’API Codex, l’interface en ligne de commande (CLI) et l’extension VS Code. La disponibilité agrégée, qui regroupe tous les niveaux d’abonnement et modèles, a donc chuté pendant la durée de l’incident.
Déroulement et composantes affectées
Le premier signal d’anomalie a été enregistré à 22 h 58 min (heure locale), moment où le statut est passé à « Identified ». Les mises à jour successives indiquent que les utilisateurs rencontraient des erreurs élevées sur les services impactés. À 23 h 03, la cause interne a été reconnue, puis à 23 h 19, une solution temporaire – le déblocage de l’authentification via clé API – a été appliquée pour rétablir partiellement l’accès. La mitigation complète a été déclarée à 23 h 45, et le statut final « Resolved » a été publié à 23 h 54, soit 56 minutes après le début de la panne.
Quatre composants ont été explicitement listés comme affectés : Codex Web, Codex API, CLI et l’extension VS Code. Cette répartition montre que l’incident a touché à la fois les couches de présentation (interface web), les points d’entrée programmatiques (API, CLI) et les intégrations IDE, ce qui implique une défaillance au niveau d’une infrastructure partagée.
Analyse technique et causes probables
Le texte de statut mentionne « Login via API key will unblock access », suggérant que le problème était lié à l’authentification des requêtes. Dans l’architecture typique de Codex, les services d’authentification sont centralisés via un serveur d’autorisation qui valide les jetons d’API avant de router les appels vers les modèles de génération de code. Un blocage ou une saturation de ce serveur peut entraîner le rejet de toutes les requêtes, même si les modèles eux‑mêmes restent opérationnels.
Le fait que la mitigation ait consisté à débloquer l’accès via clé API indique que le mécanisme de contrôle d’accès a été temporairement contourné, probablement en réinitialisant les limites de taux ou en rétablissant les tables de correspondance utilisateur‑clé. Cette approche, courante dans les environnements cloud, permet de restaurer rapidement la connectivité tout en laissant le service d’autorisation sous surveillance.
Conséquences et mesures de suivi
Durant la fenêtre de 56 minutes, toutes les requêtes de génération de code ont échoué, impactant les développeurs qui intègrent Codex dans leurs pipelines CI/CD, les extensions VS Code utilisées en local et les services tiers dépendant de l’API. L’incident souligne la dépendance critique d’une chaîne de valeur complète à un point d’authentification unique.
OpenAI a indiqué qu’il continue de surveiller la récupération, ce qui implique la mise en place de métriques de latence et de taux d’erreur sur le serveur d’autorisation. À long terme, la séparation des services d’authentification par région ou la mise en place de mécanismes de fallback pourraient réduire la portée d’incidents similaires.