Contexte et chronologie

Jeudi matin, quatre fournisseurs de modèles d'IA basés sur le cloud ont connu des interruptions qui se sont chevauchées. Anthropic a signalé à 09:23 ET une partial outage affectant les modèles Claude Mythos 5.1, Claude Fable 5.1 et Claude Opus 5, avec un correctif déployé à 12:16 ET. Une seconde alerte a concerné Claude Sonnet 5 juste après midi. OpenAI a indiqué à 10:43 ET des erreurs élevées sur ChatGPT et Codex, résolues à 12:55 ET après une mitigation appliquée ~30 minutes plus tard. xAI a affiché un message d’erreur général pour Grok ; le suivi DownDetector montre un pic de 1 365 signalements à 09:45 ET, retombant à 273 plus tard. Les créneaux de panne se recoupent entre 10:43 ET et 12:16 ET, créant une période d’indisponibilité simultanée d’environ 1 h 30.

Analyse technique des pannes

Les rapports mentionnent tous des « elevated errors », typiquement associés à des dépassements de seuils de latence ou à des réponses d’erreur HTTP 5xx générées par les serveurs d’inférence. Anthropic a identifié la cause en 15 minutes, ce qui suggère un problème de configuration ou de dépendance interne (ex. : mise à jour de bibliothèque de sérialisation). OpenAI a appliqué une mitigation, probablement un basculement vers des instances de secours ou un redémarrage de pods Kubernetes, ce qui a permis de restaurer les performances en moins d’une heure. Le message de xAI indique une indisponibilité non spécifiée, mais le volume de signalements indique une perte de capacité de traitement au moins équivalente à plusieurs dizaines de milliers de requêtes par minute.

Le chevauchement des incidents implique que les fournisseurs utilisent des infrastructures partagées (ex. : fournisseurs de cloud public, réseaux de distribution). Une saturation commune du réseau ou une mise à jour simultanée d’un composant partagé (ex. : bibliothèque de chiffrement TLS) pourrait expliquer la coïncidence, même si aucune des entreprises n’a confirmé ce point.

Implications pour la fiabilité des services IA

Ces interruptions montrent que la disponibilité d’API d’IA dépend fortement de la robustesse des chaînes d’approvisionnement logicielles. Les temps de résolution (entre 1 h 15 et 2 h) restent supérieurs aux SLA habituels (souvent <1 h) et soulignent la nécessité de mécanismes de redondance multi‑cloud. Les modèles concernés (Claude 5.1, ChatGPT, Codex, Grok) sont largement intégrés dans des applications tierces ; une panne simultanée peut entraîner des effets en cascade sur des services dépendants, comme des chatbots ou des outils de génération de code.

Limites de l'information disponible

Les communiqués de presse ne détaillent pas les causes exactes (panne matérielle, bug logiciel, surcharge réseau). Sans accès aux logs d’infrastructure, l’analyse reste hypothétique. De plus, les données de DownDetector ne distinguent pas les requêtes légitimes des tests automatisés, ce qui rend difficile d’estimer l’impact réel en termes de trafic perdu.