Présentation

Google Kubernetes Engine (GKE) a annoncé l’intégration des instantanés de pods. Cette fonctionnalité capture l’état complet du processeur (CPU) et de la mémoire graphique (GPU) d’un conteneur en cours d’exécution, puis le restaure à la demande. L’objectif affiché est de réduire le temps de mise en service des modèles d’inférence, un goulot d’étranglement majeur pour les charges de travail d’IA à grande échelle.

Instantanés de pods GKE

Les tests internes montrent une réduction du temps de démarrage pouvant atteindre 89 %. Un modèle de 70 milliards de paramètres, qui nécessitait traditionnellement plusieurs minutes, est chargé en 37 secondes grâce à l’état sauvegardé. Codeway, un client de la plateforme, a exploité les instantanés pour ramener son temps de démarrage à huit secondes avec la fonctionnalité « Retake ». Le gain provient de l’élimination du rechargement complet de la mémoire GPU, qui représente la partie la plus coûteuse en latence.

Prompt caching amélioré pour GPT‑6

OpenAI a déployé un nouveau système de caching de prompts pour la famille GPT‑6. Le cache conserve les préfixes partagés pendant une fenêtre de 30 minutes, augmentant ainsi le taux de hit par défaut. Les développeurs bénéficient de remises allant jusqu’à 90 % sur les jetons d’entrée mis en cache, ce qui se traduit par une réduction substantielle des coûts d’inférence. Deux outils accompagnent le service : un tableau de bord de suivi des taux de hit et un diagnostic permettant d’identifier les « misses » inattendues. Les utilisateurs peuvent également pré‑chauffer le cache ou ajuster l’effort de raisonnement sans invalider les entrées déjà stockées.

Écosystème d’outils pour l’IA à grande échelle

Parallèlement, plusieurs acteurs renforcent l’infrastructure DevOps autour de l’IA. Cloudflare propose un Agent Development Stack Lifecycle qui remplace les pipelines traditionnels par des systèmes autonomes basés sur son produit Workflows et le module @cloudflare/ci. L’observabilité OpenTelemetry et un modèle d’accès aux agents à durée de vie limitée limitent les mouvements latéraux. Datadog a affiné le modèle Qwen3.5‑9B, atteignant 87 % du rappel du modèle enseignant tout en abaissant le coût d’inférence à 0,003 $ par investigation ; un GPU A100 de 40 GB peut ainsi traiter environ 100 000 investigations hebdomadaires. NVIDIA a publié la bibliothèque Model Optimizer, offrant quantisation, élagage et distillation compatibles avec Hugging Face, PyTorch et ONNX, et exportable vers TensorRT‑LLM ou vLLM via PyPI ou des images conteneurisées. Le SDK Harness‑sdk (Strands Agents) facilite la création d’agents IA en Python et TypeScript, incluant des paramètres de référence pour modèles et mémoire. Enfin, la spécification Docker Sandbox Kit v3 normalise l’encapsulation des autorisations d’un agent dans une image OCI, permettant l’analyse, la signature et la comparaison des changements d’autorité. Le GKE Inference Gateway multi‑cluster, testé sur 17 000 nœuds répartis sur trois régions, montre une mise à l’échelle quasi‑linéaire avec moins de 1 % de surcharge de routage et un taux de succès de 99,9 %. Ces avancées convergent vers une réduction des temps d’attente, une optimisation des coûts et une meilleure gouvernance des charges de travail IA.