Contexte et contraintes de mémoire
Les agents IA exécutent des sessions longues, parfois jusqu’à un demi‑million de tokens. Selon Alon Horev, CTO de Vast, une telle session occupe entre un dixième et un vingtième de la mémoire d’un GPU. Cette consommation provient du cache clé‑valeur (KV) qui stocke le contexte de l’inférence. Lorsque le GPU est saturé, l’agent doit recalculer le même contexte, ce qui augmente la latence et le coût énergétique. Le problème s’amplifie lorsqu’on déploie des milliers d’agents dans l’entreprise, chaque instance devant conserver son historique.
Architecture à niveaux de stockage
Vast propose une hiérarchie à trois niveaux. Le premier niveau reste la mémoire du GPU, où le cache KV est le plus rapide. Le second niveau migre les données vers la mémoire centrale du CPU sur la même machine, offrant plusieurs gigaoctets supplémentaires. Le troisième niveau utilise un média persistant capable de stocker plusieurs pétaoctets de KV cache. Cette couche de stockage persistant permet de conserver le contexte au-delà de la durée de vie d’une session GPU, tout en libérant de l’espace pour de nouvelles requêtes.
Orchestration et déplacement des caches
Le déplacement du cache est géré par le logiciel Dynamo de Nvidia. Dynamo déplace dynamiquement une session d’un GPU occupé vers un GPU moins chargé, ou bien transfère le KV cache via le réseau vers le stockage Vast. Cette orchestration transforme l’inférence en problème distribué : chaque nœud peut exploiter la mémoire GPU, la RAM du CPU et le stockage persistant d’un parc de machines. Le résultat est une meilleure utilisation des ressources et une réduction des recalculs, car le contexte peut être relu depuis le disque sans recomposer le modèle.
Implications pour la gouvernance et la confidentialité
Les entreprises doivent enregistrer les conversations des agents pour des raisons de conformité. Le stockage persistant de Vast conserve ces logs pendant des périodes définies, ce qui en fait à la fois un actif de performance et de gouvernance. En parallèle, Vast a lancé un service de calcul confidentiel, destiné aux charges de travail sensibles. Le cache KV, qualifié d’« or », peut être réutilisé pour le fine‑tuning ou la création de modèles spécialisés, à condition que les données restent protégées par le chiffrement du service confidentiel.