Contexte et enjeux

Les agents à horizon long imposent des séquences de plusieurs centaines de milliers de tokens. Dans ce contexte, le KV‑Cache (clé‑valeur) devient le principal facteur de consommation de mémoire HBM et de bande passante d’interconnexion. Le rapport technique indique que le KV‑Cache occupe environ 890 octets par token, ce qui limite la scalabilité des services LLM. DeepSeek‑V4.1 Flash, modèle multimodal de 552 milliards de paramètres, vise à réduire ce facteur de 4 fois tout en conservant une capacité de contexte de 1 million de tokens.

Architecture Causal Encoder‑Decoder et CSA2

Le modèle adopte une architecture Causal Encoder‑Decoder (CED). Le décodeur récupère le KV‑Cache global en projetant les états cachés finaux de l’encodeur, ce qui limite le nombre de paramètres activés à 8 milliards par token pendant le pré‑remplissage (prefill) et à 16 milliards lors du décodage. Le réseau comporte 40 couches, mais seules les 20 premières sont sollicitées pendant le pré‑remplissage, réduisant ainsi la charge de calcul initiale. Le composant clé de la compression est CSA2, une évolution du Cross‑layer Sparse Attention qui partage les KV entre couches adjacentes.

Mécanismes de compression du KV‑Cache

CSA2 agit sur trois dimensions :

1. Dimension des têtes : une compression similaire à Group‑Query‑Attention (GQA) réduit le nombre de têtes effectives en partageant un vecteur latent de 512 dimensions entre clés et valeurs.

2. Dimension séquentielle : l’encodeur fusionne deux positions consécutives en une entrée de cache grâce à des poids appris par canal, ce qui diminue le nombre d’entrées de .

3. Dimension inter‑couches : le ré‑indexage croisé (Full / Reindex / Reuse) permet de réutiliser les KV d’une couche précédente après une légère perturbation de la requête, comme le décrit le principe mathématique du « query perturbation ».

En complément, le modèle utilise une précision FP4 pour le KV‑Cache, ce qui réduit la taille mémoire de chaque entrée de 75 % par rapport au FP16 standard. L’indexeur de l’attention parcimonieuse est optimisé par un Hierarchical Sparse Indexer (HSI), qui minimise le coût de recherche d’indices dans le cache compressé.

Implications sur le déploiement

Grâce à ces optimisations, le KV‑Cache en cours d’exécution occupe environ ¼ de l’espace requis par le modèle DeepSeek‑V4‑Flash précédent, et le stockage persistant (SSD/host‑memory) ne représente que 1/8 de l’ancien volume. Cette réduction se traduit par une moindre consommation de bande passante lors du transfert du cache entre le CPU et le GPU, ainsi que par une baisse du coût d’infrastructure pour les services d’inférence à long terme. Le débit atteint 420 tokens/s en décodage, ce qui montre que la compression n’entraîne pas de perte de performance notable. Cependant, la dépendance à la précision FP4 impose une attention particulière aux effets de quantisation sur la qualité des réponses, un point qui reste à évaluer de façon exhaustive sur des jeux de données variés.