Contexte et avancées de DeepSeek

Depuis le début de 2026, les laboratoires chinois publient ouvertement des techniques d’optimisation du KV cache utilisées dans les modèles de langage à contexte long. DeepSeek a d’abord introduit l’architecture MLA, qui compresse le cache d’environ 15 fois. Cette première étape a été suivie par les mécanismes Compressed Sparse Attention et Heavily Compressed Attention, qui visent à réduire le nombre d’opérations de lecture/écriture dans la mémoire GPU.

L’étape la plus récente, présentée dans la version DeepSeek‑V4.1‑Flash, combine plusieurs innovations : CSA2 (Compressed Sparse Attention version 2), la réutilisation du cache entre couches (cross‑layer cache reuse), une architecture causal encoder‑decoder et le stockage en FP4. Le résultat annoncé est un KV cache global de 890 octets par token, soit une réduction de 437 fois par rapport à la version DeepSeek‑V1.

Mécanismes de compression du KV cache

Le KV cache stocke les clés et valeurs générées à chaque token pour permettre l’attention sur l’ensemble du contexte. Dans les modèles classiques, chaque token occupe plusieurs kilooctets, ce qui impose des exigences de VRAM élevées pour les séquences longues (ex. : >8 k tokens). DeepSeek‑V4.1‑Flash réduit cette empreinte grâce à trois leviers :

  • CSA2 : élimine les entrées redondantes en ne conservant que les vecteurs réellement utilisés, ce qui diminue la densité du tableau de cache.
  • Cross‑layer cache reuse : partage les représentations entre couches successives, évitant la duplication des mêmes clés/valeurs.
  • FP4 caching : encode les valeurs en précision 4 bits, limitant la perte de précision grâce à une quantisation adaptée au profil d’erreur du modèle.

Ces techniques sont appliquées de façon séquentielle, chaque couche du modèle profitant du cache déjà compressé. Le facteur de compression de 437 fois provient d’une multiplication des gains individuels (≈15× pour MLA, puis ≈30× supplémentaires grâce à CSA2 et FP4).

Impacts sur les coûts d’inférence et adoption occidentale

Le coût principal d’une inference à contexte long réside dans la mémoire GPU nécessaire pour le KV cache. En passant de plusieurs mégaoctets à 890 octets par token, le nombre de tokens pouvant être traités simultanément augmente de façon quasi linéaire, réduisant le besoin en GPU haut de gamme et les dépenses d’énergie.

Les tarifs publiés pour le traitement de 1 million de tokens ont chuté de façon spectaculaire : les modèles occidentaux qui ont intégré ces optimisations, comme Claude Opus 5.5 (Anthropic) et GPT‑6.1 Sol (OpenAI), affichent respectivement une baisse de 60 % et 80 % du prix de lecture du cache par rapport à leurs versions précédentes. Cette réduction de prix indique que les deux acteurs ont adopté les techniques de DeepSeek, même si les annonces officielles restent discrètes.

En pratique, les laboratoires occidentaux bénéficient d’une marge d’inférence positive, ce qui pourrait inverser la tendance de pertes observées depuis l’introduction des GPU de dernière génération. Le partage gratuit du code par DeepSeek crée ainsi une dynamique où les améliorations de performance sont rapidement réappropriées, nivelant le terrain entre les acteurs chinois et occidentaux.