Présentation d'Inferra

Lightbits Labs commercialise Inferra, un moteur logiciel destiné à optimiser l’inférence des grands modèles de langage (LLM). Le produit, disponible en général depuis mars 2026, déplace les données du cache clé‑valeur (KV) hors de la mémoire à bande passante élevée (HBM) du GPU vers la DRAM et le stockage NVMe, tout en conservant un accès « just‑in‑time » grâce à une prélecture prédictive.

Architecture du cache KV

Inferra orchestre trois niveaux de mémoire : la HBM du GPU, la RAM dynamique et les disques NVMe. Un algorithme de préfetching anticipe les blocs de KV dont le GPU aura besoin, les charge depuis le stockage NVMe vers la DRAM puis les pousse dans la HBM avant la demande effective. Cette chaîne de déplacement repose sur des signaux collectés à chaque couche de la pile d’inférence, permettant d’atteindre des taux de hit de 99,9 % dans les scénarios testés. Le moteur intègre également des contrôles de qualité de service, le chiffrement des blocs et l’isolation entre locataires, ainsi que la migration de cache lors du basculement d’une session vers un autre cluster GPU.

Performances annoncées et analyse

Selon les benchmarks internes de Lightbits, Inferra réduit le « time‑to‑first‑token » de plus de 100 fois pour des charges de travail à contexte long, supporte des fenêtres de contexte supérieures à 10 millions de tokens sur du matériel standard, et augmente la densité de sessions concurrentes de plus de 16 fois. Ces gains proviennent de la capacité à conserver des caches KV plus volumineux sans saturer la HBM, évitant ainsi les recomputations coûteuses et les accès à la mémoire lente qui immobilisent les unités de calcul. En pratique, chaque token supplémentaire dans le contexte ne nécessite plus de rechargement complet du modèle, mais seulement le transfert ciblé du bloc requis.

Limites et perspectives

Le désagrégement du cache introduit une latence supplémentaire liée au réseau et au stockage. Lightbits mise sur la prédiction à long terme pour compenser ce délai ; toutefois, la précision de la prévision dépend de la bande passante du réseau et des temps d’accès NVMe, ce qui peut réduire l’efficacité en environnements à latence élevée. De plus, les chiffres avancés n’ont pas été vérifiés par des tiers, et les gains sont moins pertinents pour les organisations disposant de clusters GPU privés surdimensionnés où la mémoire HBM suffit déjà à contenir les contextes. Enfin, la complexité de la gestion multi‑niveau de mémoire impose une charge de configuration supplémentaire pour les fournisseurs de néocloud, qui devront assurer la cohérence des politiques de chiffrement et d’isolation entre locataires.