Présentation
LiquidAI a publié le modèle expérimental LFM2.5‑VL‑DSpark, un drafter spéculatif pour le VLM LFM2.5‑VL‑3B. Le drafter ajoute 280 M de paramètres, soit 8,9 % du modèle de base, et promet des décodages jusqu’à 3,13× plus rapides sur appareil et 2,66× sur un GPU H100, avec des gains end‑to‑end de 2,62× et 2,27× respectivement.
Architecture et entraînement
Le drafter reprend l’architecture texte LFM2.5‑DSpark : il capture les états cachés du modèle cible à un ensemble fixe de couches « tapped » puis génère un bloc de k tokens candidats. Image patches et tokens texte sont projetés dans une représentation partagée avant ces couches, ce qui garantit que les vecteurs d’état caché conservent la même dimension quelle que soit la modalité. Le composant compte 193,0 M de paramètres de décodage, 21,0 M pour la projection d’états, 65,5 M pour la tête Markov et 6,4 k pour les normes et la tête de confiance, totalisant 279,5 M.
L’entraînement suit la recette DSpark avec un mélange de données SFT vision‑langage, pondéré vers les charges prévues. Après 10 époques, des ablations sur 3, 4 et 5 couches ont conduit à un drafter simplifié à 4 couches d’attention uniquement, avec une taille de bloc de 9. Les auteurs recommandent une taille de bloc de 8 ou 9 selon le matériel.
Performances d’inférence
Sur un Mac M5 Max (MLX), le décodage gagne entre 2,30× et 3,13× selon la tâche, et la latence globale s’améliore de 1,56× à 2,62×. Avec llama.cpp sur un M3 Ultra, le décodage progresse de 1,57× à 2,14×, l’end‑to‑end de 1,30× à 1,77×. Sur un GPU Nvidia H100, le même drafter atteint 2,66× de décodage plus rapide, avec des gains end‑to‑end de 1,64× à 2,27×. Toutes les configurations utilisent un bloc DSpark de 8 et sont évaluées sur six tâches du benchmark MMSpec (VQA général, VQA texte, légendes d’images, VQA de graphiques, raisonnement complexe, conversation multi‑tour).
Limites et perspectives
Le décodage spéculatif n’accélère que la phase de génération ; l’encodage visuel et le pré‑remplissage (prefill) restent inchangés. Sur les appareils en bordure, le préfill représente une part importante du temps total, car le coût du pré‑remplissage croît (sub)quadratiquement avec la longueur du prompt et l’image doit d’abord traverser un encodeur vision. Ainsi, même un décodage 3× plus rapide se traduit parfois par un gain end‑to‑end modeste, conformément à la loi d’Amdahl.
Utilisation
python -m sglang.launch_server \
--model-path LiquidAI/LFM2.5-VL-3B \
--speculative-algorithm DSPARK \
--speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
--speculative-draft-attention-backend flashinfer \
--speculative-dspark-block-size 9 \
--disable-radix-cache