Contexte et objectifs

Le modèle de langage Qwen 3.8 27B, publié le 14 août 2026, occupe déjà une place de choix dans le segment des grands modèles dense. ByteShape a introduit, quatre jours plus tard, la version ShapeLearn‑Lite, une quantisation rapide réalisée avec un budget d’optimisation limité. L’objectif était de comparer cette approche légère avec une optimisation plus exhaustive, baptisée ShapeLearn, afin de mesurer l’impact sur la précision (accuracy) et le débit (tokens per second, TPS) sur plusieurs GPU.

Méthodologie d’optimisation ShapeLearn

ShapeLearn utilise un processus d’optimisation itératif incluant des vérifications de perte de précision, des calibrages de quantisation et des tests de stabilité. Deux variantes de décodage spéculatif sont proposées : MTP (Multimodal Token‑Parallel) et DFlash2. MTP conserve la capacité d’entrée d’image, tandis que DFlash2, plus rapide, ne supporte que le texte et nécessite 1,1 GB de modèle de brouillon supplémentaire. Les commandes d’inférence suivantes illustrent le lancement sous llama.cpp :

llama-server -hf byteshape/Qwen3.8-27B-GGUF:Qwen3.8-27B-IQ4_XS-3.84bpw \
    --mmproj-auto \
    --spec-type draft-mtp --spec-draft-n-max 3
llama-server -hf byteshape/Qwen3.8-27B-GGUF:Qwen3.8-27B-IQ4_XS-3.84bpw \
    -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \
    --spec-type draft-dflash --spec-draft-n-max 7 \
    --no-mmproj

DFlash2 requiert llama.cpp version b10658 ou supérieure.

Résultats de performance

Les benchmarks couvrent six GPU, du RTX 4090 (24 GB) au RTX Pro 6000 (96 GB). Sur le GPU‑5 (configuration par défaut), ShapeLearn atteint 99.63 % du score agrégé BF16 tout en délivrant 90.4 tok/s. Le même GPU‑4, avec 11,0 GB de VRAM, conserve 98.72 % du score BF16 et offre un débit légèrement supérieur grâce à une taille de modèle réduite (3.84 bpw contre 13.1 GB). Sur le RTX 5090, le débit grimpe à 93.7 tok/s avec la même proportion de précision. Les tableaux de résultats montrent que chaque modèle ShapeLearn (IQ2_XXS, IQ3_XXS, IQ3_XS, IQ3_S, IQ4_XS) se situe sur la « frontière » : aucun autre quant ‑ qu’il s’agisse d’Unsloth, ISTA‑DASLab ou AtomicChat ‑ n’est à la fois plus rapide et plus précis.

En comparaison, les versions Lite, bien que moins coûteuses à produire, conservent trois des six points de la frontière dans le test dynamique Lite‑vs‑Unsloth v3, prouvant la robustesse de l’optimisation rapide.

Analyse des limites et perspectives

La principale contrainte reste la bande passante mémoire : les modèles denses comme Qwen 3.8 27B sont limités par les transferts de données, ce qui rend le nombre de bits par poids (bpw) un facteur déterminant du TPS. Les gains de DFlash2 sont donc conditionnés à la disponibilité de VRAM suffisante (≥13 GB). De plus, le décodage MTP, bien que multimodal, introduit un léger surcoût de calcul qui peut devenir critique sur des GPU à faible capacité. Enfin, l’étude ne couvre pas les scénarios de charge mixte (texte + image) sur DFlash2, laissant une marge d’amélioration pour les futures versions.

En résumé, ShapeLearn démontre que l’optimisation approfondie d’un modèle dense peut repousser la frontière vitesse‑précision sans sacrifier la compatibilité multimodale, tout en offrant des options adaptatives (MTP vs DFlash2) selon les contraintes de mémoire.