Contexte et objectifs

Le modèle Qwen 3.8 27B en précision BF16 occupe 55 GB de VRAM, ce qui le rend inaccessible aux cartes grand public. L’étude vise à déterminer la quantité de mémoire GPU réellement nécessaire pour exécuter le modèle sans perte de qualité, en testant plusieurs niveaux de quantisation (8‑, 4‑, 2‑ et 1‑bit) sur des benchmarks reconnus : GPQA Diamond, IFBench et Terminal‑Bench 2.1.

Méthodologie et configuration

Les expériences ont été menées avec llama.cpp (build du 16 août 2026) sur des GPU NVIDIA L40S (48 GB), H100 (80 GB) et H200 (141 GB). Le cache KV a été fixé à F16, consommant 2,3 GB pour 32 k tokens, indépendamment du niveau de quantisation. Les quantisations proviennent d’Unsloth v2 (2‑, 4‑, 8‑bit) et d’Unsloth v3 (1‑bit). Le modèle 4‑bit Q4_K_M pèse 17 GB, ce qui le fait tenir sur une RTX 4090 de 24 GB tout en laissant ≈64 k tokens de contexte disponible.

Résultats des benchmarks

Sur Terminal‑Bench 2.1 (89 tâches, timeout 3 h, effort xhigh, contexte réservé 98 k tokens), le Q4_K_M reproduit exactement les scores du modèle BF16, confirmant l’absence de dégradation mesurable. La version 2‑bit UD‑Q2_K_XL (≈11 GB) montre une légère baisse de performance, mais reste comparable à des modèles de référence comme Opus 4.7 ou Gemini 3.1 Pro, tout en réduisant le contexte maximal à ≈4 k tokens. En revanche, la quantisation 1‑bit chute à un niveau proche du hasard sur GPQA Diamond, avec des scores inférieurs à la ligne de random guessing, et la performance se détériore davantage lorsque le nombre de tokens de raisonnement augmente (effort xhigh).

Analyse des limites et perspectives

Le comportement non linéaire observé – aucune perte jusqu’à 4 bits, légère chute à 2 bits, effondrement à 1 bit – s’explique par la perte d’information critique dans les poids et les activations du réseau, amplifiée par le cache KV qui reste en FP16. Les gains de mémoire (‑38 GB de BF16 à 17 GB en 4‑bits) permettent d’allouer davantage de contexte, facteur déterminant pour les tâches de programmation où ≈8 k tokens de raisonnement sont requis. Le coût financier de la campagne (≈ 3 000 $ sur Modal) souligne que les tests à grande échelle restent onéreux, même avec des services cloud optimisés. À l’avenir, il sera pertinent d’évaluer l’impact de la quantisation du cache KV et d’explorer des schémas hybrides (par exemple, 4‑bits pour les poids, 8‑bits pour le cache) afin de repousser la frontière entre compression et perte de qualité.