Contexte et limites du format actuel
Les modèles de grande taille (LLM) ternaires codent chaque poids avec l’un des trois symboles {-1,0,+1}. Sur le plan information‑theorique, la capacité minimale est log₂3 ≈ 1,585 bits par poids. En pratique, les implémentations courantes regroupent cinq poids ternaires dans un octet (« five‑trit packing »), ce qui porte le coût effectif à 1,625 bits par poids. Cette approche suppose une distribution uniforme des symboles, alors que les modèles réels ne respectent pas cette hypothèse.
Une mesure effectuée sur 29 modèles ternaires révèle que le symbole zéro représente jusqu’à 51,5 % des poids. Cette forte asymétrie crée un espace de compression inutilisé dans le format à cinq trits, limitant les gains de performance et d’économie de mémoire.
Architecture adaptative BITCOS
Le papier propose BITCOS, un agencement qui exploite la densité de zéros (z) en séparant deux structures : un bitmap dense indiquant la présence d’un poids non nul et un vecteur compact de signes pour les poids actifs. Le coût théorique du schéma s’exprime par la formule :
bits_per_weight = 2 - zero_densityConcrètement, pour un modèle où z = 0,515, le stockage requis tombe à 1,485 bits par poids, soit une réduction de 0,14 bits par rapport au format standard. BITCOS dépasse le packing à cinq trits dans 26 des 29 modèles testés, confirmant la pertinence de l’adaptation à la distribution réelle.
Performances et implications
Les auteurs ont implémenté des séquences de décompression optimisées pour les jeux d’instructions AVX‑512, AVX2 et les GPU Intel Xe2. Sur des noyaux de multiplication matrice‑vecteur ternaires, la mise en œuvre de BITCOS génère un gain de jusqu’à 1,28× à la densité de zéro observée. En conditions d’inférence complète, les débits de décodage s’améliorent de 1,18× sur des CPU (clients et serveurs) et de 1,27× sur des GPU (intégrés et discrets).
Ces améliorations s’obtiennent sans modification de l’architecture du modèle ni perte de précision, car le schéma ne touche que la représentation physique des poids. Le principal compromis réside dans la nécessité d’un décodage supplémentaire, mais les implémentations vectorisées limitent l’impact sur la latence. BITCOS ouvre ainsi la voie à des déploiements plus économes en mémoire pour les LLM ternaires, notamment sur des appareils aux ressources limitées où chaque bit compte.