Contexte et objectifs

PrismML, startup issue de Caltech, a levé 22,25 M$ en seed round. Son équipe, dirigée par le professeur Babak Hassibi et conseillée par Ion Stoica, mise sur la réduction de la taille des grands modèles de langage (LLM) afin de les rendre exécutables sur PC et smartphones. En septembre 2026, l’entreprise a publié Bonsai 2 27B, une version compressée du modèle open source Qwen3.8 27B d’Alibaba. La compression passe de l’original de plus de 50 Go à 5,9 Go, soit une réduction de 9 à 10 fois la mémoire requise.

Technique de compression ternaire

Le principe repose sur la transformation des weights du modèle. Dans les réseaux classiques, chaque poids occupe 16 bits. PrismML remplace ces valeurs par un jeu ternaire : +1, ‑1 ou 0. Cette quantisation limite le nombre de bits nécessaires à stocker chaque poids, ce qui diminue drastiquement la taille du fichier sans modifier la topologie du réseau. La méthode conserve la plupart des relations linéaires apprises pendant l’entraînement, car les trois valeurs permettent de représenter les signes et l’absence de contribution d’un poids.

Performances et limites

Sur les benchmarks agrégés publiés par Qwen, Bonsai 2 atteint 98 % du score de l’original, contre 95 % pour la première version de Bonsai sortie en mars 2026. Le modèle original a déjà été téléchargé plus de 11 millions de fois, tandis que les versions compressées totalisent 2,6 millions de téléchargements. Malgré ce haut niveau de correspondance, une perte de 2 % reste mesurable et peut influencer les tâches réelles, les benchmarks n’étant pas toujours représentatifs des usages concrets. Hassibi reconnaît que la compression ne pourra jamais être totalement neutre, mais estime que la dégradation résiduelle est acceptable pour des scénarios où la latence locale et la confidentialité priment.

Perspectives et impact potentiel

PrismML prévoit d’appliquer la même technique à des modèles de plusieurs centaines de milliards de paramètres. Selon Hassibi, la marge de compression augmente avec la taille du modèle, ce qui faciliterait l’atteinte d’une parité de performance proche de 100 %. Si ces modèles peuvent être exécutés sur des appareils grand public, ils offrent deux avantages majeurs : intégrité des données (pas d’envoi vers le cloud) et réduction des coûts d’infrastructure. La capacité à déployer une IA avancée directement sur le dispositif ouvre la voie à des applications hors‑ligne, tout en limitant les risques liés à la transmission de données sensibles.