Contexte et objectifs

PrismML a présenté le modèle Bonsai 2 27B, deuxième génération d’une IA multimodale conçue pour fonctionner sur des ordinateurs personnels et certains appareils mobiles haut de gamme. Le modèle s’appuie sur l’architecture Qwen3.8 27B, dont la version non compressée occupe environ 56 Go en 16 bits. L’enjeu principal était de réduire drastiquement cette empreinte mémoire tout en conservant la plupart des capacités du modèle d’origine.

Méthode de compression ternary

PrismML a appliqué une technique dite « ternary », qui remplace chaque poids de 16 bits par un triplet de valeurs possibles : +1, 0 ou –1. Cette représentation à trois bits diminue la taille du modèle à environ 5,9 Go, soit une réduction de plus de 90 % par rapport à la version complète. Malgré cette compression, le modèle conserve 98,2 % des performances évaluées sur les mêmes jeux de tests que Qwen3.8. La méthode diffère des quantisations classiques qui, en réduisant la précision, entraînent souvent une perte notable d’exactitude ou de connaissances.

Performances et efficacité énergétique

Sur les benchmarks, Bonsai 2 se rapproche de Qwen3.8 : les scores d’agentic et d’appel d’outils sont respectivement de 77,6 et 79,8, à moins de trois points d’écart. En programmation, les agrégats de HumanEval+, LiveCodeBench v6, MBPP+ et BigCodeBench donnent 81,6 contre 82,2 pour le modèle de référence. Pour la connaissance et le raisonnement, les suites MMLU‑Redux, GPQA Diamond et AA‑LCR affichent 82,7 contre 81,3. En termes de vitesse, le modèle tourne sur une carte Nvidia GeForce GTX 5090 à 143 tokens/s sans aucune quantisation, et atteint 46,8 tokens/s sur le processeur Apple M5 Max. La consommation énergétique s’élève à 0,714 MWh par token, ce qui représente une amélioration de 40 % d’efficacité par rapport à d’autres modèles de 8 B exécutés en pleine précision.

Implications et limites

Le fait de pouvoir exécuter un modèle de 27 B paramètres sur du matériel grand public ouvre la voie à des applications locales, réduisant la dépendance aux services cloud et limitant les risques liés à la transmission de données sensibles. La disponibilité des poids sous licence Apache 2.0 facilite l’adoption par la communauté. Cependant, la réduction de taille repose sur une architecture ternary qui, bien que performante sur les tests publiés, n’est pas encore largement étudiée dans des scénarios de charge continue ou de tâches très spécialisées. De plus, les mesures de consommation énergétique sont exprimées en mégawatt‑heures par token, une unité peu courante qui complique la comparaison directe avec d’autres modèles. Enfin, la compatibilité matérielle reste limitée aux GPU Nvidia supportant CUDA et aux appareils Apple équipés de MLX, excluant d’autres écosystèmes.