Principe et architecture
MicroLLM Lab propose d’interroger directement dans le navigateur des Small Language Models (SLM) dont la taille varie de 25 M à 360 M paramètres. Le dispositif repose sur un catalogue de modèles pré‑quantifiés en Q4 (4 bits) et sur le moteur WebGPU, qui compile les shaders de calcul sur les GPU natifs (Metal sur Apple Silicon, DirectX 12, Vulkan). Les modèles sont stockés dans l’IndexedDB du navigateur, ce qui évite tout téléchargement de fichiers sur le disque et garantit que les prompts restent locaux.
Quantisation Q4 et empreinte mémoire
La quantisation Q4 convertit chaque poids de 16 bits flottants à 4 bits, ce qui diminue la consommation de mémoire d’environ 75 %. Ainsi, un modèle de plus de 100 M paramètres occupe seulement 50 à 84 Mo dans la mémoire du navigateur, rendant possible le chargement simultané de plusieurs SLM sur des appareils grand public. Le fichier d’exemple fourni par le projet pèse 589 Mo, contenant l’ensemble des modèles et le code d’inférence.
Exécution via WebGPU et performances mesurées
Une fois le modèle chargé, l’inférence s’effectue sur le GPU grâce à WebGPU, avec un fallback vers WebAssembly puis JavaScript si le GPU n’est pas disponible. Les métriques de benchmark affichent le temps jusqu’au premier token (TTFT) inférieur à 10 ms et un débit moyen de tokens par seconde (tok/s) mesuré sur un décodage continu de 256 tokens. Le tableau de bord indique les vitesses de pointe (« Highest Peak Speed »), les vitesses soutenues (« Highest Sustained Speed ») et le score cumulé du suite de tests, exprimé en temps d’exécution total (ms). La précision est évaluée par des tests objectifs basés sur des expressions régulières ou la correspondance exacte de tokens, par exemple un modèle de 135 M paramètres est autorisé à échouer sur un test donné.
function Eval() {
// evaluation logic executed via eval()
}
Analyse des limites et perspectives
Le modèle d’exécution dépend fortement de la disponibilité d’un GPU compatible WebGPU ; les appareils sans support tombent en arrière sur WASM, ce qui augmente le temps de latence et réduit le débit. La quantisation Q4, bien que « presque sans perte », peut affecter la qualité de génération pour des tâches complexes, un compromis non quantifié dans la documentation. De plus, l’absence de métriques détaillées (par ex. tok/s exacts par modèle) limite la comparaison objective entre différents matériels. Malgré ces contraintes, la capacité à exécuter des SLM entièrement hors ligne ouvre la voie à des applications de filtrage, de routage de requêtes ou d’assistants embarqués où la confidentialité et le coût serveur sont critiques.