Contexte matériel et modèles utilisés
Le Mac mini équipé d’un processeur M4 Pro et de 48 Go de RAM sert de serveur d’inférence pour deux modèles quantifiés en 4 bits : Qwen3.6‑35B‑A3B‑OptiQ‑4bit et Gemma‑4‑E4B‑it‑4bit. Le premier, modèle à experts multiples (MoE), occupe environ 20 GB de mémoire vive, tandis que le second ne consomme que 2,4 GB. Le système d’exploitation macOS utilise entre 6 et 8 GB, laissant ainsi plus de 20 GB disponibles pour les fenêtres de contexte et les processus annexes.
Qwen3.6-35B-A3B-OptiQ-4bit
- 35B : paramètres totaux
- A3B : paramètres actifs par token (≈3 B)
- OptiQ-4bit : quantification 4 bits (8 bits sur couches sensibles)Impact de la quantification et de l’architecture MoE
La quantification 4 bits réduit le facteur de taille du modèle à peu près à un gigaoctet par milliard de paramètres. Ainsi, les 35 milliards de paramètres du Qwen3.6 occupent 17‑20 GB sur disque, mais la mémoire active pendant l’inférence correspond à seulement 3 milliards de poids, soit l’équivalent d’un modèle dense de 6 B. Cette différence provient du mécanisme MoE : les 256 experts restent inactifs tant qu’ils ne sont pas sollicités pour le token courant, ce qui évite le débordement de la mémoire unifiée.
En comparaison, un modèle dense de 27 B quantifié en 4 bits nécessite près de 14 GB de RAM, ce qui consomme la quasi‑totalité d’un MacBook Air à 16 GB et force le système à recourir au swap SSD, entraînant une latence importante.
Avantages opérationnels du déploiement local
Le serveur d’inférence oMLX détecte automatiquement les modèles placés dans le répertoire ~/models/. L’accès se fait via un réseau privé Tailscale, permettant aux appareils iPhone, MacBook et aux applications tierces (Apollo, Raycast, Pi) d’interroger le même backend sans passer par Internet. Cette architecture élimine les limites de taux imposées par les API cloud, garantit une latence proche du temps réel grâce au moteur média du M4 Pro, et assure la continuité même en l’absence de connexion réseau.
Analyse des contraintes de déploiement
Pour évaluer la compatibilité d’un modèle avec un appareil, il faut d’abord vérifier la taille du fichier quantifié (≈ nombre de paramètres en gigaoctets), soustraire l’enveloppe système (6‑8 GB) et réserver 8‑16 GB supplémentaires pour le cache KV lors de conversations longues. Un facteur de sécurité de 10‑15 % évite le recours au swap. Les modèles MoE offrent un avantage décisif : le compte total de paramètres n’est plus un indicateur fiable de la consommation mémoire, il faut se référer au nombre de paramètres actifs (ex. A3B).
En pratique, le processus de mise à jour consiste à télécharger un nouveau modèle dans ~/models/, laisser oMLX le répertorier, puis sélectionner le modèle dans l’interface ou redémarrer le serveur. Cette procédure, réalisable via SSH, permet de remplacer les modèles toutes les quelques semaines sans interruption majeure.