Présentation

Magnitude est un moteur d’inférence open source dédié aux agents conversationnels. Il se distingue en compilant et en ajustant ses noyaux directement sur le matériel de l’utilisateur, ce qui permet d’exécuter des modèles ouverts jusqu’à deux fois plus vite que llama.cpp. Le projet, publié sous licence Apache‑2.0, propose une application de bureau disponible pour macOS, Windows et Linux, ainsi qu’une interface en ligne de commande intégrée.

Architecture et optimisation

Le principe de base repose sur la génération à la volée de code natif adapté à chaque GPU ou CPU. Sur les machines Apple Silicon, le moteur utilise le backend Metal et obtient un gain de 92 % sur le décodage par rapport aux implémentations génériques. Sur les cartes NVIDIA, le backend CUDA réalise un gain de 19 % grâce à la même méthode de compilation ciblée. Cette approche contraste avec les moteurs classiques qui livrent des noyaux précompilés pour des familles de matériel larges, souvent sous‑optimaux pour un dispositif précis.

Magnitude intègre également une gestion de la mémoire qui réduit la consommation de 27 % par agent. Lorsque plusieurs sessions sont actives, un cache de préfixe partagé évite la duplication des états intermédiaires, limitant ainsi la dégradation des performances lors de l’exécution concurrente.

Performances et benchmarks

Les tests publiés par les développeurs comparent directement le temps de décodage de modèles de 7 et 13 milliards de paramètres. Sur un MacBook Pro équipé d’un M2 Pro, le décodage atteint 92 % de vitesse supplémentaire, tandis que sur une station de travail dotée d’une RTX 3080, le gain se situe autour de 19 %. En pratique, ces améliorations se traduisent par une latence de réponse plus faible pour les agents comme Pi, OpenCode ou Hermes, et permettent d’exécuter des modèles plus volumineux sur des machines disposant de moins de mémoire.

Implications et limites

Le modèle de déploiement local garantit la confidentialité des prompts et des fichiers, aucune donnée n’est transmise à un serveur externe après le téléchargement du modèle. Cette caractéristique répond aux exigences de protection des informations sensibles dans des environnements d’entreprise. Cependant, la nécessité de compiler les noyaux à chaque installation impose un temps de démarrage supplémentaire, surtout sur des CPU modestes où la compilation peut durer plusieurs minutes. De plus, la prise en charge actuelle se limite aux familles de modèles open‑weight les plus populaires ; les architectures propriétaires ne bénéficient pas encore de ces optimisations.