Contexte et objectifs

Le Allen Institute for AI (Ai2) a présenté Olmo‑core 3, un cadre de formation dédié aux modèles de langue à mixture‑of‑experts (MoE). Les MoE diffèrent des modèles denses en n’activant qu’une petite sous‑population d’experts pour chaque token, ce qui réduit le calcul requis tout en conservant un nombre total de paramètres très élevé. Ai2 vise à rendre la création de MoE de l’ordre du trillion de paramètres économiquement viable, en limitant la consommation de GPU et la bande passante réseau.

Architecture d’Olmo‑core 3

Olmo‑core 3 repose sur trois leviers d’optimisation. Premièrement, l’expert parallelism répartit les experts sur plusieurs GPU, chaque carte ne stockant qu’une fraction du pool complet. Deuxièmement, le modèle divise ses couches entre groupes de GPU, ce qui diminue la mémoire nécessaire par carte pour chaque couche. Troisièmement, un optimiseur distribué partage l’état de l’optimiseur (gradients, moments, etc.) entre les GPU au lieu de dupliquer ces données sur chaque unité. Cette combinaison réduit l’empreinte mémoire globale et évite le goulot d’étranglement lié à la réplication complète du modèle. En outre, Olmo‑core 3 supporte le format numérique MXFP8, qui encode certaines valeurs avec moins de bits, diminuant ainsi le volume de données transférées entre les GPU.

Performances et comparaison

Lors des tests internes, Olmo‑core 3 a traité 52 000 tokens/s sur des GPU Nvidia B3000 pour un modèle de 47 milliards de paramètres. La même configuration, utilisant l’architecture de référence Megatron‑core, plafonnait à 19 400 tokens/s. Le gain de 2,7× de débit montre l’impact direct de la parallélisation des experts et de la réduction de la duplication d’état. Le cadre autorise également d’étendre le pool d’experts de 8 à 128 tout en ne sélectionnant que quatre experts par token, ce qui maintient le coût de calcul stable malgré l’augmentation du nombre total de paramètres.

Implications et limites

En rendant possible la formation de MoE dépassant le trillion de paramètres, Olmo‑core 3 ouvre la porte à des modèles plus spécialisés sans nécessiter d’infrastructures de type « exascale ». Cependant, la nécessité de stocker l’ensemble du pool d’experts sur plusieurs GPU implique toujours une dépendance forte à la bande passante inter‑GPU et à la capacité de synchronisation du réseau. De plus, le support MXFP8, bien que prometteur, requiert des GPU compatibles et peut introduire des pertes de précision non quantifiées dans la documentation publique. Le code source est disponible sur GitHub, ce qui permet aux chercheurs de tester d’autres stratégies de routage ou de parallélisme, mais la complexité du déploiement reste élevée pour les équipes ne disposant pas d’une expertise en orchestration de clusters GPU.