Présentation
Olmo‑core 3, publié le 1 octobre 2026 par AllenAI, constitue la troisième génération du framework d’entraînement dédié aux modèles de type mixture‑of‑experts (MoE). Le système vise à rendre l’entraînement de modèles contenant jusqu’à un trillion de paramètres accessible aux laboratoires académiques, en limitant les coûts énergétiques et matériels. Il remplace le parallélisme de données entièrement fragmenté (FSDP) de la version précédente par un parallélisme de données distribué (DDP), conservant les experts en mémoire GPU et évitant les allers‑retours de poids à chaque mini‑batch.
Architecture et techniques de parallélisme
Trois axes de répartition du modèle sont combinés : le expert parallelism, qui répartit les experts sur plusieurs GPU ; le pipeline parallelism, qui découpe les couches du réseau en étapes exécutées séquentiellement sur des groupes de GPU ; et le distributed optimizer, qui partage l’état de l’optimiseur entre les cartes au lieu de le dupliquer intégralement. Cette combinaison empêche chaque GPU de devoir stocker l’intégralité du modèle et de son état d’entraînement, réduisant ainsi la pression mémoire.
Des optimisations supplémentaires ciblent le routage des tokens : le rowwise expert parallelism injecte directement les données dans les tampons d’entrée des experts, le GPU‑resident routing maintient les métadonnées de routage sur le GPU, et le grouped GEMM agrège les petites multiplications matricielles propres aux experts pour exploiter pleinement les unités de calcul.
Performances et benchmarks
Dans un test préliminaire sur huit GPU NVIDIA B300, un MoE de 47 milliards de paramètres a traité 52 000 tokens / s par GPU, contre 19 400 tokens / s avec l’implémentation FSDP, soit un gain de 2,7×. En augmentant le pool d’experts de 8 à 128 tout en ne sélectionnant que quatre experts par token, le nombre total de paramètres est passé de 4,6 B à 47 B, avec une perte de débit inférieure à 5 %.
L’infrastructure a également été évaluée sur un modèle de 1,2 trillion de paramètres, réparti sur 512 GPU B300. Le débit maximal observé était de 858 TFLOP/s / GPU, avec 58,36 B de paramètres actifs par token. L’utilisation du format de précision réduit MXFP8 a augmenté le débit de 21 % par rapport au BF16, tout en faisant baisser la mémoire active maximale de 103 GiB à 95 GiB, principalement grâce à des gains dans le calcul feed‑forward et les transferts entre experts.
Limitations et perspectives
Les benchmarks cités utilisent un routage aléatoire, ce qui mesure la capacité du système mais ne reflète pas la qualité d’un modèle entraîné sur des données réelles. De plus, l’accélération apportée par MXFP8 dépend du rapport entre le coût de conversion de format et les économies de bande passante ; dans des scénarios où la conversion devient dominante, les gains pourraient diminuer. Enfin, la scalabilité repose sur la disponibilité de clusters de GPU B300, limitant l’accessibilité aux infrastructures disposant de ce matériel spécifique. Malgré ces contraintes, Olmo‑core 3 fournit une base ouverte qui combine parallélisme expert, pipeline et optimiseur distribué, offrant aux chercheurs un contrôle granulaire sur les compromis entre mémoire, bande passante et puissance de calcul.