Présentation de la flotte K2 Horizon
IFM publie aujourd’hui six modèles de grande taille – 0.9B, 3.7B, 7B, 32B, 36B‑A4B et 375B‑A23B – sous licence Apache 2.0. Chaque modèle est accompagné de l’ensemble du cycle d’entraînement : pré‑entraînement, post‑entraînement agentique, points de contrôle intermédiaires, jeux de données (ou recettes de construction), code d’entraînement, configurations et journaux détaillés. La flotte couvre les environnements « edge » (montres, lunettes) jusqu’aux déploiements d’entreprise, avec prise en charge de la quantisation pour chaque taille.
Architecture et mécanismes d’efficacité
Le modèle 375B‑A23B utilise une architecture Mixture‑of‑Experts (MoE) où 375 milliards de paramètres sont stockés mais seulement ~23 milliards sont activés par token, ce qui réduit le coût de calcul tout en conservant la capacité d’un modèle beaucoup plus grand. Le 36B‑A4B introduit le mécanisme Mixture‑of‑Value‑Attention (MoVA) : une couche d’attention sparse combinée à des experts de feed‑forward, ce qui permet d’atteindre une performance proche de celle du dense 32B tout en n’activant que ~4 milliards de paramètres par token. Les modèles 32B et 36B‑A4B partagent la même architecture de base, facilitant les comparaisons entre configurations denses et sparsées. Tous les modèles utilisent le même vocabulaire, à l’exception du 0.9B qui possède un vocabulaire réduit pour optimiser la mémoire.
Performances mesurées et limites
Sur les évaluations standards, les modèles 0.9B, 3.7B et 7B établissent de nouveaux records dans leurs classes : le 0.9B obtient un score AIME 2026 supérieur à 48, démontrant une capacité de raisonnement et d’usage d’outils comparable à des modèles plusieurs fois plus gros. Les modèles 3.7B et 7B surpassent les références sur SWE‑bench et BrowseComp, indiquant une aptitude à la programmation et à la navigation web. En revanche, les tâches de TerminalBench, qui exigent de longues séquences d’exploration et de récupération, restent difficiles pour les plus petits modèles, soulignant les limites de la profondeur de planification à faible capacité. Les modèles 32B et 375B‑A23B se classent parmi les meilleurs modèles sous 400 B paramètres sur les benchmarks de raisonnement, de codage et de tâches agentiques, confirmant la pertinence du design MoE et MoVA à grande échelle.
Implications pour la recherche ouverte
En publiant l’intégralité du pipeline d’entraînement, IFM permet aux chercheurs de reproduire les étapes qui génèrent les capacités agentiques, d’analyser l’émergence du raisonnement et d’adapter les recettes à de nouveaux domaines. La disponibilité des checkpoints intermédiaires et des logs détaillés crée une base de référence pour étudier l’impact du nombre de paramètres actifs, du mélange de données et des stratégies de post‑entraînement. Cette transparence contraste avec les modèles fermés qui ne diffusent que les poids finaux, limitant la compréhension des processus d’apprentissage. Ainsi, la flotte K2 Horizon constitue un outil de recherche complet, capable d’alimenter à la fois l’expérimentation académique et le déploiement industriel.