Présentation
Beam est le premier modèle à poids ouvert de Reflection. Il s’agit d’un modèle Mixture‑of‑Experts (MoE) comptant 501 milliards de paramètres au total, dont 23 milliards sont activés par token. Le modèle cible les charges de travail de codage, de raisonnement et d’agents autonomes, et se positionne comme une alternative efficace aux modèles propriétaires de taille comparable.
Architecture et entraînement
Le pré‑entraînement de Beam a exploité 23,8 trillions de tokens provenant de sources web diversifiées et de jeux de données sous licence. Cette phase a permis d’établir une base de connaissances robuste avant d’ajouter une phase d’apprentissage par renforcement (RL) à grande échelle. Le RL a généré plus de 100 millions de rollouts sur 10 500 GPU NVIDIA GB300 pendant quatre semaines, soit environ 1,3 milliard de sandbox exécutés. Chaque rollout utilisait une longueur de contexte maximale de 256 k tokens et s’appuyait sur un million d’environnements de codage, d’agents et de STEM soigneusement sélectionnés. Pour gérer la staleness des politiques à grande échelle, l’équipe a introduit des algorithmes d’asynchronie des gradients de politique, réduisant l’écart entre entraînement et inférence.
Performances et efficacité
Sur les benchmarks de codage et d’agents, Beam atteint des scores proches de ceux de GLM‑5.2 et se rapproche de Qwen 3.8‑Max, tout en affichant une efficacité d’inférence 3 à 4 fois supérieure. Par exemple, il obtient 97,8 % sur le test Humanity’s Last Exam (HLE) et 80,1 % sur Terminal‑Bench 2.1, contre 99,2 % et 88,2 % respectivement pour les modèles plus gros. L’estimation du coût de calcul utilise la formule FLOPs ≈ 2 × paramètres actifs × tokens générés, ce qui montre que Beam consomme moins de FLOPs par token que les modèles de 2 téra‑paramètres comme Qwen 3.8‑Max. Les gains d’efficacité se traduisent en une réduction du coût d’inférence, ce qui rend le modèle plus adapté aux charges de travail d’entreprise où le volume de requêtes est élevé.
Perspectives et limites
Beam est actuellement en phase de red‑teamings et d’évaluations de sécurité avant la publication publique des poids, du rapport technique et de la carte modèle prévue pour la fin du mois. Les estimations de FLOPs excluent le pré‑remplissage du prompt, les opérations d’attention dépendantes du contexte et les frais de service, ce qui signifie que le coût réel d’inférence reste supérieur aux valeurs théoriques. De plus, la dépendance à une infrastructure GPU massive (10,5 k GPUs) pose des questions de reproductibilité pour les laboratoires disposant de ressources limitées. Malgré ces réserves, la combinaison d’un pré‑entraînement massif et d’un RL à haute intensité place Beam comme un modèle de référence pour les applications de codage et d’agents autonomes à coût maîtrisé.