Contexte et problème de consommation de tokens
Les modèles de raisonnement comme Kimi K3 génèrent la majorité de leurs jetons – parfois plus de 90 % – pour du raisonnement interne plutôt que pour la réponse finale. Dans les charges de travail agentiques à plusieurs tours, chaque nouveau tour réinjecte l’ensemble du raisonnement précédent, ce qui fait croître le contexte de façon quadratique et augmente fortement le coût d’exécution.
Méthodologie de construction d'Ember-1
Fireworks Research a développé Ember-1 en partant de Kimi K3 et en entraînant le modèle à réduire les traces de raisonnement superflues tout en conservant les phases de réflexion utiles (auto‑réflexion, correction d’erreurs). Plus de 50 expériences d’entraînement ont été menées, accompagnées de plus de 200 évaluations, grâce à la plateforme Fireworks Serverless Training qui élimine la nécessité de provisionner des GPU et permet de payer uniquement à l’usage. Le jeu de données d’entraînement couvre les mathématiques, le codage, l’instruction, la conversation, la recherche, l’usage d’outils et l’ingénierie logicielle, incluant à la fois des tâches isolées et des interactions prolongées afin d’encourager une adaptation continue aux retours d’observation.
Évaluation sur les benchmarks et résultats
Ember-1 a été testé sur le Specialized Intelligence Index (SII), notamment le benchmark « Bedside Bench » de Doximity, qui comporte 500 cas cliniques répartis en 10 catégories. Le modèle a établi une nouvelle frontière de Pareto en termes de coût par tâche, surpassant les modèles ouverts et fermés tels que GPT‑5.6 Sol, GPT‑6 Astra et Claude Opus 5. Sur sept benchmarks publics et le trafic de production de deux clients, Ember-1 a réduit la longueur du raisonnement de 35 % à 50 % sans perte de précision. En utilisant la tarification publique de l’API Kimi K3 (entrée non‑cachée 3 $ / M tokens, entrée cachée 0,30 $ / M tokens, sortie 15 $ / M tokens), Ember-1 a maintenu le taux de réussite du modèle K3‑max tout en diminuant le coût d’exécution d’environ 40 %. Sur cinq benchmarks industriels supplémentaires, Ember-1 se situe sur ou très près de la frontière de Pareto, dominant clairement la configuration K3‑low et rivalisant avec K3‑max.
Implications et limites
La réduction de tokens se traduit directement par des économies de facturation et une latence moindre, ce qui rend les charges de travail de codage automatisé et les agents conversationnels plus scalables. Cependant, la stratégie repose sur la capacité du modèle à identifier les parties de raisonnement réellement utiles ; dans des domaines où la réflexion exhaustive est cruciale (ex. recherche médicale complexe), une réduction agressive pourrait entraîner des omissions. De plus, les résultats proviennent d’évaluations internes et de tests A/B chez des clients partenaires ; la généralisation à d’autres contextes d’utilisation reste à confirmer. Enfin, l’absence de métriques détaillées sur la variance de qualité entre les différents types de tâches limite l’évaluation fine des compromis entre économie de tokens et robustesse du raisonnement.