Présentation
Le 3 octobre 2026, Aleph Alpha publie Kolibri, un modèle de type Mixture‑of‑Experts (MoE) dédié aux langues anglaise et allemande. Le réseau compte 78 milliards de paramètres au total, dont seulement 3 milliards sont actifs à chaque passage, ce qui réduit le coût d’inférence tout en conservant une capacité élevée. Kolibri accepte des séquences de texte jusqu’à 1 million de tokens, bien au‑delà des limites classiques (souvent 2 k‑8 k tokens). Le modèle est disponible en téléchargement complet sur Hugging Face sous licence Apache 2.0, offrant ainsi une pleine souveraineté aux utilisateurs.
Architecture et entraînement
Kolibri repose sur une architecture Transformer MoE où chaque couche possède plusieurs experts ; le routage dynamique active uniquement les experts nécessaires, expliquant la différence entre le nombre total (78 B) et le nombre actif (3 B). Cette approche permet d’allouer la capacité de calcul à la complexité du texte sans multiplier la consommation énergétique. Le pipeline d’entraînement, hérité de Kolibri Origin (30 B total, 3 B actifs, fenêtre de 65 k tokens), intègre ingestion massive de données, curations sectorielles, ablations systématiques et suivi automatisé des métriques. Le processus a fonctionné sans intervention humaine même lors de pannes matérielles ou de coupures réseau, grâce à une surveillance standardisée et à des redémarrages automatiques.
Performances et comparaison
Les évaluations internes placent Kolibri sur la « Pareto frontier » du compromis qualité‑coût. Sur les benchmarks publics (AIME, GPQA, LiveCodeBench, HumanEval+, LongBench), Kolibri atteint des scores moyens de 85‑96 % selon les tâches, surpassant des modèles jusqu’à quatre fois plus gros en paramètres actifs, comme Nemotron 3 Super (120 B). Par exemple, sur AIME 2025 (anglais) Kolibri obtient 96,9 % contre 84,6 % pour Nemotron 3 Super. En termes de débit, le modèle délivre plus de texte décodé par seconde tout en consommant moins de GPU, ce qui confirme son positionnement économique. Les scores de l’index AA‑Omniscience restent négatifs (‑32,8) mais restent supérieurs aux modèles comparés, indiquant une meilleure maîtrise de l’hallucination.
Implications souveraines
Kolibri cible les secteurs réglementés (administration publique, aéronautique, industrie) où la confidentialité et la traçabilité sont essentielles. La disponibilité des poids complets garantit une intégrité de la chaîne d’approvisionnement : chaque étape, de la collecte de données à l’évaluation finale, est documentée. Les clients peuvent déployer le modèle on‑premise, évitant ainsi l’envoi de données sensibles à des services d’inférence externes. Cette souveraineté s’accompagne d’une spécialisation sectorielle (raisonnement, mathématiques, comportements agentiques) obtenue via des jeux de données synthétiques reproduisant les flux de travail spécifiques, sans jamais exploiter les données réelles des clients.