Présentation

Kolibri est le nouveau grand modèle de langage (LLM) d’Aleph Alpha, publié le 3 octobre 2026 sous licence Apache 2.0. Il cible le germanique et l’anglais avec un contexte natif de 262 144 tokens, extensible jusqu’à 1 048 576 tokens dans les tests. Le modèle compte 78,1 milliards de paramètres, dont seulement 3,46 milliards (4,4 %) sont activés pour chaque token grâce à une architecture à mélange d’experts (MoE). La taille du fichier de poids est d’environ 78 Go en précision FP8.

Architecture et mécanismes

Le réseau comporte 50 couches, chacune dotée de 384 experts plus un expert partagé. Un routeur sélectionne 6 experts parmi les 384 pour chaque token, ce qui explique la réduction de calcul à l’équivalent d’un modèle de 3,5 milliards de paramètres tout en conservant la capacité mémoire d’un modèle de 78 milliards. Cette approche impose que le modèle complet reste chargé en mémoire, même si la plupart des experts restent inactifs pendant l’inférence.

Le tokenizer de Kolibri utilise un vocabulaire de 128 000 tokens et repose sur l’algorithme UniBPE, une variante du BPE qui applique un critère d’unigramme pour respecter la morphologie germanique. Selon le rapport technique, ce tokenizer nécessite 11,2 % moins de tokens que celui de GPT‑5 pour du texte allemand. Une expérimentation reproduite sur le texte de la Loi fondamentale allemande montre une réduction de 15 % des tokens par rapport à GPT‑5, confirmant l’efficacité du découpage en deux tokens pour des mots composés comme « Bundesverfassungsgericht ».

Analyse des performances et limites

Sur les évaluations internes d’Aleph Alpha, Kolibri surpasse les modèles comparables de même taille en allemand et en anglais, notamment sur les niveaux de raisonnement (none, low, medium, high) et la capacité d’appel d’outils. Le modèle a été entraîné sur 24 trillions de tokens, dont plus d’un cinquième provient du corpus allemand, en utilisant 768 GPU NVIDIA B200 répartis entre l’Allemagne et la Finlande. Cette infrastructure garantit le respect du EU AI Act dès la conception, mais la dépendance à du matériel spécialisé (B200) peut limiter la reproductibilité hors‑Europe.

Le modèle ne possède pas de capacité de raisonnement « high » pour toutes les tâches, et les filtres de biais politique, bien que mesurés, restent sujets à des variations selon les jeux de données externes. De plus, la nécessité de charger l’ensemble des 78 GB de poids rend l’utilisation sur des serveurs modestes difficile, même si l’inférence ne mobilise qu’une fraction des paramètres.

Déploiement et souveraineté

Le caractère « sovereign » de Kolibri signifie que le code d’entraînement et les poids restent sous juridiction allemande et européenne, sans contrôle étranger. Les clients peuvent déployer le modèle sur leurs propres serveurs, assurant que les données ne quittent jamais le périmètre de l’entreprise. Aleph Alpha a également adhéré au GPAI Code of Practice de l’UE, renforçant la conformité réglementaire. Toutefois, la licence Apache 2.0 ne couvre que les poids et les fichiers de configuration ; le code d’entraînement reste propriétaire, ce qui limite la transparence complète du pipeline d’apprentissage.