Présentation du modèle
Mistral AI a annoncé Mistral Large 4 (ML4), un modèle multimodal doté d'1 trillion de paramètres, surnommé « Le Chonk ». Le modèle n’est pas encore disponible en poids ouverts ; il est exploitable uniquement via un endpoint à garde‑fou public. Mistral prévoit de publier les poids dans trois semaines, après une phase de tests de sécurité.
Entraînement et infrastructure
ML4 a été entraîné exclusivement sur l’infrastructure interne de Mistral, utilisant 4 000 GPU Nvidia. Ce parc représente deux à trois fois moins que celui des concurrents chinois et reste inférieur aux ressources mobilisées par les géants fermés. La réduction du nombre de GPU implique une optimisation du pipeline d’entraînement, mais les détails du batch size ou du nombre d’étapes d’entraînement n’ont pas été communiqués.
Implications et limites
Le laboratoire mise sur des cas d’usage ciblés : cybersécurité, finance et conception de puces, domaines soutenus par ses principaux investisseurs, le groupe néerlandais ASML et Samsung. La société, valorisée à 21 milliards d’euros (≈ 24,39 milliards USD), affirme que la spécialisation du modèle pourrait le rendre plus performant que les modèles fermés dans ces secteurs, même si les benchmarks publics restent à publier. Le fait que les poids seront ouverts après validation de sécurité soulève un double enjeu : amélioration de l’auditabilité, mais risque potentiel d’utilisation malveillante si les contrôles ne sont pas suffisants.