Présentation du modèle

Mistral AI a annoncé Mistral Large 4, surnommé « Le Chonk ». Le modèle comporte un trillion de paramètres et intègre nativement la prise en charge de données multimodales. Selon la société, 49 milliards de ces paramètres sont actifs lors de l’inférence, ce qui indique une architecture optimisée pour la charge de travail en temps réel.

Architecture et multimodalité

Le caractère « nativement multimodal » signifie que le réseau de neurones accepte simultanément texte, image et potentiellement d’autres modalités sans passer par des modules de pré‑traitement externes. Cette intégration repose généralement sur des couches de fusion pré‑entraînées qui alignent les représentations de chaque modalité dans un espace partagé. Le nombre de paramètres (1 000 000 000 000) suggère l’utilisation de blocs de transformeurs de grande taille, probablement organisés en plusieurs niveaux hiérarchiques pour limiter la consommation de mémoire tout en conservant la capacité d’apprentissage.

Performances sur les charges critiques

Le communiqué indique que le modèle atteint le meilleur score agrégé parmi les modèles à poids ouverts issus des États‑Unis ou d’Europe. Les benchmarks cités couvrent les domaines de la cybersécurité, de la fabrication et de la finance, ainsi que le visual grounding, où il dépasserait les modèles fermés de pointe. Sans accès aux scores exacts, on peut supposer que les évaluations portent sur des jeux de données standards tels que GLUE, SuperGLUE ou des jeux de données sectoriels (ex. Cybersecurity‑Bench, Manufacturing‑Metrics). La supériorité en visual grounding implique une capacité à associer des régions d’image à des descriptions textuelles, un problème typiquement résolu par des architectures de type Vision‑Language Transformer.

Déploiement et disponibilité

Mistral Large 4 est déployable depuis l’Europe via l’infrastructure propriétaire Mistral Cloud, ce qui implique que le modèle est hébergé sur des serveurs européens et que les flux de données restent sous juridiction européenne. L’accès est fourni via une API publique, ce qui facilite l’intégration dans des pipelines existants. La société mentionne également des collaborations privées avec des partenaires en cybersécurité, suggérant des cas d’usage spécifiques où le modèle est intégré à des systèmes de détection d’anomalies ou d’analyse de menaces. Les poids du modèle seront publiés à la fin du mois d’octobre, offrant ainsi la possibilité aux chercheurs de reproduire les résultats annoncés.