Présentation du modèle

Mistral Large 4, annoncé en public preview le 6 octobre 2026, est le dernier modèle multimodal open‑weight de Mistral AI. Il se positionne comme un modèle généraliste capable de traiter texte et images grâce à un encodeur vision de 1,6 milliard de paramètres. Le modèle propose 49 milliards de paramètres actifs sur un total de 1,05 trillion de paramètres, ce qui le place parmi les plus grands modèles accessibles en open‑weight.

Architecture et capacités multimodales

La spécificité de Mistral Large 4 réside dans son architecture Mixture‑of‑Experts (MoE). Cette approche répartit les calculs entre plusieurs experts spécialisés, n’activant que 49 B paramètres pour chaque requête tout en conservant un réservoir de 1,05 T paramètres disponibles pour le routage dynamique. Le MoE réduit la latence et le coût énergétique comparé à un modèle dense de même taille, tout en maintenant une capacité d’apprentissage comparable. Le sous‑module vision, intégré comme encodeur distinct, possède 1,6 B paramètres et accepte des images de résolution standard, permettant des tâches de compréhension visuelle, d’OCR et de génération d’annotations.

Sur le plan fonctionnel, le modèle expose plusieurs points d’accès API : /v1/chat/completions, /v1/conversations, /v1/batch, /v1/agents. Ces endpoints supportent des fonctionnalités avancées telles que les structured outputs, le function calling, le document QnA, le prefix‑based prompting et le baching de requêtes. L’intégration d’outils natifs (agents, conversations) facilite la construction d’applications agent‑centric sans couche supplémentaire.

Analyse des coûts, performances et limites

Le modèle est tarifé à 0,14 $ par million de tokens d’entrée et 0,68 $ par million de tokens de sortie en mode standard, avec des tarifs réduits en cache (0,07 $ d’entrée, 2,09 $ de sortie). Ces prix reflètent le coût d’inférence du MoE, où seuls les experts pertinents sont activés. La vitesse affichée dans la documentation indique une performance supérieure aux modèles concurrents de même taille, bien que les chiffres exacts de latence ne soient pas fournis.

Malgré son ouverture, Mistral Large 4 reste soumis à des contraintes pratiques : le besoin d’infrastructure capable de gérer le routage MoE, la consommation mémoire liée au réservoir de paramètres total, et la dépendance à des endpoints régionaux pour la conformité légale. De plus, le modèle ne propose pas de version quantifiée ou optimisée pour les GPU à faible puissance, ce qui peut limiter son adoption dans des environnements edge.

En résumé, Mistral Large 4 combine une architecture MoE efficace, un encodeur vision dédié et une gamme d’API orientées agents, tout en offrant une tarification compétitive pour les charges de travail à haut volume. Les utilisateurs doivent toutefois évaluer leurs capacités d’infrastructure et leurs exigences de latence avant de déployer ce modèle à grande échelle.