Présentation du modèle
MiMo‑V2.6‑Pro, publié en septembre 2026, est un modèle à poids ouverts sous licence MIT. Il possède un total de 1 000 milliards de paramètres, dont 42 milliards sont actifs par token lors de l’inférence. Le contexte s’étend à 1 million de tokens, soit l’équivalent d’environ 1 500 pages A4 en police 12 Arial. Le modèle accepte les entrées texte, image, parole et vidéo et ne génère que du texte, ce qui le classe parmi les modèles multimodaux les plus complets de sa catégorie.
Performance mesurée
Sur l’Artificial Analysis Intelligence Index, MiMo‑V2.6‑Pro obtient un score de 46, bien au‑dessus de la médiane de 18 pour les modèles comparables. Il produit 125,2 tokens de sortie par seconde, plaçant sa vitesse parmi les plus rapides du classement (rang 12/114). L’évaluation a généré 140 millions de tokens, ce qui indique une certaine verbosité. Le tarif est de 0,435 $ / M tokens d’entrée et 0,87 $ / M tokens de sortie, avec un rabais de cache de 99 % ramenant le coût effectif à 0,13 $ par tâche d’Intelligence Index. Le calcul complet de l’index a coûté 206,66 $.
Analyse technique et limites
Le ratio entre paramètres totaux (1 T) et paramètres actifs (42 B) montre une architecture à activation partielle, réduisant la charge de calcul mais conservant une capacité de représentation élevée. Le coût par token reste supérieur à la médiane de 0,30 $ / M tokens d’entrée, ce qui peut freiner les déploiements à grande échelle malgré le discount de cache. La verbosité (140 M tokens) augmente la consommation de bande passante et le temps de traitement, surtout pour des tâches où la concision est requise. Le support multimodal implique des pipelines de pré‑traitement plus lourds, ce qui peut affecter la latence dans les scénarios temps réel.
Implications pour les utilisateurs
MiMo‑V2.6‑Pro se positionne comme un choix pertinent pour les applications nécessitant une intelligence élevée et une vitesse d’inférence rapide, comme les agents conversationnels complexes ou l’analyse multimédia en temps réel. Cependant, les coûts d’utilisation et la tendance à produire des sorties très détaillées imposent de calibrer soigneusement les prompts et d’envisager des stratégies de post‑traitement pour maîtriser les dépenses et la latence.