Présentation du modèle Quasar 438B

Quasar 438B est le nouveau modèle de raisonnement de Multiverse Computing, positionné dans la classe des modèles de plus de 400 milliards de paramètres. Conçu pour les agents d’entreprise et le codage, il supporte l’anglais et l’espagnol, ce qui le rend adapté aux organisations européennes multilingues. Le modèle est accessible via l’API CompactifAI, permettant aux équipes de l’évaluer sans installer d’infrastructure dédiée.

Performances sur l'Artificial Analysis Intelligence Index

Sur l’Artificial Analysis Intelligence Index (AAI) version 4.1.1, qui agrège neuf évaluations (GDPval‑AA v2, τ³‑Banking, Terminal‑Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, CritPt, AA‑Omniscience et AA‑LCR), Quasar obtient un score de 43. Ce résultat dépasse Mistral Medium 3.5 (30), NVIDIA Nemotron 3 Ultra (38) et Inkling (42), tout en restant inférieur à Claude Opus 5 (63). Le score de 43 place Quasar comme le modèle européen le mieux noté dans ce benchmark.

Vitesse de réponse et implications pour les agents d’entreprise

Quasar génère 500 tokens, temps de réflexion inclus, en 15,3 secondes. Parmi les modèles comparés, seuls trois sont plus rapides : Nemotron 3.5 Lightning (9,4 s, score 24), Gemini 3.5 Flash‑Lite (10,8 s, score 37) et Gemini 3.7 Flash (11,5 s, score 56). Aucun autre modèle combinant une vitesse inférieure à 25 s n’atteint un score supérieur à 43, ce qui montre que Quasar optimise le compromis entre latence et capacité de raisonnement. Cette rapidité permet d’intégrer le modèle dans des interfaces interactives plutôt que de le cantonner à des traitements batch.

Capacités de contexte long et d'exécution terminale

Dans l’évaluation AA‑LCR, qui mesure la capacité à extraire, connecter et raisonner sur des informations réparties sur de longs documents, Quasar atteint 75,0, égal à Grok 4.6 et à moins d’un point de Claude Opus 5 (75,7). Cette performance indique une aptitude solide pour les tâches de recherche documentaire et les flux de travail agentiques nécessitant un contexte étendu. Sur Terminal‑Bench v2.1, qui place les agents dans des environnements de terminal réels, le modèle obtient 69,3, soit 18,7 points au-dessus de Mistral Medium 3.5 et 15,4 points au-dessus de Nemotron 3 Ultra. Cette marge souligne le potentiel de Quasar pour l’automatisation de scripts, le débogage assisté et les assistants de codage qui doivent interagir directement avec des interfaces en ligne de commande.