Présentation du classement

Le classement Artificial Analysis Intelligence Leaderboard évalue les modèles d'IA selon plusieurs critères, notamment la qualité, le prix, la vitesse de sortie, la latence, la fenêtre de contexte et d'autres paramètres. Les modèles Claude Opus 5 (max) et Claude Opus 5 (xhigh) occupent les premières places en termes d'intelligence, suivis par Claude Fable 5 (avec fallback) et GPT-5.6 Sol (max).

Performances des modèles

En ce qui concerne la vitesse de sortie, les modèles Mercury 2 (939 tokens par seconde) et HyperNova 60B 2605 (436 tokens par seconde) sont les plus rapides, suivis par Granite 4.0 H Small et Gemini 3.5 Flash-Lite. Pour la latence, les modèles Gemini 2.5 Flash-Lite (0,35 seconde) et Command A+ (0,41 seconde) affichent les temps de réponse les plus courts, suivis par Gemini 2.5 Flash et NVIDIA Nemotron 3 Nano.

Évaluations d'intelligence

Les évaluations d'intelligence sont effectuées à l'aide de l'Artificial Analysis Intelligence Index, qui combine 9 évaluations différentes, notamment GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience et AA-LCR. Les modèles de raisonnement sont indiqués par un icône de lampe.

Coûts et performances

En termes de coût, les modèles Devstral 2 et North Mini Code sont les moins chers, avec un prix de 0 dollar par million de tokens. Les modèles Llama 4 Scout et Grok 4.20 0309 ont les plus grandes fenêtres de contexte, avec respectivement 10 millions et 2 millions de tokens. Les coûts et les performances des modèles varient considérablement, et les choix dépendent des besoins spécifiques des utilisateurs.

Exemple de code pour évaluer les performances d'un modèle :
   # Évaluation de la vitesse de sortie
   vitesse_sortie = 939  # tokens par seconde
   # Évaluation de la latence
   latence = 0,35  # seconde