Principe de la valeur frontier
Le tableau présenté par Artificial Analysis place chaque modèle de langage sur un graphique où l’axe horizontal représente le coût mixte pour 1 M de tokens (ratio 3 : 1 entrée‑sortie) et l’axe vertical l’Intelligence Index. La frontière de valeur regroupe les points qui ne sont pas dominés : aucun modèle moins cher n’offre un score supérieur, et aucun modèle plus cher n’atteint le même score. Ainsi, chaque point de la frontière indique le meilleur compromis disponible à ce niveau de dépense.
Méthodologie de calcul du coût mixte
Le coût affiché est un prix blendé calculé à partir du tarif d’entrée et du tarif de sortie, pondérés respectivement à 75 % et 25 % pour reproduire le ratio 3 : 1. Les valeurs sont exprimées en dollars par million de tokens et affichées sur une échelle logarithmique, ce qui facilite la comparaison entre modèles très bon marché et très onéreux. Les variantes de chaque modèle sont filtrées par défaut : seule la version la mieux notée est conservée, les variantes moins performantes étant masquées à moins que l’utilisateur désactive le filtre « One row per model ». Le paramètre « Min score » permet de masquer les modèles dont l’Intelligence Index est inférieur à 30, évitant ainsi que des modèles très bas de gamme ancrent artificiellement la ligne.
Mise à jour quotidienne et stabilité de l’indice
Les données proviennent d’une API publique d’Artificial Analysis et sont récupérées chaque jour par un workflow GitHub Actions. Cette fréquence assure que les ajouts de nouveaux modèles, les suppressions et les ré‑évaluations de prix ou de scores sont immédiatement reflétés. L’indice est toutefois re‑basé à chaque version du benchmark, ce qui signifie que les scores ne sont comparables qu’à l’intérieur d’un même instant de capture et non entre deux snapshots distincts. Le tableau indique également les variations entre deux récupérations consécutives, signalant les changements de modèle, de prix ou de score.
Limites et considérations d’usage
Le calcul du prix blendé exclut les discounts liés à l’entrée mise en cache, la tarification par lots ou les modes d’inférence accélérée. Par conséquent, le coût réel pour un usage intensif peut être inférieur à la valeur affichée. De plus, la sélection d’un modèle « meilleur pour votre budget » repose uniquement sur le score de l’Intelligence Index, qui ne mesure pas des critères spécifiques tels que la latence, la conformité aux normes de sécurité ou la capacité à gérer des langues rares. Enfin, la dépendance à une source unique d’évaluation introduit un biais potentiel : les modèles évalués avec des prompts ou des jeux de données particuliers peuvent obtenir des scores qui ne reflètent pas leur performance dans d’autres contextes.