Contexte et limites du graphique d’ArtificialAnalysis

ArtificialAnalysis (AA) publie un Intelligence Index obtenu en moyennant les scores de plusieurs benchmarks. Le même jeu de tests sert à mesurer le coût par tâche en utilisant les tarifs officiels des API fournisseurs. Le graphique « Intelligence vs. coût » trace la frontière de Pareto, c’est‑à‑dire le modèle le moins cher atteignant chaque niveau d’intelligence. Deux problèmes majeurs sont soulevés : l’axe des coûts est logarithmique, ce qui masque l’écart gigantesque entre les modèles bon marché (ex. $0.015) et les modèles premium ($3.69), et les prix affichés proviennent exclusivement des offres officielles, alors que des fournisseurs tiers comme OpenRouter proposent souvent des tarifs inférieurs.

Méthodologie de calcul des coûts locaux

Pour les modèles pouvant tourner sur du matériel grand public, l’auteur remplace le prix datacenter par le coût énergétique. Le calcul repose sur les éléments suivants :

- Tokens de sortie par tâche (données AA)
- Vitesse de décodage (tok/s) mesurée sur RTX 3090 (2020)
- Différence de consommation entre pic et repos du GPU
- Prix de l’électricité US résidentielle : $0.2049/kWh (mai 2026)
- Majoration de 15 % pour les tokens d’entrée non cachés et les appels d’outil
- Le matériel est considéré comme gratuit (RTX 3090 ≈ $1 400, PC déjà possédé)

Cette approche ignore le coût d’amortissement du GPU et les variations de consommation entre cartes (ex. Strix Halo vs RTX 3090), mais l’auteur justifie que la différence énergétique est négligeable comparée à la consommation temporelle.

Analyse comparative des modèles

Les scores et coûts cités illustrent la loi des rendements décroissants. Fable 5.1 atteint un score d’intelligence de 66 pour $3.69 par tâche, soit 7,5 fois plus cher que GLM‑5.3 (score 60, $0.49). En descendant davantage, GLM‑5.3‑Flash (score 55) coûte $0.023, soit 160 fois moins cher que Fable, mais montre des limites notables sur des tâches complexes comme la génération d’un projet de code complet. Le point de référence « Intelligence = 50 » correspond à la performance maximale d’Opus 4.6 (février 2026).

Les modèles marqués ⚡ (ex. Qwen3.8‑Flash) sont évalués en fonction de leur consommation électrique. Le calcul montre que même avec un GPU RTX 3090 à $1 400, le coût énergétique reste inférieur à $0.03 par tâche, rendant ces modèles compétitifs pour des usages ponctuels sur smartphone ou PC domestique.

Implications, risques et limites

Passer d’une échelle logarithmique à une échelle linéaire rend les différences de prix plus perceptibles pour les décideurs, mais ne résout pas le problème de transparence des coûts réels : le prix d’un modèle open‑weight dépend fortement du fournisseur, et les tarifs datacenter ne reflètent pas les dépenses d’un utilisateur final qui possède déjà le matériel. De plus, l’exclusion des coûts d’amortissement du GPU sous‑estime le prix total d’adoption pour les modèles > 64 GB de RAM, où le matériel requis (Strix Halo 128 GB ≈ $3 600) représente un investissement majeur.

En conclusion, le graphique d’AA offre une vue simplifiée mais trompeuse. Une analyse rigoureuse doit intégrer le coût énergétique, le prix du matériel et les alternatives de fournisseurs tiers pour éviter de sur‑payer des modèles sur‑dimensionnés pour des tâches banales.