Contexte économique

Le coût d’utilisation d’un modèle de langage diminue de plusieurs ordres de grandeur chaque année. Même si le prix unitaire d’un token ne baisse pas de façon linéaire pour les modèles de pointe, le coût total d’une tâche chute nettement, comme le montre le graphique du « pareto frontier » de 2026 où le coût‑/‑qualité s’améliore sur toute la gamme de modèles, du coûteux Claude Fable‑5.1 au plus abordable GPT‑5.6 Luna.

Améliorations techniques

Les GPU gagnent en efficacité énergétique selon une loi logarithmique dont le facteur 1,3 implique un doublement de l’efficacité tous les deux ans, un rythme comparable à la loi de Moore des années 1960. Cette progression se traduit directement dans les moteurs d’inférence : vLLM 0.11.1 (déc. 2025) consomme 40 % moins d’énergie par token que vLLM 0.5.4 (sept. 2024). NVIDIA rapporte jusqu’à 50 % d’amélioration d’efficacité sur son stack MLPerf entre les versions 2.0 et 2.1, tandis qu’Intel observe un gain de 2,4 × de débit entre les suites 6.0 et 6.1, indiquant que les gains logiciels sont aussi significatifs que les gains matériels.

Les architectures Mixture‑of‑Experts (MoE) réduisent la taille des modèles de 7 fois (de 6 M à 0,8 M de paramètres) tout en conservant les mêmes scores de benchmark, ce qui diminue à la fois la consommation de mémoire et le coût d’inférence.

Implications pour l’infrastructure IA

Lorsque le prix du token devient négligeable face aux appels d’outils, les développeurs basculeront de la facturation à la consommation de tokens vers la facturation à la consommation de ressources (CPU, GPU, bande passante). Cette transition accélère l’intégration des LLMs comme composant d’infrastructure plutôt que comme produit autonome, et rend plausible le déploiement de modèles de pointe sur du matériel grand public d’ici trois à six ans.

Le phénomène de Jevons (paradoxe de l’offre) apparaît : l’augmentation de l’efficacité pousse les utilisateurs à consommer davantage, ce qui peut neutraliser les économies d’énergie attendues. Du côté de la demande, la même dynamique se manifeste : la baisse du coût par tâche incite à élargir les cas d’usage, augmentant la charge globale du système.

Limites et perspectives

Les données restent partielles : les graphiques cités proviennent de sources publiques mais ne détaillent pas les méthodologies de mesure, ce qui rend difficile la comparaison précise entre différents moteurs d’inférence. De plus, la baisse du coût par token ne s’applique pas uniformément aux modèles les plus avancés, qui conservent des tarifs élevés pour chaque token traité.

À moyen terme, la pression économique devrait favoriser l’émergence de standards d’évaluation de l’efficacité énergétique et de la consommation de tokens, afin d’éviter que les gains d’efficacité ne soient entièrement absorbés par une hausse de la demande.