Contexte et données du rapport
Le rapport Epoch AI d’Emberson et Roodman, publié en 2026, indique que le coût d’une performance donnée d’intelligence artificielle a diminué en moyenne de 47 % par trimestre sur les trois dernières années. Cette décroissance équivaut à un facteur 13 chaque année, soit le rythme le plus rapide jamais observé pour une technologie transformatrice. L’étude cite un exemple concret : le modèle OpenAI o3 coûtait 0,30 $ par question pour atteindre 75 % au test GPQA Diamond en janvier 2025, alors que le modèle GPT‑5.6 Luna a atteint le même score pour 0,0004 $ à la mi‑2026, soit une baisse de 725 fois en moins de 18 mois.
Mécanismes techniques de la réduction de coût
Cette chute spectaculaire résulte de plusieurs leviers. D’abord, les avancées matérielles – notamment les puces d’inférence spécialisées comme les Tensor‑Core de nouvelle génération – offrent une densité de calcul supérieure tout en réduisant la consommation énergétique. Ensuite, les algorithmes d’entraînement ont intégré des techniques de sparsité et de quantisation qui diminuent le nombre d’opérations flottantes nécessaires sans sacrifier la précision. Enfin, les architectures de modèles ont évolué vers des designs plus efficaces, par exemple les Mixture‑of‑Experts, qui activent uniquement les sous‑réseaux pertinents pour chaque requête, limitant ainsi le coût d’inférence. La combinaison de ces facteurs explique la réduction de 0,30 $ à 0,0004 $ pour le même niveau de performance.
Implications économiques et sécuritaires
Un coût d’inférence réduit rend les modèles de pointe accessibles à un plus grand nombre d’acteurs, y compris les petites entreprises et les chercheurs indépendants. Cette démocratisation peut accélérer l’innovation dans des domaines comme la santé, la finance ou la logistique, où les calculs d’IA sont désormais économiquement viables. En revanche, la même baisse de prix augmente le risque de diffusion massive de modèles puissants, ce qui atténue l’avantage compétitif des acteurs qui détiennent les plus grands jeux de données. Le texte souligne que la « menace des modèles ouverts » est moins importante que prévu, car les modèles de nouvelle génération ne sont pas seulement plus performants, ils sont aussi beaucoup moins chers à exploiter. Ainsi, la barrière économique à l’usage de l’IA de pointe s’amincit rapidement.
Limites de l'analyse
Le rapport d’Emberson et Roodman ne détaille pas la méthodologie exacte utilisée pour calculer les coûts par question, ni les conditions de charge (batch size, latence, type de serveur). De plus, les chiffres proviennent d’un petit nombre de modèles publics (OpenAI o3, GPT‑5.6 Luna) et peuvent ne pas refléter les coûts réels des modèles propriétaires ou des déploiements à grande échelle. Enfin, l’étude ne quantifie pas les effets indirects, comme l’augmentation de la consommation énergétique globale due à la multiplication des requêtes. Ces lacunes limitent la capacité à extrapoler la tendance à long terme.