Contexte économique des GPU
Les fournisseurs de services d’IA évaluent habituellement la valeur d’un GPU à l’aune de son coût d’acquisition et de la rapidité d’obsolescence supposée par chaque nouvelle génération NVIDIA. Ornn Data montre que, sur le marché de location, le prix mensuel d’une A100 reste à 80 % de son tarif initial après cinq ans, contre 44 %‑60 % pour les familles Hopper et Blackwell. Cette rétention de prix s’accompagne d’une hausse d’occupation de 74 % à 90 % entre mars et septembre 2026, soit une augmentation de capacité listée de 13 % et une hausse du spot de 20 %.
Ces indicateurs suggèrent que la pression économique ne pousse pas automatiquement les opérateurs à remplacer les GPU Ampere par les modèles plus récents, dès lors que le coût marginal d’utilisation reste compétitif.
Analyse des coûts d’inférence open-weight
En comparant onze modèles open-weight à huit modèles fermés sur l’Artificial Analysis Intelligence Index, le modèle open-weight le moins cher réalise une tâche pour environ un cinquième du coût d’un modèle fermé équivalent. En auto‑hébergement sur du matériel loué, le coût de calcul pur se situe entre 0,12 $ et 0,35 $ par million de jetons de sortie à pleine utilisation.
Pour le modèle sparse gpt-oss-120b (5,1 M paramètres actifs), le A100 génère des sorties moins chères que le H100, tant en location spot qu’en contrats de trois et cinq ans. Les lignes A100/H100 pour ce modèle proviennent de mesures tierces, tandis que la ligne dense A100 est estimée à partir de données de débit publiées le 1 septembre 2026.
Impact sur la durée de vie des générations NVIDIA
Les charges de travail intensives en calcul – agents à long terme, évaluations par lots, apprentissage par renforcement – tolèrent des latences plus élevées et ne dépendent pas d’une architecture spécifique. Cette flexibilité crée une demande élastique qui s’oriente naturellement vers le matériel offrant le meilleur ratio coût/performance, même si ce matériel appartient à une génération plus ancienne.
Les données d’Ornn indiquent que, pour les modèles open-weight, le prix du token varie entre 1,8× et 5,6× selon le fournisseur, reflétant des différences de quantisation, de capacité, de fiabilité et de coûts de migration. Cette variabilité montre que la simple disponibilité d’un poids ouvert ne garantit pas une substitution sans friction, mais elle ouvre néanmoins la porte à une utilisation plus large de GPU amortis.
Limites et perspectives
Le rapport ne prouve pas que la demande open-weight soit la cause directe de l’augmentation d’occupation ou de la stabilité des prix de location des A100. De plus, les mesures de performances sparse proviennent de configurations tierces et ne sont pas des scores MLPerf, ce qui limite la généralisation des résultats. Enfin, les modèles fermés restent moins chers à certains seuils de performance, ce qui indique que la compétitivité dépend du niveau de précision requis.
Malgré ces réserves, l’étude remet en question les prévisions selon lesquelles les nouvelles générations de GPU éliminent la rentabilité des générations précédentes. Tant que les charges de travail restent compatibles avec les contraintes matérielles et que les poids ouverts restent accessibles, les GPU NVIDIA plus anciens conservent une capacité de génération de revenus sur plusieurs années.