Contexte économique de l’AI factory
Ian Buck, vice‑président de la division hyperscale et HPC chez Nvidia, décrit le passage d’une logique centrée sur les puces à une logique où l’ensemble du centre de données est considéré comme un système productif. Dans ce modèle, la valeur générée ne provient plus uniquement du nombre de GPU installés, mais du nombre de tokens produits par watt consommé. Buck qualifie ces tokens d’actifs « fungibles, durables et productifs », soulignant qu’ils constituent la monnaie d’échange d’une économie d’IA où chaque unité de puissance doit être monétisée.
Mécanismes d’inférence et rôle des tokens
L’inférence, c’est‑à‑dire le traitement de requêtes par des modèles déjà déployés, constitue le principal flux de revenus d’une AI factory. Buck précise que l’inférence ne remplace pas l’entraînement : les modèles sont continuellement ré‑alignés et enrichis de nouvelles données, un processus qu’il qualifie de « petit entraînement ». Cette boucle de rétroaction crée une demande constante de capacité de calcul à faible latence, notamment dans les secteurs fintech où chaque milliseconde compte. Nvidia cite son accélérateur Groq 3 LPX, couplé à la plateforme Vera Rubin, comme moyen d’augmenter le taux de tokens par utilisateur pour les charges de travail sensibles au temps.
Efficacité énergétique et amélioration des GPU
Le facteur limitant d’un centre de données reste la puissance disponible. Buck indique que chaque génération de GPU doit améliorer le ratio tokens per watt. Selon ses propos, les GPU Nvidia offrent « une amélioration de plus de 10 fois » d’efficacité à chaque itération, et la génération Blackwell aurait atteint une hausse de 30 fois du même indicateur. Cette progression repose sur des optimisations architecturales (mémoire plus rapide, unités de calcul spécialisées) et sur une meilleure gestion du parallélisme au niveau du système, ce qui permet de placer plus de calculs d’inférence dans la même enveloppe énergétique.
Écosystème et services d’inférence
Pour éviter que les clients ne soient submergés par la complexité du dimensionnement, Nvidia s’appuie sur des partenaires comme CoreWeave. Cette société propose des configurations pré‑définies ou des services d’inférence gérés qui équilibrent le débit et la vitesse des tokens selon les besoins spécifiques. L’objectif est de transformer la contrainte énergétique en un levier économique : plus le nombre de tokens générés par watt est élevé, plus le coût marginal de chaque requête diminue, renforçant ainsi la compétitivité des offres d’inférence à grande échelle.