Contexte de la demande d’inférence

Lors du keynote Fully Connected, l’analyste Dave Vellante a indiqué que la proportion d’inférence dans les charges de travail de CoreWeave était déjà de 50 % et qu’elle devrait atteindre 90 % d’ici l’an prochain. Cette évolution dépasse la croissance du training, qui reste la source traditionnelle de consommation GPU. Le passage à l’inférence impose de mesurer l’efficacité non plus en FLOP mais en tokens produits par watt, ce qui oriente les décisions d’architecture vers des systèmes capables de transformer rapidement le calcul en sortie exploitable.

Extension du stack : réseau, stockage et logiciel

CoreWeave ne se contente plus de proposer du GPU compute. L’entreprise a annoncé l’ajout de services de networking et de stockage, ainsi qu’une couche logicielle baptisée CoreWeave Forge. Cette couche intègre de l’observabilité, de la sécurité et un mécanisme de boucle fermée entre évaluation, observation et exécution en temps réel. En contrôlant ces couches, CoreWeave peut réduire la latence d’accès aux données et optimiser le débit réseau, deux facteurs critiques pour l’inférence à grande échelle.

Économie des tokens et modèle de facturation

Les clients de CoreWeave privilégient désormais des contrats courts, du spot pricing et un accès à la demande. Selon Vellante, ces modèles sont « beaucoup plus chers » que les accords à long terme, mais les utilisateurs sont prêts à payer pour la flexibilité. Cette dynamique crée une nouvelle dimension économique où le coût d’un token dépend à la fois de la consommation d’énergie (tokens / watt) et du prix du service à la minute. Ainsi, la rentabilité ne repose plus uniquement sur le taux d’utilisation du GPU, mais sur l’efficacité globale du système.

Implications système et dépendance au silicium

John Furrier a souligné que, même si le silicium Nvidia reste le cœur matériel, la valeur commerciale se mesure désormais à la vitesse à laquelle l’ensemble du stack – processeur, réseau, stockage et logiciel – génère des tokens utiles. Cette approche « system‑level performance » transforme les data‑centers en environnements où chaque composant doit être calibré pour minimiser les pertes énergétiques. La disponibilité du GPU demeure un facteur, mais elle est intégrée dans une équation plus large où l’efficacité du réseau et la rapidité du stockage influencent directement le coût par token.