Contexte du marché IA

Le passage du entraînement à l’inférence représente la phase la plus coûteuse pour les entreprises qui ont déjà investi dans des modèles d’apprentissage profond. Selon leCUBE Research, 86 % des entreprises placent l’unification des données avant la puissance de calcul, tandis que environ 30 % d’elles rencontrent un écart de préparation opérationnelle entre expérimentation et production. De plus, 88 % des projets pilotes d’IA n’atteignent pas la mise en production, ce qui crée une demande pour des infrastructures capables de réduire ces frictions.

Architecture full‑stack de CoreWeave

CoreWeave a validé le NVL72 de la plateforme Nvidia Vera Rubin sur son cloud, marquant la première mise en service d’une solution unifiée destinée aux charges de travail agentiques. La pile technique intègre le calcul GPU, le déplacement de données, l’orchestration d’infrastructure et les services d’observabilité dans un même environnement. Cette intégration permet de déployer des modèles d’inférence avec une latence réduite grâce à la proximité entre le stockage des jeux de données et les unités de traitement.

Le modèle d’orchestration repose sur des conteneurs spécialisés qui séparent les étapes de traitement : un petit modèle pré‑filtre les requêtes, puis un modèle plus lourd prend le relais pour les tâches complexes. Cette approche « pipeline » optimise l’utilisation des GPU tout en limitant le coût énergétique, car les ressources ne sont sollicitées que pour les phases nécessitant une puissance maximale.

Analyse des performances et de la tarification

Le partenariat avec Nvidia a permis à CoreWeave d’afficher un coût par million de tokens dix fois inférieur à celui des versions antérieures de Nvidia. Cette compression tarifaire provient de la combinaison d’une utilisation plus élevée des GPU (grâce à la répartition dynamique des charges) et d’une facturation basée sur la consommation réelle de tokens plutôt que sur la capacité provisionnée. Le résultat est une meilleure économie de token pour les clients qui exécutent des modèles à grande échelle.

En termes de capacité, CoreWeave revendique une utilisation plus élevée des ressources et un accès plus rapide aux GPU, ce qui réduit le temps d’attente pour les charges de travail critiques. La plateforme fournit également des outils de gouvernance et de sécurité intégrés, indispensables pour les déploiements d’IA agentique où le code généré doit être contrôlé en temps réel.

Enjeux d’opérationnalisation et limites

Malgré ces avancées, la transition vers une infrastructure full‑stack ne supprime pas les défis liés à la maturité des processus internes. Le écart de préparation opérationnelle de 30 % indique que de nombreuses organisations doivent encore harmoniser leurs pipelines de données, leurs pratiques de CI/CD et leurs politiques de conformité avant de tirer pleinement parti de la solution de CoreWeave.

De plus, la dépendance à une plateforme propriétaire peut limiter la portabilité des charges de travail vers d’autres clouds. Les entreprises devront évaluer le risque de verrouillage technologique, notamment si les futures versions de Vera Rubin introduisent des exigences matérielles incompatibles avec leurs investissements existants.