Contexte et besoin d’optimisation
Le volume d’inférences IA augmente rapidement. Une enquête menée par theCUBE Research auprès des clients de CoreWeave montre qu’un client du secteur de la santé est passé d’une part d’inférence d’environ 10 % la première année à 40 % la deuxième, avec une prévision de 50 % dans les douze prochains mois. Cette croissance crée un goulet d’étranglement qui ne dépend plus uniquement de la capacité brute des GPU, mais de la façon dont les couches logicielles au‑dessus sont gérées.
Architecture de Forge et optimisation des couches
Forge repose sur une pile logicielle où chaque niveau est ajusté. CoreWeave utilise le moteur vLLM pour la gestion des requêtes, applique la quantisation des modèles afin de réduire la taille des poids, et déploie des décodeurs spéculatifs personnalisés qui anticipent les tokens suivants. L’entreprise s’appuie sur des outils open source, contribue aux projets afin de préserver la flexibilité des clients, puis superpose ses services de formation, post‑formation et d’inférence. Cette approche « layer‑by‑layer » vise à réduire la latence et le coût sans modifier le matériel sous‑jacent.
RL Rollouts et gains de performance
Le nouveau module CoreWeave RL Rollouts s’appuie sur le framework Dynamo de Nvidia. Il charge les points de contrôle (checkpoints) de modèles entraînés en continu dans un déploiement actif. Les tests internes indiquent une amélioration du temps de rechargement des modèles de 15 fois par rapport à une configuration de référence. Cette accélération permet aux boucles d’apprentissage par renforcement – où chaque itération génère un nouveau checkpoint – de rester synchronisées avec le service d’inférence, évitant ainsi que l’entraînement ne devienne le facteur limitant.
Implications et limites
Forge est proposé avec une offre gratuite de démarrage ; les niveaux payants ajoutent des capacités supplémentaires, notamment un accès élargi aux outils d’observabilité et d’évaluation. La dépendance à l’écosystème Nvidia (GPU et Dynamo) implique que les gains de performance restent conditionnés à la disponibilité de ces composants matériels. De plus, la stratégie d’open source, bien que bénéfique pour la transparence, nécessite que les clients maintiennent une compatibilité avec les versions évolutives des bibliothèques tierces. Enfin, l’accent mis sur l’optimisation logicielle ne résout pas les limites physiques de bande passante réseau ou de stockage qui peuvent apparaître à très grande échelle.