Contexte et objectifs
Face à la nécessité de réduire les temps d’attente entre les cycles de formation, CoreWeave a annoncé le lancement de CoreWeave Forge, une plateforme full‑stack destinée à gérer le cycle de vie complet des agents IA. La plateforme vise à maintenir un taux d’occupation GPU élevé pendant les phases de post‑entraînement, phase où les modèles sont réévalués et ajustés à partir de nouvelles données.
Architecture de CoreWeave Forge
Forge intègre trois fonctions principales : le déploiement du modèle, l’évaluation des réponses générées et l’amélioration via l’apprentissage par renforcement (RL Rollouts). La capacité de weight synchronization a été repensée : au lieu de charger les poids depuis un stockage d’objets à chaque itération (cold start), le système récupère les poids depuis des nœuds voisins, ce qui constitue un « hot start ». Cette approche réduit le temps de chargement des paramètres et limite les accès réseau répétés.
Mécanismes d’optimisation GPU
CoreWeave AI Object Storage a été étendu pour accepter les écritures inter‑régionales. Ainsi, les résultats d’un job de post‑entraînement sont immédiatement disponibles pour d’autres jobs, évitant les latences liées à la réplication distante. Les développeurs peuvent écrire dans le stockage comme sur une machine locale, alors que le système le traite comme un dispositif global, ce qui minimise les déplacements de données vers le GPU. En partenariat avec You.com, les agents intègrent un moteur de recherche web qui alimente les prompts pendant les rollouts, augmentant la pertinence des réponses générées.
Évaluation et limites
Lors d’une démonstration, les deux sociétés ont utilisé les RL Rollouts pour post‑entraîner le modèle Nemotron 3.5 Lightning en huit heures, un délai que les équipes de recherche avancée considèrent habituellement comme réservé aux laboratoires de pointe. Selon les intervenants, cette réduction de temps se traduit par une amélioration de la précision et une baisse du coût total de possession (TCO). Toutefois, la présentation ne fournit pas de métriques chiffrées sur le gain d’utilisation GPU ni sur la scalabilité inter‑régionale du stockage, ce qui limite l’évaluation quantitative de l’impact réel.