Contexte et objectifs
Le projet Devin de Cognition AI Inc. vise à couvrir l’ensemble du cycle de vie logiciel, de la planification à la résolution d’incidents en production. Selon Silas Alberti, responsable recherche, les agents fonctionnent en mode « always‑on » : chaque exécution génère des données qui alimentent immédiatement la phase d’entraînement. L’objectif déclaré est de maintenir un flux permanent d’observations, de récompenses et de mises à jour de modèle afin d’améliorer les performances sans interruption de service.
Architecture de l’infrastructure continue
L’infrastructure repose sur un réseau distribué de milliers de GPU situés dans plusieurs centres de données internationaux. Alberti indique que la perte d’une réplique entraîne l’arrêt complet d’un entraînement, d’où la cible de 99,99 % de disponibilité. La plateforme utilise le matériel Nvidia Vera Rubin en accès anticipé, ce qui permet d’observer les kernels et d’ajuster les architectures de modèle pour optimiser le ratio prix‑performance à chaque génération.
Mécanismes de fiabilité et d’apprentissage
Le couplage étroit entre entraînement et inférence repose sur des charges de travail de renforcement (reinforcement learning). Chaque itération produit un signal de récompense qui alimente le prochain cycle d’entraînement. La fiabilité est assurée par la réplication synchronisée des checkpoints et par le monitoring en temps réel des GPU. En cas de défaillance, le système redirige les tâches vers des nœuds sains, préservant ainsi la continuité du processus d’apprentissage.
Rôle de CoreWeave Forge
CoreWeave Forge complète l’écosystème en offrant des services dédiés aux boucles d’apprentissage. Le composant Agent Lens trace l’activité des agents, tandis que le service RL Rollouts injecte des checkpoints mis à jour dans les déploiements en cours sans redéploiement complet. Cette capacité de « hot‑load » permet à Devin de réagir à un incident de production, de générer un pull request et de le proposer pour fusion dès le lendemain, tout en continuant à s’entraîner sur les nouvelles données collectées. Le modèle de déploiement serverless facilite le démarrage rapide, puis l’évolution progressive vers des entraînements distribués à grande échelle.