Contexte et partenariat
Dell Technologies et CoreWeave ont annoncé un partenariat centré sur la fiabilité de l’infrastructure IA. Selon Sarat Krishnan, directeur de l’architecture PowerEdge AI chez Dell, les deux équipes coordonnent le développement de systèmes rack‑scale dès les phases de conception, parfois plusieurs années avant la mise en production. Jacob Yundt, vice‑président de l’ingénierie chez CoreWeave, décrit ce travail comme une co‑ingénierie « tight », incluant la présence de Dell dans les usines de fabrication pour ajuster les produits en fonction des retours d’exploitation. Cette approche vise à réduire les écarts entre les prototypes et les déploiements réels.
Architecture modulaire et diagnostics anticipés
Les nouvelles plateformes adoptent une architecture modulaire capable de s’adapter aux exigences de refroidissement provenant du haut ou du bas du rack, ainsi qu’aux différents calibres de câbles d’alimentation. Dell ajuste les paramètres du firmware et les modifications mécaniques avant l’arrivée du premier rack sur site. L’objectif déclaré est de « push risk to the left », c’est‑à‑dire de déplacer les diagnostics les plus complexes vers les étapes de fabrication, où la détection d’une défaillance matérielle coûte nettement moins cher que son remplacement en centre de données. Cette stratégie repose sur des tests de diagnostic intégrés au niveau du serveur et du rack.
Gestion du refroidissement liquide et détection de fuites
CoreWeave intègre son gestionnaire de rack, nommé Racky, qui consolide la télémétrie d’alimentation, de température et d’humidité dans une interface unique. Dell utilise ces données pour valider les systèmes avant expédition depuis ses usines L11. Un point d’attention majeur est la détection de fuites de liquide de refroidissement, jugée potentiellement catastrophique. Le partenariat a conduit à la mise au point de mécanismes de détection de fuites plus sensibles, permettant d’identifier rapidement toute perte de liquide et d’activer des procédures d’arrêt d’urgence.
Implications pour les centres de données IA
Les systèmes Vera Rubin de Nvidia, déployés chez CoreWeave, illustrent la complexité croissante des piles IA, où les plateaux de calcul, les commutateurs, les DPUs et les tissus réseau doivent être synchronisés avec l’alimentation et le refroidissement du site. Yundt indique que la frontière du « computer » s’étend désormais du rack à la rangée, voire à l’ensemble du hall de données. Cette vision impose une intégration serrée entre le matériel, le logiciel de gestion et les infrastructures physiques, afin de garantir une disponibilité continue dans des charges de travail IA intensives.