Contexte et enjeux

Cornelis Networks, startup spécialisée dans les réseaux de centre de données pour l'IA, a levé 205 millions de dollars lors d’un tour mené par IAG Capital Partners. Ce financement vise à concurrencer des acteurs établis comme Cisco et Arista en proposant une architecture réseau capable de suivre la croissance des clusters de modèles d’IA.

Les concepteurs soulignent que les réseaux actuels, qui représentent environ 15 % du coût total d’un système IA, fonctionnent comme des tuyaux passifs. Cette inertie oblige les accélérateurs à rester inactifs pendant que les données les atteignent, ce qui limite l’utilisation effective des GPU à près de 50 % de leur capacité installée.

Architecture de l'Active Compute Fabric

L’Active Compute Fabric (ACF) intègre une unité de calcul programmable directement dans le tissu réseau. Elle repose sur des standards ouverts – Ethernet, UALink pour le scale‑up et Ultra Ethernet pour le scale‑out – ce qui permet de l’interfacer avec les architectures existantes sans modification majeure du matériel.

Grâce à cette intégration, le réseau exécute des opérations spécifiques aux charges IA pendant le transit des paquets : assemblage de caches KV pour l’inférence désagrégée, dispatch d’experts dans les modèles mixture‑of‑experts, accélération d’AllReduce et compression de gradients. Le résultat partiel est ainsi produit avant d’atteindre la destination finale.

Le transport reste lossless et la logique programmable s’ajuste en temps réel aux variations de charge. En déchargeant les opérations collectives du processeur, l’ACF libère des cycles d’accélérateur qui seraient autrement consommés par la synchronisation et le transfert de données.

Performances et limites

Les simulations pré‑production de Cornelis indiquent une réduction du trafic réseau pouvant atteindre 50 %. Cette diminution se traduit par une latence moindre et une utilisation accrue des GPU, surtout dans les grands clusters où les opérations de synchronisation dominent les temps d’exécution.

Le gain réel dépend du modèle d’IA, de la taille du cluster et de la pile logicielle du client. Ainsi, si certains scénarios voient une amélioration de l’efficacité de 30 % à 45 %, d’autres pourraient n’enregistrer que des bénéfices modestes.

Les performances annoncées reposent sur des environnements de test contrôlés. Leur validation en production exigera le déploiement des commutateurs CN5000 et CN6000, ainsi que l’adoption généralisée des standards Ethernet/UALink par les fournisseurs de serveurs et d’accélérateurs.

Perspectives de déploiement

Le capital levé sera dédié à la mise à l’échelle de la production des commutateurs CN5000/CN6000 et à l’accélération du déploiement de l’ACF. La collaboration stratégique avec Qualcomm vise à co‑développer des solutions d’inférence rack‑scale, en alignant le réseau et les accélérateurs dès la conception.

En traitant le réseau comme une décision de conception de premier ordre, Cornelis espère redistribuer la part de coût du réseau au sein du système IA et améliorer le ratio performance/coût. La réussite dépendra toutefois de l’adhésion de l’écosystème à une architecture active, ainsi que de la capacité à intégrer l’ACF dans des environnements hétérogènes déjà en place.