Contexte et enjeux
Volantis a levé 88 millions de dollars lors d’une levée de fonds Series A, menée par Lachy Groom et Abstract Ventures, avec la participation de John Doerr et de l’ancien responsable IA d’Intel, Naveen Rao. Cette enveloppe financière vise à créer une architecture d’inférence optimisée pour les modèles d’IA de très grande taille, où la bande passante mémoire constitue le principal goulet d’étranglement. Les ingénieurs de la société, issus de Nvidia et Broadcom, ont déjà réalisé la première implémentation commerciale de CoWoS, un interconnect largement utilisé dans les GPU haut de gamme.
Architecture photoniques et interconnects
Le cœur du projet repose sur un interconnect optique basé sur des VCSEL (Vertical‑Cavity Surface‑Emitting Lasers). Chaque VCSEL intègre un puits quantique qui convertit l’énergie électrique du puce en photons, puis deux miroirs qui amplifient le faisceau lumineux. Cette technologie, moins coûteuse que les lasers traditionnels et compatible avec le gallium‑arséniure, permet d’allonger la portée des liaisons de 5 mm (limite des fils métalliques classiques) à plus de 200 mm. En pratique, cela autorise l’intégration de plus de 220 chiplets mémoire sur un même accélérateur, contre une dizaine au maximum dans les architectures GPU actuelles.
Performances annoncées et limites
Volantis affirme que son interconnect offre plus de 30 fois la bande passante mémoire des accélérateurs contemporains. Le système A‑1, destiné aux data‑centers, occupe un tiers d’une baie serveur standard, intègre 10 TB de mémoire et délivre 250 Tb/s de bande passante. Selon les calculs internes, il pourrait traiter jusqu’à 10 000 tokens/s avec un modèle de 20 trillions de paramètres, soit une latence de l’ordre de 30 secondes pour une tâche de codage qui prendrait 30 minutes sur du matériel classique. Toutefois, ces chiffres reposent sur des estimations internes ; aucune mesure indépendante n’a encore été publiée. De plus, la dépendance à la technologie VCSEL impose des contraintes de température et de consommation d’énergie qui ne sont pas détaillées dans le communiqué.
Perspectives d'adoption
Le lancement commercial de l’A‑1 est prévu pour l’an prochain, ciblant les charges de travail d’inférence à grande échelle où la latence et le débit mémoire sont critiques. Si les promesses de bande passante se confirment, les architectures photoniques pourraient remettre en cause la dominance des GPU traditionnels dans les data‑centers. Néanmoins, l’adoption dépendra de la capacité des fournisseurs à intégrer ces interconnects dans les flux de fabrication existants, ainsi que de la disponibilité de logiciels capables d’exploiter efficacement la topologie à 220 chiplets. En l’absence de benchmarks publics, les opérateurs devront évaluer le rapport coût‑performance avant de remplacer leurs infrastructures actuelles.