Présentation de la solution

Cerebras et AMD ont annoncé un partenariat pour construire la solution d'inférence IA dégroupée la plus rapide au monde. Cette solution combine l'architecture Helios d'AMD pour la phase de pré-remplissage et le moteur Wafer-Scale Engine de Cerebras pour le décodage à latence ultra-faible.

Architecture technique

L'architecture de la solution est basée sur la logique suivante : la phase de pré-remplissage est intensive en calcul, mais gérable avec une infrastructure GPU optimisée comme Helios d'AMD. La phase de décodage est limitée par la bande passante mémoire. Le moteur Wafer-Scale Engine de Cerebras offre environ 2 000 fois la bande passante mémoire des GPU Nvidia, ce qui en fait une solution conçue pour le goulet d'étranglement du décodage qui limite l'inférence IA à grande échelle en production.

2 000 fois plus de bande passante mémoire que les GPU Nvidia

Avantages et applications

La solution offre un gain de 5 fois en termes de débit par watt par rapport aux solutions existantes. Les charges de travail qui nécessitent le plus cette solution sont la génération de code agentic, la voix en temps réel et la génération multimodale. Ces catégories nécessitent une vitesse de réponse élevée. Le gain de débit de 5 fois signifie que la même infrastructure peut servir un nombre considérablement plus élevé d'utilisateurs simultanés.

Implémentation et déploiement

Cerebras prévoit d'intégrer les systèmes Helios d'AMD dans ses propres centres de données d'ici la fin de l'année pour alimenter la couche de pré-remplissage. Cette partnership est à la fois une collaboration de produit et un engagement d'infrastructure de production. L'objectif est de fournir cette vitesse et cette intelligence maximale sans compromis à chaque développeur sur Terre.