Contexte et approche wafer‑scale

Cerebras Systems, fondée en 2015 par Andrew Feldman, a choisi de rompre avec la pratique classique qui consiste à découper une tranche de silicium en puces individuelles. La société a développé un processeur construit directement sur la tranche entière, une architecture dite wafer‑scale conçue pour les charges de travail d’intelligence artificielle les plus exigeantes. Cette approche élimine les limites de bande passante entre puces et réduit la latence interne, deux facteurs qui freinent les modèles de grande taille. Le dernier modèle, le CS‑4, présenté en août 2026, incarne la quatrième génération de cette technologie et confirme la capacité de Cerebras à livrer des systèmes d’inférence et d’entraînement à l’échelle du datacenter.

Capacités de production et engagements énergétiques

Lors de son introduction en bourse en mai 2026, Cerebras a levé 5,5 milliards de dollars, ce qui a financé une expansion massive de ses lignes de fabrication. L’entreprise affirme disposer de plus de 600 MW de capacité de datacenter, déjà en service ou sous contrat pour fin 2027, et prévoit d’accroître sa capacité de production de plus de dix fois au cours de l’année 2026. Un accord pluriannuel avec OpenAI prévoit le déploiement de 750 MW de systèmes Cerebras entre 2026 et 2028, illustrant la confiance d’un acteur majeur de l’IA dans la solution wafer‑scale. Par ailleurs, Cerebras a annoncé le lancement de son premier centre de données européen en 2026, avec un objectif de 200 MW d’ici à la fin 2027, afin de réduire la distance physique entre les serveurs et les utilisateurs européens.

Analyse des limites d’infrastructure

Le simple fait d’augmenter la puissance de calcul ne suffit pas à garantir la progression de l’IA. Les systèmes wafer‑scale requièrent des installations de refroidissement spécialisées, une alimentation électrique stable et une chaîne d’approvisionnement capable de produire des tranches de silicium sans défauts. Cerebras indique que la fabrication de wafers complets augmente la probabilité de défauts, ce qui impose des contrôles de qualité plus stricts et un coût de rebut plus élevé. De plus, la consommation énergétique de 750 MW à 600 MW de capacité installée représente une charge importante pour les réseaux électriques, surtout dans les régions où la capacité de production d’énergie renouvelable est limitée. Enfin, la concentration de milliers de cœurs sur une même tranche rend la maintenance physique plus complexe : un défaut matériel peut affecter l’ensemble du système, contrairement à une architecture à puces multiples où les pièces défectueuses peuvent être remplacées individuellement.

Perspectives pour l’avenir de l’IA

Si les contraintes d’énergie et de fabrication sont maîtrisées, le wafer‑scale pourrait repousser la barrière de taille des modèles d’IA sans recourir à des agrégats de puces traditionnels. Cependant, la viabilité à long terme dépendra de l’évolution des technologies de refroidissement, de la disponibilité d’énergie à faible coût et de la capacité des fonderies à livrer des wafers exempts de défauts à grande échelle. Les engagements de Cerebras avec OpenAI et son expansion européenne suggèrent une stratégie visant à diversifier les sources d’énergie et à rapprocher les infrastructures des utilisateurs finaux. En définitive, la solution wafer‑scale représente une alternative crédible aux architectures fragmentées, à condition que les défis d’infrastructure soient résolus de façon cohérente.