Cerebras CS-4 : 750 PFLOPs sur trois WSE-3 Turbo
Cerebras CS-4wafer-scaleинференс ИИ
Ce que Cerebras a intégré dans CS-4
À mes yeux, l'essentiel dans CS-4 n'est pas le chiffre de PFLOPs, mais la tentative de supprimer les transferts de poids entre la mémoire externe et les unités de calcul. CS-4 est un système en baie reposant sur trois wafers WSE-3 Turbo, et non un accélérateur autonome de plus. Sur la page produit CS-4 et dans son annonce de lancement, Cerebras évoque 750 PFLOPs de calcul IA.
Chaque wafer dispose de 44 Go de SRAM, dans laquelle l'architecture conserve les poids du modèle. La bande passante mémoire annoncée atteint 129,6 Po/s, tandis que le réseau interne à la puce est donné pour 160,5 Po/s. Pour les entrées-sorties système, les chiffres annoncés sont 7,2 Tb/s et 2 microsecondes de latence.
C'est là que le sujet devient intéressant : Cerebras revendique une inférence jusqu'à 30 fois plus rapide que sur des systèmes GPU. Dans une comparaison directe avec GPT-OSS-120B et des requêtes identiques, l'entreprise annonce plus de 4 400 tokens par seconde et par utilisateur. Il s'agit de données du fabricant issues des documents de lancement, pas d'une garantie universelle pour tous les modèles ou schémas de service.
Le prix du matériel n'est pas public. En août 2026, la page tarifaire ouverte de Cerebras concerne les services hébergés et les API, mais pas CS-4. Il est donc encore impossible de comparer honnêtement le coût total de possession et les performances avec un cluster GPU à partir des données publiées.
Pourquoi l'architecture compte davantage que le chiffre record
Si les résultats annoncés se confirment sur des charges réelles, CS-4 modifie d'abord l'architecture d'inférence des grands modèles. Au lieu de déplacer constamment les poids entre accélérateurs, le système mise sur leur présence directe dans la SRAM des wafers. Le gain devrait être le plus visible là où la latence mémoire importe davantage que la puissance de calcul nominale.
Je vérifierais d'abord non pas la vitesse de pointe, mais la stabilité des résultats selon la longueur des requêtes, le traitement par lots et le nombre d'utilisateurs simultanés. La prise en charge des modèles, l'intégration logicielle et le coût réel d'exploitation restent aussi à éclaircir. L'annonce d'un gain pouvant atteindre 30 fois est forte, mais sans méthodologie identique ni prix, elle ne montre qu'une partie du tableau.
Le principal atout de CS-4 est aussi son risque majeur : l'architecture spécialisée wafer-scale doit démontrer son avantage non lors d'une démonstration unique, mais dans le service quotidien des modèles. C'est là qu'on verra s'il s'agit d'une nouvelle classe d'infrastructure ou d'un outil très rapide, mais étroitement spécialisé.