Cerebras CS-4: 750 PFLOPs en tres WSE-3 Turbo
Cerebras CS-4wafer-scaleинференс ИИ
Qué ha reunido Cerebras en CS-4
Para mí, lo más relevante de CS-4 no es la cifra de PFLOPs, sino el intento de eliminar el traslado de pesos entre la memoria externa y los procesadores. CS-4 es un sistema de rack basado en tres wafers WSE-3 Turbo, no otro acelerador independiente. En la página del producto y en el anuncio de lanzamiento, Cerebras indica 750 PFLOPs de cómputo para IA.
Cada wafer incorpora 44 GB de SRAM, donde la arquitectura mantiene los pesos del modelo. El ancho de banda de memoria declarado es de 129,6 PB/s y el de la red interna del chip, de 160,5 PB/s. Para la entrada y salida del sistema se indican 7,2 Tb/s y una latencia de 2 microsegundos.
Aquí es donde la propuesta se vuelve interesante: Cerebras afirma lograr hasta 30 veces más velocidad de inferencia que los sistemas con GPU. En una comparación directa con GPT-OSS-120B y las mismas solicitudes, la empresa informa de más de 4.400 tokens por segundo por usuario. Son cifras del fabricante incluidas en los materiales de lanzamiento, no una garantía universal para cualquier modelo o configuración de servicio.
El precio del hardware no se ha publicado. En agosto de 2026, la página pública de precios de Cerebras se refiere a servicios alojados y API, no a CS-4. Por eso todavía no es posible comparar de forma honesta el coste total de propiedad y el rendimiento con un clúster de GPU a partir de datos públicos.
Por qué la arquitectura importa más que la cifra récord
Si los resultados declarados se reproducen en cargas reales, CS-4 cambia sobre todo la arquitectura de inferencia para modelos grandes. En lugar de luchar continuamente con la transferencia de pesos entre aceleradores, el sistema apuesta por mantenerlos directamente en la SRAM de los wafers. La ventaja debería aparecer donde la latencia de memoria importe más que la potencia de cálculo nominal.
Yo comprobaría primero no la velocidad máxima, sino la estabilidad del resultado con distintas longitudes de solicitud, procesamiento por lotes y usuarios simultáneos. También quedan dudas sobre el soporte de modelos, la integración de software y el coste operativo real. El titular de hasta 30 veces más rapidez suena potente, pero sin una metodología idéntica y sin precios solo muestra una parte del panorama.
La mayor fortaleza de CS-4 es al mismo tiempo su principal riesgo: la arquitectura especializada wafer-scale debe demostrar su ventaja no en una prueba llamativa, sino en el servicio diario de modelos. Ahí se verá si es una nueva clase de infraestructura o una herramienta muy rápida, pero limitada.