Cerebras CS-4: 750 PFLOPs на трьох WSE-3 Turbo
Cerebras CS-4wafer-scaleинференс ИИ
Що Cerebras зібрала в CS-4
Для мене головне в CS-4 — не цифра PFLOPs, а спроба прибрати перенесення ваг між зовнішньою пам’яттю та обчислювачами. CS-4 є стійковою системою на трьох пластинах WSE-3 Turbo, а не черговим окремим прискорювачем. На сторінці продукту CS-4 і в анонсі запуску Cerebras вказує 750 PFLOPs ШІ-обчислень.
Кожна пластина має 44 ГБ SRAM, де архітектура утримує ваги моделі. Заявлена пропускна здатність пам’яті становить 129,6 ПБ/с, а внутрішньокристальної мережі — 160,5 ПБ/с. Для системного введення-виведення вказано 7,2 Тбіт/с і затримку 2 мікросекунди.
Саме тут пропозиція стає цікавою: Cerebras заявляє до 30-разового прискорення інференсу порівняно із системами на GPU. У прямому порівнянні GPT-OSS-120B на однакових запитах компанія повідомляє про понад 4400 токенів за секунду на користувача. Це дані виробника з матеріалів запуску, а не універсальна гарантія для кожної моделі чи схеми обслуговування.
Ціну самого обладнання публічно не вказано. Станом на серпень 2026 року відкрита сторінка цін Cerebras стосується хостингових сервісів та API, а не CS-4. Тому чесно порівняти сукупну вартість володіння й продуктивність із GPU-кластером за опублікованими даними поки неможливо.
Чому архітектура важливіша за рекордну цифру
Якщо заявлені результати відтворюються на реальних навантаженнях, CS-4 насамперед змінює архітектуру інференсу великих моделей. Замість постійної боротьби з передаванням ваг між прискорювачами система робить ставку на їхнє розміщення безпосередньо в SRAM пластин. Виграш має проявитися там, де затримка пам’яті важливіша за номінальну обчислювальну потужність.
Я б насамперед перевіряв не пікову швидкість, а стабільність результату за різної довжини запитів, пакетної обробки та одночасних користувачів. Окремі питання викликають підтримка моделей, програмна інтеграція й реальна вартість експлуатації. Заголовок про прискорення до 30 разів звучить гучно, але без однакової методики та ціни він лишається лише частиною картини.
Найсильніша риса CS-4 водночас є головним ризиком: спеціалізована wafer-scale архітектура має довести перевагу не в одному показовому запуску, а в щоденному обслуговуванні моделей. Саме там стане зрозуміло, чи це новий клас інфраструктури, чи дуже швидкий, але вузький інструмент.