2 хв читання

Cerebras CS-4: 750 PFLOPs на трьох WSE-3 Turbo

Cerebras CS-4wafer-scaleинференс ИИ

Cerebras представила CS-4 — стійкову систему з трьох пластин WSE-3 Turbo із заявленою продуктивністю 750 PFLOPs. Для GPT-OSS-120B компанія повідомляє понад 4400 токенів за секунду на користувача. Ключова особливість — зберігання ваг моделі в SRAM на пластині, що зменшує обмін із зовнішньою пам’яттю.

Що Cerebras зібрала в CS-4

Для мене головне в CS-4 — не цифра PFLOPs, а спроба прибрати перенесення ваг між зовнішньою пам’яттю та обчислювачами. CS-4 є стійковою системою на трьох пластинах WSE-3 Turbo, а не черговим окремим прискорювачем. На сторінці продукту CS-4 і в анонсі запуску Cerebras вказує 750 PFLOPs ШІ-обчислень.

Кожна пластина має 44 ГБ SRAM, де архітектура утримує ваги моделі. Заявлена пропускна здатність пам’яті становить 129,6 ПБ/с, а внутрішньокристальної мережі — 160,5 ПБ/с. Для системного введення-виведення вказано 7,2 Тбіт/с і затримку 2 мікросекунди.

Саме тут пропозиція стає цікавою: Cerebras заявляє до 30-разового прискорення інференсу порівняно із системами на GPU. У прямому порівнянні GPT-OSS-120B на однакових запитах компанія повідомляє про понад 4400 токенів за секунду на користувача. Це дані виробника з матеріалів запуску, а не універсальна гарантія для кожної моделі чи схеми обслуговування.

Ціну самого обладнання публічно не вказано. Станом на серпень 2026 року відкрита сторінка цін Cerebras стосується хостингових сервісів та API, а не CS-4. Тому чесно порівняти сукупну вартість володіння й продуктивність із GPU-кластером за опублікованими даними поки неможливо.

Чому архітектура важливіша за рекордну цифру

Якщо заявлені результати відтворюються на реальних навантаженнях, CS-4 насамперед змінює архітектуру інференсу великих моделей. Замість постійної боротьби з передаванням ваг між прискорювачами система робить ставку на їхнє розміщення безпосередньо в SRAM пластин. Виграш має проявитися там, де затримка пам’яті важливіша за номінальну обчислювальну потужність.

Я б насамперед перевіряв не пікову швидкість, а стабільність результату за різної довжини запитів, пакетної обробки та одночасних користувачів. Окремі питання викликають підтримка моделей, програмна інтеграція й реальна вартість експлуатації. Заголовок про прискорення до 30 разів звучить гучно, але без однакової методики та ціни він лишається лише частиною картини.

Найсильніша риса CS-4 водночас є головним ризиком: спеціалізована wafer-scale архітектура має довести перевагу не в одному показовому запуску, а в щоденному обслуговуванні моделей. Саме там стане зрозуміло, чи це новий клас інфраструктури, чи дуже швидкий, але вузький інструмент.

Раніше ми розбирали Cocoon — інфраструктуру конфіденційних обчислень, яка змінює економіку та вимоги до приватності ШІ-інференсу. На тлі wafer-scale підходу Cerebras це допомагає порівняти різні шляхи масштабування обчислень для моделей.