Cerebras CS-4: 750 PFLOPs на трех WSE-3 Turbo
Cerebras CS-4wafer-scaleинференс ИИ
Что Cerebras собрала в CS-4
Для меня главное в CS-4 не цифра PFLOPs, а попытка убрать перенос весов между внешней памятью и вычислителями. CS-4 представляет собой стоечную систему на трех пластинах WSE-3 Turbo, а не очередной отдельный ускоритель. На странице продукта CS-4 и в анонсе запуска Cerebras указывает 750 PFLOPs ИИ-вычислений.
Каждая пластина получила 44 ГБ SRAM, где архитектура удерживает веса модели. Заявленная пропускная способность памяти составляет 129,6 ПБ/с, а внутрикристальной сети — 160,5 ПБ/с. Для системного ввода-вывода указаны 7,2 Тбит/с и задержка 2 микросекунды.
И вот тут стало интересно: Cerebras заявляет до 30-кратного ускорения инференса относительно систем на GPU. В прямом сравнении GPT-OSS-120B на одинаковых запросах компания сообщает о результате свыше 4400 токенов в секунду на пользователя. Это данные производителя из материалов запуска, а не универсальная гарантия для любой модели и схемы обслуживания.
Цена самого оборудования публично не указана. По состоянию на август 2026 года открытая страница цен Cerebras относится к размещенным сервисам и API, но не к CS-4. Поэтому честно сравнить стоимость владения и производительность с GPU-кластером по опубликованным данным пока нельзя.
Почему архитектура важнее рекордной цифры
Если заявленные результаты воспроизводятся на реальных нагрузках, CS-4 меняет прежде всего архитектуру инференса больших моделей. Вместо постоянной борьбы с передачей весов между ускорителями система делает ставку на их размещение непосредственно в SRAM пластин. Выигрыш должен проявляться там, где задержка памяти важнее номинальной вычислительной мощности.
Я бы первым делом проверял не пиковую скорость, а устойчивость результата при разных длинах запросов, пакетной обработке и одновременных пользователях. Отдельные вопросы вызывают поддержка моделей, программная интеграция и реальная стоимость эксплуатации. Заголовок про ускорение до 30 раз звучит громко, но без одинаковой методики и цены он остается лишь частью картины.
Самое сильное место CS-4 одновременно является главным риском: специализированная wafer-scale архитектура должна доказать преимущество не в одном показательном прогоне, а в повседневном обслуживании моделей. Именно там станет ясно, это новый класс инфраструктуры или очень быстрый, но узкий инструмент.