2 мин чтения

Cerebras CS-4: 750 PFLOPs на трех WSE-3 Turbo

Cerebras CS-4wafer-scaleинференс ИИ

Cerebras представила CS-4 — стоечную систему из трех пластин WSE-3 Turbo с заявленной производительностью 750 PFLOPs. Для GPT-OSS-120B компания сообщает скорость свыше 4400 токенов в секунду на пользователя. Главная особенность — хранение весов модели в SRAM на пластине, что уменьшает обмен с внешней памятью.

Что Cerebras собрала в CS-4

Для меня главное в CS-4 не цифра PFLOPs, а попытка убрать перенос весов между внешней памятью и вычислителями. CS-4 представляет собой стоечную систему на трех пластинах WSE-3 Turbo, а не очередной отдельный ускоритель. На странице продукта CS-4 и в анонсе запуска Cerebras указывает 750 PFLOPs ИИ-вычислений.

Каждая пластина получила 44 ГБ SRAM, где архитектура удерживает веса модели. Заявленная пропускная способность памяти составляет 129,6 ПБ/с, а внутрикристальной сети — 160,5 ПБ/с. Для системного ввода-вывода указаны 7,2 Тбит/с и задержка 2 микросекунды.

И вот тут стало интересно: Cerebras заявляет до 30-кратного ускорения инференса относительно систем на GPU. В прямом сравнении GPT-OSS-120B на одинаковых запросах компания сообщает о результате свыше 4400 токенов в секунду на пользователя. Это данные производителя из материалов запуска, а не универсальная гарантия для любой модели и схемы обслуживания.

Цена самого оборудования публично не указана. По состоянию на август 2026 года открытая страница цен Cerebras относится к размещенным сервисам и API, но не к CS-4. Поэтому честно сравнить стоимость владения и производительность с GPU-кластером по опубликованным данным пока нельзя.

Почему архитектура важнее рекордной цифры

Если заявленные результаты воспроизводятся на реальных нагрузках, CS-4 меняет прежде всего архитектуру инференса больших моделей. Вместо постоянной борьбы с передачей весов между ускорителями система делает ставку на их размещение непосредственно в SRAM пластин. Выигрыш должен проявляться там, где задержка памяти важнее номинальной вычислительной мощности.

Я бы первым делом проверял не пиковую скорость, а устойчивость результата при разных длинах запросов, пакетной обработке и одновременных пользователях. Отдельные вопросы вызывают поддержка моделей, программная интеграция и реальная стоимость эксплуатации. Заголовок про ускорение до 30 раз звучит громко, но без одинаковой методики и цены он остается лишь частью картины.

Самое сильное место CS-4 одновременно является главным риском: специализированная wafer-scale архитектура должна доказать преимущество не в одном показательном прогоне, а в повседневном обслуживании моделей. Именно там станет ясно, это новый класс инфраструктуры или очень быстрый, но узкий инструмент.

Мы ранее разбирали Cocoon — инфраструктуру конфиденциальных вычислений, которая меняет экономику и требования к приватности ИИ-инференса. На фоне wafer-scale подхода Cerebras это помогает сравнить разные пути масштабирования вычислений для моделей.