2 мин чтения

gpt-oss-120B выдает 3000 токенов/с на Cerebras

gpt-oss-120BCerebrasинференс LLM

gpt-oss-120B на инфраструктуре Cerebras заявлен со скоростью около 3000 токенов в секунду при потоковой работе с контекстом 128k. Это не универсальная характеристика модели, а результат специализированного инференс-стека. Для ИИ-агентов такая пропускная способность сокращает паузы между рассуждением, вызовами инструментов и следующим действием.

Откуда взялись 3000 токенов в секунду

Я бы сразу отделил модель от машины: около 3000 токенов/с заявлены для gpt-oss-120B именно на инфраструктуре Cerebras. Это результат конкретного размещения, а не скорость, которую модель автоматически покажет на любом сервере. На момент анонса Cerebras приводила этот показатель в документации по инференсу, включая потоковую работу с полным контекстом 128k.

Сама gpt-oss-120B описана OpenAI в публикации о запуске как MoE-модель на 120 миллиардов параметров. У нее 36 слоев и 128 экспертов в каждом слое, но для одного токена активируются четыре эксперта. Такая разреженность сокращает объем вычислений относительно плотной модели сопоставимого общего размера.

Вторая часть истории связана с железом. Cerebras объясняет ускорение wafer-scale архитектурой, которая убирает типичные ограничения пропускной способности памяти GPU и накладные расходы на обмен между ускорителями. И вот тут цифра становится интересной: это уже не просто оптимизированный чекпоинт, а модель вместе со специализированным инференс-стеком.

Для масштаба, в приведенных независимых результатах пиковая скорость gpt-oss-120B составляла примерно 511 токенов/с на одном H100 и 849 токенов/с на одном H200. Сравнение не доказывает превосходство во всех режимах, но хорошо показывает зависимость результата от оборудования. Я бы отдельно смотрел на время до первого токена, длину входа, параллельные запросы и устойчивую, а не пиковую пропускную способность.

Почему агенты почувствуют разницу первыми

Главное изменение простое: генерация перестает быть самым медленным звеном агентного цикла. Когда модель быстро выдает рассуждение или команду, агент раньше переходит к поиску, выполнению кода либо следующему вызову инструмента. Особенно заметен эффект в длинных цепочках, где небольшая задержка повторяется много раз.

Это делает реалистичнее интерактивных помощников для кода, быстрый разбор документов и исследовательские цепочки с несколькими шагами. Длинный контекст тоже становится практичнее: мало поддержать 128k, нужно еще не заставлять пользователя ждать генерацию после большого входа.

Но 3000 токенов/с не отвечают на вопрос о качестве рассуждений, стоимости запроса и поведении под нагрузкой. Если время до первого токена или конкуренция между сессиями растут, красивая пиковая цифра быстро теряет магию. Настоящий рубеж здесь не рекорд скорости, а способность удерживать ее внутри реального агентного контура.

Ранее мы разбирали, как конфигурации Claude Opus 4.6 влияют на стоимость контекста и практическую архитектуру моделей. Этот взгляд помогает оценить модель на 120 млрд параметров, выдающую 3000 токенов в секунду, шире, чем по одной громкой цифре скорости.