gpt-oss-120B выдает 3000 токенов/с на Cerebras
gpt-oss-120BCerebrasинференс LLM
Откуда взялись 3000 токенов в секунду
Я бы сразу отделил модель от машины: около 3000 токенов/с заявлены для gpt-oss-120B именно на инфраструктуре Cerebras. Это результат конкретного размещения, а не скорость, которую модель автоматически покажет на любом сервере. На момент анонса Cerebras приводила этот показатель в документации по инференсу, включая потоковую работу с полным контекстом 128k.
Сама gpt-oss-120B описана OpenAI в публикации о запуске как MoE-модель на 120 миллиардов параметров. У нее 36 слоев и 128 экспертов в каждом слое, но для одного токена активируются четыре эксперта. Такая разреженность сокращает объем вычислений относительно плотной модели сопоставимого общего размера.
Вторая часть истории связана с железом. Cerebras объясняет ускорение wafer-scale архитектурой, которая убирает типичные ограничения пропускной способности памяти GPU и накладные расходы на обмен между ускорителями. И вот тут цифра становится интересной: это уже не просто оптимизированный чекпоинт, а модель вместе со специализированным инференс-стеком.
Для масштаба, в приведенных независимых результатах пиковая скорость gpt-oss-120B составляла примерно 511 токенов/с на одном H100 и 849 токенов/с на одном H200. Сравнение не доказывает превосходство во всех режимах, но хорошо показывает зависимость результата от оборудования. Я бы отдельно смотрел на время до первого токена, длину входа, параллельные запросы и устойчивую, а не пиковую пропускную способность.
Почему агенты почувствуют разницу первыми
Главное изменение простое: генерация перестает быть самым медленным звеном агентного цикла. Когда модель быстро выдает рассуждение или команду, агент раньше переходит к поиску, выполнению кода либо следующему вызову инструмента. Особенно заметен эффект в длинных цепочках, где небольшая задержка повторяется много раз.
Это делает реалистичнее интерактивных помощников для кода, быстрый разбор документов и исследовательские цепочки с несколькими шагами. Длинный контекст тоже становится практичнее: мало поддержать 128k, нужно еще не заставлять пользователя ждать генерацию после большого входа.
Но 3000 токенов/с не отвечают на вопрос о качестве рассуждений, стоимости запроса и поведении под нагрузкой. Если время до первого токена или конкуренция между сессиями растут, красивая пиковая цифра быстро теряет магию. Настоящий рубеж здесь не рекорд скорости, а способность удерживать ее внутри реального агентного контура.