2 хв читання

gpt-oss-120B видає 3000 токенів/с на Cerebras

gpt-oss-120BCerebrasинференс LLM

Для gpt-oss-120B на інфраструктурі Cerebras заявлено близько 3000 токенів за секунду в потоковому режимі з контекстом 128k. Це не універсальна характеристика моделі, а результат спеціалізованого стеку інференсу. Для ШІ-агентів така пропускна здатність скорочує паузи між міркуванням, викликами інструментів і наступною дією.

Звідки взялася цифра 3000 токенів за секунду

Варто одразу відокремити модель від машини: близько 3000 токенів/с заявлено для gpt-oss-120B саме на інфраструктурі Cerebras. Це результат конкретного розгортання, а не швидкість, яку модель автоматично покаже на будь-якому сервері. На час анонсу Cerebras наводила цей показник у документації з інференсу, зокрема для потокової роботи з повним контекстом 128k.

OpenAI описує gpt-oss-120B у публікації про запуск як MoE-модель зі 120 мільярдами параметрів. Вона має 36 шарів і 128 експертів у кожному шарі, але для одного токена активуються лише чотири експерти. Така розрідженість зменшує обсяг обчислень порівняно зі щільною моделлю аналогічного загального розміру.

Інша частина історії пов'язана із залізом. Cerebras пояснює прискорення wafer-scale архітектурою, що усуває типові обмеження пропускної здатності пам'яті GPU та накладні витрати на обмін між прискорювачами. Саме тут цифра стає цікавою: це не просто оптимізований чекпойнт, а модель разом зі спеціалізованим стеком інференсу.

Для масштабу: у наведених незалежних результатах пікова швидкість gpt-oss-120B становила приблизно 511 токенів/с на одному H100 і 849 токенів/с на одному H200. Це порівняння не доводить перевагу в усіх режимах, проте добре показує залежність результату від обладнання. Окремо варто дивитися на час до першого токена, довжину входу, паралельні запити та сталу, а не пікову пропускну здатність.

Чому агенти відчують різницю першими

Головна зміна проста: генерація перестає бути найповільнішою ланкою агентного циклу. Коли модель швидко видає міркування або команду, агент раніше переходить до пошуку, виконання коду чи наступного виклику інструмента. Ефект особливо помітний у довгих ланцюжках, де невелика затримка повторюється багато разів.

Це робить реалістичнішими інтерактивних помічників для коду, швидкий аналіз документів і дослідницькі ланцюжки з кількома кроками. Довгий контекст теж стає практичнішим: недостатньо підтримувати 128k, якщо користувачеві доводиться чекати генерації після великого входу.

Проте 3000 токенів/с нічого не кажуть про якість міркувань, вартість запиту та поведінку під навантаженням. Якщо зростає час до першого токена або конкуренція між сесіями, гарна пікова цифра швидко втрачає магію. Справжній рубіж тут — не рекорд швидкості, а здатність утримувати її в реальному агентному контурі.

Раніше ми розглядали, як конфігурації Claude Opus 4.6 впливають на вартість контексту та практичну архітектуру моделей. Цей ракурс допомагає оцінити модель на 120 млрд параметрів, що видає 3000 токенів за секунду, не лише за гучним показником швидкості.