2 мин чтения

10 млн токенов в секунду: рекорд или подмена метрики

инференсLLMбенчмарки

Заявление о 10 миллионах токенов в секунду не означает, что одна модель выдает такой поток одному пользователю. По доступному контексту, речь, вероятнее всего, об агрегатном результате кластера, пакетной обработке или смешении throughput с метриками длинного контекста. Важны методика измерения, оборудование, задержка и стоимость.

Что скрывается за 10 миллионами токенов в секунду

Я бы не называл 10 млн токенов в секунду скоростью модели, пока не показано, что именно и как измеряли. Исходная точка истории — публикация Rysana в X, на которую сослался User 144406. В обсуждении закономерно возникли вопросы, а стоимость такой скорости даже сравнили с золотым слитком за миллион токенов.

Ключевая проблема здесь не в самом большом числе, а в знаменателе. Это может быть совокупная пропускная способность кластера при пакетной обработке, скорость prefill, обработка кэшированных состояний или decode одного запроса. Для пользователя эти режимы выглядят совершенно по-разному, хотя маркетинговая единица у них одна: токены в секунду.

Есть и показательная путаница с длинным контекстом. В материале Lightbits и Inferra заявлена поддержка контекста на 10 млн токенов на оборудовании L40S, но приведенный результат относится к time-to-first-token: 26 секунд против 8,3 часа. Это сильное ускорение конкретного этапа, а не генерация 10 млн новых токенов каждую секунду.

Для масштаба полезна страница бенчмарка NVIDIA. Там для DeepSeek R1 на системе Vera Rubin NVL72 указано 1 183 327 токенов в секунду. Число огромное, но оно относится к специализированной многопроцессорной системе и все равно заметно ниже обсуждаемых 10 млн.

Почему такой рекорд пока мало говорит о реальной работе

Без конфигурации оборудования, размера батча и разделения prefill и decode этот рекорд нельзя перенести на обычный API-запрос. На 30 сентября 2026 года доступный контекст не показывает, что речь идет об одной модели, выдающей 10 млн выходных токенов в секунду одному пользователю.

Инженерно здесь важны три вещи: задержка первого токена, стабильная скорость продолжения и стоимость обработки. Агрегатный throughput может быть отличным показателем загрузки кластера, но одновременно ничего не сказать о задержке отдельной сессии. Чем крупнее батч, тем эффектнее итоговая цифра и тем слабее ее связь с интерактивным использованием.

Мой вывод простой: это не обязательно фальшивый результат, но пока точно неоднозначная формулировка. В гонке инференса побеждает не тот, у кого больше число, а тот, кто честнее подписал оси графика.

Ранее мы разбирали, как сети конфиденциальных вычислений меняют стоимость и доступную мощность ИИ-инференса. Этот контекст помогает понять, что на практике потребовалось бы для заявлений о 10 миллионах токенов в секунду.