10 млн токенов в секунду: рекорд или подмена метрики
инференсLLMбенчмарки
Что скрывается за 10 миллионами токенов в секунду
Я бы не называл 10 млн токенов в секунду скоростью модели, пока не показано, что именно и как измеряли. Исходная точка истории — публикация Rysana в X, на которую сослался User 144406. В обсуждении закономерно возникли вопросы, а стоимость такой скорости даже сравнили с золотым слитком за миллион токенов.
Ключевая проблема здесь не в самом большом числе, а в знаменателе. Это может быть совокупная пропускная способность кластера при пакетной обработке, скорость prefill, обработка кэшированных состояний или decode одного запроса. Для пользователя эти режимы выглядят совершенно по-разному, хотя маркетинговая единица у них одна: токены в секунду.
Есть и показательная путаница с длинным контекстом. В материале Lightbits и Inferra заявлена поддержка контекста на 10 млн токенов на оборудовании L40S, но приведенный результат относится к time-to-first-token: 26 секунд против 8,3 часа. Это сильное ускорение конкретного этапа, а не генерация 10 млн новых токенов каждую секунду.
Для масштаба полезна страница бенчмарка NVIDIA. Там для DeepSeek R1 на системе Vera Rubin NVL72 указано 1 183 327 токенов в секунду. Число огромное, но оно относится к специализированной многопроцессорной системе и все равно заметно ниже обсуждаемых 10 млн.
Почему такой рекорд пока мало говорит о реальной работе
Без конфигурации оборудования, размера батча и разделения prefill и decode этот рекорд нельзя перенести на обычный API-запрос. На 30 сентября 2026 года доступный контекст не показывает, что речь идет об одной модели, выдающей 10 млн выходных токенов в секунду одному пользователю.
Инженерно здесь важны три вещи: задержка первого токена, стабильная скорость продолжения и стоимость обработки. Агрегатный throughput может быть отличным показателем загрузки кластера, но одновременно ничего не сказать о задержке отдельной сессии. Чем крупнее батч, тем эффектнее итоговая цифра и тем слабее ее связь с интерактивным использованием.
Мой вывод простой: это не обязательно фальшивый результат, но пока точно неоднозначная формулировка. В гонке инференса побеждает не тот, у кого больше число, а тот, кто честнее подписал оси графика.