Qwen3.8-Flash-Next: 50–60 токенов/с на двух GPU
Qwen3.8-Flash-NextStrataлокальный инференс
Что именно показал домашний запуск
Меня здесь цепляет заявленная скорость: в публикации пользователя 122159126 модель Qwen3.8-Flash-Next на движке Strata выдаёт 50–60 токенов/с. Конфигурация необычная: RTX PRO 2000 Blackwell с 16 ГБ и RTX A2000 с 12 ГБ в одном домашнем сервере. Это реальный пользовательский отчёт, но не независимо воспроизведённый тест.
По официальным материалам Qwen, это MoE-модель на 125 млрд параметров, у которой для каждого токена активируются 6 млрд. Разреженная архитектура и объясняет, почему такой масштаб вообще можно обсуждать применительно к локальной машине. Материалы сообщества Strata описывают движок как решение для локального инференса с распределением нагрузки между GPU, системной памятью и CPU.
У Qwen3.8-Flash-Next есть ещё одна тяжёлая характеристика: нативный контекст составляет 262 144 токена, а с YaRN заявлено расширение до 1 000 000. Однако контекст конкретного запуска не указан, поэтому переносить результат 50–60 токенов/с на длинные диалоги нельзя. Скорость на коротком запросе и при заполненном контексте может отличаться весьма заметно.
Главный пробел отчёта находится не в цифре, а вокруг неё. В доступном описании нет параметров квантования, объёма системной памяти, схемы распределения модели и данных о загрузке PCIe. Также неясно, измерялась ли только генерация или в результат попала обработка промпта.
Почему смешанная пара GPU здесь интереснее модели
Для меня вывод простой: локальный запуск крупной MoE-модели на неоднородных GPU уже выглядит не трюком, а технически правдоподобной конфигурацией. Один ускоритель здесь заметно новее другого, однако Strata, судя по отчёту, смог использовать эту связку без провала до единиц токенов в секунду.
Выигрывают прежде всего локальные экспериментаторы, которым важны контроль данных и отсутствие удалённого API. Но единичный результат ещё не превращается в универсальный ориентир: производительность будет зависеть от квантования, контекста, системной памяти и накладных расходов между устройствами.
На 30 сентября 2026 года широкого набора независимых тестов Strata для этой точной пары GPU нет. Поэтому 50–60 токенов/с я воспринимаю как сильный сигнал, но не как обещание, которое автоматически повторится на соседнем столе.