2 мин чтения

Qwen3.8-Flash-Next: 50–60 токенов/с на двух GPU

Qwen3.8-Flash-NextStrataлокальный инференс

Пользователь 122159126 сообщил, что Qwen3.8-Flash-Next в Strata выдаёт 50–60 токенов/с на домашнем сервере с RTX PRO 2000 Blackwell 16 ГБ и RTX A2000 12 ГБ. Результат показывает потенциал локального MoE-инференса на смешанных GPU, но пока остаётся единичным отчётом без независимого воспроизведения.

Что именно показал домашний запуск

Меня здесь цепляет заявленная скорость: в публикации пользователя 122159126 модель Qwen3.8-Flash-Next на движке Strata выдаёт 50–60 токенов/с. Конфигурация необычная: RTX PRO 2000 Blackwell с 16 ГБ и RTX A2000 с 12 ГБ в одном домашнем сервере. Это реальный пользовательский отчёт, но не независимо воспроизведённый тест.

По официальным материалам Qwen, это MoE-модель на 125 млрд параметров, у которой для каждого токена активируются 6 млрд. Разреженная архитектура и объясняет, почему такой масштаб вообще можно обсуждать применительно к локальной машине. Материалы сообщества Strata описывают движок как решение для локального инференса с распределением нагрузки между GPU, системной памятью и CPU.

У Qwen3.8-Flash-Next есть ещё одна тяжёлая характеристика: нативный контекст составляет 262 144 токена, а с YaRN заявлено расширение до 1 000 000. Однако контекст конкретного запуска не указан, поэтому переносить результат 50–60 токенов/с на длинные диалоги нельзя. Скорость на коротком запросе и при заполненном контексте может отличаться весьма заметно.

Главный пробел отчёта находится не в цифре, а вокруг неё. В доступном описании нет параметров квантования, объёма системной памяти, схемы распределения модели и данных о загрузке PCIe. Также неясно, измерялась ли только генерация или в результат попала обработка промпта.

Почему смешанная пара GPU здесь интереснее модели

Для меня вывод простой: локальный запуск крупной MoE-модели на неоднородных GPU уже выглядит не трюком, а технически правдоподобной конфигурацией. Один ускоритель здесь заметно новее другого, однако Strata, судя по отчёту, смог использовать эту связку без провала до единиц токенов в секунду.

Выигрывают прежде всего локальные экспериментаторы, которым важны контроль данных и отсутствие удалённого API. Но единичный результат ещё не превращается в универсальный ориентир: производительность будет зависеть от квантования, контекста, системной памяти и накладных расходов между устройствами.

На 30 сентября 2026 года широкого набора независимых тестов Strata для этой точной пары GPU нет. Поэтому 50–60 токенов/с я воспринимаю как сильный сигнал, но не как обещание, которое автоматически повторится на соседнем столе.

Ранее мы рассказывали о Rust LocalGPT — локальном ассистенте в виде одного бинарного файла, созданном для практического развёртывания на устройстве. Его подход к локальному инференсу полезен при оценке производительности Qwen3.8-Flash-Next в движке Strata.