2 хв читання

Qwen3.8-Flash-Next: 50–60 токенів/с на двох GPU

Qwen3.8-Flash-NextStrataлокальный инференс

Користувач 122159126 повідомив, що Qwen3.8-Flash-Next у Strata досягла 50–60 токенів за секунду на домашньому сервері з RTX PRO 2000 Blackwell 16 ГБ та RTX A2000 12 ГБ. Це свідчить про потенціал локального MoE-інференсу на змішаних GPU, але результат поки не має незалежного відтворення.

Що саме показав домашній запуск

Найцікавіше тут — заявлена швидкість: у дописі користувача 122159126 модель Qwen3.8-Flash-Next на рушії Strata видає 50–60 токенів за секунду. Конфігурація незвична: RTX PRO 2000 Blackwell з 16 ГБ і RTX A2000 з 12 ГБ в одному домашньому сервері. Це реальний звіт користувача, але не незалежно відтворений тест.

Згідно з офіційними матеріалами Qwen, це MoE-модель на 125 млрд параметрів, для кожного токена якої активуються 6 млрд. Саме розріджена архітектура пояснює, чому модель такого масштабу взагалі можна обговорювати для локальної машини. Матеріали спільноти Strata описують рушій як рішення для локального інференсу з розподілом навантаження між GPU, системною пам'яттю та CPU.

Qwen3.8-Flash-Next має ще одну вимогливу характеристику: нативний контекст становить 262 144 токени, а з YaRN заявлено розширення до 1 000 000. Водночас контекст конкретного запуску не вказано, тому переносити результат 50–60 токенів/с на довгі діалоги не варто. Швидкість на короткому запиті та із заповненим контекстом може суттєво відрізнятися.

Головна прогалина звіту — не сама цифра, а відсутні деталі навколо неї. У доступному описі немає параметрів квантування, обсягу системної пам'яті, схеми розподілу моделі та даних про завантаження PCIe. Також незрозуміло, чи вимірювалася лише генерація, чи до результату увійшла обробка промпту.

Чому змішана пара GPU цікавіша за саму модель

Висновок простий: локальний запуск великої MoE-моделі на неоднорідних GPU вже не виглядає трюком, а є технічно правдоподібною конфігурацією. Один прискорювач значно новіший за інший, проте Strata, судячи зі звіту, змогла використати цю пару без падіння швидкості до кількох токенів за секунду.

Найбільше від цього виграють локальні експериментатори, яким важливі контроль даних і відсутність залежності від віддаленого API. Але одиничний результат ще не є універсальним орієнтиром: продуктивність залежатиме від квантування, контексту, системної пам'яті та накладних витрат між пристроями.

Станом на 30 вересня 2026 року немає широкого набору незалежних тестів Strata для цієї точної пари GPU. Тому 50–60 токенів/с я сприймаю як сильний сигнал, але не як обіцянку, що автоматично повториться на іншому столі.

Раніше ми розповідали про Rust LocalGPT — локального асистента в одному бінарному файлі, створеного для практичного розгортання безпосередньо на пристрої. Його підхід до локального інференсу дає корисний контекст для оцінки продуктивності Qwen3.8-Flash-Next у рушії Strata.