Qwen3.8-Flash-Next: 177B параметров, активны 6,6B
QwenMixture of ExpertsAI-агенты
Что именно скрывается за 177B
Меня здесь цепляет не число 177B само по себе, а разрыв между полным и активным размером модели. В публикации пользователя 144406 указано, что на каждом токене работают лишь 6,6B параметров, а остальные входят в общий пул экспертов MoE.
Публичные карточки Ollama связывают этот набор характеристик с Qwen3.8-Flash-Next от команды Qwen и описывают модель как ориентированную на рассуждение, вызов инструментов, код и агентные сценарии. Однако официальная карточка разработчика и таблица его бенчмарков в доступных материалах не представлены, поэтому идентификацию и заявления о назначении разумно считать предварительными, а не окончательно подтвержденными.
Механика MoE здесь довольно практичная: маршрутизатор выбирает для токена ограниченную часть экспертов вместо вычисления всей сети. Это позволяет держать большой общий набор параметров, не превращая каждый шаг генерации в проход через все 177B. Но 6,6B активных параметров не означают, что модель во всех отношениях эквивалентна обычной плотной модели такого размера: полный весовой набор все равно влияет на требования к размещению и запуску.
С контекстом есть небольшое расхождение. Исходная публикация называет 256K, тогда как сторонние публичные карточки указывают 262K и одновременно описывают его как контекст класса 256K. Сторонняя сравнительная публикация относит релиз к августу 2026 года, так что эти характеристики стоит воспринимать как состояние модели на момент того анонса.
Почему эта конфигурация интересна для агентов
Практический смысл такой архитектуры в потенциально более выгодном балансе между специализацией и вычислениями. Для AI-агентов это особенно заметно: планирование, генерация кода и вызовы инструментов создают длинные цепочки, где стоимость и задержка каждого следующего токена быстро накапливаются.
Я бы первым делом проверял не красивое соотношение 177B к 6,6B, а реальную скорость на длинном контексте, требования к памяти и стабильность маршрутизации экспертов. Без официальных результатов нельзя заключить, что модель действительно быстрее конкурентов или лучше пишет код. Архитектура объясняет, откуда может взяться эффективность, но не доказывает ее.
Если заявленные свойства подтвердятся, Qwen3.8-Flash-Next будет интересна не рекордным размером, а тем, насколько мало этого размера приходится активировать. Главный открытый вопрос теперь не в количестве параметров, а в качестве решений, которые принимает маршрутизатор.