Qwen3.8-Flash-Next: 177B параметрів, активні 6,6B
QwenMixture of ExpertsAI-агенты
Що насправді означають 177B
Тут привертає увагу не лише цифра 177B, а розрив між загальним і активним розміром моделі. У дописі користувача 144406 зазначено, що для кожного токена працюють лише 6,6B параметрів, а решта входить до спільного пулу MoE-експертів.
Публічні картки Ollama пов’язують цей набір характеристик із Qwen3.8-Flash-Next від команди Qwen та описують модель як орієнтовану на міркування, виклики інструментів, код і агентні сценарії. Водночас у доступних матеріалах немає офіційної картки розробника й таблиці бенчмарків, тому ідентифікацію та заяви про призначення варто вважати попередніми, а не остаточно підтвердженими.
Механіка MoE тут практична: маршрутизатор обирає для токена обмежену частину експертів замість обчислення всієї мережі. Це дозволяє зберігати великий загальний набір параметрів, не запускаючи всі 177B на кожному кроці генерації. Проте 6,6B активних параметрів не означають, що модель в усьому еквівалентна щільній моделі такого розміру: повний набір ваг усе одно впливає на вимоги до розміщення та запуску.
Щодо контексту є невелика розбіжність. Вихідний допис називає 256K, тоді як сторонні публічні картки вказують 262K і водночас описують його як контекст класу 256K. Інша порівняльна публікація відносить реліз до серпня 2026 року, тому ці характеристики слід сприймати як стан моделі на момент того анонсу.
Чому ця конфігурація цікава для агентів
Практична цінність такої архітектури полягає в потенційно вигіднішому балансі між спеціалізацією та обчисленнями. Для AI-агентів це особливо помітно: планування, генерація коду та виклики інструментів створюють довгі ланцюжки, де вартість і затримка кожного наступного токена швидко накопичуються.
Насамперед я б перевіряв не привабливе співвідношення 177B до 6,6B, а реальну швидкість на довгому контексті, вимоги до пам’яті та стабільність маршрутизації експертів. Без офіційних результатів не можна стверджувати, що модель справді швидша за конкурентів або краще пише код. Архітектура пояснює, звідки може виникнути ефективність, але не доводить її.
Якщо заявлені властивості підтвердяться, Qwen3.8-Flash-Next буде цікава не рекордним розміром, а тим, яку малу частину цього розміру потрібно активувати. Головне відкрите питання тепер не в кількості параметрів, а в якості рішень, які приймає маршрутизатор.