2 хв читання

Qwen3.8-Flash-Next: 177B параметрів, активні 6,6B

QwenMixture of ExpertsAI-агенты

Qwen3.8-Flash-Next, за дописом користувача 144406 і публічними картками моделі, описують як MoE-модель зі 177B параметрів, 6,6B активних на токен і контекстом 256K. Це важливо для коду та AI-агентів, адже велика місткість експертів може поєднуватися з меншими обчисленнями на токен.

Що насправді означають 177B

Тут привертає увагу не лише цифра 177B, а розрив між загальним і активним розміром моделі. У дописі користувача 144406 зазначено, що для кожного токена працюють лише 6,6B параметрів, а решта входить до спільного пулу MoE-експертів.

Публічні картки Ollama пов’язують цей набір характеристик із Qwen3.8-Flash-Next від команди Qwen та описують модель як орієнтовану на міркування, виклики інструментів, код і агентні сценарії. Водночас у доступних матеріалах немає офіційної картки розробника й таблиці бенчмарків, тому ідентифікацію та заяви про призначення варто вважати попередніми, а не остаточно підтвердженими.

Механіка MoE тут практична: маршрутизатор обирає для токена обмежену частину експертів замість обчислення всієї мережі. Це дозволяє зберігати великий загальний набір параметрів, не запускаючи всі 177B на кожному кроці генерації. Проте 6,6B активних параметрів не означають, що модель в усьому еквівалентна щільній моделі такого розміру: повний набір ваг усе одно впливає на вимоги до розміщення та запуску.

Щодо контексту є невелика розбіжність. Вихідний допис називає 256K, тоді як сторонні публічні картки вказують 262K і водночас описують його як контекст класу 256K. Інша порівняльна публікація відносить реліз до серпня 2026 року, тому ці характеристики слід сприймати як стан моделі на момент того анонсу.

Чому ця конфігурація цікава для агентів

Практична цінність такої архітектури полягає в потенційно вигіднішому балансі між спеціалізацією та обчисленнями. Для AI-агентів це особливо помітно: планування, генерація коду та виклики інструментів створюють довгі ланцюжки, де вартість і затримка кожного наступного токена швидко накопичуються.

Насамперед я б перевіряв не привабливе співвідношення 177B до 6,6B, а реальну швидкість на довгому контексті, вимоги до пам’яті та стабільність маршрутизації експертів. Без офіційних результатів не можна стверджувати, що модель справді швидша за конкурентів або краще пише код. Архітектура пояснює, звідки може виникнути ефективність, але не доводить її.

Якщо заявлені властивості підтвердяться, Qwen3.8-Flash-Next буде цікава не рекордним розміром, а тим, яку малу частину цього розміру потрібно активувати. Головне відкрите питання тепер не в кількості параметрів, а в якості рішень, які приймає маршрутизатор.

Раніше ми розглядали, як код, згенерований ШІ, може погіршувати якість і підвищувати довгострокові витрати на підтримку. Цей контекст допомагає оцінити нову MoE-модель для коду не лише за кількістю параметрів і бенчмарками.