2 хв читання

Qwen3.8-27B: Dense замість MoE у молодшій моделі

Qwen3.8-27Bоткрытые LLMархитектура моделей

Qwen3.8-27B обговорюють як швидку нову ітерацію відкритого сімейства моделей. На відміну від флагманських MoE-варіантів, вона має щільну архітектуру. Її 64 шари та нативний контекст 262K важливі для розробників: розгортання простіше, але змінюється профіль витрат пам’яті й обчислень.

Що саме змінилося в Qwen3.8-27B

Тут привертає увагу не черговий номер версії, а архітектурне рішення: Qwen3.8-27B є щільною мультимодальною моделлю, а не MoE. Станом на 23 вересня 2026 року 27B також обговорюють як молодший розмір сімейства, що добре показує, наскільки швидко зростає базовий клас відкритих моделей.

В офіційній картці моделі Qwen на Hugging Face вказано 64 шари, приховану розмірність 5120 і словник на 248 320 токенів. Це вже досить конкретний профіль, щоб відокремити реальний реліз від переказів спільноти.

Документація vLLM уточнює будову уваги: 48 із 64 шарів використовують лінійну увагу, а решта 16 — повну gated attention. Виходить цікавий гібрид усередині щільної моделі: флагманська частина сімейства зберігає MoE, тоді як варіант 27B бере спільну архітектурну лінію, але відмовляється від розрідженої маршрутизації.

Нативне контекстне вікно заявлено на рівні 262K, із розширенням приблизно до 1M через YaRN. Модель також приймає мультимодальний ввід. На папері поєднання довгого контексту, гібридної уваги та щільних ваг виглядає практичним, хоча максимальна довжина сама по собі ще нічого не говорить про якість роботи по всьому вікну.

Розробники вже очікують четверту ітерацію, але це поки що настрій спільноти, а не підтверджений анонс. Темп справді високий, однак нумерація версій тут менш важлива, ніж сумісність рантаймів і стабільність поведінки між оновленнями.

Dense замість MoE змінює профіль розгортання

Відмова від MoE у моделі 27B робить архітектуру зрозумілішою для наявних інструментів, але не перетворює її автоматично на дешевший варіант. Щільні й розріджені моделі по-різному витрачають пам’ять та обчислювальні ресурси, тому порівняння лише за кількістю параметрів легко вводить в оману.

Є і практичний сигнал: в одному обговоренні на Hugging Face повідомляли про 171 токен за секунду та 17,5 ГБ відеопам’яті за контексту 64K. Це результат окремого запуску, а не універсальна характеристика, але він пояснює, чому модель розглядають саме як таку, що можна розгорнути локально, а не лише як гарний рядок у рейтингу.

Я б насамперед перевіряв деградацію на довгому контексті, стабільність tool calling і поведінку в тривалих агентних циклах. Саме там архітектурні обіцянки зазвичай стикаються з реальністю, а середні бали перестають допомагати.

Найцікавіше в цій історії не те, що Dense перемогла MoE. Радше ринок відкритих LLM знову показує: архітектурні вподобання розробників змінюються повільніше, ніж самі моделі.

Раніше ми розглядали, як конфігурація моделі та архітектурні рішення впливають на можливості, використання контексту й вартість розгортання. Цей погляд допомагає зрозуміти, що нова ітерація Qwen може змінити поза заявленим розміром моделі.