Qwen3.8-27B: Dense замість MoE у молодшій моделі
Qwen3.8-27Bоткрытые LLMархитектура моделей
Що саме змінилося в Qwen3.8-27B
Тут привертає увагу не черговий номер версії, а архітектурне рішення: Qwen3.8-27B є щільною мультимодальною моделлю, а не MoE. Станом на 23 вересня 2026 року 27B також обговорюють як молодший розмір сімейства, що добре показує, наскільки швидко зростає базовий клас відкритих моделей.
В офіційній картці моделі Qwen на Hugging Face вказано 64 шари, приховану розмірність 5120 і словник на 248 320 токенів. Це вже досить конкретний профіль, щоб відокремити реальний реліз від переказів спільноти.
Документація vLLM уточнює будову уваги: 48 із 64 шарів використовують лінійну увагу, а решта 16 — повну gated attention. Виходить цікавий гібрид усередині щільної моделі: флагманська частина сімейства зберігає MoE, тоді як варіант 27B бере спільну архітектурну лінію, але відмовляється від розрідженої маршрутизації.
Нативне контекстне вікно заявлено на рівні 262K, із розширенням приблизно до 1M через YaRN. Модель також приймає мультимодальний ввід. На папері поєднання довгого контексту, гібридної уваги та щільних ваг виглядає практичним, хоча максимальна довжина сама по собі ще нічого не говорить про якість роботи по всьому вікну.
Розробники вже очікують четверту ітерацію, але це поки що настрій спільноти, а не підтверджений анонс. Темп справді високий, однак нумерація версій тут менш важлива, ніж сумісність рантаймів і стабільність поведінки між оновленнями.
Dense замість MoE змінює профіль розгортання
Відмова від MoE у моделі 27B робить архітектуру зрозумілішою для наявних інструментів, але не перетворює її автоматично на дешевший варіант. Щільні й розріджені моделі по-різному витрачають пам’ять та обчислювальні ресурси, тому порівняння лише за кількістю параметрів легко вводить в оману.
Є і практичний сигнал: в одному обговоренні на Hugging Face повідомляли про 171 токен за секунду та 17,5 ГБ відеопам’яті за контексту 64K. Це результат окремого запуску, а не універсальна характеристика, але він пояснює, чому модель розглядають саме як таку, що можна розгорнути локально, а не лише як гарний рядок у рейтингу.
Я б насамперед перевіряв деградацію на довгому контексті, стабільність tool calling і поведінку в тривалих агентних циклах. Саме там архітектурні обіцянки зазвичай стикаються з реальністю, а середні бали перестають допомагати.
Найцікавіше в цій історії не те, що Dense перемогла MoE. Радше ринок відкритих LLM знову показує: архітектурні вподобання розробників змінюються повільніше, ніж самі моделі.