Qwen3.8-27B: Dense вместо MoE в младшей модели
Qwen3.8-27Bоткрытые LLMархитектура моделей
Что именно изменилось в Qwen3.8-27B
Меня здесь цепляет не очередной номер версии, а архитектурный выбор: Qwen3.8-27B представляет собой плотную мультимодальную модель, а не MoE. На 23 сентября 2026 года 27B также обсуждается как младший размер семейства, что хорошо показывает, насколько быстро растет базовый класс открытых моделей.
В официальной карточке модели Qwen на Hugging Face указаны 64 слоя, скрытая размерность 5120 и словарь на 248 320 токенов. Это уже достаточно конкретный портрет, чтобы отделить реальный релиз от пересказов сообщества.
Документация vLLM уточняет устройство внимания: 48 из 64 слоев используют линейное внимание, остальные 16 — полное gated attention. Получается любопытный гибрид внутри плотной модели: флагманская часть семейства сохраняет MoE, а вариант 27B берет общую архитектурную линию, но отказывается от разреженной маршрутизации.
Нативное контекстное окно заявлено на уровне 262K, с расширением примерно до 1M через YaRN. Модель также принимает мультимодальный ввод. На бумаге сочетание длинного контекста, гибридного внимания и плотных весов выглядит практично, хотя максимальная длина сама по себе еще ничего не говорит о качестве работы по всему окну.
Разработчики уже ожидают четвертую итерацию, но это пока настроение сообщества, а не подтвержденный анонс. Темп действительно высокий, однако нумерация версий здесь менее важна, чем совместимость рантаймов и устойчивость поведения между обновлениями.
Dense вместо MoE меняет профиль развертывания
Отказ от MoE в модели 27B делает архитектуру понятнее для существующих инструментов, но не превращает ее автоматически в более дешевый вариант. Плотная модель и разреженная модель по-разному расходуют память и вычисления, поэтому сравнение только по числу параметров легко вводит в заблуждение.
Есть и практический сигнал: в одном обсуждении на Hugging Face сообщалось о 171 токене в секунду и 17,5 ГБ видеопамяти при контексте 64K. Это результат отдельного запуска, а не универсальная характеристика, но он объясняет, почему модель рассматривают именно как локально развертываемую, а не только как красивую строку в рейтинге.
Я бы первым делом проверял деградацию на длинном контексте, стабильность tool calling и поведение в продолжительных агентных циклах. Именно там архитектурные обещания обычно сталкиваются с реальностью, а средние баллы перестают помогать.
Самая интересная часть этой истории не в том, что Dense победила MoE. Скорее рынок открытых LLM снова показывает: архитектурные предпочтения разработчиков меняются медленнее, чем сами модели.