3 min de lectura

Qwen3.8-27B: denso en lugar de MoE en el modelo menor

Qwen3.8-27Bоткрытые LLMархитектура моделей

Qwen3.8-27B se comenta como una nueva y rápida iteración de una familia abierta de modelos. A diferencia de los buques insignia MoE, usa una arquitectura densa. Sus 64 capas y contexto nativo de 262K importan porque simplifican el despliegue, aunque modifican los costes de memoria y cómputo.

Qué ha cambiado exactamente en Qwen3.8-27B

Lo llamativo no es otro número de versión, sino la decisión arquitectónica: Qwen3.8-27B es un modelo multimodal denso, no un modelo MoE. A fecha de 23 de septiembre de 2026, la variante 27B también se comenta como el tamaño menor de la familia, lo que ilustra la rapidez con la que crece la categoría base de los modelos abiertos.

La ficha oficial de Qwen en Hugging Face indica 64 capas, una dimensión oculta de 5120 y un vocabulario de 248.320 tokens. Es un perfil suficientemente concreto como para distinguir un lanzamiento real de los relatos de la comunidad.

La documentación de vLLM precisa el diseño de atención: 48 de las 64 capas emplean atención lineal y las 16 restantes usan full gated attention. El resultado es un híbrido interesante dentro de un modelo denso: la parte insignia de la familia conserva MoE, mientras que la variante 27B sigue la línea arquitectónica común sin recurrir al enrutamiento disperso.

La ventana de contexto nativa se anuncia en 262K, con ampliación a aproximadamente 1M mediante YaRN. El modelo también acepta entradas multimodales. Sobre el papel, el contexto largo, la atención híbrida y los pesos densos forman una combinación práctica, aunque la longitud máxima por sí sola no dice nada sobre la calidad en toda la ventana.

Los desarrolladores ya esperan una cuarta iteración, pero por ahora es una expectativa de la comunidad y no un anuncio confirmado. El ritmo es alto, aunque la numeración importa menos que la compatibilidad de los runtimes y la estabilidad del comportamiento entre actualizaciones.

Elegir Dense en lugar de MoE cambia el perfil de despliegue

Prescindir de MoE en el modelo 27B hace que la arquitectura sea más fácil de abordar con las herramientas existentes, pero no la convierte automáticamente en una opción más barata. Los modelos densos y dispersos consumen memoria y cómputo de forma distinta, por lo que compararlos solo por parámetros puede inducir a error.

También hay una señal práctica: en una discusión de Hugging Face se reportaron 171 tokens por segundo y 17,5 GB de VRAM con un contexto de 64K. Es el resultado de una ejecución concreta, no una especificación universal, pero explica por qué se considera un modelo desplegable localmente y no solo una entrada vistosa en un ranking.

Yo comprobaría primero la degradación con contexto largo, la fiabilidad del tool calling y el comportamiento en ciclos de agentes prolongados. Ahí es donde las promesas arquitectónicas suelen enfrentarse a la realidad y las puntuaciones medias dejan de ser tan útiles.

Lo más interesante no es que Dense haya vencido a MoE. El mercado de las LLM abiertas vuelve a demostrar que las preferencias arquitectónicas de los desarrolladores cambian más despacio que los propios modelos.

Anteriormente analizamos cómo la configuración de un modelo y las decisiones arquitectónicas afectan sus capacidades, el uso del contexto y los costes de despliegue. Esa perspectiva ayuda a entender qué podría cambiar una nueva iteración de Qwen más allá del tamaño anunciado.