Qwen3.8-Flash-Next: 177B parámetros y 6,6B activos
QwenMixture of ExpertsAI-агенты
Qué significa realmente la cifra de 177B
Lo interesante no es solo la cifra de 177B, sino la diferencia entre el tamaño total y el tamaño activo del modelo. La publicación del usuario 144406 indica que solo 6,6B de parámetros trabajan en cada token; el resto forma parte del conjunto compartido de expertos MoE.
Las fichas públicas de Ollama relacionan estas especificaciones con Qwen3.8-Flash-Next, del equipo de Qwen, y lo presentan como un modelo orientado al razonamiento, las llamadas a herramientas, el código y los flujos de agentes. Sin embargo, los materiales disponibles no incluyen una ficha oficial del desarrollador ni una tabla de benchmarks, por lo que su identificación y las afirmaciones sobre su propósito deben considerarse preliminares.
La mecánica MoE tiene una utilidad práctica: un router selecciona un número limitado de expertos para cada token en lugar de calcular toda la red. Así se mantiene un gran conjunto total de parámetros sin ejecutar los 177B en cada paso de generación. Aun así, 6,6B de parámetros activos no hacen que el modelo sea equivalente en todo a uno denso de ese tamaño: el conjunto completo de pesos sigue afectando los requisitos de alojamiento y despliegue.
Hay una pequeña discrepancia sobre el contexto. La publicación original menciona 256K, mientras que fichas públicas de terceros indican 262K y lo describen como un contexto de la clase 256K. Otra publicación comparativa sitúa el lanzamiento en agosto de 2026, por lo que estas características deben entenderse como el estado del modelo en ese anuncio.
Por qué esta configuración interesa a los agentes
El valor práctico de esta arquitectura está en un equilibrio potencialmente más favorable entre especialización y cómputo. Para los agentes IA es especialmente relevante: la planificación, la generación de código y las llamadas a herramientas crean cadenas largas en las que el coste y la latencia de cada token adicional se acumulan rápidamente.
Antes que fijarme en la atractiva proporción entre 177B y 6,6B, comprobaría la velocidad real con contexto largo, los requisitos de memoria y la estabilidad del enrutamiento de expertos. Sin resultados oficiales, no se puede concluir que el modelo sea más rápido que sus rivales o escriba mejor código. La arquitectura explica de dónde podría venir la eficiencia, pero no la demuestra.
Si se confirman las propiedades anunciadas, Qwen3.8-Flash-Next será interesante no por un tamaño récord, sino por la pequeña parte de esa capacidad que necesita activar. La gran incógnita ya no es el número de parámetros, sino la calidad de las decisiones del router.