3 min de lectura

Qwen3.8 Flash Next se redujo de 354 GB a 29,6 GB

Qwen3.8 Flash NextквантизацияMoE

ISTA-DASLab comprimió el modelo MoE de código Qwen3.8 Flash Next eliminando la mitad de sus expertos y aplicando cuantización GSQ y RCO a 3,5 bpw. El conjunto de trabajo declarado pasó de 354 GB a 29,6 GB y retuvo gran parte del rendimiento en SWE-bench Verified y LiveCodeBench v6, facilitando la inferencia local.

Cómo se comprimió el modelo sin cuantizar a ciegas

Lo interesante no es el formato GGUF en sí, sino la combinación de dos palancas: reducir el número de expertos MoE y aplicar cuantización no uniforme a los pesos restantes. En la tarjeta de Hugging Face de ISTA-DASLab, Qwen3.8 Flash Next se describe como un modelo MoE con 512 expertos, comprimido con GSQ y RCO para entornos compatibles con llama.cpp.

La compilación publicada elimina, según se indica, la mitad de los expertos y reduce la precisión de los pesos a 3,5 bpw. La base BF16 original ocupaba 354 GB, mientras que el conjunto de trabajo procesado ocupa 29,6 GB. No es una reducción cosmética del archivo, sino el paso a otra clase de hardware accesible.

GSQ realiza cuantización escalar posterior al entrenamiento. El método aprende la asignación de coordenadas a rejillas y las escalas de grupos de pesos mediante una relajación Gumbel-Softmax. La idea es evitar imponer un único esquema grueso a todos los tensores cuando la sensibilidad de las distintas partes del modelo es claramente diferente.

RCO aborda el siguiente nivel: elige uno de K tipos de cuantización para cada tensor cumpliendo una restricción exacta sobre el tamaño final. No hace falta ajustar un coeficiente de penalización independiente para el presupuesto. Desde la ingeniería, esto es más sólido que probar preajustes de GGUF, porque el tamaño pasa a ser una condición de optimización y no un resultado casual de la configuración.

La conservación de calidad declarada es llamativa: 91,3% del resultado original en SWE-bench Verified y 98,7% en LiveCodeBench v6. Sin embargo, los materiales de la tarjeta oficial respaldan en detalle GSQ, RCO y la arquitectura de 512 expertos, pero no permiten verificar de forma independiente todas las cifras de compresión y pruebas. Por eso las considero resultados del lanzamiento, no mediciones reproducidas.

Qué cambia para los modelos locales de programación

El cambio práctico es sencillo: un gran modelo MoE puede acercarse a la inferencia local no con una sola cuantización agresiva, sino optimizando conjuntamente la estructura y la representación de los pesos. Esto reduce la memoria necesaria y conserva buena parte de la calidad declarada en tareas de programación.

Aun así, la eliminación de expertos sería lo primero que comprobaría. Un promedio de benchmark puede ocultar caídas en lenguajes poco frecuentes, repositorios inusuales y tareas cuyo enrutamiento dependía de expertos especializados. También importan la velocidad real, el consumo de memoria en sesiones largas y la estabilidad de la calidad fuera de las dos pruebas citadas.

El enfoque parece menos un truco que un esquema serio de compresión con un presupuesto definido. La gran pregunta pendiente es si la calidad en rutas MoE poco frecuentes se conserva tan bien como en la distribución conocida de benchmarks de código.

También evaluamos Pony Alpha como modelo para realizar pilotos de bajo riesgo y validar una arquitectura de IA con recursos limitados. La cuantización de Qwen3.8 Flash Next hace estos experimentos mucho más accesibles para una ejecución local y eficiente.