Qwen 3.8 perdió frente a 3.6 en una prueba NVFP4
Qwen 3.8Qwen 3.6NVFP4
Qué mostró exactamente la prueba
Para mí, la conclusión principal de esta comparación es incómodamente práctica: Qwen 3.8 no pasó a producción allí donde Qwen 3.6 ya mantiene el formato y los hechos. Un informe de campo del usuario 438528858 describió analítica de llamadas de un centro de atención en una sola solicitud, con thinking desactivado. Tras una semana de pruebas, el autor decidió no sustituir la versión que ya funcionaba.
La carga era concreta: unas 10.000 tokens de entrada de media, incluida la transcripción y el prompt, seguidas de 400–500 tokens de análisis en JSON. La comparación se realizó con 200 llamadas y el mismo prompt. Qwen 3.8 produjo 10 JSON inválidos, mientras que Qwen 3.6 no produjo ninguno.
El formato no fue el único problema. Según el autor de la prueba, 3.8 invertía hechos con más frecuencia y sacaba conclusiones que no aparecían en la transcripción original. En analítica de llamadas, esto es peor que una simple caída de calidad estilística: un JSON válido se puede comprobar automáticamente, pero un hecho distorsionado con seguridad puede avanzar fácilmente por el flujo.
Hay una salvedad importante: no se compararon los modelos originales, sino compilaciones muy comprimidas, unsloth/Qwen3.8-27B-NVFP4 y sakamakismile/Qwen3.6-27B-Text-NVFP4-MTP. El hardware del autor admite cálculo nativo NVFP4, por lo que este formato es crítico en su caso. La causa del peor resultado aún no se ha separado de la calidad de la compilación concreta y de la propia cuantización.
Thinking estuvo desactivado en la prueba. Es un detalle relevante: cualquier posible ventaja de Qwen 3.8 en ese modo no resuelve las necesidades de un flujo de una sola pasada, que exige latencia predecible, fidelidad factual y una estructura de salida estricta.
Por qué la actualización aún no parece una mejora
La conclusión es limitada, pero útil: para este escenario NVFP4, Qwen 3.6 resultó más segura como componente de producción. Un validador puede detectar diez respuestas defectuosas, pero una distorsión factual más frecuente exige revisar el contenido por separado y consume rápidamente el beneficio de cambiar de modelo.
Primero separaría tres posibles fuentes del problema: el comportamiento del modelo base, la calidad de la cuantización NVFP4 y las particularidades de este repack. La prueba no demuestra que 3.6 sea mejor que 3.8 en general, pero ilustra bien el coste de actualizarse demasiado deprisa solo por el número de versión.
Por ahora, la pregunta sin resolver no es si Qwen 3.8 es más potente en términos generales, sino si su ventaja se mantiene tras la compresión y al desactivar el modo del que podría depender.