Qwen3.8-Flash-Next: 50–60 tokens/s en dos GPU
Qwen3.8-Flash-NextStrataлокальный инференс
Qué mostró realmente la ejecución doméstica
Lo llamativo es la velocidad declarada: en una publicación del usuario 122159126, Qwen3.8-Flash-Next ejecutado con el motor Strata produce 50–60 tokens por segundo. La configuración es poco habitual: una RTX PRO 2000 Blackwell de 16 GB y una RTX A2000 de 12 GB en el mismo servidor doméstico. Es un informe real de usuario, pero no una prueba reproducida de forma independiente.
Según los materiales oficiales de Qwen, se trata de un modelo MoE de 125.000 millones de parámetros, del que se activan 6.000 millones para cada token. Ese diseño disperso explica por qué puede plantearse un modelo de esta escala en una máquina local. Los materiales de la comunidad Strata describen el motor como una solución de inferencia local que distribuye la carga entre GPU, memoria del sistema y CPU.
Qwen3.8-Flash-Next también tiene una especificación de contexto exigente: su contexto nativo alcanza 262.144 tokens y con YaRN se anuncia una ampliación hasta 1.000.000. Sin embargo, no se indica el contexto usado en esta ejecución, por lo que el resultado de 50–60 tokens/s no debe trasladarse a diálogos largos. El rendimiento con un prompt corto puede diferir mucho del rendimiento con la ventana de contexto llena.
La principal carencia del informe no es la cifra, sino los detalles que la rodean. La descripción disponible no incluye parámetros de cuantización, cantidad de RAM, esquema de reparto del modelo ni datos de uso de PCIe. Tampoco queda claro si se midió solo la generación o si se incluyó el procesamiento del prompt.
Por qué la pareja de GPU mixtas importa más que el modelo
La conclusión es sencilla: ejecutar localmente un gran modelo MoE en GPU heterogéneas ya no parece un truco, sino una configuración técnicamente plausible. Un acelerador es mucho más nuevo que el otro, pero Strata aparentemente aprovechó ambos sin que el rendimiento cayera a apenas unos pocos tokens por segundo.
Los principales beneficiados son los experimentadores locales que valoran el control de sus datos y no depender de una API remota. Aun así, un único resultado no se convierte en una referencia universal: el rendimiento dependerá de la cuantización, el contexto, la memoria del sistema y la sobrecarga entre dispositivos.
A 30 de septiembre de 2026, no existe un conjunto amplio de pruebas independientes de Strata para esta combinación exacta de GPU. Por eso considero los 50–60 tokens/s una señal sólida, no una promesa que vaya a repetirse automáticamente en otro equipo.