Qwen3.8-Flash-Next : 50–60 jetons/s sur deux GPU
Qwen3.8-Flash-NextStrataлокальный инференс
Ce que l'exécution sur serveur domestique a réellement montré
Le point le plus marquant est le débit annoncé : dans une publication de l'utilisateur 122159126, Qwen3.8-Flash-Next exécuté avec le moteur Strata produit 50 à 60 jetons par seconde. La configuration est inhabituelle : une RTX PRO 2000 Blackwell de 16 Go et une RTX A2000 de 12 Go dans le même serveur domestique. Il s'agit d'un rapport utilisateur réel, mais pas d'un test reproduit indépendamment.
D'après les documents officiels de Qwen, il s'agit d'un modèle MoE de 125 milliards de paramètres, dont 6 milliards sont activés pour chaque jeton. Cette architecture clairsemée explique pourquoi un modèle de cette taille peut être envisagé sur une machine locale. Les ressources de la communauté Strata présentent le moteur comme une solution d'inférence locale répartissant la charge entre les GPU, la mémoire système et le CPU.
Qwen3.8-Flash-Next présente aussi une caractéristique exigeante concernant le contexte : sa fenêtre native est de 262 144 jetons, et YaRN est annoncé pour l'étendre jusqu'à 1 000 000. Or, la longueur de contexte utilisée ici n'est pas précisée. Le résultat de 50–60 jetons/s ne doit donc pas être extrapolé aux longues conversations. Les performances peuvent fortement différer entre une requête courte et une fenêtre de contexte remplie.
La principale lacune du rapport n'est pas le chiffre, mais les détails manquants qui l'entourent. La description disponible ne précise ni les paramètres de quantification, ni la quantité de mémoire vive, ni le schéma de répartition du modèle, ni l'utilisation du PCIe. On ignore également si la mesure porte seulement sur la génération ou inclut le traitement du prompt.
Pourquoi la paire de GPU mixtes compte davantage que le modèle
La conclusion est simple : exécuter localement un grand modèle MoE sur des GPU hétérogènes ne ressemble plus à une astuce, mais à une configuration techniquement crédible. L'un des accélérateurs est nettement plus récent que l'autre, mais Strata semble avoir exploité l'ensemble sans faire tomber le débit à quelques jetons par seconde.
Les principaux bénéficiaires sont les expérimentateurs locaux qui privilégient le contrôle de leurs données et l'absence d'API distante. Toutefois, un résultat isolé ne devient pas une référence universelle : les performances dépendront de la quantification, du contexte, de la mémoire système et des surcoûts entre appareils.
Au 30 septembre 2026, il n'existe pas de vaste ensemble de tests indépendants de Strata pour cette combinaison exacte de GPU. Je considère donc les 50–60 jetons/s comme un signal fort, et non comme une promesse automatiquement reproductible sur une autre machine.