3 min de lecture

Qwen3.8-Flash-Next : 50–60 jetons/s sur deux GPU

Qwen3.8-Flash-NextStrataлокальный инференс

L'utilisateur 122159126 indique que Qwen3.8-Flash-Next a atteint 50–60 jetons par seconde dans Strata sur un serveur domestique équipé d'une RTX PRO 2000 Blackwell 16 Go et d'une RTX A2000 12 Go. Ce résultat montre le potentiel du MoE local sur GPU mixtes, mais il n'a pas encore été reproduit indépendamment.

Ce que l'exécution sur serveur domestique a réellement montré

Le point le plus marquant est le débit annoncé : dans une publication de l'utilisateur 122159126, Qwen3.8-Flash-Next exécuté avec le moteur Strata produit 50 à 60 jetons par seconde. La configuration est inhabituelle : une RTX PRO 2000 Blackwell de 16 Go et une RTX A2000 de 12 Go dans le même serveur domestique. Il s'agit d'un rapport utilisateur réel, mais pas d'un test reproduit indépendamment.

D'après les documents officiels de Qwen, il s'agit d'un modèle MoE de 125 milliards de paramètres, dont 6 milliards sont activés pour chaque jeton. Cette architecture clairsemée explique pourquoi un modèle de cette taille peut être envisagé sur une machine locale. Les ressources de la communauté Strata présentent le moteur comme une solution d'inférence locale répartissant la charge entre les GPU, la mémoire système et le CPU.

Qwen3.8-Flash-Next présente aussi une caractéristique exigeante concernant le contexte : sa fenêtre native est de 262 144 jetons, et YaRN est annoncé pour l'étendre jusqu'à 1 000 000. Or, la longueur de contexte utilisée ici n'est pas précisée. Le résultat de 50–60 jetons/s ne doit donc pas être extrapolé aux longues conversations. Les performances peuvent fortement différer entre une requête courte et une fenêtre de contexte remplie.

La principale lacune du rapport n'est pas le chiffre, mais les détails manquants qui l'entourent. La description disponible ne précise ni les paramètres de quantification, ni la quantité de mémoire vive, ni le schéma de répartition du modèle, ni l'utilisation du PCIe. On ignore également si la mesure porte seulement sur la génération ou inclut le traitement du prompt.

Pourquoi la paire de GPU mixtes compte davantage que le modèle

La conclusion est simple : exécuter localement un grand modèle MoE sur des GPU hétérogènes ne ressemble plus à une astuce, mais à une configuration techniquement crédible. L'un des accélérateurs est nettement plus récent que l'autre, mais Strata semble avoir exploité l'ensemble sans faire tomber le débit à quelques jetons par seconde.

Les principaux bénéficiaires sont les expérimentateurs locaux qui privilégient le contrôle de leurs données et l'absence d'API distante. Toutefois, un résultat isolé ne devient pas une référence universelle : les performances dépendront de la quantification, du contexte, de la mémoire système et des surcoûts entre appareils.

Au 30 septembre 2026, il n'existe pas de vaste ensemble de tests indépendants de Strata pour cette combinaison exacte de GPU. Je considère donc les 50–60 jetons/s comme un signal fort, et non comme une promesse automatiquement reproductible sur une autre machine.

Nous avons précédemment présenté Rust LocalGPT, un assistant local livré sous la forme d'un binaire unique et conçu pour un déploiement pratique sur l'appareil. Son approche de l'inférence locale apporte un contexte utile pour évaluer les performances de Qwen3.8-Flash-Next sur Strata Engine.