3 Min. Lesezeit

Qwen3.8-Flash-Next: 50–60 Token/s auf zwei GPUs

Qwen3.8-Flash-NextStrataлокальный инференс

Nutzer 122159126 berichtet, dass Qwen3.8-Flash-Next in Strata auf einem Heimserver mit RTX PRO 2000 Blackwell 16 GB und RTX A2000 12 GB 50–60 Token pro Sekunde erreichte. Das zeigt das Potenzial lokaler MoE-Inferenz auf gemischten GPUs, bleibt jedoch ein einzelner Bericht ohne unabhängige Reproduktion.

Was der Lauf auf dem Heimserver tatsächlich zeigte

Auffällig ist vor allem der angegebene Durchsatz: In einem Beitrag von Nutzer 122159126 erzeugt Qwen3.8-Flash-Next mit der Strata Engine 50–60 Token pro Sekunde. Die Konfiguration ist ungewöhnlich: eine RTX PRO 2000 Blackwell mit 16 GB und eine RTX A2000 mit 12 GB in einem Heimserver. Es handelt sich um einen echten Nutzerbericht, jedoch nicht um einen unabhängig reproduzierten Test.

Nach offiziellen Qwen-Unterlagen ist dies ein MoE-Modell mit 125 Milliarden Parametern, von denen pro Token 6 Milliarden aktiviert werden. Diese Sparse-Architektur erklärt, warum ein Modell dieser Größenordnung überhaupt für einen lokalen Rechner infrage kommt. Materialien aus der Strata-Community beschreiben die Engine als lokale Inferenzlösung, die Last auf GPUs, Systemspeicher und CPU verteilt.

Qwen3.8-Flash-Next hat zudem eine anspruchsvolle Kontextvorgabe: Der native Kontext umfasst 262.144 Token, mit YaRN wird eine Erweiterung auf 1.000.000 Token angegeben. Die für diesen Lauf verwendete Kontextlänge wurde jedoch nicht genannt. Das Ergebnis von 50–60 Token/s sollte deshalb nicht auf lange Dialoge übertragen werden. Die Geschwindigkeit bei einem kurzen Prompt kann deutlich von der bei gefülltem Kontextfenster abweichen.

Die größte Lücke im Bericht ist nicht die Zahl selbst, sondern die fehlende Dokumentation darum herum. In der verfügbaren Beschreibung fehlen Angaben zur Quantisierung, zur Größe des Systemspeichers, zur Aufteilung des Modells und zur PCIe-Auslastung. Ebenso bleibt offen, ob nur die Generierung gemessen wurde oder auch die Prompt-Verarbeitung in das Ergebnis eingeflossen ist.

Warum das gemischte GPU-Paar wichtiger ist als das Modell

Mein Fazit ist einfach: Der lokale Betrieb eines großen MoE-Modells auf heterogenen GPUs wirkt nicht mehr wie ein Trick, sondern wie eine technisch plausible Konfiguration. Ein Beschleuniger ist deutlich neuer als der andere, dennoch konnte Strata dieses Paar dem Bericht zufolge nutzen, ohne dass der Durchsatz auf wenige Token pro Sekunde einbrach.

Am meisten profitieren lokale Experimentierende, denen Datenkontrolle und der Verzicht auf eine externe API wichtig sind. Ein einzelnes Ergebnis wird jedoch nicht automatisch zum universellen Richtwert: Die Leistung hängt von Quantisierung, Kontext, Systemspeicher und dem Overhead zwischen den Geräten ab.

Stand 30. September 2026 gibt es keine breite Sammlung unabhängiger Strata-Tests für genau diese GPU-Kombination. Daher werte ich 50–60 Token/s als starkes Signal, nicht als Versprechen, das sich auf dem nächsten Rechner automatisch wiederholt.

Zuvor haben wir Rust LocalGPT vorgestellt, einen lokalen Assistenten als einzelne Binärdatei für den praktischen Einsatz direkt auf dem Gerät. Sein Ansatz für lokale Inferenz liefert hilfreichen Kontext zur Bewertung der Qwen3.8-Flash-Next-Performance in der Strata Engine.