Xiaomi MiMo V2.6 Pro UltraSpeed startet bei OpenRouter
Xiaomi MiMoOpenRouterLLM-инференс
Was bei MiMo V2.6 Pro genau beschleunigt wurde
Hier fällt vor allem eine konkrete Zahl auf: OpenRouter spricht von einer etwa zehnfach schnelleren Ausgabe gegenüber der normalen MiMo V2.6 Pro. Auf der Modellseite wird die Neuheit als auf Geschwindigkeit optimierte Variante desselben 1T-Checkpoints beschrieben, die die Qualität der ursprünglichen Pro-Version beibehalten soll.
MiMo V2.6 Pro UltraSpeed erschien am 21. September 2026 auf der Plattform. Das angegebene Kontextfenster umfasst 1.048.576 Token, sodass die Beschleunigung offenbar nicht durch eine offensichtliche Kürzung des verfügbaren Kontexts erkauft wird. Für lange Agentensitzungen und die Arbeit mit großen Repositories ist diese Kombination interessanter als ein hoher Wert für Tokens pro Sekunde allein.
Zum Start kostete die Eingabe 4,35 US-Dollar pro Million Token, die Ausgabe 8,70 US-Dollar. Auf der Anbieterkarte von Xiaomi zeigte die Plattform außerdem einen Durchsatz von 169 Token pro Sekunde und eine Latenz von 1,29 Sekunden. Das sind durchaus konkrete Orientierungspunkte, sie lassen sich jedoch nicht direkt auf jede Arbeitslast übertragen.
Als Erstes würde ich nicht einen attraktiven Spitzenwert prüfen, sondern die stabile Geschwindigkeit bei langen Generierungen, die Zeit bis zum ersten Token und das Verhalten bei gefülltem Kontext. Die OpenRouter-Metrik spiegelt die beobachtete Leistung eines bestimmten Anbietereintrags wider, nicht ein garantiertes Ergebnis für jede Anfrage. Warteschlangen, Promptlänge und Dekodierungsverhalten können das Bild leicht verändern.
Ein weiterer praktischer Vorteil von OpenRouter: Das Modell ist über die vertraute kompatible API unter der Kennung xiaomi/mimo-v2.6-pro-ultraspeed verfügbar. Es ist nicht nötig, den gesamten Client-Stack zu wechseln, nur um ein neues Modell zu testen.
Wo diese Geschwindigkeit die Lage tatsächlich verändert
Den größten Nutzen haben interaktive Systeme, bei denen ein Nutzer oder Agent sofort auf die Fortsetzung wartet. Eine schnelle Ausgabe verkürzt Pausen in Planungszyklen, bei der Codegenerierung und bei aufeinanderfolgenden Tool-Aufrufen. Gleichzeitig lässt sich durch das große Kontextfenster der Arbeitszustand länger erhalten.
UltraSpeed wird dadurch jedoch nicht automatisch zur besten Wahl für Stapelverarbeitung. Bei großen Mengen an Ausgabetoken sind nicht nur 169 Token pro Sekunde wichtig, sondern auch Gesamtkosten, Stabilität des Anbieters und die Qualität bei den konkreten Zielaufgaben. Die Behauptung einer mit der Pro-Version übereinstimmenden Qualität verstehe ich als Hypothese für einen Vergleich, nicht als universelle Garantie.
Das ist mehr als ein kosmetischer Geschwindigkeitszusatz: Die Verbindung aus angekündigter Beschleunigung, langem Kontext und transparenter Preisgestaltung macht das Modell zu einer echten Alternative für Inferenz mit niedriger Latenz. Die zentrale offene Frage ist nun, wie gut diese Werte bei langen Anfragen und echter Konkurrenz um Rechenkapazität bestehen.