10 Millionen Tokens pro Sekunde: Rekord oder Metriktrick?
инференсLLMбенчмарки
Was hinter 10 Millionen Tokens pro Sekunde steckt
Ich würde 10 Millionen Tokens pro Sekunde nicht als Geschwindigkeit eines Modells bezeichnen, solange nicht klar ist, was genau und wie gemessen wurde. Ausgangspunkt war ein Beitrag von Rysana auf X, auf den User 144406 verwies. Die Diskussion warf verständlicherweise Fragen auf, und die Kosten dieser Geschwindigkeit wurden sogar mit einem Goldbarren pro Million Tokens verglichen.
Das Kernproblem ist nicht die große Zahl selbst, sondern ihr Nenner. Gemeint sein könnte der aggregierte Durchsatz eines Clusters beim Batching, die Prefill-Geschwindigkeit, die Verarbeitung gecachter Zustände oder das Decode einer einzelnen Anfrage. Für Nutzende sehen diese Modi völlig unterschiedlich aus, auch wenn das Marketing sie alle als Tokens pro Sekunde bezeichnet.
Auch bei langen Kontexten zeigt sich eine aufschlussreiche Verwechslung. Lightbits und Inferra nennen die Unterstützung eines Kontexts von 10 Millionen Tokens auf L40S-Hardware, doch das angeführte Ergebnis betrifft die Zeit bis zum ersten Token: 26 Sekunden statt 8,3 Stunden. Das ist eine starke Beschleunigung eines bestimmten Schritts, nicht die Erzeugung von 10 Millionen neuen Tokens pro Sekunde.
Als Größenvergleich dient die Benchmark-Seite von NVIDIA. Dort werden für DeepSeek R1 auf einem Vera Rubin NVL72-System 1.183.327 Tokens pro Sekunde genannt. Das ist eine enorme Zahl, sie gilt jedoch für ein spezialisiertes Multiprozessorsystem und liegt weiterhin deutlich unter den diskutierten 10 Millionen.
Warum dieser Rekord bisher wenig über den Praxiseinsatz aussagt
Ohne Hardwarekonfiguration, Batchgröße und eine klare Trennung von Prefill und Decode lässt sich dieser Rekord nicht auf eine gewöhnliche API-Anfrage übertragen. Mit Stand vom 30. September 2026 zeigt der verfügbare Kontext nicht, dass ein einzelnes Modell 10 Millionen Output-Tokens pro Sekunde für einen Nutzer erzeugt.
Technisch sind drei Dinge wichtig: die Latenz bis zum ersten Token, die dauerhaft erreichbare Generierungsgeschwindigkeit und die Verarbeitungskosten. Aggregierter Throughput kann ein hervorragender Wert für die Clusterauslastung sein und zugleich nichts über die Latenz einer einzelnen Sitzung aussagen. Je größer der Batch, desto beeindruckender die Zahl und desto schwächer ihr Bezug zur interaktiven Nutzung.
Mein Fazit ist einfach: Das Ergebnis muss nicht gefälscht sein, doch die Aussage ist bislang eindeutig mehrdeutig. Im Inferenzrennen gewinnt nicht, wer die größte Zahl hat, sondern wer die Achsen seines Diagramms am ehrlichsten beschriftet.