2 Min. Lesezeit

Lokales Jev war mit DiffusionGemma 2,4x schneller

DiffusionGemmaJevлокальный инференс

Ein Nutzer-Benchmark zeigt, dass lokal ausgeführtes Jev mit DiffusionGemma unter Einbezug der Netzwerklatenz etwa 2,4-mal schneller war als eine Cloud-Variante. Bei Banking77 lag die Qualität rund 4% niedriger, während die geschätzten monatlichen Kosten für eine Spark GPU bei ungefähr $30 lagen.

Was der lokale Jev-Lauf gezeigt hat

Das einfache Ergebnis ist bemerkenswert: Lokales Jev war etwa 2,4-mal schneller als die Cloud-Variante, wenn die Netzwerklatenz einbezogen wird. Der Beitrag von Nutzer 144406 nennt außerdem einen Qualitätsrückstand von rund 4% beim Banking77-Datensatz. Dies ist ein Nutzertest und kein von NVIDIA oder Google bestätigter Benchmark.

Im Hintergrund läuft DiffusionGemma mit NVFP4-Quantisierung. Die NVIDIA-Modellkarte auf Hugging Face nennt 25,2 Milliarden Parameter insgesamt und 3,8 Milliarden aktive Parameter, während Google in der Modellübersicht die gerundeten Angaben 26B total und 4B active verwendet. Die MoE-Architektur aktiviert bei jedem Durchlauf nur einen Teil der Parameter.

DiffusionGemma unterscheidet sich auch bei der Generierung: Das Modell verarbeitet parallele Blöcke mit jeweils 256 Token, statt sich auf ein strikt sequenzielles Dekodieren von links nach rechts zu beschränken. Die Modellkarte nennt zudem ein Kontextfenster von 256K, Function Calling und einen anpassbaren Reasoning-Modus. Für lokale Inferenz ist die NVFP4-Variante für vLLM vorbereitet; sowohl Gewichte als auch Aktivierungen sind quantisiert.

Die Kostenschätzung liegt bei etwa $30 monatlich für eine Spark GPU mit einem typischen Lastprofil. Zum Zeitpunkt der Diskussion war dies eine externe Berechnung und kein offizieller Preis von NVIDIA oder Google. Der tatsächliche Betrag hängt von Auslastung, Batching und Laufzeit der Hardware ab.

Stand 22. September 2026 würde ich diese Zahlen als starkes vorläufiges Signal einordnen. Für einen fairen Vergleich fehlen noch identische Prompts, Hardware-Konfiguration, Batchgröße, Latenzverteilung und eine vollständige Beschreibung der Banking77-Auswertung.

Warum lokale Inferenz hier wirklich interessant ist

Der wichtigste Gewinn ist nicht nur die durchschnittliche Geschwindigkeit, sondern dass das Netzwerk aus dem kritischen Pfad verschwindet. Für interaktive Klassifikatoren und Agenten kann das besser vorhersehbare Latenzen, mehr Datenkontrolle und weniger Abhängigkeit von einer externen API bedeuten.

NVFP4 macht jedoch nicht jede RTX-Karte zur idealen Plattform. Der native Vorteil des Formats ist an Blackwell gebunden; ältere RTX-GPUs benötigen möglicherweise ein anderes Format, striktes Speichermanagement oder einen Kompromiss beim Durchsatz. Ich würde zuerst VRAM, Speicherbandbreite und die Qualität auf dem konkreten Zieldatensatz prüfen.

Ein Rückstand von rund 4% bei Banking77 kann je nach Fehlern in einzelnen Klassen akzeptabel oder kritisch sein. Die entscheidende Frage ist nicht die attraktive Zahl von 2,4x, sondern ob dieses Verhältnis aus Geschwindigkeit, Kosten und Qualität auch außerhalb eines einzelnen Nutzerszenarios bestehen bleibt.

Zuvor haben wir Rust LocalGPT vorgestellt, einen lokalen Single-Binary-Assistenten für selbstgehostete Inferenz mit persistentem Speicher und HTTP-API. Sein Bereitstellungsmodell liefert nützlichen Kontext für die Bewertung schnellerer lokaler Inferenz bei Leistung auf Cloud-Niveau.