2 Min. Lesezeit

Lokale Inferenz: 90 Watt gegen teure GPUs

локальный инференсоблачный инференсGPU

Lokale Inferenz bietet planbare Kosten und Freiheit zum Experimentieren: Das beschriebene Spark-System verbrauchte rund 90 Watt. Doch die Knappheit verändert die Rechnung, denn RTX PRO 6000 kosten inzwischen 16–17 Tausend Dollar. Die Cloud bleibt sinnvoll für unregelmäßige Lasten und temporären Zugang zu H200-Hardware.

Lokaler Betrieb spart an unerwarteten Stellen

Ich würde die Entscheidung nicht allein auf den Tokenpreis reduzieren. Im beschriebenen Beispiel verbrauchte ein lokales System rund 90 Watt und ermöglichte Experimente ohne Angst vor einer unerwarteten Cloud-Rechnung. In der ursprünglichen Diskussion nennt Teilnehmer 144406 Spark als Beispiel für eine solche Konfiguration.

90 Watt dürfen jedoch nicht als allgemeingültiger Wert für lokale KI gelten. Sie stehen für einen bestimmten Betriebsmodus, ein bestimmtes Modell und eine konkrete Hardwarekonfiguration – nicht für einen Richtwert zum Bereitstellen großer Modelle. Mit steigenden Anforderungen an Speicher und Leistung wird aus einem sparsamen lokalen System schnell ein teures Rack, das zusätzlich gekühlt werden muss.

Genau hier liegt das Paradox des Open-Weight-Ökosystems. Fast täglich erscheinende chinesische Modelle erweitern die Auswahl, treiben aber zugleich die Nachfrage nach GPUs mit viel Speicher nach oben. Zum Zeitpunkt der Diskussion stiegen die Preise für RTX PRO 6000 von 11–13 auf 16–17 Tausend Dollar.

Die Cloud vermeidet die Anfangsinvestition, doch jede aktive Sitzung kostet Geld. Preisübersichten aus der Mitte des Jahres 2026 verorteten H200 bei etwa 4,50–5,50 Dollar pro Stunde zu regulären Tarifen und bei 1,80–2,80 Dollar in einzelnen Spot-Angeboten. Für seltene, rechenintensive Läufe ist diese Rechnung oft plausibler als der Kauf eines Beschleunigers.

Der Kontrast wird im Anthropic-Artikel „Automated researchers can reliably mitigate alignment failures“ vom 28. August 2026 deutlich. Dort kamen H200 für automatisierte Forschende zum Einsatz. Das ist bereits eine Aufgabenklasse, für die ein kompakter lokaler 90-Watt-Betrieb keine direkte Alternative darstellt.

Auslastung statt Ideologie bestimmt nun die Wahl

Lokale Inferenz gewinnt bei kontinuierlicher Nutzung, sensiblen Daten und dem Bedarf an vollständiger Kontrolle über die Umgebung. Die Cloud bleibt stärker bei unregelmäßiger Auslastung, abrupten Spitzen und Experimenten, die zeitweise Beschleuniger der H200-Klasse benötigen.

Bei der ersten Rechnung sollten nicht nur Strom und Stundentarif zählen. Zum lokalen Kostenmodell gehören GPU-Preis, Leerlauf, Kühlung, Wartung und das Risiko schneller Obsoleszenz. Zum Cloud-Modell gehören Speicher, Datenübertragung und Stunden, die durch schlecht konfigurierte Ressourcenlebenszyklen verloren gehen.

Die steigenden Preise der RTX PRO 6000 zeigen, dass Open-Weight-Modelle Inferenz nicht nur demokratisieren. Sie verlagern die Knappheit von APIs auf Hardware. Die zentrale offene Frage lautet nicht mehr, wo das Modell läuft, sondern wie vollständig der gekaufte Beschleuniger tatsächlich ausgelastet wird.

Wir haben zuvor Cocoon untersucht und gezeigt, wie vertrauliches Rechnen die Inferenzkosten und Datenschutzanforderungen verändert. Dieses Beispiel ergänzt die Frage, wann sich eigene Infrastruktur trotz steigender GPU-Preise lohnt.