3 Min. Lesezeit

Qwen3-Coder 30B auf RTX 3090: die 24-GB-Grenze

локальные LLMQwen3-CoderRTX 3090

Qwen3-Coder-30B-A3B-Instruct lässt sich auf einer RTX 3090 mit 24 GB VRAM per 4-Bit-Quantisierung ausführen; die Gewichte benötigen etwa 17–20 GB. Das macht lokale Spieleentwicklung praktikabel, doch für KV-Cache und lange Kontexte bleibt wenig Reserve. Bei komplexen agentischen Aufgaben sind kommerzielle Modelle weiterhin im Vorteil.

30B passt tatsächlich in 24 GB, aber ohne Reserve

Ich würde die Idee eines lokalen Coding-Modells auf einer einzelnen RTX 3090 nicht abschreiben: Stand September 2026 ist das bereits eine funktionierende, wenn auch grenzwertige Option. In der bereitgestellten Suchzusammenfassung wird Qwen3-Coder-30B-A3B-Instruct als wichtigster Kandidat genannt, mit 30 Milliarden Parametern, von denen pro Token 3,3 Milliarden aktiv sind.

Bei 4-Bit-Quantisierung belegen die Modellgewichte etwa 17–20 GB. Auf einer Karte mit 24 GB VRAM bleibt Platz für den KV-Cache, doch lange Kontexte verbrauchen diese Reserve schnell. Für herkömmliche Modelle der 30B-Klasse wird eine noch engere Spanne genannt: etwa 18–21 GB allein für die Gewichte.

  • Volle Präzision kommt nicht infrage: das praxistaugliche Szenario beginnt hier mit 4-Bit-Quantisierung.
  • 3,3 Milliarden aktive Parameter helfen bei der Inferenz: die MoE-Architektur muss nicht bei jedem Token alle 30 Milliarden Parameter nutzen.
  • Der Kontext bleibt der Engpass: dass das Modell nominell in den Speicher passt, garantiert noch kein komfortables Arbeiten an einem großen Projekt.

Die Zusammenfassung nennt außerdem Qwen3-Coder-Ergebnisse von etwa 50,3 bei SWE-bench Verified, 66,2 bei Aider Polyglot und 58,9 bei LiveCodeBench v6. Da die Quelldaten weder eine direkte Modellkarte noch Entwicklerdokumentation enthalten, betrachte ich diese Werte als Orientierung und nicht als endgültiges Urteil. Für einen Spieleprototypen ist wichtiger, die Stabilität dateiübergreifender Änderungen, die Werkzeugnutzung und die Codequalität nach mehreren Iterationen zu prüfen.

Lokales Coding ist bereits nützlich, erreicht die Spitze aber noch nicht

Die wesentliche Veränderung ist einfach: Ein lokales Modell der 30B-Klasse kann jetzt auf einer einzelnen Consumer-GPU ein praktischer Prototyping-Assistent sein. Das ermöglicht lokale Ausführung und Experimente ohne ständigen Aufruf eines kommerziellen Modells, sofern die Qualität für das jeweilige Repository ausreicht.

Die in der Diskussion wiederholte Behauptung, offene Modelle lägen exakt drei Monate zurück, würde ich allerdings nicht zu einer Kennzahl machen. Eine Primärquelle wird nicht genannt, und der Abstand hängt von der Aufgabe ab: Kleine Funktionen zu erzeugen und lokale Fehler zu beheben, unterscheidet sich deutlich von langen Agentenzyklen, dateiübergreifendem Refactoring und Debugging.

Der bereitgestellten Zusammenfassung zufolge sind proprietäre Modelle bei komplexen und langwierigen Aufgaben weiterhin stärker. 24 GB VRAM lösen daher das Startproblem, nicht das Zuverlässigkeitsproblem. Die eigentliche Grenze verläuft nicht zwischen lokalem und Cloud-Betrieb, sondern zwischen einem überzeugenden Codeausschnitt und einem Modell, dem man Änderungen am gesamten Projekt anvertrauen kann.

Zuvor haben wir Rust LocalGPT vorgestellt, einen lokalen Assistenten als einzelne Binärdatei mit persistentem Speicher und HTTP-API. Sein Bereitstellungsmodell liefert hilfreichen Kontext dafür, wie sich größere lokale Modelle in selbstgehostete Entwicklungsworkflows einfügen können.