Muse Glimmer 30B passt in 24 GB VRAM
ai-modelscoding-agentslocal-ai
Was genau veröffentlicht wurde
Muse Glimmer 30B fällt nicht deshalb auf, weil es noch ein großes Modell ist, sondern weil Meta es im Launch-Post und auf der Hugging-Face-Karte als offenes lokales Modell für agentisches Coding positioniert. Die Karte nennt 30 Milliarden Parameter, Apache 2.0, das Veröffentlichungsdatum August 2026 und einen Kontext von 131.072+ Token.
Die offenen Gewichte liegen auf Hugging Face, und im Umfeld des Release taucht eine 17-GB-Quantisierung für Geräte mit 24 GB Speicher auf. Das ist die praktische Grenze: kein Server-Rack, kein Cloud-Zähler, sondern ein starker lokaler Knoten.
Das Modell ist außerdem multimodal, mit Fokus auf agentischem Coding. Die Wette lautet nicht nur auf Code-Autovervollständigung, sondern auf Arbeit im Agentenmodus: Kontext lesen, eine lange Aufgabe halten, Tools aufrufen und zum Patch zurückkehren. 131k Token sind hier kein Luxus, sondern eine Absicherung gegen das ständige Abschneiden des Repositorys.
Benchmarks wirken stark, aber nicht magisch
Der Sinn der Benchmarks ist einfach: Glimmer sieht nicht mehr wie ein lokales Modell zweiter Klasse aus. In den genannten Vergleichen zum agentischen Coding ist es deutlich stärker als Gemma4-31B und liegt ungefähr gleichauf mit Qwen3.6-27B: Glimmer ist besser bei SWE-Bench Pro, Qwen stärker beim Terminal-Bench.
In der NVIDIA-Dokumentation zu Muse Glimmer taucht außerdem SWE-Bench Verified 76,0 auf. Das ist ein nützlicher Punkt auf der Karte, aber ich würde daraus keine Kultzahl machen: Coding-Agenten scheitern nicht nur beim Lösen von Aufgaben, sondern auch bei langen Iterationen, unsauberen Abhängigkeiten und schlechtem Tool-Einsatz.
Die auffälligste Geschwindigkeitsangabe stammt von einem kleinen Hilfsmodell zur Beschleunigung der Generierung. Damit werden für Glimmer 233 Token pro Sekunde auf einer RTX 5090, 50 auf M5 Max und 38 auf M4 Max genannt. Schön, aber in der realen Arbeit zählt weniger der Spitzendurchsatz, sondern wie viele dieser Token das Review überleben.
Was das für lokales Coding ändert
Die wichtigste Verschiebung: 24 GB VRAM werden zu einer normalen Hardwareklasse für einen ernsthaften lokalen Coding-Agenten. Nicht für einen Spielzeug-Chatbot neben dem Editor, sondern für ein Modell mit offenen Gewichten, langem Kontext und Apache-2.0-Lizenz.
Für mich ist hier genau die Kombination aus Lizenz, Größe und Quantisierung wichtig. Wenn sich das Modell lokal ausführen lässt, in der Nähe von privatem Code bleibt und nicht sofort an eine Cloud-API stößt, werden technische Experimente deutlich entspannter.
Aber die Schwachstelle bleibt: die Agentenfähigkeit. Lokale Ausführung garantiert keine sorgfältigen Änderungen, sicheren Befehle und reibungslose Arbeit mit einem großen Repository. Die Frage ist nicht mehr, ob ein lokales Modell Code schreiben kann, sondern wie viel Autonomie man ihm ohne Sicherungsleine anvertrauen kann.