3 Min. Lesezeit

Splash schließt M1 Max und Ultra aus: Was stattdessen läuft

SplashApple Siliconлокальный ИИllama.cppMetal

Der aktuelle Splash-Build läuft nur auf Apple M3 oder neuer, benötigt macOS 26.4 und mindestens 36 GB Unified Memory; Inco empfiehlt 48 GB. M1 Max und M1 Ultra werden wegen ihrer GPU-Generation ausgeschlossen. Praktischer sind daher llama.cpp oder LM Studio mit Metal und quantisierten GGUF-Modellen.

Warum selbst leistungsstarke M1 Max und Ultra außen vor bleiben

Die unangenehme Schlussfolgerung vorweg: Viel Speicher bewahrt einen M1 Max oder M1 Ultra nicht vor der Einschränkung von Splash. Der aktuell veröffentlichte Build verlangt Apple M3 oder neuer, macOS 26.4 und mindestens 36 GB Unified Memory. Inco empfiehlt in der Beschreibung der Anforderungen bereits 48 GB.

Die zentrale Hürde ist hardwarebedingt und nicht nur eine Frage der Kapazität. Laut Berichten aus der Community stoppt die Engine auf älteren Macs mit einem Fehler zur GPU-Familie. Die benötigte GPU family 9 beginnt erst bei M3. Daher scheitert auch ein Rechner mit viel Speicher weiterhin an der Kompatibilitätsprüfung.

Genau hier wird Splash interessant: Es ist nicht als universelle Runtime für beliebige Modelle aufgebaut. Es handelt sich um eine spezialisierte Engine mit Metal-Kernels und vorgefertigten Modell-Layouts, die auf konkrete Ziele optimiert sind. Dieser Ansatz kann aus unterstützter Hardware mehr Geschwindigkeit herausholen, macht Kompatibilität aber zu einem Teil der Architektur statt zu einer Option, die sich leicht abschalten lässt.

Bei Modellen der 27B-Klasse zählen die Kapazität des Unified Memory, dessen Bandbreite und die verfügbaren GPU-Funktionen gleichzeitig. Die Beschränkung auf M3 wirkt deshalb nicht wie ein dekorativer Filter, sondern wie eine Folge der gewählten Optimierungsstrategie. Die aktuelle offizielle Kompatibilität erlaubt es nicht, ein Splash-Paket einfach auf M1 oder M2 zu übertragen.

Was Besitzern älterer Apple-Silicon-Macs bleibt

Für M1- und M2-Nutzer ist der praktische Weg derzeit klar: eine universellere Engine verwenden und das Modell passend zum verfügbaren Speicher auswählen. LM Studio mit llama.cpp und Metal unterstützt M1, M2, M3 und M4, während der direkte Start von llama.cpp denselben grundlegenden Weg ohne Oberfläche bietet.

Der Kompromiss liegt auf der Hand. Statt der Optimierungen von Splash braucht es möglicherweise ein kleineres GGUF-Modell oder eine aggressivere Quantisierung. Geschwindigkeit und Qualität hängen dann nicht vom attraktiven Namen des Chips ab, sondern vom konkreten Modell, seinem Format und davon, wie viele Layer tatsächlich in den Unified Memory passen.

Ich würde zuerst nicht die angegebene RAM-Menge prüfen, sondern die Unterstützung der GPU-Familie durch die gewählte Runtime. Die Geschichte von Splash zeigt gut eine neue Grenze lokaler KI: Ein älterer Mac kann rechnerisch noch leistungsfähig genug sein und dennoch für einen bestimmten Satz von Metal-Kernels zu alt sein.

Das ist nicht das Ende von M1 Max und Ultra für lokale Modelle. Es ist das Ende der Annahme, dass viel Unified Memory automatisch Kompatibilität mit jeder neuen spezialisierten Engine garantiert.

Zuvor haben wir Rust LocalGPT vorgestellt, einen lokalen Assistenten als einzelne Binärdatei für den selbst gehosteten Einsatz von LLMs. Sein Ansatz für lokale Bereitstellungen liefert wichtigen Kontext dafür, warum Änderungen bei der Hardwareunterstützung für diese Community relevant sind.