Splash schließt M1 Max und Ultra aus: Was stattdessen läuft
SplashApple Siliconлокальный ИИllama.cppMetal
Warum selbst leistungsstarke M1 Max und Ultra außen vor bleiben
Die unangenehme Schlussfolgerung vorweg: Viel Speicher bewahrt einen M1 Max oder M1 Ultra nicht vor der Einschränkung von Splash. Der aktuell veröffentlichte Build verlangt Apple M3 oder neuer, macOS 26.4 und mindestens 36 GB Unified Memory. Inco empfiehlt in der Beschreibung der Anforderungen bereits 48 GB.
Die zentrale Hürde ist hardwarebedingt und nicht nur eine Frage der Kapazität. Laut Berichten aus der Community stoppt die Engine auf älteren Macs mit einem Fehler zur GPU-Familie. Die benötigte GPU family 9 beginnt erst bei M3. Daher scheitert auch ein Rechner mit viel Speicher weiterhin an der Kompatibilitätsprüfung.
Genau hier wird Splash interessant: Es ist nicht als universelle Runtime für beliebige Modelle aufgebaut. Es handelt sich um eine spezialisierte Engine mit Metal-Kernels und vorgefertigten Modell-Layouts, die auf konkrete Ziele optimiert sind. Dieser Ansatz kann aus unterstützter Hardware mehr Geschwindigkeit herausholen, macht Kompatibilität aber zu einem Teil der Architektur statt zu einer Option, die sich leicht abschalten lässt.
Bei Modellen der 27B-Klasse zählen die Kapazität des Unified Memory, dessen Bandbreite und die verfügbaren GPU-Funktionen gleichzeitig. Die Beschränkung auf M3 wirkt deshalb nicht wie ein dekorativer Filter, sondern wie eine Folge der gewählten Optimierungsstrategie. Die aktuelle offizielle Kompatibilität erlaubt es nicht, ein Splash-Paket einfach auf M1 oder M2 zu übertragen.
Was Besitzern älterer Apple-Silicon-Macs bleibt
Für M1- und M2-Nutzer ist der praktische Weg derzeit klar: eine universellere Engine verwenden und das Modell passend zum verfügbaren Speicher auswählen. LM Studio mit llama.cpp und Metal unterstützt M1, M2, M3 und M4, während der direkte Start von llama.cpp denselben grundlegenden Weg ohne Oberfläche bietet.
Der Kompromiss liegt auf der Hand. Statt der Optimierungen von Splash braucht es möglicherweise ein kleineres GGUF-Modell oder eine aggressivere Quantisierung. Geschwindigkeit und Qualität hängen dann nicht vom attraktiven Namen des Chips ab, sondern vom konkreten Modell, seinem Format und davon, wie viele Layer tatsächlich in den Unified Memory passen.
Ich würde zuerst nicht die angegebene RAM-Menge prüfen, sondern die Unterstützung der GPU-Familie durch die gewählte Runtime. Die Geschichte von Splash zeigt gut eine neue Grenze lokaler KI: Ein älterer Mac kann rechnerisch noch leistungsfähig genug sein und dennoch für einen bestimmten Satz von Metal-Kernels zu alt sein.
Das ist nicht das Ende von M1 Max und Ultra für lokale Modelle. Es ist das Ende der Annahme, dass viel Unified Memory automatisch Kompatibilität mit jeder neuen spezialisierten Engine garantiert.