2 хв читання

Splash відсікає M1 Max та Ultra: що запускати натомість

SplashApple Siliconлокальный ИИllama.cppMetal

Поточна збірка Splash працює лише на Apple M3 або новіших чипах, потребує macOS 26.4 і щонайменше 36 ГБ об'єднаної пам'яті, хоча Inco радить 48 ГБ. M1 Max та M1 Ultra блокуються через покоління GPU, тому практичнішими є llama.cpp або LM Studio з Metal і квантизованими GGUF-моделями.

Чому навіть потужні M1 Max і Ultra залишилися за бортом

Неприємний висновок одразу: великий обсяг пам'яті не рятує M1 Max чи M1 Ultra від обмеження Splash. Поточна випущена збірка потребує Apple M3 або новішого чипа, macOS 26.4 і щонайменше 36 ГБ об'єднаної пам'яті. У описі вимог Inco вже рекомендує 48 ГБ.

Ключовий бар'єр тут апаратний, а не лише кількісний. За повідомленнями спільноти, на старіших Mac рушій зупиняється з помилкою сімейства GPU. Потрібна GPU family 9 починається з M3, тому машина з великим обсягом пам'яті однаково не проходить перевірку сумісності.

Саме тут Splash стає цікавим: він побудований не як універсальний рантайм для довільних моделей. Це спеціалізований рушій з Metal-ядрами та заздалегідь підготовленими конфігураціями моделей, оптимізованими під конкретні цілі. Такий підхід дає змогу вичавити швидкість із підтримуваного заліза, але робить сумісність частиною архітектури, а не параметром, який легко вимкнути.

Для моделей класу 27B одночасно важливі місткість об'єднаної пам'яті, її пропускна здатність і доступні можливості GPU. Тому обмеження на M3 виглядає не декоративним фільтром, а наслідком обраної схеми оптимізації. Поточна офіційна сумісність не дозволяє просто перенести пакет Splash на M1 або M2.

Що залишається власникам старіших Apple Silicon

Для M1 і M2 практичний шлях зараз один: використовувати універсальніший рушій і добирати модель відповідно до доступної пам'яті. LM Studio з llama.cpp і Metal підтримує покоління M1, M2, M3 та M4, а прямий запуск llama.cpp дає той самий базовий шлях без оболонки.

Компроміс зрозумілий. Замість оптимізацій Splash доведеться вибирати меншу GGUF-модель або агресивніше квантування. Швидкість і якість залежатимуть не від гарної назви чипа, а від конкретної моделі, формату та кількості шарів, які реально вміщуються в об'єднану пам'ять.

Я б насамперед перевіряв не заявлений обсяг RAM, а підтримку сімейства GPU вибраним рантаймом. Історія зі Splash добре показує нову межу локального ШІ: старий Mac може бути достатньо потужним обчислювально, але надто старим для конкретного набору Metal-ядер.

Це не кінець M1 Max і Ultra для локальних моделей. Це кінець ілюзії, що великий обсяг об'єднаної пам'яті автоматично гарантує сумісність із кожним новим спеціалізованим рушієм.

Раніше ми розповідали про Rust LocalGPT — локального асистента в одному бінарному файлі для самостійного розгортання LLM. Його підхід до локального запуску дає корисний контекст, чому зміни в підтримці обладнання важливі для цієї спільноти.