3 min de lecture

Splash écarte les M1 Max et Ultra : quelles alternatives lancer

SplashApple Siliconлокальный ИИllama.cppMetal

La version actuelle de Splash ne fonctionne que sur Apple M3 ou plus récent, avec macOS 26.4 et au moins 36 Go de mémoire unifiée ; Inco recommande 48 Go. Les M1 Max et M1 Ultra sont bloqués par leur génération de GPU : llama.cpp ou LM Studio avec Metal et des modèles GGUF quantifiés sont plus adaptés.

Pourquoi même les puissants M1 Max et Ultra sont exclus

Le constat est immédiatement désagréable : une grande quantité de mémoire ne protège pas un M1 Max ou un M1 Ultra de la restriction imposée par Splash. La version actuellement publiée exige une puce Apple M3 ou plus récente, macOS 26.4 et au moins 36 Go de mémoire unifiée. Dans sa description des prérequis, Inco recommande déjà 48 Go.

Le principal obstacle est matériel, et pas seulement quantitatif. D'après les retours de la communauté, le moteur s'arrête sur les anciens Mac avec une erreur de famille GPU. La GPU family 9 requise commence avec M3 : une machine disposant de beaucoup de mémoire échoue donc malgré tout au contrôle de compatibilité.

C'est là que Splash devient intéressant : il n'est pas conçu comme un runtime universel pour des modèles quelconques. C'est un moteur spécialisé, doté de kernels Metal et de configurations de modèles préparées à l'avance, optimisées pour des cibles précises. Cette approche permet de tirer davantage de performances du matériel pris en charge, mais elle fait de la compatibilité une partie de l'architecture, et non une option facile à désactiver.

Pour les modèles de la classe 27B, la capacité de mémoire unifiée, sa bande passante et les fonctions GPU disponibles comptent simultanément. La restriction aux M3 ne ressemble donc pas à un filtre décoratif, mais à une conséquence du schéma d'optimisation choisi. La compatibilité officielle actuelle ne permet pas de déplacer simplement un paquet Splash vers M1 ou M2.

Quelles options pour les propriétaires d'anciens Apple Silicon

Pour les utilisateurs de M1 et M2, la voie pragmatique est simple : employer un moteur plus universel et choisir le modèle selon la mémoire disponible. LM Studio avec llama.cpp et Metal prend en charge les générations M1, M2, M3 et M4, tandis que lancer llama.cpp directement offre le même chemin de base sans interface.

Le compromis est clair. À la place des optimisations de Splash, il faudra choisir un modèle GGUF plus petit ou une quantification plus agressive. La vitesse et la qualité dépendront moins du nom séduisant de la puce que du modèle précis, de son format et du nombre de couches qui tiennent réellement en mémoire unifiée.

Je vérifierais d'abord la prise en charge de la famille GPU par le runtime choisi, plutôt que la quantité de RAM affichée. L'histoire de Splash illustre bien une nouvelle limite de l'IA locale : un ancien Mac peut rester suffisamment puissant en calcul, tout en étant trop vieux pour un jeu donné de kernels Metal.

Ce n'est pas la fin des M1 Max et Ultra pour les modèles locaux. C'est la fin de l'idée qu'une grande mémoire unifiée garantit automatiquement la compatibilité avec chaque nouveau moteur spécialisé.

Nous avons précédemment présenté Rust LocalGPT, un assistant local distribué sous la forme d'un binaire unique pour l'usage de LLM auto-hébergés. Son approche du déploiement local aide à comprendre pourquoi les changements de prise en charge matérielle comptent pour cette communauté.