Splash écarte les M1 Max et Ultra : quelles alternatives lancer
SplashApple Siliconлокальный ИИllama.cppMetal
Pourquoi même les puissants M1 Max et Ultra sont exclus
Le constat est immédiatement désagréable : une grande quantité de mémoire ne protège pas un M1 Max ou un M1 Ultra de la restriction imposée par Splash. La version actuellement publiée exige une puce Apple M3 ou plus récente, macOS 26.4 et au moins 36 Go de mémoire unifiée. Dans sa description des prérequis, Inco recommande déjà 48 Go.
Le principal obstacle est matériel, et pas seulement quantitatif. D'après les retours de la communauté, le moteur s'arrête sur les anciens Mac avec une erreur de famille GPU. La GPU family 9 requise commence avec M3 : une machine disposant de beaucoup de mémoire échoue donc malgré tout au contrôle de compatibilité.
C'est là que Splash devient intéressant : il n'est pas conçu comme un runtime universel pour des modèles quelconques. C'est un moteur spécialisé, doté de kernels Metal et de configurations de modèles préparées à l'avance, optimisées pour des cibles précises. Cette approche permet de tirer davantage de performances du matériel pris en charge, mais elle fait de la compatibilité une partie de l'architecture, et non une option facile à désactiver.
Pour les modèles de la classe 27B, la capacité de mémoire unifiée, sa bande passante et les fonctions GPU disponibles comptent simultanément. La restriction aux M3 ne ressemble donc pas à un filtre décoratif, mais à une conséquence du schéma d'optimisation choisi. La compatibilité officielle actuelle ne permet pas de déplacer simplement un paquet Splash vers M1 ou M2.
Quelles options pour les propriétaires d'anciens Apple Silicon
Pour les utilisateurs de M1 et M2, la voie pragmatique est simple : employer un moteur plus universel et choisir le modèle selon la mémoire disponible. LM Studio avec llama.cpp et Metal prend en charge les générations M1, M2, M3 et M4, tandis que lancer llama.cpp directement offre le même chemin de base sans interface.
Le compromis est clair. À la place des optimisations de Splash, il faudra choisir un modèle GGUF plus petit ou une quantification plus agressive. La vitesse et la qualité dépendront moins du nom séduisant de la puce que du modèle précis, de son format et du nombre de couches qui tiennent réellement en mémoire unifiée.
Je vérifierais d'abord la prise en charge de la famille GPU par le runtime choisi, plutôt que la quantité de RAM affichée. L'histoire de Splash illustre bien une nouvelle limite de l'IA locale : un ancien Mac peut rester suffisamment puissant en calcul, tout en étant trop vieux pour un jeu donné de kernels Metal.
Ce n'est pas la fin des M1 Max et Ultra pour les modèles locaux. C'est la fin de l'idée qu'une grande mémoire unifiée garantit automatiquement la compatibilité avec chaque nouveau moteur spécialisé.