3 min de lectura

Splash deja fuera al M1 Max y al Ultra: qué usar en su lugar

SplashApple Siliconлокальный ИИllama.cppMetal

La versión actual de Splash solo funciona en Apple M3 o posterior, necesita macOS 26.4 y al menos 36 GB de memoria unificada; Inco recomienda 48 GB. Los M1 Max y M1 Ultra quedan bloqueados por su generación de GPU, así que llama.cpp o LM Studio con Metal y modelos GGUF cuantizados son alternativas más realistas.

Por qué incluso los potentes M1 Max y Ultra se quedan fuera

La conclusión incómoda es inmediata: tener mucha memoria no libra a un M1 Max o M1 Ultra de la restricción de Splash. La compilación publicada actualmente exige Apple M3 o posterior, macOS 26.4 y un mínimo de 36 GB de memoria unificada. Inco ya recomienda 48 GB en la descripción de requisitos.

La barrera principal es de hardware, no solo de capacidad. Según informes de la comunidad, el motor se detiene en Macs antiguos con un error de familia de GPU. La GPU family 9 requerida comienza con M3, por lo que una máquina con mucha memoria sigue sin superar la comprobación de compatibilidad.

Aquí es donde Splash resulta interesante: no está concebido como un runtime universal para modelos arbitrarios. Es un motor especializado, con kernels de Metal y distribuciones de modelos preparadas de antemano y optimizadas para objetivos concretos. Este enfoque permite exprimir el rendimiento del hardware compatible, pero convierte la compatibilidad en parte de la arquitectura, no en una opción fácil de desactivar.

Para modelos de la clase 27B importan al mismo tiempo la capacidad de memoria unificada, su ancho de banda y las funciones de GPU disponibles. Por eso el requisito de M3 no parece un filtro decorativo, sino una consecuencia de la estrategia de optimización elegida. La compatibilidad oficial actual no permite trasladar sin más un paquete de Splash a M1 o M2.

Qué opciones quedan para los dueños de Apple Silicon anteriores

Para usuarios de M1 y M2, el camino práctico es sencillo: usar un motor más universal y elegir el modelo según la memoria disponible. LM Studio con llama.cpp y Metal es compatible con M1, M2, M3 y M4, mientras que ejecutar llama.cpp directamente ofrece la misma ruta básica sin interfaz gráfica.

La concesión es clara. En lugar de las optimizaciones de Splash, habrá que elegir un modelo GGUF más pequeño o una cuantización más agresiva. La velocidad y la calidad dependerán menos del nombre atractivo del chip que del modelo concreto, su formato y cuántas capas caben realmente en la memoria unificada.

Primero comprobaría la compatibilidad de la familia de GPU en el runtime elegido, no la capacidad de RAM anunciada. El caso de Splash muestra bien una nueva frontera de la IA local: un Mac antiguo puede seguir teniendo potencia de cálculo suficiente, pero ser demasiado viejo para un conjunto específico de kernels de Metal.

No es el fin de los M1 Max y Ultra para modelos locales. Es el fin de la idea de que una gran cantidad de memoria unificada garantiza automáticamente compatibilidad con cada nuevo motor especializado.

Anteriormente analizamos Rust LocalGPT, un asistente local de un solo binario diseñado para usar LLM autoalojados. Su enfoque de despliegue local ayuda a entender por qué los cambios en la compatibilidad de hardware importan a esta comunidad.