Contexto Técnico
Fui directo a las especificaciones porque la frase "118B, pero local" suena bien hasta que ves los pesos. La nueva Laguna S 2.1 de Poolside es un modelo MoE de 118B parámetros, pero solo 8B están activos por token. Para la automatización práctica de IA, es un buen patrón: más barato que un modelo denso de esta clase y prometen una calidad muy alta para codificación.
Después, no es marketing, es física. El checkpoint BF16 pesa unos 236 GB, así que no cabe en una GPU de consumo común. Si tomas la ruta oficial para ejecución local, se trata de pesos cuantizados, y para q4_k_m necesitas unos 75 GB de memoria.
Aquí me detuve. No es una historia de "lo ejecutas en una RTX 4090 y ya", sino de máquinas con 128 GB de memoria unificada, especialmente Apple Silicon, o de una descarga muy cuidadosa. En los materiales de Poolside aparecen formatos BF16, FP8, INT4, NVFP4, GGUF y MLX, pero no se confirma un escenario cómodo con una sola GPU de consumo.
Los benchmarks muestran que el modelo no es un juguete. Poolside afirma un 70.2% en Terminal-Bench 2.1 y un 40.4% en DeepSWE, claramente apunta a flujos de trabajo de codificación largos, no a una demo de autocompletado bonita. Me gusta esta dirección: menos charla sobre "agentes en general", más sobre desarrollo real de múltiples pasos.
Lo que esto cambia para los negocios y la automatización
Si lo vemos con realismo, ganan los equipos que necesitan integración local de IA en el desarrollo: código privado, repositorios internos, agentes para revisión, refactorización y tareas de ingeniería largas. Pero la ganancia solo llega cuando el hardware y la arquitectura se adaptan al modelo, no al revés.
Pierden quienes leen "8B activos" como "casi gratis". No, la memoria sigue limitada por la huella completa de 118B del modelo, y un error al elegir formato o hardware convierte rápidamente el proyecto en un experimento caro.
En Nahornyi AI Lab veo constantemente esta bifurcación: el modelo por sí solo rara vez resuelve la tarea; lo que la resuelve es la combinación de cuantización, tiempo de ejecución, memoria, enrutamiento de solicitudes y UX del equipo. Si quieres construir automatización de IA alrededor de modelos de código locales sin compras innecesarias y comienzos fallidos, podemos analizar tu stack y armar un esquema de trabajo para cargas reales, no para una diapositiva bonita del proveedor.