Skip to main content
PoolsideLaguna S 2.1локальные LLM

Laguna S 2.1: MoE de Código Local Sin Magia

Poolside ha lanzado Laguna S 2.1, un modelo de mezcla de expertos de 118B con solo 8B de parámetros activos por token. Para la implementación de IA, esto es una señal importante: los potentes modelos generadores de código se acercan a la ejecución local, pero sin ilusiones: la memoria sigue siendo el factor decisivo.

Contexto Técnico

Fui directo a las especificaciones porque la frase "118B, pero local" suena bien hasta que ves los pesos. La nueva Laguna S 2.1 de Poolside es un modelo MoE de 118B parámetros, pero solo 8B están activos por token. Para la automatización práctica de IA, es un buen patrón: más barato que un modelo denso de esta clase y prometen una calidad muy alta para codificación.

Después, no es marketing, es física. El checkpoint BF16 pesa unos 236 GB, así que no cabe en una GPU de consumo común. Si tomas la ruta oficial para ejecución local, se trata de pesos cuantizados, y para q4_k_m necesitas unos 75 GB de memoria.

Aquí me detuve. No es una historia de "lo ejecutas en una RTX 4090 y ya", sino de máquinas con 128 GB de memoria unificada, especialmente Apple Silicon, o de una descarga muy cuidadosa. En los materiales de Poolside aparecen formatos BF16, FP8, INT4, NVFP4, GGUF y MLX, pero no se confirma un escenario cómodo con una sola GPU de consumo.

Los benchmarks muestran que el modelo no es un juguete. Poolside afirma un 70.2% en Terminal-Bench 2.1 y un 40.4% en DeepSWE, claramente apunta a flujos de trabajo de codificación largos, no a una demo de autocompletado bonita. Me gusta esta dirección: menos charla sobre "agentes en general", más sobre desarrollo real de múltiples pasos.

Lo que esto cambia para los negocios y la automatización

Si lo vemos con realismo, ganan los equipos que necesitan integración local de IA en el desarrollo: código privado, repositorios internos, agentes para revisión, refactorización y tareas de ingeniería largas. Pero la ganancia solo llega cuando el hardware y la arquitectura se adaptan al modelo, no al revés.

Pierden quienes leen "8B activos" como "casi gratis". No, la memoria sigue limitada por la huella completa de 118B del modelo, y un error al elegir formato o hardware convierte rápidamente el proyecto en un experimento caro.

En Nahornyi AI Lab veo constantemente esta bifurcación: el modelo por sí solo rara vez resuelve la tarea; lo que la resuelve es la combinación de cuantización, tiempo de ejecución, memoria, enrutamiento de solicitudes y UX del equipo. Si quieres construir automatización de IA alrededor de modelos de código locales sin compras innecesarias y comienzos fallidos, podemos analizar tu stack y armar un esquema de trabajo para cargas reales, no para una diapositiva bonita del proveedor.

Anteriormente analizamos un método sencillo de autodestilación para mejorar la calidad de la generación de código sin utilizar verificadores complejos. Esta técnica se cruza con el desafío de ejecutar modelos grandes en hardware limitado, del que trata este artículo.

Compartir este articulo