Skip to main content
PoolsideLaguna S 2.1локальные LLM

Laguna S 2.1: локальная кодовая MoE без магии

Poolside выпустила Laguna S 2.1, 118B MoE-модель с 8B активных параметров на токен. Для AI implementation это важный сигнал: сильные кодогенерирующие модели становятся ближе к локальному запуску, но без иллюзий — память все еще решает всё, определяя реальную доступность. Этот сдвиг заставляет пересмотреть подходы к приватности и инфраструктуре.

Технический контекст

Я сразу полез в спецификации, потому что формулировка «118B, но локально» звучит красиво ровно до первого взгляда на веса. У Poolside новая Laguna S 2.1 это MoE-модель на 118B параметров, но на каждом токене активны только 8B. Для практической AI automation это хороший паттерн: считать дешевле, чем у плотной модели такого класса, а качество для кодинга обещают очень серьезное.

Дальше начинается не маркетинг, а физика. BF16-чекпойнт весит около 236 ГБ, так что на обычную одну потребительскую GPU он, конечно, не «влезает». Если брать официальный маршрут для локального запуска, то речь уже про квантованные веса, и для q4_k_m нужно примерно 75 ГБ памяти.

Вот здесь я и сделал паузу. Это не история про «запустил на RTX 4090 и поехали», а скорее про машины с 128 ГБ unified memory, особенно Apple Silicon, либо про очень аккуратный оффлоад. В доступных материалах Poolside есть форматы BF16, FP8, INT4, NVFP4, GGUF и MLX, но именно удобный single-GPU consumer сценарий там не подтвержден.

По бенчмаркам модель выглядит не как игрушка. Poolside заявляет 70.2% на Terminal-Bench 2.1 и 40.4% на DeepSWE, то есть это явно ставка на длинные coding workflows, а не на красивый демо-автокомплит. Мне нравится именно этот вектор: меньше разговоров про «агента вообще», больше про реальную многошаговую разработку.

Что это меняет для бизнеса и автоматизации

Если смотреть трезво, выигрывают команды, которым нужен локальный AI integration в разработку: приватный код, внутренние репозитории, агент для ревью, рефакторинга и длинных инженерных задач. Но выигрыш есть только там, где железо и архитектура подобраны под модель, а не наоборот.

Проигрывают те, кто прочитает «8B active» как «почти бесплатно». Нет, память все равно упирается в полный 118B след модели, и ошибка в выборе формата или железа быстро превращает проект в дорогой эксперимент.

Я у себя в Nahornyi AI Lab постоянно вижу именно эту развилку: модель сама по себе редко решает задачу, решает связка из квантования, рантайма, памяти, маршрутизации запросов и UX для команды. Если вы хотите build AI automation вокруг локальных кодовых моделей без лишних закупок и ложных стартов, можем вместе разобрать ваш стек и собрать рабочую схему под реальную нагрузку, а не под красивый слайд от вендора.

Мы ранее рассматривали метод простой самодистилляции для повышения качества кодогенерации без использования сложных верификаторов. Эта техника пересекается с задачей запуска больших моделей на ограниченном железе, о которой идёт речь в данной статье.

Поделиться статьёй