Технический контекст
Я сразу полез в спецификации, потому что формулировка «118B, но локально» звучит красиво ровно до первого взгляда на веса. У Poolside новая Laguna S 2.1 это MoE-модель на 118B параметров, но на каждом токене активны только 8B. Для практической AI automation это хороший паттерн: считать дешевле, чем у плотной модели такого класса, а качество для кодинга обещают очень серьезное.
Дальше начинается не маркетинг, а физика. BF16-чекпойнт весит около 236 ГБ, так что на обычную одну потребительскую GPU он, конечно, не «влезает». Если брать официальный маршрут для локального запуска, то речь уже про квантованные веса, и для q4_k_m нужно примерно 75 ГБ памяти.
Вот здесь я и сделал паузу. Это не история про «запустил на RTX 4090 и поехали», а скорее про машины с 128 ГБ unified memory, особенно Apple Silicon, либо про очень аккуратный оффлоад. В доступных материалах Poolside есть форматы BF16, FP8, INT4, NVFP4, GGUF и MLX, но именно удобный single-GPU consumer сценарий там не подтвержден.
По бенчмаркам модель выглядит не как игрушка. Poolside заявляет 70.2% на Terminal-Bench 2.1 и 40.4% на DeepSWE, то есть это явно ставка на длинные coding workflows, а не на красивый демо-автокомплит. Мне нравится именно этот вектор: меньше разговоров про «агента вообще», больше про реальную многошаговую разработку.
Что это меняет для бизнеса и автоматизации
Если смотреть трезво, выигрывают команды, которым нужен локальный AI integration в разработку: приватный код, внутренние репозитории, агент для ревью, рефакторинга и длинных инженерных задач. Но выигрыш есть только там, где железо и архитектура подобраны под модель, а не наоборот.
Проигрывают те, кто прочитает «8B active» как «почти бесплатно». Нет, память все равно упирается в полный 118B след модели, и ошибка в выборе формата или железа быстро превращает проект в дорогой эксперимент.
Я у себя в Nahornyi AI Lab постоянно вижу именно эту развилку: модель сама по себе редко решает задачу, решает связка из квантования, рантайма, памяти, маршрутизации запросов и UX для команды. Если вы хотите build AI automation вокруг локальных кодовых моделей без лишних закупок и ложных стартов, можем вместе разобрать ваш стек и собрать рабочую схему под реальную нагрузку, а не под красивый слайд от вендора.