Skip to main content
PoolsideLaguna S 2.1локальные LLM

Laguna S 2.1: локальна кодова MoE без магії

Poolside випустила Laguna S 2.1, 118B модель зі змішаними експертами (MoE) і лише 8B активними параметрами на токен. Для впровадження ШІ це важливий сигнал: потужні кодогенеруючі моделі стають ближчими до локального запуску, але без ілюзій — пам'ять, як і раніше, вирішує все. Це може змінити підхід до приватності та інфраструктури.

Технічний контекст

Я відразу поліз у специфікації, бо формулювання «118B, але локально» звучить гарно рівно до першого погляду на ваги. У Poolside нова Laguna S 2.1 — це MoE-модель на 118B параметрів, але на кожному токені активні лише 8B. Для практичної AI automation це хороший патерн: рахувати дешевше, ніж у щільної моделі такого класу, а якість для кодингу обіцяють дуже серйозну.

Далі починається не маркетинг, а фізика. BF16-чекпойнт важить близько 236 ГБ, тож на звичайну одну споживчу GPU він, звісно, не «влазить». Якщо брати офіційний маршрут для локального запуску, то йдеться вже про квантовані ваги, і для q4_k_m потрібно приблизно 75 ГБ пам’яті.

Ось тут я і зробив паузу. Це не історія про «запустив на RTX 4090 і поїхали», а скоріше про машини зі 128 ГБ unified memory, особливо Apple Silicon, або про дуже акуратний оффлоад. У доступних матеріалах Poolside є формати BF16, FP8, INT4, NVFP4, GGUF і MLX, але саме зручний single-GPU consumer сценарій там не підтверджено.

За бенчмарками модель виглядає не як іграшка. Poolside заявляє 70.2% на Terminal-Bench 2.1 і 40.4% на DeepSWE, тобто це явно ставка на довгі coding workflows, а не на гарний демо-автокомпліт. Мені подобається саме цей вектор: менше розмов про «агента взагалі», більше про реальну багатокрокову розробку.

Що це змінює для бізнесу та автоматизації

Якщо дивитися тверезо, виграють команди, яким потрібна локальна AI integration у розробку: приватний код, внутрішні репозиторії, агент для рев’ю, рефакторингу і довгих інженерних задач. Але виграш є лише там, де залізо та архітектура підібрані під модель, а не навпаки.

Програють ті, хто прочитає «8B active» як «майже безкоштовно». Ні, пам’ять усе одно впирається в повний 118B слід моделі, і помилка у виборі формату чи заліза швидко перетворює проєкт на дорогий експеримент.

Я у себе в Nahornyi AI Lab постійно бачу саме цю розвилку: модель сама по собі рідко вирішує задачу, вирішує зв’язка з квантування, рантайму, пам’яті, маршрутизації запитів і UX для команди. Якщо ви хочете build AI automation навколо локальних кодових моделей без зайвих закупок і хибних стартів, можемо разом розібрати ваш стек і зібрати робочу схему під реальне навантаження, а не під гарний слайд від вендора.

Ми раніше розглядали метод простої самодистиляції для підвищення якості кодогенерації без використання складних верифікаторів. Ця техніка перетинається із завданням запуску великих моделей на обмеженому обладнанні, про яке йдеться у цій статті.

Поділитися статтею