Технічний контекст
Я відразу поліз у специфікації, бо формулювання «118B, але локально» звучить гарно рівно до першого погляду на ваги. У Poolside нова Laguna S 2.1 — це MoE-модель на 118B параметрів, але на кожному токені активні лише 8B. Для практичної AI automation це хороший патерн: рахувати дешевше, ніж у щільної моделі такого класу, а якість для кодингу обіцяють дуже серйозну.
Далі починається не маркетинг, а фізика. BF16-чекпойнт важить близько 236 ГБ, тож на звичайну одну споживчу GPU він, звісно, не «влазить». Якщо брати офіційний маршрут для локального запуску, то йдеться вже про квантовані ваги, і для q4_k_m потрібно приблизно 75 ГБ пам’яті.
Ось тут я і зробив паузу. Це не історія про «запустив на RTX 4090 і поїхали», а скоріше про машини зі 128 ГБ unified memory, особливо Apple Silicon, або про дуже акуратний оффлоад. У доступних матеріалах Poolside є формати BF16, FP8, INT4, NVFP4, GGUF і MLX, але саме зручний single-GPU consumer сценарій там не підтверджено.
За бенчмарками модель виглядає не як іграшка. Poolside заявляє 70.2% на Terminal-Bench 2.1 і 40.4% на DeepSWE, тобто це явно ставка на довгі coding workflows, а не на гарний демо-автокомпліт. Мені подобається саме цей вектор: менше розмов про «агента взагалі», більше про реальну багатокрокову розробку.
Що це змінює для бізнесу та автоматизації
Якщо дивитися тверезо, виграють команди, яким потрібна локальна AI integration у розробку: приватний код, внутрішні репозиторії, агент для рев’ю, рефакторингу і довгих інженерних задач. Але виграш є лише там, де залізо та архітектура підібрані під модель, а не навпаки.
Програють ті, хто прочитає «8B active» як «майже безкоштовно». Ні, пам’ять усе одно впирається в повний 118B слід моделі, і помилка у виборі формату чи заліза швидко перетворює проєкт на дорогий експеримент.
Я у себе в Nahornyi AI Lab постійно бачу саме цю розвилку: модель сама по собі рідко вирішує задачу, вирішує зв’язка з квантування, рантайму, пам’яті, маршрутизації запитів і UX для команди. Якщо ви хочете build AI automation навколо локальних кодових моделей без зайвих закупок і хибних стартів, можемо разом розібрати ваш стек і зібрати робочу схему під реальне навантаження, а не під гарний слайд від вендора.