3 мин чтения

Muse Glimmer 30B влезает в 24 ГБ VRAM

ai-modelscoding-agentslocal-ai

Meta выпустила Muse Glimmer 30B как открытую локальную модель для агентного кодинга: 30 млрд параметров, контекст 131к токенов, Apache 2.0 и 17-гигабайтная квантизация для устройств с 24 ГБ памяти. Это важно не как игрушка, а как сдвиг локального кодинг-агента ближе к рабочей машине.

Что именно выложили

Muse Glimmer 30B цепляет не тем, что это еще одна крупная модель, а тем, что Meta в запусковом посте и карточка Hugging Face позиционируют ее как открытую локальную модель для агентного кодинга. В карточке указаны 30 млрд параметров, Apache 2.0, дата релиза August 2026 и контекст 131,072+ токенов.

Открытые веса выложены на Hugging Face, а вокруг релиза фигурирует 17-гигабайтная квантизация для запуска на устройствах с 24 ГБ памяти. Вот это уже практичная граница: не серверная стойка, не облачный счетчик, а один сильный локальный узел.

Модель еще и мультимодальная, с фокусом на agentic coding. То есть ставка не просто на автодополнение кода, а на работу в режиме агента: читать контекст, держать длинную задачу, дергать инструменты и возвращаться к патчу. 131к токенов тут не роскошь, а страховка от постоянного обрезания репозитория.

Бенчмарки выглядят сильными, но без магии

Смысл бенчмарков здесь простой: Glimmer уже не выглядит как локальная модель второго сорта. По заявленным сравнениям в агентном кодинге она заметно сильнее Gemma4-31B, а с Qwen3.6-27B идет примерно рядом: Glimmer лучше на SWE-Bench Pro, Qwen сильнее на Terminal-Bench.

Отдельно в документации NVIDIA для Muse Glimmer фигурирует SWE-Bench Verified 76.0. Это полезная точка на карте, но я бы не превращал ее в культовую цифру: кодинг-агенты ломаются не только на решении задач, но и на длинных итерациях, грязных зависимостях и плохом tool-use.

Самая бодрая заявка по скорости связана с небольшой вспомогательной моделью для ускорения генерации. С ней для Glimmer называют 233 токена в секунду на RTX 5090, 50 на M5 Max и 38 на M4 Max. Красиво, но в реальной работе важнее не пиковый поток токенов, а сколько из этих токенов переживет ревью.

Что это меняет для локального кодинга

Главный сдвиг: 24 ГБ VRAM становятся нормальным классом железа для серьезного локального кодинг-агента. Не для игрушечного чат-бота рядом с редактором, а для модели с открытыми весами, длинным контекстом и лицензией Apache 2.0.

Для меня здесь важна именно связка лицензии, размера и квантизации. Если модель можно поднять локально, держать рядом с приватным кодом и не упираться сразу в облачный API, инженерные эксперименты становятся намного спокойнее.

Но слабое место никуда не делось: агентность. Локальный запуск не гарантирует аккуратные правки, безопасные команды и нормальную работу с большим репозиторием. Теперь вопрос не в том, может ли локальная модель писать код, а в том, сколько автономии ей вообще можно доверить без страховочного троса.

Pydantic Monty решает задачу безопасного исполнения LLM-генерируемого кода через изолированный Python-интерпретатор без контейнеров. В случае локального кодового агента, такого как Muse Glimmer 30B, это напрямую закрывает вопрос среды запуска сгенерированного кода.