Qwen3-Coder 30B на RTX 3090: пределы 24 ГБ
локальные LLMQwen3-CoderRTX 3090
30B действительно помещается в 24 ГБ, но без запаса
Я бы не списывал идею локальной coding-модели на одной RTX 3090: на сентябрь 2026 года это уже рабочий, хотя и пограничный вариант. В предоставленной поисковой сводке главным кандидатом названа Qwen3-Coder-30B-A3B-Instruct с 30 млрд параметров, из которых для каждого токена активны 3,3 млрд.
В 4-битной квантизации веса модели занимают примерно 17-20 ГБ. На карте с 24 ГБ VRAM остается место для KV-кэша, но длинный контекст быстро съедает этот запас. Для обычных моделей класса 30B приводится еще более тесный диапазон: около 18-21 ГБ только под веса.
- Полная точность не подходит: практический сценарий здесь начинается с 4-битной квантизации.
- 3,3 млрд активных параметров помогают инференсу: архитектура MoE не требует задействовать все 30 млрд на каждом токене.
- Контекст остается ограничителем: номинально поместившаяся модель еще не гарантирует комфортную работу с большим проектом.
В сводке также приведены результаты Qwen3-Coder: около 50,3 на SWE-bench Verified, 66,2 на Aider Polyglot и 58,9 на LiveCodeBench v6. Прямой карточки модели или документа разработчика в исходных данных нет, поэтому я воспринимаю эти цифры как ориентиры, а не как окончательный вердикт. Для игрового прототипа важнее проверить стабильность правок между файлами, работу с инструментами и качество кода после нескольких итераций.
Локальный кодинг уже полезен, но фронтир не догнал
Главное изменение простое: локальная модель класса 30B теперь может быть практичным помощником для прототипирования на одной потребительской видеокарте. Это дает локальное выполнение и позволяет экспериментировать без постоянного обращения к коммерческой модели, если качество на конкретном репозитории устраивает.
Но пересказанное в обсуждении утверждение об отставании открытых моделей ровно на три месяца я бы не превращал в метрику. У него нет указанного первичного источника, а разрыв зависит от задачи: генерация небольших функций и исправление локальных ошибок заметно отличаются от длинного агентного цикла, многофайлового рефакторинга и отладки.
По предоставленной сводке проприетарные модели все еще сильнее именно на сложных и длинных задачах. Поэтому 24 ГБ VRAM решают вопрос запуска, но не вопрос надежности. Настоящая граница проходит не между локальным и облачным запуском, а между убедительным фрагментом кода и моделью, которой можно доверить изменения во всем проекте.