2 мин чтения

Qwen3-Coder 30B на RTX 3090: пределы 24 ГБ

локальные LLMQwen3-CoderRTX 3090

Qwen3-Coder-30B-A3B-Instruct можно запускать на RTX 3090 с 24 ГБ VRAM в 4-битной квантизации: веса занимают примерно 17–20 ГБ. Это делает локальную разработку игр реалистичной, но запас под KV-кэш и длинный контекст остается небольшим, а на сложных агентных задачах коммерческие модели сохраняют преимущество.

30B действительно помещается в 24 ГБ, но без запаса

Я бы не списывал идею локальной coding-модели на одной RTX 3090: на сентябрь 2026 года это уже рабочий, хотя и пограничный вариант. В предоставленной поисковой сводке главным кандидатом названа Qwen3-Coder-30B-A3B-Instruct с 30 млрд параметров, из которых для каждого токена активны 3,3 млрд.

В 4-битной квантизации веса модели занимают примерно 17-20 ГБ. На карте с 24 ГБ VRAM остается место для KV-кэша, но длинный контекст быстро съедает этот запас. Для обычных моделей класса 30B приводится еще более тесный диапазон: около 18-21 ГБ только под веса.

  • Полная точность не подходит: практический сценарий здесь начинается с 4-битной квантизации.
  • 3,3 млрд активных параметров помогают инференсу: архитектура MoE не требует задействовать все 30 млрд на каждом токене.
  • Контекст остается ограничителем: номинально поместившаяся модель еще не гарантирует комфортную работу с большим проектом.

В сводке также приведены результаты Qwen3-Coder: около 50,3 на SWE-bench Verified, 66,2 на Aider Polyglot и 58,9 на LiveCodeBench v6. Прямой карточки модели или документа разработчика в исходных данных нет, поэтому я воспринимаю эти цифры как ориентиры, а не как окончательный вердикт. Для игрового прототипа важнее проверить стабильность правок между файлами, работу с инструментами и качество кода после нескольких итераций.

Локальный кодинг уже полезен, но фронтир не догнал

Главное изменение простое: локальная модель класса 30B теперь может быть практичным помощником для прототипирования на одной потребительской видеокарте. Это дает локальное выполнение и позволяет экспериментировать без постоянного обращения к коммерческой модели, если качество на конкретном репозитории устраивает.

Но пересказанное в обсуждении утверждение об отставании открытых моделей ровно на три месяца я бы не превращал в метрику. У него нет указанного первичного источника, а разрыв зависит от задачи: генерация небольших функций и исправление локальных ошибок заметно отличаются от длинного агентного цикла, многофайлового рефакторинга и отладки.

По предоставленной сводке проприетарные модели все еще сильнее именно на сложных и длинных задачах. Поэтому 24 ГБ VRAM решают вопрос запуска, но не вопрос надежности. Настоящая граница проходит не между локальным и облачным запуском, а между убедительным фрагментом кода и моделью, которой можно доверить изменения во всем проекте.

Ранее мы рассказывали о Rust LocalGPT — локальном ассистенте в одном бинарном файле с постоянной памятью и HTTP API. Его модель развертывания помогает оценить, как более крупные локальные модели могут вписаться в самостоятельные процессы разработки.