2 хв читання

Qwen3-Coder 30B на RTX 3090: межі 24 ГБ

локальные LLMQwen3-CoderRTX 3090

Qwen3-Coder-30B-A3B-Instruct можна запускати на RTX 3090 із 24 ГБ VRAM у 4-бітній квантизації: ваги займають приблизно 17–20 ГБ. Це робить локальну розробку ігор реальною, але залишає мало місця для KV-кешу й довгого контексту, тоді як комерційні моделі сильніші у складних агентних завданнях.

30B справді вміщується у 24 ГБ, але без запасу

Я б не відкидав ідею локальної моделі для коду на одній RTX 3090: станом на вересень 2026 року це вже робочий, хоч і граничний, варіант. У наданому пошуковому зведенні головним кандидатом названо Qwen3-Coder-30B-A3B-Instruct із 30 млрд параметрів, з яких для кожного токена активні 3,3 млрд.

У 4-бітній квантизації ваги моделі займають приблизно 17–20 ГБ. На карті з 24 ГБ VRAM ще лишається місце для KV-кешу, але довгий контекст швидко з’їдає цей запас. Для звичайних моделей класу 30B наведено ще тісніший діапазон: близько 18–21 ГБ лише для ваг.

  • Повна точність не підходить: практичний сценарій тут починається з 4-бітної квантизації.
  • 3,3 млрд активних параметрів допомагають інференсу: архітектурі MoE не потрібно залучати всі 30 млрд для кожного токена.
  • Контекст залишається обмеженням: те, що модель номінально помістилася в пам’ять, ще не гарантує зручної роботи з великим проєктом.

У зведенні також наведено результати Qwen3-Coder: близько 50,3 на SWE-bench Verified, 66,2 на Aider Polyglot і 58,9 на LiveCodeBench v6. Прямої картки моделі чи документації розробника у вихідних даних немає, тому я сприймаю ці цифри як орієнтири, а не остаточний вердикт. Для ігрового прототипу важливіше перевірити стабільність правок між файлами, роботу з інструментами та якість коду після кількох ітерацій.

Локальне кодування вже корисне, але фронтиру ще не досягло

Головна зміна проста: локальна модель класу 30B тепер може бути практичним помічником для прототипування на одній споживчій відеокарті. Це дає локальне виконання та дозволяє експериментувати без постійних звернень до комерційної моделі, якщо її якість влаштовує для конкретного репозиторію.

Втім, я б не перетворював на метрику твердження, переказане в обговоренні, що відкриті моделі відстають рівно на три місяці. Для нього не наведено первинного джерела, а розрив залежить від завдання: генерація невеликих функцій і виправлення локальних помилок суттєво відрізняються від довгого агентного циклу, багатофайлового рефакторингу та налагодження.

За наданим зведенням, пропрієтарні моделі все ще сильніші саме у складних і довгих завданнях. Отже, 24 ГБ VRAM вирішують питання запуску, але не надійності. Справжня межа проходить не між локальним і хмарним запуском, а між переконливим фрагментом коду та моделлю, якій можна довірити зміни в усьому проєкті.

Раніше ми розглядали Rust LocalGPT — локального асистента в одному бінарному файлі з постійною пам’яттю та HTTP API. Його модель розгортання допомагає оцінити, як більші локальні моделі можуть увійти до самостійно розміщених процесів розробки.