Qwen3-Coder 30B на RTX 3090: межі 24 ГБ
локальные LLMQwen3-CoderRTX 3090
30B справді вміщується у 24 ГБ, але без запасу
Я б не відкидав ідею локальної моделі для коду на одній RTX 3090: станом на вересень 2026 року це вже робочий, хоч і граничний, варіант. У наданому пошуковому зведенні головним кандидатом названо Qwen3-Coder-30B-A3B-Instruct із 30 млрд параметрів, з яких для кожного токена активні 3,3 млрд.
У 4-бітній квантизації ваги моделі займають приблизно 17–20 ГБ. На карті з 24 ГБ VRAM ще лишається місце для KV-кешу, але довгий контекст швидко з’їдає цей запас. Для звичайних моделей класу 30B наведено ще тісніший діапазон: близько 18–21 ГБ лише для ваг.
- Повна точність не підходить: практичний сценарій тут починається з 4-бітної квантизації.
- 3,3 млрд активних параметрів допомагають інференсу: архітектурі MoE не потрібно залучати всі 30 млрд для кожного токена.
- Контекст залишається обмеженням: те, що модель номінально помістилася в пам’ять, ще не гарантує зручної роботи з великим проєктом.
У зведенні також наведено результати Qwen3-Coder: близько 50,3 на SWE-bench Verified, 66,2 на Aider Polyglot і 58,9 на LiveCodeBench v6. Прямої картки моделі чи документації розробника у вихідних даних немає, тому я сприймаю ці цифри як орієнтири, а не остаточний вердикт. Для ігрового прототипу важливіше перевірити стабільність правок між файлами, роботу з інструментами та якість коду після кількох ітерацій.
Локальне кодування вже корисне, але фронтиру ще не досягло
Головна зміна проста: локальна модель класу 30B тепер може бути практичним помічником для прототипування на одній споживчій відеокарті. Це дає локальне виконання та дозволяє експериментувати без постійних звернень до комерційної моделі, якщо її якість влаштовує для конкретного репозиторію.
Втім, я б не перетворював на метрику твердження, переказане в обговоренні, що відкриті моделі відстають рівно на три місяці. Для нього не наведено первинного джерела, а розрив залежить від завдання: генерація невеликих функцій і виправлення локальних помилок суттєво відрізняються від довгого агентного циклу, багатофайлового рефакторингу та налагодження.
За наданим зведенням, пропрієтарні моделі все ще сильніші саме у складних і довгих завданнях. Отже, 24 ГБ VRAM вирішують питання запуску, але не надійності. Справжня межа проходить не між локальним і хмарним запуском, а між переконливим фрагментом коду та моделлю, якій можна довірити зміни в усьому проєкті.