3 min de lectura

Qwen3-Coder 30B en RTX 3090: el límite de 24 GB

локальные LLMQwen3-CoderRTX 3090

Qwen3-Coder-30B-A3B-Instruct puede ejecutarse en una RTX 3090 con 24 GB de VRAM mediante cuantización de 4 bits: los pesos ocupan unos 17–20 GB. Esto hace viable el desarrollo local de juegos, aunque deja poco margen para caché KV y contextos largos; los modelos comerciales siguen destacando en tareas agentivas complejas.

30B sí cabe en 24 GB, pero sin margen

No descartaría la idea de una modelo local para programación en una sola RTX 3090: a septiembre de 2026 ya es una opción funcional, aunque al límite. En el resumen de búsqueda proporcionado, el principal candidato es Qwen3-Coder-30B-A3B-Instruct, con 30.000 millones de parámetros, de los cuales 3.300 millones están activos para cada token.

Con cuantización de 4 bits, los pesos del modelo ocupan aproximadamente 17–20 GB. En una tarjeta de 24 GB de VRAM queda espacio para la caché KV, pero los contextos largos consumen ese margen muy rápido. Para modelos convencionales de la clase 30B, el intervalo es aún más ajustado: unos 18–21 GB solo para los pesos.

  • La precisión completa no es viable: aquí el escenario práctico empieza con cuantización de 4 bits.
  • Los 3.300 millones de parámetros activos ayudan a la inferencia: la arquitectura MoE no necesita usar los 30.000 millones en cada token.
  • El contexto sigue siendo el límite: que el modelo entre en memoria no garantiza trabajar cómodamente con un proyecto grande.

El resumen también cita resultados de Qwen3-Coder de alrededor de 50,3 en SWE-bench Verified, 66,2 en Aider Polyglot y 58,9 en LiveCodeBench v6. Como el material de origen no incluye una tarjeta directa del modelo ni documentación del desarrollador, tomo estas cifras como referencias, no como un veredicto definitivo. Para un prototipo de juego, importa más comprobar la estabilidad de los cambios entre archivos, el uso de herramientas y la calidad del código tras varias iteraciones.

La programación local ya es útil, pero aún no alcanza la frontera

El cambio principal es sencillo: un modelo local de la clase 30B ya puede ser un asistente práctico de prototipado en una sola GPU de consumo. Permite ejecutar y experimentar localmente sin recurrir de forma constante a un modelo comercial, siempre que su calidad sea suficiente para el repositorio concreto.

Sin embargo, no convertiría en métrica la afirmación repetida en la discusión de que los modelos abiertos llevan exactamente tres meses de retraso. No se indica una fuente primaria y la diferencia depende de la tarea: generar funciones pequeñas y corregir errores locales no se parece a un ciclo agentivo largo, una refactorización multifichero o la depuración.

Según el resumen proporcionado, los modelos propietarios todavía son más sólidos en tareas difíciles y prolongadas. Por eso, 24 GB de VRAM resuelven el problema de arrancar el modelo, no el de su fiabilidad. La frontera real no está entre ejecución local y nube, sino entre un fragmento de código convincente y un modelo al que confiar cambios en todo el proyecto.

Anteriormente analizamos Rust LocalGPT, un asistente local de un solo binario con memoria persistente y una API HTTP. Su modelo de despliegue aporta contexto útil para evaluar cómo modelos locales más grandes pueden integrarse en flujos de desarrollo autoalojados.