3 min de lectura

YuE2-3B: modelo open-weight de IA para crear canciones completas

YuE2-3Bгенерация музыкиаудио-ИИ

YuE2-3B es un modelo open-weight de 3B que convierte letras y un prompt de estilo en canciones completas con voz. Lo relevante es su control mediante partitura simbólica: permite trabajar con melodías, acordes y ediciones secuenciales. El uso local en BF16 requiere una GPU NVIDIA con 24 GB.

Qué abre realmente YuE2-3B

Yo definiría YuE2-3B como algo más que un generador de audio: es un intento de construir una canción editable a partir de varias representaciones musicales. En la tarjeta del modelo de m-a-p en Hugging Face se presenta como un sistema open-weight de clase 3B que recibe letras y un prompt de estilo para generar una composición completa con voz y acompañamiento.

Lo más interesante no es la función de texto a canción, sino el control mediante una partitura simbólica. YuE2-3B admite composición con melodía y acordes, trabajo solo con melodía, generación directa y edición secuencial. Se parece más a una cadena de producción musical, donde pueden modificarse decisiones concretas, que a una caja negra de un solo botón.

La documentación de YuE2 describe la arquitectura como AR-NAR Mixture-of-Transformers. Primero, el modelo planifica una partitura y tokens semánticos; después crea latentes acústicos mediante flow matching y, por último, un VAE los decodifica en audio estéreo. La interfaz pública reproduce esa lógica con etapas separadas de planificación, generación semántica, síntesis y decodificación.

Cuando se publicó la tarjeta, la inferencia local se indicaba para GPU NVIDIA con 24 GB de memoria y soporte BF16. El repositorio usa la licencia CC-BY-NC-4.0, por lo que conviene matizar el término «abierto»: los pesos están disponibles, pero el uso comercial está restringido.

También hay un resultado llamativo: con selección best-of-8, YuE2 obtuvo una media de 6,9632 en SongBench frente a 6,8721 de Suno v5. Son cifras del propio equipo del proyecto, no una validación independiente, así que no deberían considerarse un veredicto definitivo.

Por qué una partitura editable cambia el panorama

El cambio principal es que la generación musical abierta gana una capa intermedia de control. Desarrolladores e investigadores pueden trabajar no solo con la onda de audio final, sino también con la melodía, la armonía y el plan semántico de la canción. Este enfoque encaja mejor con iteraciones, agentes automatizados y experimentos reproducibles.

Aun así, una arquitectura elegante no garantiza una herramienta musical cómoda. Yo revisaría antes la estabilidad de estructuras largas, la inteligibilidad vocal, la precisión al seguir los acordes y si una edición local conserva el resto de la composición. Es justo en estas tareas donde los generadores suelen reescribir discretamente todo lo que rodea al fragmento modificado.

YuE2-3B no parece otra demostración de un clip de audio corto, sino una propuesta seria de generación controlable de canciones completas. La pregunta principal ya no es si puede componer, sino con qué disciplina puede corregir su propia música.

Anteriormente analizamos Seedance 2, un modelo de generación de vídeo con audio nativo y resolución 2K anunciada. Ese análisis complementa el caso de YuE2-3B y ayuda a evaluar nuevos modelos open-weight para generar contenido multimedia.