2 мин чтения

YuE2-3B: open-weight ИИ-модель для генерации полных песен

YuE2-3Bгенерация музыкиаудио-ИИ

YuE2-3B — open-weight модель класса 3B, которая превращает текст песни и стилевой промпт в композицию с вокалом и сопровождением. Ее отличие — управление через символическую партитуру: доступны мелодия, аккорды и последовательное редактирование. Для локального BF16-инференса заявлена NVIDIA GPU с 24 ГБ памяти.

Что именно открыли в YuE2-3B

Я бы назвал YuE2-3B не просто генератором аудио, а попыткой собрать редактируемую песню из нескольких представлений музыки. В карточке модели m-a-p на Hugging Face она описана как open-weight система класса 3B, которая принимает текст песни и стилевой промпт, а затем генерирует полноценную композицию с вокалом и сопровождением.

Самая интересная часть здесь не сам режим текст-в-песню, а управление через символическую партитуру. YuE2-3B поддерживает композицию по мелодии и аккордам, работу только с мелодией, прямую генерацию и сценарии последовательного редактирования. Это уже ближе к музыкальному конвейеру, где отдельные решения можно менять, а не к черному ящику с одной кнопкой.

В документации проекта YuE2 архитектура описана как AR-NAR Mixture-of-Transformers. Сначала модель планирует партитуру и семантические токены, затем через flow matching формирует акустические латенты, после чего VAE декодирует их в стереоаудио. Публичный интерфейс повторяет эту логику: планирование, генерация семантики, синтез и декодирование разделены на отдельные стадии.

На момент публикации карточки локальный инференс заявлен для NVIDIA GPU с 24 ГБ памяти и поддержкой BF16. Репозиторий распространяется по лицензии CC-BY-NC-4.0, поэтому слово «открытая» здесь требует аккуратности: веса доступны, но коммерческое использование лицензия ограничивает.

Есть и громкий результат: в карточке модели YuE2 с выбором best-of-8 получила 6,9632 среднего балла SongBench против 6,8721 у Suno v5. Но это данные самой команды проекта, а не независимая проверка, поэтому воспринимать их как окончательный вердикт я бы не стал.

Почему редактируемая партитура меняет расклад

Главный сдвиг в том, что открытая генерация музыки получает промежуточный слой управления. Для разработчиков и исследователей это означает возможность работать не только с готовой звуковой волной, но и с мелодией, гармонией и семантическим планом песни. Такой интерфейс лучше подходит для итераций, автоматических агентов и воспроизводимых экспериментов.

При этом архитектурная красота еще не гарантирует удобный музыкальный инструмент. Я бы в первую очередь смотрел на устойчивость длинной структуры, разборчивость вокала, точность следования аккордам и то, насколько локальная правка сохраняет остальные части композиции. Именно на таких задачах генераторы часто начинают незаметно переписывать все вокруг измененного фрагмента.

YuE2-3B выглядит не как очередная демонстрация короткого аудиоклипа, а как серьезная заявка на управляемую генерацию полных песен. Теперь главный вопрос не в том, умеет ли модель сочинять, а в том, насколько дисциплинированно она умеет исправлять собственную музыку.

Ранее мы разбирали Seedance 2 — модель для генерации видео с нативным звуком и заявленным разрешением 2K. Этот разбор дополняет обсуждение YuE2-3B и показывает, как оценивать новые open-weight модели для генерации медиаконтента.