YuE2-3B: open-weight ИИ-модель для генерации полных песен
YuE2-3Bгенерация музыкиаудио-ИИ
Что именно открыли в YuE2-3B
Я бы назвал YuE2-3B не просто генератором аудио, а попыткой собрать редактируемую песню из нескольких представлений музыки. В карточке модели m-a-p на Hugging Face она описана как open-weight система класса 3B, которая принимает текст песни и стилевой промпт, а затем генерирует полноценную композицию с вокалом и сопровождением.
Самая интересная часть здесь не сам режим текст-в-песню, а управление через символическую партитуру. YuE2-3B поддерживает композицию по мелодии и аккордам, работу только с мелодией, прямую генерацию и сценарии последовательного редактирования. Это уже ближе к музыкальному конвейеру, где отдельные решения можно менять, а не к черному ящику с одной кнопкой.
В документации проекта YuE2 архитектура описана как AR-NAR Mixture-of-Transformers. Сначала модель планирует партитуру и семантические токены, затем через flow matching формирует акустические латенты, после чего VAE декодирует их в стереоаудио. Публичный интерфейс повторяет эту логику: планирование, генерация семантики, синтез и декодирование разделены на отдельные стадии.
На момент публикации карточки локальный инференс заявлен для NVIDIA GPU с 24 ГБ памяти и поддержкой BF16. Репозиторий распространяется по лицензии CC-BY-NC-4.0, поэтому слово «открытая» здесь требует аккуратности: веса доступны, но коммерческое использование лицензия ограничивает.
Есть и громкий результат: в карточке модели YuE2 с выбором best-of-8 получила 6,9632 среднего балла SongBench против 6,8721 у Suno v5. Но это данные самой команды проекта, а не независимая проверка, поэтому воспринимать их как окончательный вердикт я бы не стал.
Почему редактируемая партитура меняет расклад
Главный сдвиг в том, что открытая генерация музыки получает промежуточный слой управления. Для разработчиков и исследователей это означает возможность работать не только с готовой звуковой волной, но и с мелодией, гармонией и семантическим планом песни. Такой интерфейс лучше подходит для итераций, автоматических агентов и воспроизводимых экспериментов.
При этом архитектурная красота еще не гарантирует удобный музыкальный инструмент. Я бы в первую очередь смотрел на устойчивость длинной структуры, разборчивость вокала, точность следования аккордам и то, насколько локальная правка сохраняет остальные части композиции. Именно на таких задачах генераторы часто начинают незаметно переписывать все вокруг измененного фрагмента.
YuE2-3B выглядит не как очередная демонстрация короткого аудиоклипа, а как серьезная заявка на управляемую генерацию полных песен. Теперь главный вопрос не в том, умеет ли модель сочинять, а в том, насколько дисциплинированно она умеет исправлять собственную музыку.