2 хв читання

YuE2-3B: open-weight ШІ-модель для генерації повних пісень

YuE2-3Bгенерация музыкиаудио-ИИ

YuE2-3B — open-weight модель класу 3B, що перетворює текст пісні та стильовий промпт на композицію з вокалом і супроводом. Її ключова особливість — контроль через символічну партитуру: можна керувати мелодією, акордами й послідовними правками. Локальний BF16-інференс заявлено для NVIDIA GPU з 24 ГБ пам’яті.

Що саме відкриває YuE2-3B

Я б назвав YuE2-3B не просто генератором аудіо, а спробою зібрати редаговану пісню з кількох музичних представлень. У картці моделі m-a-p на Hugging Face її описано як open-weight систему класу 3B, що приймає текст пісні та стильовий промпт, а потім генерує повноцінну композицію з вокалом і супроводом.

Найцікавіше тут не сам режим «текст у пісню», а керування через символічну партитуру. YuE2-3B підтримує композицію за мелодією й акордами, роботу лише з мелодією, пряму генерацію та сценарії послідовного редагування. Це вже ближче до музичного конвеєра, де окремі рішення можна змінювати, ніж до чорної скриньки з однією кнопкою.

У документації YuE2 архітектуру описано як AR-NAR Mixture-of-Transformers. Спочатку модель планує партитуру та семантичні токени, потім за допомогою flow matching формує акустичні латенти, після чого VAE декодує їх у стереоаудіо. Публічний інтерфейс повторює цю логіку: планування, генерація семантики, синтез і декодування поділені на окремі етапи.

На час публікації картки локальний інференс було заявлено для NVIDIA GPU з 24 ГБ пам’яті та підтримкою BF16. Репозиторій поширюється за ліцензією CC-BY-NC-4.0, тому слово «відкрита» потребує уточнення: ваги доступні, але комерційне використання ліцензія обмежує.

Є і гучний результат: у картці моделі YuE2 з вибором best-of-8 отримала середній бал 6,9632 у SongBench проти 6,8721 у Suno v5. Однак це дані самої команди проєкту, а не незалежна перевірка, тож вважати їх остаточним вердиктом не варто.

Чому редагована партитура змінює ситуацію

Головна зміна в тому, що відкрита генерація музики отримує проміжний шар керування. Розробники й дослідники можуть працювати не лише з готовою звуковою хвилею, а й з мелодією, гармонією та семантичним планом пісні. Такий інтерфейс краще підходить для ітерацій, автоматизованих агентів і відтворюваних експериментів.

Водночас архітектурна краса ще не гарантує зручного музичного інструмента. Я б передусім перевіряв стійкість довгої структури, розбірливість вокалу, точність дотримання акордів і те, наскільки локальна правка зберігає інші частини композиції. Саме в таких завданнях генератори часто непомітно переписують усе навколо зміненого фрагмента.

YuE2-3B виглядає не як чергова демонстрація короткого аудіокліпу, а як серйозна заявка на керовану генерацію повних пісень. Тепер головне питання не в тому, чи вміє модель складати музику, а в тому, наскільки дисципліновано вона вміє виправляти власні композиції.

Раніше ми розбирали Seedance 2 — модель для генерації відео з нативним звуком і заявленою роздільною здатністю 2K. Цей огляд доповнює обговорення YuE2-3B та показує, як оцінювати нові open-weight моделі для створення медіаконтенту.