YuE2-3B: open-weight ШІ-модель для генерації повних пісень
YuE2-3Bгенерация музыкиаудио-ИИ
Що саме відкриває YuE2-3B
Я б назвав YuE2-3B не просто генератором аудіо, а спробою зібрати редаговану пісню з кількох музичних представлень. У картці моделі m-a-p на Hugging Face її описано як open-weight систему класу 3B, що приймає текст пісні та стильовий промпт, а потім генерує повноцінну композицію з вокалом і супроводом.
Найцікавіше тут не сам режим «текст у пісню», а керування через символічну партитуру. YuE2-3B підтримує композицію за мелодією й акордами, роботу лише з мелодією, пряму генерацію та сценарії послідовного редагування. Це вже ближче до музичного конвеєра, де окремі рішення можна змінювати, ніж до чорної скриньки з однією кнопкою.
У документації YuE2 архітектуру описано як AR-NAR Mixture-of-Transformers. Спочатку модель планує партитуру та семантичні токени, потім за допомогою flow matching формує акустичні латенти, після чого VAE декодує їх у стереоаудіо. Публічний інтерфейс повторює цю логіку: планування, генерація семантики, синтез і декодування поділені на окремі етапи.
На час публікації картки локальний інференс було заявлено для NVIDIA GPU з 24 ГБ пам’яті та підтримкою BF16. Репозиторій поширюється за ліцензією CC-BY-NC-4.0, тому слово «відкрита» потребує уточнення: ваги доступні, але комерційне використання ліцензія обмежує.
Є і гучний результат: у картці моделі YuE2 з вибором best-of-8 отримала середній бал 6,9632 у SongBench проти 6,8721 у Suno v5. Однак це дані самої команди проєкту, а не незалежна перевірка, тож вважати їх остаточним вердиктом не варто.
Чому редагована партитура змінює ситуацію
Головна зміна в тому, що відкрита генерація музики отримує проміжний шар керування. Розробники й дослідники можуть працювати не лише з готовою звуковою хвилею, а й з мелодією, гармонією та семантичним планом пісні. Такий інтерфейс краще підходить для ітерацій, автоматизованих агентів і відтворюваних експериментів.
Водночас архітектурна краса ще не гарантує зручного музичного інструмента. Я б передусім перевіряв стійкість довгої структури, розбірливість вокалу, точність дотримання акордів і те, наскільки локальна правка зберігає інші частини композиції. Саме в таких завданнях генератори часто непомітно переписують усе навколо зміненого фрагмента.
YuE2-3B виглядає не як чергова демонстрація короткого аудіокліпу, а як серйозна заявка на керовану генерацію повних пісень. Тепер головне питання не в тому, чи вміє модель складати музику, а в тому, наскільки дисципліновано вона вміє виправляти власні композиції.