3 min de lecture

YuE2-3B : un modèle d'IA open-weight pour créer des chansons

YuE2-3Bгенерация музыкиаудио-ИИ

YuE2-3B est un modèle open-weight de 3B qui transforme des paroles et un prompt de style en chansons complètes avec voix. Son intérêt majeur est le contrôle par partition symbolique : mélodie, accords et modifications successives sont accessibles. L'inférence locale BF16 est annoncée sur GPU NVIDIA avec 24 Go de mémoire.

Ce que YuE2-3B ouvre réellement

Je décrirais YuE2-3B comme davantage qu'un générateur audio : c'est une tentative de construire une chanson modifiable à partir de plusieurs représentations musicales. Dans la fiche Hugging Face de m-a-p, il est présenté comme un système open-weight de classe 3B qui reçoit des paroles et un prompt de style, puis produit une composition complète avec voix et accompagnement.

Le point le plus intéressant n'est pas la génération texte-vers-chanson, mais le contrôle par partition symbolique. YuE2-3B prend en charge la composition à partir de mélodies et d'accords, le travail sur la mélodie seule, la génération directe et les scénarios d'édition séquentielle. On se rapproche ainsi d'une chaîne de production musicale, où les décisions individuelles peuvent être modifiées, plutôt que d'une boîte noire à un bouton.

La documentation de YuE2 décrit l'architecture comme une AR-NAR Mixture-of-Transformers. Le modèle planifie d'abord une partition et des tokens sémantiques, crée ensuite des latents acoustiques par flow matching, puis les décode en audio stéréo au moyen d'un VAE. L'interface publique reprend cette logique avec des étapes distinctes de planification, génération sémantique, synthèse et décodage.

Lors de la publication de la fiche, l'inférence locale était annoncée pour des GPU NVIDIA dotés de 24 Go de mémoire et compatibles BF16. Le dépôt est distribué sous licence CC-BY-NC-4.0 : le terme « ouvert » doit donc être nuancé, car les poids sont disponibles mais l'usage commercial est limité.

Un résultat marquant est également cité : avec une sélection best-of-8, YuE2 a obtenu une moyenne de 6,9632 dans SongBench, contre 6,8721 pour Suno v5. Il s'agit toutefois des données de l'équipe du projet, et non d'une évaluation indépendante ; elles ne constituent donc pas un verdict définitif.

Pourquoi une partition modifiable change la donne

Le changement majeur est que la génération musicale ouverte gagne une couche intermédiaire de contrôle. Les développeurs et chercheurs peuvent agir non seulement sur la forme d'onde finale, mais aussi sur la mélodie, l'harmonie et le plan sémantique de la chanson. Cette interface convient mieux aux itérations, aux agents automatisés et aux expériences reproductibles.

Pour autant, une belle architecture ne garantit pas un outil musical pratique. Je regarderais d'abord la stabilité des structures longues, l'intelligibilité des voix, la précision du suivi des accords et la capacité d'une retouche locale à préserver le reste de la composition. C'est précisément dans ces tâches que les générateurs réécrivent souvent discrètement tout ce qui entoure le passage modifié.

YuE2-3B ressemble moins à une nouvelle démonstration de court extrait audio qu'à une proposition sérieuse de génération contrôlable de chansons complètes. La question centrale n'est plus de savoir si le modèle sait composer, mais avec quelle rigueur il sait corriger sa propre musique.

Nous avons précédemment analysé Seedance 2, un modèle de génération vidéo avec audio natif et une définition 2K annoncée. Cette analyse complète le sujet YuE2-3B et montre comment évaluer de nouveaux modèles open-weight de génération de contenus multimédias.