Raon-OpenTTS : un modèle TTS ouvert réservé à l'anglais
Raon-OpenTTSText-to-Speechopen-source AI
Ce ne sont pas seulement les poids qui sont ouverts, mais tout le stack TTS
Ce qui retient l'attention ici n'est pas simplement un modèle TTS de plus, mais une tentative rare d'ouvrir l'ensemble du stack : poids, données d'entraînement, code d'entraînement et code d'inférence. Dans le dépôt Raon-OpenTTS et sa carte de modèle, KRAFTON AI décrit le système comme open-data et open-weight, conçu pour la synthèse zero-shot à partir d'un audio de référence. Au 21 août 2026, il est plus juste d'y voir l'analyse d'un projet publié qu'une actualité du jour : les éléments fournis ne précisent pas la date de l'annonce initiale.
Deux variantes sont disponibles. Raon-OpenTTS-0.3B contient 336M paramètres, tandis que Raon-OpenTTS-1B en compte 1048M. Les deux modèles reposent sur une architecture DiT dérivée de F5-TTS. Le choix est donc assez pragmatique : le plus petit modèle pour les environnements contraints, le plus grand pour vérifier un gain potentiel de qualité.
La partie la plus substantielle de cette publication se situe sous le modèle lui-même. Le corpus Raon-OpenTTS-Core comprend 510.1K heures après filtrage d'un pool initial de 615K heures provenant de 11 jeux de données en anglais. Le pipeline de filtrage, le code d'entraînement et les checkpoints sont également publics, ce qui rend le projet intéressant pour des expériences reproductibles, et pas seulement pour lancer une inférence prête à l'emploi.
Dans Seed-TTS-Eval, le petit modèle obtient WER 1.95 et SIM 0.687, tandis que le grand atteint WER 1.78 et SIM 0.749. Un jeu distinct, Raon-OpenTTS-Eval, est orienté vers la robustesse : 6 000 paires référence-texte, quatre conditions acoustiques et 12 jeux de données. Ce sont les résultats publiés par les auteurs, pas mes propres mesures, mais la tendance est claire : l'augmentation de la taille améliore les deux métriques annoncées.
Ce qui change réellement pour les développeurs
Le principal avantage n'est pas une démo spectaculaire, mais la possibilité d'examiner l'origine du résultat. Le corpus ouvert et le pipeline d'entraînement permettent d'étudier le filtrage, de reproduire l'entraînement et d'adapter certaines parties du système sans dépendre d'une API fermée.
Pour les pipelines vocaux, cela offre une base claire de TTS zero-shot avec audio de référence. Les benchmarks publiés ne répondent toutefois pas encore aux questions de latence, de consommation mémoire ou de robustesse pour des voix précises. Je testerais d'abord ces propriétés, séparément pour les deux tailles de modèle : c'est souvent là que se révèle l'écart entre un bon tableau et une inférence réellement exploitable.
La limitation est stricte : l'entraînement a été réalisé uniquement sur de la parole anglaise. Le russe et les autres langues sortent du scénario documenté ; la prononciation occasionnelle de phrases isolées ne doit donc pas être considérée comme une prise en charge multilingue. Raon-OpenTTS semble ainsi constituer une solide base ouverte pour le TTS anglais, mais ne remplace pas encore une couche vocale universelle.