Raon-OpenTTS: відкрита TTS-модель лише для англійської
Raon-OpenTTSText-to-Speechopen-source AI
Відкрили не лише ваги, а й увесь TTS-стек
Тут привертає увагу не просто ще одна TTS-модель, а рідкісна спроба відкрити весь стек: ваги, навчальні дані, код навчання та інференсу. KRAFTON AI у репозиторії Raon-OpenTTS і картці моделі описує систему як open-data та open-weight, призначену для zero-shot синтезу за референсним аудіо. Станом на 21 серпня 2026 року коректніше сприймати це як огляд опублікованого проєкту, а не як новину дня: дата початкового анонсу в наданих матеріалах не вказана.
Доступні два варіанти. Raon-OpenTTS-0.3B містить 336M параметрів, а Raon-OpenTTS-1B — уже 1048M. Обидві моделі використовують DiT-архітектуру, похідну від F5-TTS, тому вибір виглядає практичним: менша версія підходить для обмеженіших середовищ, а більша — для перевірки потенційного приросту якості.
Найвагоміша частина релізу лежить під самою моделлю. Корпус Raon-OpenTTS-Core містить 510.1K годин після фільтрації початкового масиву з 615K годин із 11 англомовних наборів даних. Також відкриті пайплайн фільтрації, код навчання та контрольні точки, що робить проєкт цікавим саме для відтворюваних експериментів, а не лише для запуску готового інференсу.
У таблиці Seed-TTS-Eval молодша модель отримала WER 1.95 і SIM 0.687, а старша — WER 1.78 і SIM 0.749. Окремий Raon-OpenTTS-Eval зосереджений на стійкості: 6 000 пар референс-текст, чотири акустичні режими та 12 наборів даних. Це опубліковані результати авторів, а не мої вимірювання, але напрям очевидний: збільшення моделі покращує обидві заявлені метрики.
Що реально змінюється для розробника
Головна перевага тут не в ефектному демо, а в можливості розібрати походження результату. Відкритий корпус і навчальний пайплайн дозволяють вивчати фільтрацію, повторювати навчання та адаптувати окремі частини системи без залежності від закритого API.
Для голосових пайплайнів це дає зрозумілу основу zero-shot TTS із референсним аудіо. Проте опубліковані бенчмарки ще не відповідають на питання про затримку, споживання пам'яті та стійкість на конкретних голосах. Я б спершу перевіряв саме ці властивості, окремо для обох розмірів моделі: різниця між гарною таблицею та придатним інференсом зазвичай проявляється саме тут.
Обмеження жорстке: навчання проводилося винятково на англійському мовленні. Українська, російська та інші мови перебувають поза документованим сценарієм, тому випадкову вимову окремих фраз не можна вважати багатомовною підтримкою. У підсумку Raon-OpenTTS виглядає сильною відкритою базою для English-only TTS, але поки не замінює універсальний голосовий шар.