Raon-OpenTTS: открытая TTS-модель только для английского
Raon-OpenTTSText-to-Speechopen-source AI
Открыли не только веса, но и весь TTS-стек
Меня здесь цепляет не еще одна TTS-модель, а редкая попытка открыть весь стек: веса, обучающие данные, код обучения и инференса. KRAFTON AI в репозитории Raon-OpenTTS и карточке модели описывает систему как open-data и open-weight, рассчитанную на zero-shot синтез по референсному аудио. По состоянию на 21 августа 2026 года это корректнее воспринимать как разбор опубликованного проекта, а не как новость дня: дата исходного анонса в предоставленных материалах не указана.
Доступны два варианта. Raon-OpenTTS-0.3B содержит 336M параметров, а Raon-OpenTTS-1B уже 1048M. Обе модели используют DiT-архитектуру, производную от F5-TTS, поэтому выбор здесь выглядит практично: меньший вариант для более ограниченного контура, крупный для проверки потенциального выигрыша в качестве.
Самая весомая часть релиза находится под моделью. Корпус Raon-OpenTTS-Core включает 510.1K часов после фильтрации исходного пула на 615K часов из 11 англоязычных наборов данных. Публичны также пайплайн фильтрации, обучающий код и контрольные точки, что делает проект интересным именно для воспроизводимых экспериментов, а не только для запуска готового инференса.
В таблице Seed-TTS-Eval младшая модель получила WER 1.95 и SIM 0.687, старшая модель получила WER 1.78 и SIM 0.749. Отдельный Raon-OpenTTS-Eval построен вокруг устойчивости: 6 000 пар референс-текст, четыре акустических режима и 12 наборов данных. Это опубликованные результаты авторов, а не мои измерения, но направление понятно: увеличение модели сопровождается улучшением обеих заявленных метрик.
Что реально меняется для разработчика
Главный выигрыш здесь не в эффектном демо, а в возможности разобрать происхождение результата. Открытый корпус и обучающий пайплайн позволяют изучать фильтрацию, повторять обучение и адаптировать отдельные части системы без зависимости от закрытого API.
Для голосовых пайплайнов это дает понятную основу zero-shot TTS с референсным аудио. Но опубликованные бенчмарки еще не отвечают на вопросы о задержке, потреблении памяти и устойчивости на конкретных голосах. Я бы сначала проверял именно эти свойства, причем отдельно для обеих размеров модели: разница между хорошей таблицей и пригодным инференсом обычно обнаруживается там.
Ограничение жесткое: обучение проводилось исключительно на английской речи. Русский и другие языки находятся вне документированного сценария, поэтому случайное произношение отдельных фраз нельзя считать мультиязычной поддержкой. В итоге Raon-OpenTTS выглядит сильной открытой базой для English-only TTS, но пока не заменяет универсальный голосовой слой.