3 min de lectura

Raon-OpenTTS: un modelo TTS abierto solo para inglés

Raon-OpenTTSText-to-Speechopen-source AI

KRAFTON AI publicó Raon-OpenTTS con pesos, datos, código de entrenamiento e inferencia disponibles. Incluye modelos zero-shot de 336M y 1048M parámetros basados en audio de referencia. Es importante porque permite reproducir gran parte del pipeline de voz, aunque fue entrenado y documentado únicamente para habla inglesa.

No solo abrieron los pesos, sino todo el stack de TTS

Lo interesante no es simplemente otro modelo de TTS, sino un intento poco habitual de abrir todo el stack: pesos, datos de entrenamiento, código de entrenamiento y código de inferencia. En el repositorio y la tarjeta del modelo Raon-OpenTTS, KRAFTON AI describe el sistema como open-data y open-weight, diseñado para síntesis zero-shot a partir de audio de referencia. A fecha del 21 de agosto de 2026, conviene entenderlo como un análisis de un proyecto publicado y no como una noticia de última hora: los materiales proporcionados no indican la fecha del anuncio original.

Hay dos variantes disponibles. Raon-OpenTTS-0.3B tiene 336M parámetros, mientras que Raon-OpenTTS-1B alcanza 1048M. Ambos modelos utilizan una arquitectura DiT derivada de F5-TTS, por lo que la elección es práctica: la versión pequeña encaja mejor en entornos restringidos y la grande sirve para comprobar una posible mejora de calidad.

La parte más relevante del lanzamiento está por debajo del propio modelo. El corpus Raon-OpenTTS-Core reúne 510.1K horas tras filtrar un conjunto inicial de 615K horas procedentes de 11 datasets en inglés. También son públicos el pipeline de filtrado, el código de entrenamiento y los checkpoints, lo que hace atractivo el proyecto para experimentos reproducibles y no solo para ejecutar inferencia lista para usar.

En Seed-TTS-Eval, el modelo pequeño obtuvo WER 1.95 y SIM 0.687, mientras que el grande logró WER 1.78 y SIM 0.749. Un conjunto independiente, Raon-OpenTTS-Eval, se centra en la robustez: 6.000 pares referencia-texto, cuatro condiciones acústicas y 12 datasets. Son resultados publicados por los autores, no mediciones propias, pero la tendencia es clara: el aumento de tamaño mejora ambas métricas reportadas.

Qué cambia realmente para los desarrolladores

La principal ventaja no es una demo llamativa, sino la posibilidad de inspeccionar el origen del resultado. El corpus abierto y el pipeline de entrenamiento permiten estudiar el filtrado, reproducir el entrenamiento y adaptar partes concretas del sistema sin depender de una API cerrada.

Para los pipelines de voz, esto ofrece una base clara de TTS zero-shot con audio de referencia. Sin embargo, los benchmarks publicados todavía no responden a cuestiones de latencia, consumo de memoria o robustez con voces concretas. Yo comprobaría primero esas propiedades y lo haría por separado para los dos tamaños: la diferencia entre una buena tabla y una inferencia útil suele aparecer ahí.

La limitación es estricta: el entrenamiento se realizó exclusivamente con habla inglesa. El ruso y otros idiomas quedan fuera del caso de uso documentado, por lo que una pronunciación ocasional de frases aisladas no debe interpretarse como soporte multilingüe. Raon-OpenTTS parece una sólida base abierta para TTS solo en inglés, pero todavía no sustituye una capa de voz universal.

Anteriormente cubrimos Rust LocalGPT, un asistente local pensado para un uso práctico de IA autoalojada. Raon-OpenTTS también amplía las opciones de los equipos que buscan mayor control sobre su stack de IA.