Contexto técnico
Probé Nemotron 3.5 ASR Streaming 0.6B tras los comentarios de colegas y rápidamente entendí las fortalezas y debilidades del modelo. Para la automatización con IA en llamadas, la idea es atractiva: solo 600M de parámetros, modo streaming, baja latencia prometida y un único punto de control para 40 localizaciones, incluyendo ru-RU y uk-UA.
En cuanto a hardware, el modelo es realmente agradable. NVIDIA lo promueve como un ASR en streaming con conciencia de caché y alta concurrencia, y a través de la API se puede usar sin una pesada infraestructura propia. Hay modos de latencia desde unos 80 ms hasta 1.12 s, además de puntuación y mayúsculas decentes por defecto.
Pero aquí es donde falla: el soporte de idioma en la ficha del modelo y la calidad real de transcripción no son lo mismo. Para ruso y ucraniano, NVIDIA apenas muestra cifras WER públicas, lo cual ya era una señal de alarma. Si creemos en el campo de localizaciones admitidas, todo está bien. Pero al probar con habla real, especialmente con acento, ruido de fondo o ritmo rápido, la cosa se pone triste.
Otro punto importante: la frase "puede funcionar incluso en el navegador" suena demasiado optimista. En un navegador se puede llamar fácilmente a un endpoint remoto, pero el modelo no se ejecuta de forma nativa como un juguete web ligero. Para la inferencia se necesita NeMo, CUDA y un entorno de servidor adecuado, a menos que se use la API alojada.
Impacto en el negocio y la automatización
Mi conclusión práctica es simple. Si construyes IA de voz para tráfico en inglés o un prototipo multilingüe, el modelo puede ser interesante por su coste, velocidad y densidad de recursos.
Pero si tu carga principal es ru/ukr, el reconocimiento deficiente mata todo el flujo posterior: resúmenes de llamadas, extracción de entidades, control de calidad, integración con CRM. Un error en el ASR se extiende luego por toda la cadena y convierte la automatización en una costosa imitación de utilidad.
Ganan los equipos que necesitan una línea base de streaming barata y están dispuestos a validar los idiomas con sus propios datos. Pierden quienes toman el soporte multilingüe de la ficha del modelo como garantía de calidad lista para producción.
En Nahornyi AI Lab solemos resolver esto muy rápido: primero probar con llamadas reales, luego desarrollar la solución de IA alrededor de la transcripción, y no al revés. Si tus procesos de voz se atascan justo en esta capa, podemos analizar la pila juntos y construir una automatización con IA sin concesiones vistosas pero inútiles.