3 min de lectura

Voces locales de Siri en macOS 27: qué hay dentro

SirimacOS 27локальный TTS

macOS 27 incorpora una pila local para las nuevas voces de Siri, con un LLM, el archivo instruct_3b.voice y un decodificador de audio en streaming. Pruebas independientes detectaron un límite de 163 segundos y degradación o repeticiones tras aproximadamente un minuto. Es relevante para el TTS local, aunque su fiabilidad aún no está resuelta.

Qué se encontró bajo el capó

Las nuevas voces de Siri parecen funcionar sobre una pila generativa local, no sobre un sintetizador convencional con un conjunto limitado de entonaciones. La combinación de un LLM y un decodificador de audio en streaming resulta especialmente interesante: permite tener en cuenta el significado del texto, controlar la interpretación y empezar a reproducir antes de terminar toda la generación.

La documentación pública de Siri AI (Beta) confirma que Apple usa un modelo avanzado en el dispositivo, pero no revela su arquitectura interna. En el momento de probar macOS 27, los requisitos indicados eran un Mac con M3 o posterior y al menos 12 GB de memoria unificada. El usuario puede ajustar la velocidad y la expresividad.

Un análisis independiente aporta detalles no oficiales. En el sistema se encontró el archivo instruct_3b.voice, vinculado al modelo de voz. Durante la investigación funcionaba con inglés, alemán y japonés, entendía el contenido del texto y aceptaba algunas etiquetas de emoción, aunque Apple no documenta este mecanismo.

El parámetro expressivity parece influir en algo más que una emoción genérica. Según las observaciones, el modelo relaciona la expresividad con la semántica de la frase, por lo que el resultado no se reduce a cambiar el tono o la velocidad. Su calidad todavía no alcanza a los modelos de voz recientes de ElevenLabs y Gemini, pero ya está lejos de la locución monótona habitual.

La principal limitación apareció en generaciones largas. La duración máxima de la prueba fue de 163 segundos, pero alrededor del primer minuto el modelo empezaba a degradarse y podía repetir una sola palabra en bucle. Dividir el texto en fragmentos reducía de forma visible la degradación, mientras que trabajar con representaciones float empeoraba más el resultado.

Por qué interesa a los desarrolladores

Ya es una base útil para TTS local, aunque todavía no un componente listo para producción. El decodificador en streaming encaja en interfaces de baja latencia, y el procesamiento semántico y emocional ofrece más control que la síntesis de voz clásica.

La parte más llamativa del análisis es la posibilidad de insertar embeddings de voz propios. Apple no ofrece una API pública ni documentación para ello, así que no se puede contar con la estabilidad del formato: el archivo interno, los parámetros o el comportamiento podrían cambiar con cualquier compilación del sistema.

Yo comprobaría primero los límites entre fragmentos, la acumulación de errores del decodificador y la consistencia de la entonación entre segmentos. Un límite de 163 segundos impresiona solo sobre el papel si la estabilidad real termina al minuto. Se perfila un motor de voz local potente, pero la cuestión técnica clave sigue siendo la predictibilidad en generaciones largas.

Antes analizamos Rust LocalGPT, un asistente local con memoria y API HTTP. Este caso complementa la historia de Apple instruct_3b al mostrar cómo los modelos locales transforman el trabajo privado con IA.