Voix locales de Siri dans macOS 27 : ce qu’elles cachent
SirimacOS 27локальный TTS
Ce qui a été trouvé sous le capot
Les nouvelles voix de Siri semblent reposer sur une pile générative locale, et non sur un synthétiseur classique limité à quelques intonations. L’association d’un LLM et d’un décodeur audio en flux est particulièrement intéressante : elle permet de tenir compte du sens du texte, de contrôler la diction et de démarrer la lecture avant la fin de la génération complète.
La documentation publique de Siri AI (Beta) confirme l’utilisation d’un modèle avancé sur l’appareil, sans détailler l’architecture interne. Lors des essais de macOS 27, les prérequis annoncés étaient un Mac équipé d’une puce M3 ou plus récente et au moins 12 Go de mémoire unifiée. L’utilisateur peut régler le débit et l’expressivité.
Une analyse indépendante apporte des détails non officiels. Le système contient un fichier nommé instruct_3b.voice, associé au modèle vocal. Au moment de l’étude, il fonctionnait en anglais, allemand et japonais, comprenait le contenu du texte et acceptait certains tags d’émotion, même si Apple ne documente pas ce mécanisme.
Le paramètre expressivity semble agir sur bien plus qu’une simple émotion. D’après les observations, le modèle relie l’expressivité à la sémantique de la phrase : le résultat ne se résume donc pas à modifier la hauteur ou le débit. La qualité n’atteint pas encore celle des nouveaux modèles vocaux d’ElevenLabs et Gemini, mais elle dépasse déjà nettement la diction monotone habituelle.
La principale limite est apparue sur les générations longues. La durée maximale du test était de 163 secondes, mais après environ une minute, le modèle commençait à se dégrader et pouvait boucler sur un mot. Découper le texte en segments réduisait visiblement cette dégradation, tandis que le travail avec des représentations float détériorait davantage le résultat.
Pourquoi cela intéresse les développeurs
Il s’agit déjà d’une base utile pour du TTS local, mais pas encore d’un composant prêt pour la production. Le décodeur en flux convient aux interfaces à faible latence, tandis que le traitement du sens et des émotions apporte plus de contrôle que la synthèse vocale classique.
La partie la plus intrigante de l’analyse concerne la possibilité d’injecter ses propres embeddings vocaux. Apple ne propose ni API publique ni documentation à ce sujet ; il ne faut donc pas présumer de la stabilité du format. Le fichier interne, les paramètres ou le comportement peuvent évoluer avec chaque nouvelle version du système.
Je commencerais par vérifier les frontières entre segments, l’accumulation des erreurs du décodeur et la cohérence de l’intonation d’un fragment à l’autre. Une limite de 163 secondes n’impressionne que sur le papier si la stabilité réelle s’arrête au bout d’une minute. Le moteur vocal local paraît déjà solide, mais la question d’ingénierie centrale reste la prévisibilité des générations longues.