2 хв читання

Локальні голоси Siri в macOS 27: що всередині

SirimacOS 27локальный TTS

У macOS 27 виявили локальний стек нових голосів Siri: файл instruct_3b.voice, LLM і потоковий аудіодекодер. Незалежне тестування показало межу в 163 секунди, але приблизно після хвилини мовлення могло деградувати або зациклюватися. Це перспективна основа для локального TTS, однак стабільність довгих відповідей ще потребує перевірки.

Що саме знайшли під капотом

Нові голоси Siri, схоже, працюють на локальному генеративному стеку, а не на звичайному синтезаторі з невеликим набором інтонацій. Поєднання LLM і потокового аудіодекодера особливо цікаве: така схема враховує зміст тексту, керує подачею та може почати відтворення ще до завершення всієї генерації.

У публічній документації Siri AI (Beta) Apple підтверджує використання просунутої моделі на пристрої, але не розкриває внутрішню архітектуру. На момент тестування macOS 27 вказаними вимогами були Mac з M3 або новішим чипом і щонайменше 12 ГБ об’єднаної пам’яті. Користувачеві доступні налаштування темпу та виразності.

Незалежний розбір додає неофіційні деталі. У системі виявили файл instruct_3b.voice, пов’язаний із голосовою моделлю. На час дослідження вона працювала з англійською, німецькою та японською мовами, розуміла зміст тексту й приймала частину емоційних тегів, хоча Apple не документує цей механізм.

Параметр expressivity впливає не лише на умовну емоційність. Судячи зі спостережень, модель пов’язує виразність із семантикою фрази, тому результат не можна звести до простої зміни висоти тону чи швидкості. За якістю це ще не рівень нових голосових моделей ElevenLabs і Gemini, але звичного монотонного звучання тут уже немає.

Головне обмеження проявилося під час довгої генерації. Максимальна тривалість у тесті становила 163 секунди, однак приблизно після хвилини модель починала деградувати й могла зациклитися на одному слові. Поділ тексту на чанки помітно зменшував деградацію голосу, тоді як робота з float-представленням сильніше псувала результат.

Чому це цікаво розробникам

Це вже корисний конструктор для локального TTS, але ще не готовий виробничий компонент. Потоковий декодер підходить для інтерфейсів із низькою затримкою, а обробка змісту та емоцій дає більше контролю, ніж класичний синтез мовлення.

Найцікавіша частина розбору пов’язана з можливістю підставляти власні голосові ембеддинги. Публічного API та документації для цього в Apple немає, тому не варто розраховувати на стабільність формату: внутрішній файл, параметри або поведінка можуть змінитися з наступною збіркою системи.

Насамперед я б перевіряв межі чанків, накопичення помилок декодера та повторюваність інтонації між фрагментами. Ліміт у 163 секунди виглядає переконливо лише на папері, якщо реальна стабільність завершується після хвилини. Тут уже видно сильний локальний голосовий рушій, але ключове інженерне питання поки що не в красі голосу, а в передбачуваності довгої генерації.

Раніше ми розбирали Rust LocalGPT — локального асистента з пам’яттю та HTTP API. Цей приклад доповнює історію Apple instruct_3b, показуючи, як локальні моделі змінюють приватну роботу з ШІ.