3 Min. Lesezeit

Lokale Siri-Stimmen in macOS 27: Was steckt dahinter?

SirimacOS 27локальный TTS

macOS 27 enthält einen lokalen Stack für neue Siri-Stimmen: ein LLM, die Datei instruct_3b.voice und einen Streaming-Audiodekoder. Unabhängige Tests fanden ein Limit von 163 Sekunden; nach etwa einer Minute konnte die Sprache jedoch schlechter werden oder sich wiederholen. Das ist relevant für lokales TTS, doch die Zuverlässigkeit bei langen Ausgaben bleibt offen.

Was unter der Haube gefunden wurde

Die neuen Siri-Stimmen scheinen auf einem lokalen generativen Stack zu laufen und nicht auf einem herkömmlichen Sprachsynthesizer mit wenigen Intonationsvarianten. Besonders interessant ist die Kombination aus LLM und Streaming-Audiodekoder: Sie kann die Bedeutung des Textes berücksichtigen, die Sprechweise steuern und die Wiedergabe beginnen, bevor die gesamte Ausgabe fertig generiert ist.

Apples öffentliche Dokumentation zu Siri AI (Beta) bestätigt den Einsatz eines fortschrittlichen On-Device-Modells, legt die interne Architektur jedoch nicht offen. Zum Zeitpunkt der macOS-27-Tests galten ein Mac mit M3 oder neuer sowie mindestens 12 GB gemeinsam genutzter Speicher als Anforderungen. Nutzern stehen Einstellungen für Tempo und Ausdrucksstärke zur Verfügung.

Eine unabhängige Analyse liefert inoffizielle Details. Im System wurde die Datei instruct_3b.voice gefunden, die mit dem Sprachmodell verbunden ist. Zum Untersuchungszeitpunkt arbeitete sie mit Englisch, Deutsch und Japanisch, verstand Textinhalte und akzeptierte einige Emotions-Tags, obwohl Apple diesen Mechanismus nicht dokumentiert.

Der Parameter expressivity beeinflusst offenbar mehr als nur eine allgemeine Emotionalität. Beobachtungen zufolge verbindet das Modell Ausdrucksstärke mit der Semantik eines Satzes; das Ergebnis lässt sich daher nicht auf Tonhöhe oder Sprechgeschwindigkeit reduzieren. Qualitativ erreicht es noch nicht die neueren Sprachmodelle von ElevenLabs und Gemini, doch die übliche monotone Ausgabe ist bereits überwunden.

Die wichtigste Einschränkung zeigte sich bei langen Generierungen. Die maximale Testdauer betrug 163 Sekunden, doch nach ungefähr einer Minute begann das Modell abzubauen und konnte sich bei einem einzelnen Wort wiederholen. Die Aufteilung des Textes in Chunks verringerte die Stimmdegradation deutlich, während die Arbeit mit Float-Repräsentationen das Ergebnis stärker verschlechterte.

Warum das für Entwickler interessant ist

Das ist bereits ein nützlicher Baukasten für lokales TTS, aber noch keine produktionsreife Komponente. Ein Streaming-Dekoder eignet sich für Oberflächen mit geringer Latenz, und die Verarbeitung von Bedeutung und Emotionen bietet mehr Kontrolle als klassische Sprachsynthese.

Der spannendste Teil der Analyse betrifft die Möglichkeit, eigene Sprach-Embeddings einzusetzen. Apple stellt dafür weder eine öffentliche API noch Dokumentation bereit. Auf ein stabiles Format sollte man daher nicht bauen: Interne Datei, Parameter oder Verhalten können sich mit jedem System-Build ändern.

Ich würde zuerst Chunk-Grenzen, die Fehlerakkumulation des Dekoders und die Wiederholbarkeit der Intonation zwischen Segmenten prüfen. Ein Limit von 163 Sekunden wirkt nur auf dem Papier beeindruckend, wenn die reale Stabilität nach einer Minute endet. Ein leistungsfähiger lokaler Sprachmotor ist erkennbar, doch die zentrale technische Frage lautet weiterhin: Wie vorhersehbar sind lange Generierungen?

Wir haben zuvor Rust LocalGPT untersucht, einen lokalen Assistenten mit Speicher und HTTP-API. Dieses Beispiel ergänzt die Geschichte von Apple instruct_3b und zeigt, wie lokale Modelle datenschutzbewusste KI-Arbeit verändern.