3 Min. Lesezeit

Inflect-Nano-v2 auf ESP32 komprimiert

ttsesp32edge-ai

In einer Diskussion berichtete ein Entwickler, dass er das vollständige TTS-Modell Inflect-Nano-v2 auf einen ESP32 komprimiert hat und dabei nahezu 2x Echtzeit erreichte. Interessant ist, dass die offizielle Hugging-Face-Karte das Modell als lokales englisches Text-zu-Wellenform-TTS mit 3.966.721 bereitstellbaren Parametern und 24-kHz-Monoausgabe beschreibt.

Der Haupttrick liegt nicht im Modell, sondern darin, was daraus entfernt wurde

Die Kernnachricht ist einfach: Ein Diskussionsteilnehmer berichtete, dass das vollständige TTS-Modell Inflect-Nano-v2 erfolgreich auf eine winzige ESP32-Platine komprimiert wurde und dabei nahezu 2x Echtzeit erreichte. Stand 11. August 2026 sieht das nicht wie ein offizielles Firmware-Release aus, sondern wie ein sehr interessanter Engineering-Fall aus der Praxis.

Die Hugging-Face-Karte zu owensong/Inflect-Nano-v2 gibt an, dass es sich um ein vollständiges lokales englisches Text-to-Waveform-TTS handelt: 3.966.721 bereitstellbare Parameter, Zielausgabe 24 kHz mono, End-to-End-Generator der VITS-Familie. Für einen Mikrocontroller ist das kein Pappenstiel. Beim ESP32 geht es nicht um Luxus – jeder zusätzliche Block wird schnell zur Qual.

Laut Kartenbeschreibung enthält es ein englisches Phonem-Frontend, monotone Ausrichtung, stochastische latente Synthese, Residual Coupling Flow und einen alias-reduzierten neuronalen Wellenform-Decoder. Kompakte Einstellungen sind ebenfalls aufgeführt: 128 latente Kanäle, 72 versteckte Textkanäle, 3 Encoder-Schichten, 2 Heads, 384 Feed-Forward-Kanäle, 4 Flow Coupling Blöcke, 192 anfängliche Decoder-Kanäle und Upsampling-Raten von 8, 8, 2, 2.

Und hier ist die Erwähnung des Reverse Engineering wichtiger als der reine Lauf. Der Diskussionsautor schrieb ausdrücklich, dass sich beim Zerlegen herausstellte, dass man vieles wegwerfen kann. Welche Komponenten genau entfernt wurden, ist in den Ausgangsdaten nicht offengelegt, daher ist es ehrlicher, nicht über eine konkrete Liste von Schichten zu spekulieren.

Die technische Richtung ist jedoch klar. Ein solches Modell hat einen akustischen Teil, eine Ausrichtung, eine latente Generierung und einen Wellenform-Decoder. Ist das Ziel eng gefasst – etwa eine englische Stimme und lokale Sprachausgabe kurzer Sätze – kann ein Teil der allgemeinen Flexibilität eine unnötige Belastung sein.

Warum nahezu 2x Echtzeit auf dem ESP32 bedeutsam ist

Ein nahezu zweifacher Echtzeit-Puffer auf dem ESP32 verändert die Diskussion: Es ist nicht länger nur ein knappes Quietschen, sondern eine potenziell brauchbare lokale TTS-Pipeline. Für IoT und Wearables ist der Unterschied enorm, denn Sprache kann ohne Server und ohne Netzwerklatenz generiert werden.

Die offizielle ONNX-Verpackung von Inflect-Nano-v2 deutet ebenfalls auf eine praktische Schnittstelle hin: duration.onnx ist für Tokens zur ausgerichteten akustischen Verteilung zuständig, decode.onnx für akustische Verteilung plus Seed-Rauschen zur Wellenform. Eine solche Aufteilung beweist noch nicht die ESP32-Tauglichkeit, zeigt aber, wo das Modell zerschnitten, quantisiert oder in Teilen ersetzt werden kann.

Ich würde zuerst nicht auf die schöne Parameterzahl schauen, sondern auf Speicher, Berechnungstypen und die Kosten des Decoders. Bei TTS lässt sich der Textteil oft relativ gefahrlos komprimieren, aber ein zu grober Angriff auf den Wellenform-Decoder verwandelt Sprache schnell in Brei.

Dieser Fall besticht gerade durch seine Bodenständigkeit. Kein weiterer riesiger Cloud-Generator, sondern ein kleines Modell, das jemand mit dem Schraubenzieher bis auf Mikrocontroller-Ebene zerlegt hat. Die spannendste Frage ist nun nicht der Start, sondern wie viel Qualität nach all dieser Chirurgie übrig geblieben ist.

Wir haben zuvor einen ähnlichen Fall der Ausführung von Codex auf Raspberry Pi analysiert — das Fehlen eines architektonischen Ansatzes machte die Demonstration zu einem Mythos. Diese Geschichte über die Optimierung von TTS für ESP32 ergänzt dieses Thema anschaulich und zeigt, welche technischen Lösungen auf stromsparender Hardware tatsächlich funktionieren.