3 min de lectura

Inflect-Nano-v2 comprimido en ESP32

ttsesp32edge-ai

En una discusión, un desarrollador comprimió el TTS Inflect-Nano-v2 en un ESP32 logrando casi 2x tiempo real. Es notable porque su ficha de Hugging Face lo define como un TTS local inglés de texto a forma de onda con 3,97 millones de parámetros y salida mono de 24 kHz.

El truco principal no es el modelo, sino lo que se eliminó de él

La noticia clave es simple: un participante de la discusión informó que el modelo TTS completo Inflect-Nano-v2 se logró comprimir en una pequeña placa ESP32 y obtuvo casi el doble de rendimiento en tiempo real. A fecha del 11 de agosto de 2026, esto no parece un lanzamiento oficial de firmware, sino un caso de ingeniería muy interesante desde el terreno.

La ficha de Hugging Face para owensong/Inflect-Nano-v2 indica que es un TTS local completo de texto a forma de onda en inglés: 3.966.721 parámetros desplegables, salida mono objetivo de 24 kHz, generador de extremo a extremo de la familia VITS. Para un microcontrolador, eso no es ninguna broma. El ESP32 no es para lujos: cada bloque adicional se convierte rápidamente en un dolor.

Según la descripción de la ficha, contiene un frontend de fonemas en inglés, alineación monótona, síntesis latente estocástica, flujo de acoplamiento residual y un decodificador de forma de onda neuronal con reducción de alias. También se enumeran configuraciones compactas: 128 canales latentes, 72 canales ocultos de texto, 3 capas de codificador, 2 cabezales, 384 canales feed-forward, 4 bloques de acoplamiento de flujo, 192 canales iniciales del decodificador y tasas de sobremuestreo de 8, 8, 2, 2.

Aquí, la mención de la ingeniería inversa es más importante que el hecho de haberlo ejecutado. El autor de la discusión escribió explícitamente que, al desmontarlo, resultó que se podía descartar mucho. No se revelaron exactamente qué componentes se eliminaron en los datos originales, por lo que es más honesto no especular sobre una lista concreta de capas.

Pero la dirección de ingeniería está clara. Este modelo tiene una parte acústica, alineamiento, generación latente y un decodificador de forma de onda. Si el objetivo es limitado —por ejemplo, una sola voz en inglés y la locución local de frases cortas—, parte de la flexibilidad general puede ser un impuesto innecesario.

Por qué casi el doble de tiempo real en ESP32 es importante

Un margen de casi el doble del tiempo real en ESP32 cambia la conversación: ya no se trata de que apenas funcione, sino de un circuito TTS local potencialmente viable. Para IoT y dispositivos portátiles, la diferencia es enorme, porque se puede generar voz sin servidor y sin latencia de red.

El empaquetado ONNX oficial de Inflect-Nano-v2 también insinúa un punto de corte conveniente: duration.onnx se encarga de los tokens a la distribución acústica alineada, decode.onnx de la distribución acústica más ruido inicial a la forma de onda. Esta división no prueba que esté listo para ESP32, pero muestra dónde se puede seccionar, cuantificar o reemplazar el modelo por partes.

Yo miraría primero no la bonita cifra de parámetros, sino la memoria, los tipos de cálculo y el coste del decodificador. En TTS, a menudo se puede comprimir la parte de texto con relativa seguridad, pero un ataque demasiado brusco al decodificador de forma de onda convierte rápidamente el habla en papilla.

Este caso es valioso precisamente por su enfoque realista. No es otro enorme generador en la nube, sino un modelo pequeño que alguien empezó a desmontar con un destornillador hasta el nivel de microcontrolador. La pregunta más interesante ahora no es el lanzamiento, sino cuánta calidad quedó después de toda esa cirugía.

Anteriormente analizamos un caso similar de ejecutar Codex en Raspberry Pi — la falta de un enfoque arquitectónico convirtió la demostración en un mito. Esta historia sobre la optimización de TTS para ESP32 complementa claramente ese tema y muestra qué soluciones de ingeniería realmente funcionan en hardware de bajo consumo.