Gemini Audio aún pierde frente a GPT Live en producción
Gemini Audio APIGPT Liveголосовые модели
Qué reveló la comparación con GPT Live
Mi conclusión breve no favorece a Google: Gemini Audio API todavía se siente como un producto en vista previa, aunque su presentación diga lo contrario. La probé junto a GPT Live y encontré mezcla de idiomas, fallos frecuentes de voz y una conversación menos predecible.
En septiembre de 2026, la diferencia se nota especialmente cuando una interfaz de voz simplemente debe funcionar. Un fallo aislado se puede tolerar, pero los artefactos recurrentes en el habla y los cambios repentinos de idioma rompen rápidamente la sensación de una conversación natural.
El anuncio de Google sobre Gemini Audio API pone el foco en aplicaciones de voz en tiempo real. Los materiales oficiales describen entrada de audio PCM sin procesar, salida de audio a 24 kHz y traducción de voz en tiempo real. Sobre el papel, el conjunto es sólido: el modelo recibe un flujo de audio y responde con voz sin una cadena separada de reconocimiento y síntesis.
Sin embargo, las especificaciones de transporte no equivalen a la estabilidad del producto. En mi comparación, el problema no era la idea del audio en streaming, sino la calidad del comportamiento dentro de la sesión. La voz fallaba periódicamente, los idiomas se mezclaban y el resultado se percibía inmaduro.
También hay informes de desarrolladores en redes sociales que indican que el modelo a veces no está disponible en absoluto. No son estadísticas públicas de disponibilidad ni sustituyen una monitorización adecuada, por lo que no deben convertirse en una métrica exacta. Aun así, los materiales oficiales disponibles no aportan una cifra concreta que resuelva esta duda.
Por qué la madurez importa más que una lista de funciones
Para un agente de voz real, GPT Live parece hoy la opción de ingeniería más segura. La documentación de OpenAI para Realtime API explica con más detalle el ciclo de vida de las sesiones, las interrupciones, las llamadas a herramientas y el trabajo con WebRTC: justo los puntos donde los sistemas de voz suelen empezar a fallar.
Yo miraría antes que nada la recuperación tras una desconexión, el cambio de idioma, la gestión de interrupciones y la estabilidad durante conversaciones largas, no solo una demostración de traducción. Si el modelo pierde el idioma o degrada la voz, una latencia atractiva ya no salva la experiencia.
Gemini Audio tiene una base técnicamente interesante, sobre todo para escenarios multilingües. Pero la imagen actual se parece más a un lanzamiento rápido bajo presión competitiva que a la salida tranquila de una API madura. Por ahora, la principal diferencia frente a GPT Live no está en las capacidades del modelo, sino en la previsibilidad de cada siguiente fragmento de audio.