3 min de lecture

Gemini Audio reste derrière GPT Live en production

Gemini Audio APIGPT Liveголосовые модели

Gemini Audio API reste moins prête pour la production que GPT Live. Lors de mon test, le service mélangeait les langues, produisait des bugs vocaux récurrents et des développeurs signalaient des accès intermittents au modèle. Ses capacités audio temps réel sont sérieuses, mais des sessions instables empêchent encore d'en faire un produit vocal fiable.

Ce que la comparaison avec GPT Live a révélé

Ma conclusion courte n'est pas flatteuse pour Google : Gemini Audio API donne encore l'impression d'un produit en préversion, même si son emballage affirme le contraire. Je l'ai essayé à côté de GPT Live et j'ai constaté des mélanges de langues, des bugs vocaux fréquents et un dialogue moins prévisible.

En septembre 2026, l'écart se voit surtout là où une interface vocale doit simplement fonctionner. Un incident isolé reste acceptable, mais des artefacts de parole répétés et un changement soudain de langue cassent vite l'impression d'une conversation naturelle.

L'annonce de Google concernant Gemini Audio API met l'accent sur les applications vocales en temps réel. Les documents officiels décrivent l'envoi d'audio PCM brut, une sortie audio à 24 kHz et la traduction vocale en temps réel. Sur le papier, l'ensemble est solide : le modèle reçoit un flux audio et répond vocalement sans chaîne distincte de reconnaissance et de synthèse.

Mais les spécifications de transport ne garantissent pas la stabilité du produit. Dans ma comparaison, le problème n'était pas l'idée même de l'audio en streaming, mais la qualité du comportement au sein d'une session. La voix buguait par moments, les langues se mélangeaient et le résultat paraissait encore brut.

Des développeurs ont également signalé sur les réseaux sociaux que le modèle était parfois complètement indisponible. Ce ne sont ni des statistiques publiques de disponibilité ni un remplacement du monitoring, il ne faut donc pas les transformer en indicateur précis. Pourtant, les documents officiels accessibles ne fournissent pas de métrique concrète qui permettrait de lever ce doute.

Pourquoi la maturité compte plus qu'une liste de fonctions

Pour un véritable agent vocal, GPT Live semble actuellement le choix d'ingénierie le plus sûr. La documentation d'OpenAI pour Realtime API détaille davantage le cycle de vie des sessions, les interruptions, les appels d'outils et les flux WebRTC : précisément les endroits où les systèmes vocaux commencent habituellement à se dégrader.

Je regarderais d'abord la reprise après une coupure, le changement de langue, la gestion des interruptions et la stabilité d'un long dialogue, plutôt qu'une démonstration de traduction. Si le modèle perd la langue ou altère la voix, une belle latence ne sauve plus l'expérience.

Gemini Audio possède une base techniquement intéressante, notamment pour les scénarios multilingues. Mais la situation actuelle ressemble davantage à une sortie rapide sous pression concurrentielle qu'au lancement serein d'une API mature. Pour l'instant, l'écart principal avec GPT Live ne porte pas sur les capacités du modèle, mais sur la prévisibilité de chaque fragment audio suivant.

Nous avons déjà comparé Gemini à des outils de synthèse de réunions, en nous concentrant sur la précision de transcription et les risques d'hallucination. Ces compromis concrets liés à la qualité audio comptent aussi pour évaluer les API vocales en temps réel.