Gemini Audio пока проигрывает GPT Live в продакшне
Gemini Audio APIGPT Liveголосовые модели
Что показало сравнение с GPT Live
Мой короткий вывод неприятный для Google: Gemini Audio API пока выглядит как превью, даже если упаковка говорит обратное. Я попробовал его рядом с GPT Live и получил смешение языков, частые голосовые гличи и менее предсказуемый диалог.
По состоянию на сентябрь 2026 года разница особенно заметна там, где голосовой интерфейс должен просто работать. Отдельный сбой можно пережить, но повторяющиеся артефакты речи и внезапное переключение языка быстро ломают ощущение живого разговора.
В анонсе Google о Gemini Audio API акцент сделан на голосовых приложениях реального времени. Официальные материалы описывают передачу необработанного PCM-аудио, аудиовыход с частотой 24 кГц и перевод речи в реальном времени. На бумаге набор сильный: модель получает поток аудио и отвечает голосом без отдельной цепочки распознавания и синтеза.
Но спецификация транспорта не равна стабильности продукта. В моём сравнении проблема была не в самой идее потокового аудио, а в качестве поведения внутри сессии. Голос периодически глючил, языки смешивались, и результат ощущался сырым.
Есть и сообщения разработчиков в соцсетях о том, что модель временами вообще недоступна. Это не публичная статистика доступности и не замена мониторингу, поэтому превращать такие отзывы в точный показатель нельзя. Однако в доступных официальных материалах нет конкретной метрики, которая бы снимала этот вопрос.
Почему для продакшна зрелость важнее списка функций
Для реального голосового агента GPT Live сейчас выглядит безопаснее именно как инженерный выбор. Документация OpenAI для Realtime API подробнее разбирает жизненный цикл сессии, прерывания, вызовы инструментов и работу через WebRTC, то есть те места, где голосовые системы обычно начинают разваливаться.
Первым делом я бы смотрел не на демонстрацию перевода, а на восстановление после обрыва, переключение языков, обработку перебиваний и стабильность длинного диалога. Если модель теряет язык или портит голос, красивая задержка уже ничего не спасает.
У Gemini Audio есть технически интересная база, особенно для мультиязычных сценариев. Но текущая картина больше напоминает быстрый выпуск под давлением конкуренции, чем спокойный выход зрелого API. Пока главный разрыв между Gemini Audio и GPT Live проходит не по возможностям модели, а по предсказуемости каждого следующего аудиофрагмента.