Skip to main content
VoxCPM2голосовые агентыAI automation

VoxCPM2 вытесняет старые версии из телефонии

Пользователи, которые раньше полагались на VoxCPM 0.6B и 1.7B, теперь активно переходят на VoxCPM2 для телефонных задач. Причина проста: модель быстрее, поддерживает больше языков и лучше интегрируется в AI automation для голосовых ботов и IVR. Это практичный шаг для улучшения реальных звонков.

Технический контекст

Я зацепился за короткую реплику про миграцию с VoxCPM 0.6B и 1.7B на VoxCPM2 именно потому, что это не абстрактный релиз, а живая проверка боем. Если модель забирают в звонилку, значит там смотрят не на красивый демо-ролик, а на задержку, стабильность и то, насколько это вообще переживает прод.

По спецификации картина понятная. VoxCPM2 это уже 2B-модель, с 30 языками и 9 китайскими диалектами, 48 kHz аудио, zero-shot voice cloning и стримингом. Для AI implementation в телефонии это важнее любых бенчмарков на слайдах: один стек закрывает и голос, и мультиязычность, и более-менее живой conversational tempo.

Я отдельно посмотрел на скорость. Официально у них заявлен RTF около 0.30 в обычной подаче и около 0.13 с оптимизированным Nano-vLLM serving. Для телефонного канала это уже рабочий диапазон, особенно если весь пайплайн не разваливается на ASR, роутинге и LLM-оркестрации.

На фоне старых 0.6B и 1.7B разница не только в размере. У ранних версий была более узкая зона применения, в первую очередь по языкам и общей гибкости. VoxCPM2 выглядит как версия, где семейство наконец стало пригодным не только для эксперимента, а для нормальной AI integration в голосовые процессы.

Влияние на бизнес и автоматизацию

Для звонков тут три практических вывода. Первый: меньше костылей в архитектуре, потому что не нужно городить отдельные решения под языки, стиль голоса и клон. Второй: быстрее запуск международных сценариев, где раньше всё упиралось в TTS-слой. Третий: выше шанс, что голосовой агент звучит не как банкомат 2014 года.

Выигрывают команды, которым нужен один движок под IVR, обзвон и входящие голосовые сценарии. Проигрывают те, кто построил стек вокруг старых моделей и теперь будет платить за миграцию, тюнинг и тесты на реальных линиях.

И вот тут начинается не магия, а инженерка: даже хорошая TTS-модель сама по себе не спасает, если у вас плохой буферинг, кривой SIP-слой или задержки между ASR и генерацией. Я у себя в Nahornyi AI Lab как раз такие узкие места и разгребаю, когда собираю AI solutions for business вокруг телефонии.

Если вы уже упёрлись в качество или latency голосового бота, можно не гадать по форумам. Давайте посмотрим на ваш стек целиком: в Nahornyi AI Lab я могу помочь с AI automation под звонки, чтобы агент не просто говорил красивым голосом, а реально снимал нагрузку с команды и не бесил людей на линии.

Мы ранее разбирали актуальные AI-сервисы для автоматического подведения итогов встреч — это тоже пример внедрения ИИ в звонки, но с фокусом на анализ, а не на генерацию речи.

Поделиться статьёй