Skip to main content
ASRNVIDIAHugging Face

Nemotron 3.5 ASR слаб на русском и украинском

NVIDIA выпустила легковесную streaming ASR-модель Nemotron 3.5 0.6B, но на практике для русского и украинского транскрипция заметно проседает. Для бизнеса это важно: дешевая AI automation со звонками и голосом не имеет смысла, если качество распознавания ломает весь пайплайн. Это делает работу с голосовыми ИИ сложной.

Технический контекст

Я покрутил Nemotron 3.5 ASR Streaming 0.6B после отзывов коллег и быстро понял, где у модели сильная сторона, а где провал. Для AI automation со звонками идея выглядит красиво: всего 600M параметров, streaming-режим, заявленная низкая задержка и один чекпоинт на 40 локалей, включая ru-RU и uk-UA.

По железу модель действительно приятная. NVIDIA продвигает ее как cache-aware streaming ASR с высокой concurrency, а через API ее уже можно брать без тяжелого self-hosted зоопарка. Есть режимы латентности от примерно 80 мс до 1.12 с, плюс нормальная пунктуация и капитализация из коробки.

Но вот здесь я и споткнулся: поддержка языка в карточке модели и реальное качество транскрипции не одно и то же. По русскому и украинскому публичных WER-цифр NVIDIA почти не показывает, и это уже был тревожный сигнал. Если верить полю supported locales, все хорошо. Если прогнать живую речь, особенно с акцентом, фоновым шумом или быстрым темпом, становится грустно.

Еще один важный момент: фраза «может работать даже в браузере» звучит слишком оптимистично. В браузере можно удобно дергать удаленный endpoint, но сама модель не крутится нативно как легкая web-игрушка. Для инференса нужны NeMo, CUDA и нормальный серверный контур, если не брать hosted API.

Влияние на бизнес и автоматизацию

Практический вывод у меня простой. Если вы строите voice AI для англоязычного потока или мульти-язычный прототип, модель может быть интересной за счет цены, скорости и плотности по ресурсам.

Если же у вас основная нагрузка в ru/ukr, слабое распознавание убивает весь downstream: саммари звонков, извлечение сущностей, контроль качества, AI integration в CRM. Ошибка в ASR потом размазывается по всей цепочке и делает автоматизацию просто дорогой имитацией пользы.

Выигрывают команды, которым нужен дешевый streaming baseline и которые готовы честно валидировать языки на своих данных. Проигрывают те, кто берет multilingual-support из model card как гарантию production-ready качества.

Мы в Nahornyi AI Lab такие вещи обычно режем очень быстро: сначала тест на реальных звонках, потом уже AI solution development вокруг транскрипции, а не наоборот. Если у вас голосовые процессы буксуют именно на этом слое, можно вместе разобрать стек и собрать AI automation без красивых, но бесполезных компромиссов.

Мы ранее сравнивали точность популярных сервисов транскрибации встреч — tl;dv, Otter.ai и других — и выявили риски галлюцинаций. Это напрямую перекликается с сегодняшним тестом Nemotron-3.5, где качество распознавания русского и украинского оказалось близким к нулю.

Поделиться статьёй