Skip to main content
ASRNVIDIAHugging Face

Nemotron 3.5 ASR слабкий у російській та українській

NVIDIA випустила легку потокову ASR-модель Nemotron 3.5 0.6B, але на практиці якість транскрипції для російської та української значно падає. Для бізнесу це критично: дешева AI-автоматизація дзвінків та голосу втрачає сенс, якщо якість розпізнавання ламає весь пайплайн. Це ускладнює голосову AI-інтеграцію.

Технічний контекст

Я протестував Nemotron 3.5 ASR Streaming 0.6B після відгуків колег і швидко зрозумів сильні та слабкі сторони моделі. Для AI-автоматизації дзвінків ідея виглядає привабливо: лише 600M параметрів, потоковий режим, заявлена низька затримка і єдиний чекпоінт для 40 локалей, включаючи ru-RU та uk-UA.

Щодо апаратної частини, модель справді приємна. NVIDIA просуває її як потокову ASR з кеш-орієнтованою обробкою та високою паралельністю, а через API її можна використовувати без важкої власної інфраструктури. Є режими затримки від приблизно 80 мс до 1.12 с, а також нормальна пунктуація та капіталізація з коробки.

Але ось де проблема: підтримка мови в картці моделі та реальна якість транскрипції — не одне й те саме. Для російської та української NVIDIA майже не показує публічних WER-цифр, і це вже був тривожний сигнал. Якщо вірити полю підтримуваних локалей, усе добре. Якщо ж прогнати живу мову, особливо з акцентом, фоновим шумом або швидким темпом, стає сумно.

Ще один важливий момент: фраза «може працювати навіть у браузері» звучить надто оптимістично. У браузері зручно звертатися до віддаленого інтерфейсу, але сама модель не працює нативно як легка веб-іграшка. Для інференсу потрібні NeMo, CUDA та нормальний серверний контур, якщо не брати розміщений API.

Вплив на бізнес та автоматизацію

Мій практичний висновок простий. Якщо ви будуєте голосовий ШІ для англомовного трафіку або мультимовний прототип, модель може бути цікавою через ціну, швидкість і щільність ресурсів.

Якщо ж основне навантаження — ru/ukr, слабке розпізнавання вбиває весь подальший ланцюжок: резюме дзвінків, видобування сутностей, контроль якості, AI-інтеграція в CRM. Помилка в ASR потім розмазується по всьому ланцюгу й робить автоматизацію просто дорогою імітацією користі.

Виграють команди, яким потрібен дешевий потоковий базис і які готові чесно валідувати мови на власних даних. Програють ті, хто бере multilingual-підтримку з картки моделі як гарантію якості, готової до виробництва.

Ми в Nahornyi AI Lab зазвичай такі речі вирішуємо дуже швидко: спочатку тест на реальних дзвінках, потім вже розробка AI-рішення навколо транскрипції, а не навпаки. Якщо у вас голосові процеси буксуютъ саме на цьому рівні, можна разом розібрати стек і зібрати AI-автоматизацію без гарних, але марних компромісів.

Ми раніше порівнювали точність популярних сервісів транскрибації зустрічей — tl;dv, Otter.ai та інших — і виявили ризики галюцинацій. Це прямо перегукується з сьогоднішнім тестом Nemotron-3.5, де якість розпізнавання російської та української виявилася близькою до нуля.

Поділитися статтею