Технічний контекст
Я протестував Nemotron 3.5 ASR Streaming 0.6B після відгуків колег і швидко зрозумів сильні та слабкі сторони моделі. Для AI-автоматизації дзвінків ідея виглядає привабливо: лише 600M параметрів, потоковий режим, заявлена низька затримка і єдиний чекпоінт для 40 локалей, включаючи ru-RU та uk-UA.
Щодо апаратної частини, модель справді приємна. NVIDIA просуває її як потокову ASR з кеш-орієнтованою обробкою та високою паралельністю, а через API її можна використовувати без важкої власної інфраструктури. Є режими затримки від приблизно 80 мс до 1.12 с, а також нормальна пунктуація та капіталізація з коробки.
Але ось де проблема: підтримка мови в картці моделі та реальна якість транскрипції — не одне й те саме. Для російської та української NVIDIA майже не показує публічних WER-цифр, і це вже був тривожний сигнал. Якщо вірити полю підтримуваних локалей, усе добре. Якщо ж прогнати живу мову, особливо з акцентом, фоновим шумом або швидким темпом, стає сумно.
Ще один важливий момент: фраза «може працювати навіть у браузері» звучить надто оптимістично. У браузері зручно звертатися до віддаленого інтерфейсу, але сама модель не працює нативно як легка веб-іграшка. Для інференсу потрібні NeMo, CUDA та нормальний серверний контур, якщо не брати розміщений API.
Вплив на бізнес та автоматизацію
Мій практичний висновок простий. Якщо ви будуєте голосовий ШІ для англомовного трафіку або мультимовний прототип, модель може бути цікавою через ціну, швидкість і щільність ресурсів.
Якщо ж основне навантаження — ru/ukr, слабке розпізнавання вбиває весь подальший ланцюжок: резюме дзвінків, видобування сутностей, контроль якості, AI-інтеграція в CRM. Помилка в ASR потім розмазується по всьому ланцюгу й робить автоматизацію просто дорогою імітацією користі.
Виграють команди, яким потрібен дешевий потоковий базис і які готові чесно валідувати мови на власних даних. Програють ті, хто бере multilingual-підтримку з картки моделі як гарантію якості, готової до виробництва.
Ми в Nahornyi AI Lab зазвичай такі речі вирішуємо дуже швидко: спочатку тест на реальних дзвінках, потім вже розробка AI-рішення навколо транскрипції, а не навпаки. Якщо у вас голосові процеси буксуютъ саме на цьому рівні, можна разом розібрати стек і зібрати AI-автоматизацію без гарних, але марних компромісів.