2 хв читання

Photon 2.1 утричі прискорив ASR-модель без налаштування

Photon 2.1ASRраспознавание речи

Photon 2.1 утричі прискорив невелику ASR-модель користувача на NVIDIA RTX Pro 2000 одразу після запуску та без зміни налаштувань. Це важливо, бо CUDA-шлях Moondream може суттєво зменшити затримку локального розпізнавання мовлення, хоча офіційного тесту для цієї GPU немає.

Триразове прискорення без тюнінгу

Тут привертає увагу конкретний практичний результат: Photon 2.1 утричі прискорив невелику ASR-модель користувача відразу після запуску та зі стандартними налаштуваннями. Проєкт працював на професійній відеокарті NVIDIA RTX Pro 2000. Це не мій тест, а практичний досвід, описаний автором повідомлення.

У примітках до релізу Photon 2.1 Moondream заявляє підтримку розпізнавання мовлення для Whisper large-v3-turbo, Qwen3-ASR 0.6B і 1.7B, а також Parakeet TDT 0.6B v3. Додано потокове транскрибування та прогресивні часові мітки. Локальний speech-to-text виконується через CUDA-шлях Photon на підтримуваних GPU NVIDIA.

Офіційні цифри добре узгоджуються зі спостереженням користувача, але прямо його не підтверджують. Moondream тестувала Photon 2.1 на H100 і B200 за паралелізму 1 та 8. За даними сторінки продуктивності, система перемогла в усіх 16 конфігураціях ASR, а максимальне прискорення сягнуло 3,1 раза.

Є важливе застереження: в опублікованих матеріалах немає окремого офіційного бенчмарку для RTX Pro 2000. Тому триразовий приріст на цій карті не варто перетворювати на універсальну обіцянку для будь-якої моделі та навантаження. Станом на 5 вересня 2026 року це сильний польовий результат, а не відтворювана таблиця від розробника.

Що змінюється для локального розпізнавання мовлення

Практичний ефект цілком реальний: якщо триразове прискорення зберігається в конкретному конвеєрі, можна помітно зменшити затримку без заміни ASR-моделі та ручного тюнінгу. Для потокового транскрибування це особливо цінно, адже продуктивність там швидко впирається в розмір черги, тривалість аудіо й конкуруючі запити.

Я б насамперед перевіряв не гарний середній throughput, а затримку до перших токенів, стабільність часових міток, споживання пам’яті та якість на довгому аудіо. Ще один ризик прихований у словах стандартні налаштування: вдалий дефолт для малої моделі не гарантує такого самого виграшу за іншого розміру батча або паралельної обробки.

Поки це схоже не на магію, а на добре оптимізований CUDA-шлях, що потрапив у відповідне навантаження. Найцікавіше тепер не пікові 3,1 раза на серверних прискорювачах, а те, наскільки стабільно Photon утримує прискорення на робочих GPU поза лабораторними конфігураціями.

Раніше ми порівнювали ШІ-інструменти для підсумків зустрічей, зокрема точність транскрибування та компроміси щодо галюцинацій у результатах. Швидший ASR від Moondream Photon 2.1 може зробити ті самі робочі процеси більш чуйними.