Photon 2.1 утричі прискорив ASR-модель без налаштування
Photon 2.1ASRраспознавание речи
Триразове прискорення без тюнінгу
Тут привертає увагу конкретний практичний результат: Photon 2.1 утричі прискорив невелику ASR-модель користувача відразу після запуску та зі стандартними налаштуваннями. Проєкт працював на професійній відеокарті NVIDIA RTX Pro 2000. Це не мій тест, а практичний досвід, описаний автором повідомлення.
У примітках до релізу Photon 2.1 Moondream заявляє підтримку розпізнавання мовлення для Whisper large-v3-turbo, Qwen3-ASR 0.6B і 1.7B, а також Parakeet TDT 0.6B v3. Додано потокове транскрибування та прогресивні часові мітки. Локальний speech-to-text виконується через CUDA-шлях Photon на підтримуваних GPU NVIDIA.
Офіційні цифри добре узгоджуються зі спостереженням користувача, але прямо його не підтверджують. Moondream тестувала Photon 2.1 на H100 і B200 за паралелізму 1 та 8. За даними сторінки продуктивності, система перемогла в усіх 16 конфігураціях ASR, а максимальне прискорення сягнуло 3,1 раза.
Є важливе застереження: в опублікованих матеріалах немає окремого офіційного бенчмарку для RTX Pro 2000. Тому триразовий приріст на цій карті не варто перетворювати на універсальну обіцянку для будь-якої моделі та навантаження. Станом на 5 вересня 2026 року це сильний польовий результат, а не відтворювана таблиця від розробника.
Що змінюється для локального розпізнавання мовлення
Практичний ефект цілком реальний: якщо триразове прискорення зберігається в конкретному конвеєрі, можна помітно зменшити затримку без заміни ASR-моделі та ручного тюнінгу. Для потокового транскрибування це особливо цінно, адже продуктивність там швидко впирається в розмір черги, тривалість аудіо й конкуруючі запити.
Я б насамперед перевіряв не гарний середній throughput, а затримку до перших токенів, стабільність часових міток, споживання пам’яті та якість на довгому аудіо. Ще один ризик прихований у словах стандартні налаштування: вдалий дефолт для малої моделі не гарантує такого самого виграшу за іншого розміру батча або паралельної обробки.
Поки це схоже не на магію, а на добре оптимізований CUDA-шлях, що потрапив у відповідне навантаження. Найцікавіше тепер не пікові 3,1 раза на серверних прискорювачах, а те, наскільки стабільно Photon утримує прискорення на робочих GPU поза лабораторними конфігураціями.