Photon 2.1 ускорил ASR-модель втрое без настройки
Photon 2.1ASRраспознавание речи
Трехкратное ускорение без тюнинга
Меня здесь цепляет конкретный результат: Photon 2.1 ускорил небольшую ASR-модель пользователя в три раза сразу после запуска, причем с настройками по умолчанию. Проект работал на профессиональной видеокарте NVIDIA RTX Pro 2000. Это не мой тест, а описанный автором сообщения практический опыт.
Moondream в примечаниях к выпуску Photon 2.1 заявляет поддержку распознавания речи для Whisper large-v3-turbo, Qwen3-ASR 0.6B и 1.7B, а также Parakeet TDT 0.6B v3. Добавлены потоковая транскрипция и прогрессивные временные метки. Локальный speech-to-text выполняется через CUDA-путь Photon на поддерживаемых GPU NVIDIA.
Официальные цифры хорошо согласуются с пользовательским наблюдением, но не подтверждают его напрямую. Moondream тестировала Photon 2.1 на H100 и B200 при параллелизме 1 и 8. По данным страницы производительности, система выиграла все 16 конфигураций ASR, а максимальное ускорение достигло 3,1 раза.
Есть важная оговорка: отдельного официального бенчмарка для RTX Pro 2000 в опубликованных материалах нет. Поэтому трехкратный прирост на этой карте нельзя превращать в универсальное обещание для любой модели и нагрузки. По состоянию на 5 сентября 2026 года это сильный полевой результат, а не воспроизводимая таблица от разработчика.
Что меняется для локального распознавания речи
Главный эффект вполне реальный: если трехкратное ускорение сохраняется на конкретном конвейере, можно заметно сократить задержку без смены ASR-модели и ручного тюнинга. Для потоковой транскрипции это особенно ценно, поскольку там производительность быстро упирается в размер очереди, длительность аудио и конкурирующие запросы.
Я бы первым делом проверял не красивый средний throughput, а задержку первых токенов, стабильность временных меток, потребление памяти и качество при длинном аудио. Еще один риск скрыт в словах «настройки по умолчанию»: удачный дефолт для небольшой модели не гарантирует тот же выигрыш при другом размере батча или параллельной обработке.
Пока это выглядит не как магия, а как хорошо оптимизированный CUDA-путь, попавший в подходящую нагрузку. Самое интересное теперь не пиковые 3,1 раза на серверных ускорителях, а то, насколько ровно Photon держит ускорение на рабочих GPU вне лабораторных конфигураций.