S1-mini очищает расшифровки после ASR
S1-miniASRнормализация текста
Это нормализатор текста, а не ещё один ASR
Я бы не ставил S1-mini вместо ASR-движка: это модель с открытыми весами на 0,6 млрд параметров для следующего шага. Сначала движок превращает аудио в сырой текст, затем нормализатор переписывает его в читабельную форму. И вот в таком узком месте отдельная модель выглядит логично.
В карточке модели Superwhisper на Hugging Face S1-mini описана именно как text normalizer для результатов распознавания речи. Она удаляет слова-паразиты, разбирает ложные старты и самокоррекции, добавляет пунктуацию и заглавные буквы. Числа, даты, время, валюты и адреса электронной почты модель приводит к письменному формату.
Это не просто косметика. В голосовом интерфейсе сырой ASR часто приходится чинить набором правил, отдельной моделью пунктуации или универсальной LLM. S1-mini пытается закрыть эти операции одним специализированным проходом и по умолчанию возвращает только очищенный текст.
Для локального развёртывания опубликованы примеры с Docker и SGLang, включая OpenAI-совместимый интерфейс чат-запросов. Есть и вариант GGUF для llama.cpp. В его инструкции отдельно указано, что режим thinking нужно отключить, поскольку модель обучалась без него.
В официальном блоге Superwhisper заявлены token accuracy 94,8% и text-edit error rate 11,6%. Там же описана обработка структуры, включая обнаружение списков и форматирование электронной почты. На момент публикации карточки это показатели самого разработчика, а не независимая проверка.
Где отдельная модель действительно меняет конвейер
Для диктовки и голосовых приложений такой нормализатор может убрать заметный слой ручных правил. Выигрывают конвейеры, где нужен чистый пользовательский текст, но универсальная LLM после каждого ASR-запроса выглядит слишком тяжёлой и непредсказуемой.
При инженерной оценке я бы первым проверял не красоту пунктуации, а сохранение смысла. Особенно уязвимы имена, термины, фрагменты кода, смешение языков и продиктованные символы. Дополнительный проход также приносит задержку и ещё одну точку отказа, даже если сама модель компактна и запускается локально.
Есть и принципиальная граница: удаление пауз и самокоррекций полезно для заметок, но опасно для дословных протоколов. Главный вопрос здесь не в том, насколько гладким стал текст, а в том, не переписала ли модель вместе с формой ещё и содержание.