2 мин чтения

S1-mini очищает расшифровки после ASR

S1-miniASRнормализация текста

S1-mini — открытая модель на 0,6 млрд параметров для очистки текста после ASR, а не для распознавания речи. Она удаляет слова-паразиты, ложные старты и самокоррекции, восстанавливает пунктуацию и регистр, а также приводит к письменному виду числа, даты, время, валюты и адреса электронной почты.

Это нормализатор текста, а не ещё один ASR

Я бы не ставил S1-mini вместо ASR-движка: это модель с открытыми весами на 0,6 млрд параметров для следующего шага. Сначала движок превращает аудио в сырой текст, затем нормализатор переписывает его в читабельную форму. И вот в таком узком месте отдельная модель выглядит логично.

В карточке модели Superwhisper на Hugging Face S1-mini описана именно как text normalizer для результатов распознавания речи. Она удаляет слова-паразиты, разбирает ложные старты и самокоррекции, добавляет пунктуацию и заглавные буквы. Числа, даты, время, валюты и адреса электронной почты модель приводит к письменному формату.

Это не просто косметика. В голосовом интерфейсе сырой ASR часто приходится чинить набором правил, отдельной моделью пунктуации или универсальной LLM. S1-mini пытается закрыть эти операции одним специализированным проходом и по умолчанию возвращает только очищенный текст.

Для локального развёртывания опубликованы примеры с Docker и SGLang, включая OpenAI-совместимый интерфейс чат-запросов. Есть и вариант GGUF для llama.cpp. В его инструкции отдельно указано, что режим thinking нужно отключить, поскольку модель обучалась без него.

В официальном блоге Superwhisper заявлены token accuracy 94,8% и text-edit error rate 11,6%. Там же описана обработка структуры, включая обнаружение списков и форматирование электронной почты. На момент публикации карточки это показатели самого разработчика, а не независимая проверка.

Где отдельная модель действительно меняет конвейер

Для диктовки и голосовых приложений такой нормализатор может убрать заметный слой ручных правил. Выигрывают конвейеры, где нужен чистый пользовательский текст, но универсальная LLM после каждого ASR-запроса выглядит слишком тяжёлой и непредсказуемой.

При инженерной оценке я бы первым проверял не красоту пунктуации, а сохранение смысла. Особенно уязвимы имена, термины, фрагменты кода, смешение языков и продиктованные символы. Дополнительный проход также приносит задержку и ещё одну точку отказа, даже если сама модель компактна и запускается локально.

Есть и принципиальная граница: удаление пауз и самокоррекций полезно для заметок, но опасно для дословных протоколов. Главный вопрос здесь не в том, насколько гладким стал текст, а в том, не переписала ли модель вместе с формой ещё и содержание.

Ранее мы сравнивали ИИ-инструменты для расшифровки и суммаризации встреч, уделяя особое внимание точности и рискам галлюцинаций. Этот контекст помогает понять, где модель постобработки вроде s1-mini способна улучшить итоговую расшифровку.