S1-mini очищує транскрипції після ASR
S1-miniASRнормализация текста
Це нормалізатор тексту, а не ще один ASR
Я б не використовував S1-mini замість ASR-рушія: це модель з відкритими вагами на 0,6 млрд параметрів для наступного етапу. Спочатку рушій перетворює аудіо на сирий текст, а потім нормалізатор переписує його в читабельну форму. Для такої вузької частини конвеєра окрема модель виглядає логічно.
У картці Superwhisper на Hugging Face S1-mini описано саме як нормалізатор тексту для результатів розпізнавання мовлення. Вона видаляє слова-паразити, обробляє хибні початки та самовиправлення, додає пунктуацію і великі літери. Числа, дати, час, валюти й адреси електронної пошти модель приводить до письмового формату.
Це не просто косметичне редагування. У голосовому інтерфейсі сирий ASR-результат часто доводиться виправляти набором правил, окремою моделлю пунктуації або універсальною LLM. S1-mini намагається виконати ці операції за один спеціалізований прохід і за замовчуванням повертає лише очищений текст.
Для локального розгортання опубліковано приклади з Docker і SGLang, зокрема OpenAI-сумісний інтерфейс чат-запитів. Є також варіант GGUF для llama.cpp. В інструкції окремо зазначено, що режим thinking слід вимкнути, оскільки модель навчали без нього.
В офіційному блозі Superwhisper заявлено точність токенів 94,8% і text-edit error rate 11,6%. Там само описано обробку структури, включно з виявленням списків і форматуванням електронної пошти. На момент публікації картки це були показники розробника, а не незалежна перевірка.
Де окрема модель справді змінює конвеєр
Для диктування та голосових застосунків такий нормалізатор може прибрати помітний шар ручних правил. Найбільше виграють конвеєри, яким потрібен чистий текст для користувача, але запуск універсальної LLM після кожного ASR-запиту є надто важким або непередбачуваним.
Під час інженерної оцінки я б насамперед перевіряв збереження змісту, а не красу пунктуації. Особливо вразливі імена, терміни, фрагменти коду, змішування мов і продиктовані символи. Додатковий прохід також додає затримку та ще одну точку відмови, навіть якщо сама модель компактна й працює локально.
Є й принципова межа: видалення пауз і самовиправлень корисне для нотаток, але небезпечне для дослівних протоколів. Головне питання не в тому, наскільки гладким став текст, а в тому, чи не переписала модель разом із формою ще й зміст.