2 Min. Lesezeit

S1-mini bereinigt Transkripte nach ASR

S1-miniASRнормализация текста

S1-mini ist ein Open-Weights-Modell mit 0,6 Milliarden Parametern zur Textbereinigung nach der Spracherkennung, nicht zur Audiotranskription. Es entfernt Füllwörter, Fehlstarts und Selbstkorrekturen, ergänzt Zeichensetzung und Großschreibung und formatiert Zahlen, Daten, Uhrzeiten, Währungen sowie E-Mail-Adressen in eine lesbare schriftliche Form.

Ein Textnormalisierer, kein weiteres ASR-Modell

Ich würde S1-mini nicht anstelle einer ASR-Engine einsetzen. Es ist ein Open-Weights-Modell mit 0,6 Milliarden Parametern für den nächsten Verarbeitungsschritt: Zuerst wandelt die Engine Audio in Rohtext um, anschließend schreibt der Normalisierer diesen Text in eine lesbare Form um. Für diese eng abgegrenzte Stelle der Pipeline ist ein separates Modell plausibel.

In der Superwhisper-Modellkarte auf Hugging Face wird S1-mini ausdrücklich als Textnormalisierer für Ergebnisse der Spracherkennung beschrieben. Es entfernt Füllwörter, verarbeitet Fehlstarts und Selbstkorrekturen und ergänzt Satzzeichen sowie Großschreibung. Zahlen, Daten, Uhrzeiten, Währungen und E-Mail-Adressen bringt das Modell in ein schriftliches Format.

Das ist nicht bloß Kosmetik. In Sprachschnittstellen muss roher ASR-Text oft mit Regelwerken, einem separaten Modell für Zeichensetzung oder einem universellen LLM nachbearbeitet werden. S1-mini soll diese Aufgaben in einem spezialisierten Durchlauf abdecken und gibt standardmäßig nur den bereinigten Text zurück.

Für die lokale Bereitstellung gibt es Beispiele mit Docker und SGLang, darunter eine OpenAI-kompatible Schnittstelle für Chat-Anfragen. Außerdem ist eine GGUF-Variante für llama.cpp verfügbar. In der Anleitung wird ausdrücklich darauf hingewiesen, den Thinking-Modus zu deaktivieren, weil das Modell ohne ihn trainiert wurde.

Im offiziellen Superwhisper-Blog werden eine Token-Genauigkeit von 94,8 % und eine Textbearbeitungsfehlerrate von 11,6 % genannt. Dort wird auch die Verarbeitung von Strukturen beschrieben, einschließlich Listenerkennung und E-Mail-Formatierung. Zum Zeitpunkt der Veröffentlichung der Modellkarte waren dies Angaben des Entwicklers, keine unabhängige Prüfung.

Wo ein eigenes Modell die Pipeline wirklich verändert

Für Diktat- und Sprachanwendungen kann ein solcher Normalisierer eine spürbare Schicht manueller Regeln ersetzen. Besonders sinnvoll ist er in Pipelines, die sauberen Text für Nutzende benötigen, bei denen ein universelles LLM nach jeder ASR-Anfrage jedoch zu schwergewichtig oder unvorhersehbar wäre.

Bei einer technischen Bewertung würde ich zuerst die Bedeutungstreue prüfen, nicht die Schönheit der Zeichensetzung. Namen, Fachbegriffe, Codefragmente, Sprachmischungen und diktierte Symbole sind besonders anfällig. Der zusätzliche Durchlauf erzeugt zudem Latenz und einen weiteren möglichen Ausfallpunkt, auch wenn das Modell selbst kompakt ist und lokal läuft.

Es gibt außerdem eine grundsätzliche Grenze: Das Entfernen von Pausen und Selbstkorrekturen ist für Notizen hilfreich, für wortgetreue Protokolle aber riskant. Die zentrale Frage lautet nicht, wie glatt der Text geworden ist, sondern ob das Modell mit der Form auch den Inhalt verändert hat.

Wir haben zuvor KI-Tools für Meeting-Transkription und Zusammenfassungen verglichen, mit besonderem Fokus auf Genauigkeit und Halluzinationsrisiken. Dieser Kontext zeigt, an welcher Stelle ein Nachbearbeitungsmodell wie s1-mini das endgültige Transkript verbessern kann.