Superwhisper · S1
S1-mini
superwhisper/s1-mini
SituativEin-Zweck-Modell hinter der Spracherkennung
- Aufräumstufe hinter Whisper, Whisper.cpp, Parakeet oder eigener ASR
- lokale Diktier-Ketten, bei denen das Transkript die Maschine nicht verlassen soll
- Massenverarbeitung gesprochener Eingaben ohne Aufräum-API-Rechnung
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen → - 1 K
TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → - Preis (Input / Output)
- k. A. je 1 Mio. Token
WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen → - nicht ausgewiesen
- Release
- 19. August 2026
Stärken
Winzig und lokal: 596 Mio. Parameter (0,44 Mrd. ohne Einbettungen), quantisiert 462 MiB – läuft laut Anbieter auf einer Laptop-CPU Enger Auftrag als Schutz: „S1-mini is not a chat model and will not follow general instructions; it does one job“ – es kann das Transkript nicht umschreiben oder zusammenfassen Deterministisch steuerbar über eine Steuerzeile statt über Prompts: `[Styling: …] [Structure: …] [Context: …]` Offene Gewichte (Apache 2.0 mit Namensklausel) und GGUF-Bauten für llama.cpp, Ollama und LM Studio; dazu vLLM und SGLang
Schwächen
Nur Englisch – für mehrsprachige Transkript-Ketten in Version 1 nicht brauchbar Kontext „Up to ~1,000 tokens“; längere Transkripte müssen selbst zerteilt werden Betrieb setzt `enable_thinking=False` voraus; ohne diesen Schalter entsteht laut Modellkarte „no usable output at all“ Sämtliche Genauigkeitszahlen sind anbieter-selbstberichtet; eine unabhängige Messung liegt nicht vor
Typische Einsatzfälle
Nachbearbeitung von ASR-Ausgaben (Füllwörter, Selbstkorrekturen, Zahl-/Datums-/E-Mail-Formatierung) lokale Diktier-Werkzeuge mit Datenhoheit Vorstufe vor einem Coding- oder Chat-Agenten, damit die gesprochene Anweisung sauber ankommt
Benchmarks im Detail
Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →
Token-Genauigkeit (zurückgehaltener Satz, 7.519 englische Fälle, Q4_K_M-GGUF, gierige Dekodierung)
94,8 %
AnbieterangabeSuperwhisper – Modellkarte s1-mini (Hugging Face), abgerufen 2026-08-28
Text-Edit-Fehlerrate (Anbieterangabe)
11,6 %
AnbieterangabeSuperwhisper – „Introducing the S1 family of models“, abgerufen 2026-08-28
Erkennung von E-Mail-Grußzeile / Grußformel (Anbieterangabe)
99,3 %
/ 97,9 %
AnbieterangabeSuperwhisper – „Introducing the S1 family of models“, abgerufen 2026-08-28
Einordnung
Einordnung in die Familie: S1 besteht aus drei Modellen, von denen nur eines offen ist. S1-Voice (Spracherkennung) und S1-Language (Instruktionsmodell) laufen in der Cloud des Anbieters; S1-mini ist das Stück, das man herunterladen und selbst betreiben kann. Die Trennlinie verläuft damit genau dort, wo die Datenhoheit interessant wird: Die Erkennung bleibt beim Anbieter, die Aufräumstufe kann lokal bleiben. Beleg · PrimärquelleVerhältnis zur Basis: S1-mini ist ein Feintuning von Qwen/Qwen3-0.6B – dieselbe Bauform, aber auf eine einzige Transformation getrimmt. Die Modellkarte nennt 28 Schichten, 16 Aufmerksamkeitsköpfe für Q und 8 für KV, BF16. Das erklärt zugleich den Wert und die Grenze: Ein Allzweck-0.6B-Modell würde diese Aufgabe schlechter und unzuverlässiger erledigen, aber S1-mini kann eben auch nichts anderes. Beleg · PrimärquelleVerbreitung am Tag der Aufnahme: Die Hugging-Face-API meldete am 28.08.2026 für die Ablage 4.149 Downloads und 282 Likes bei letzter Änderung am 21.08.2026. Für ein neun Tage altes Spezialmodell ist das eine Nischen-, keine Massenverbreitung – die Zahl steht hier als Anker für spätere Vergleiche, nicht als Qualitätsurteil. Beleg · Primärquelle
Stimmen aus der Öffentlichkeit
Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.
- positivPraxis-Vorführung (Tier C): Führt S1-mini auf einem Mac M4 Pro über Ollama vor und ordnet es ausdrücklich als Zwischenschicht ein, nicht als Ersatz – „I’m not replacing a transcription stack. I’m just adding one tiny cleanup layer to all of it.“ Der genannte Vorteil gegenüber einem großen Modell ist nicht Qualität, sondern Zurückhaltung: „A general LLM can rewrite your transcript, summarize it, expand it“, während S1-mini die Bedeutung stehen lasse und nur den Rand aufräume. Nennt dieselbe Dateigröße (rund 462 MB) und dieselben Grenzen (nur Englisch, sehr frisch) wie die Modellkarte.Better Stack (YouTube) – „This 600M Model Fixes What Whisper Leaves Behind“, 27.08.2026 (per oEmbed verifiziert, gegen das Transkript gelesen; alle Kennzahlen dieses Eintrags stammen aus der Modellkarte, nicht aus dem Video) · Community, 2026-08-27
ℹ️