← Alle Modelle

Superwhisper · S1

S1-mini

superwhisper/s1-mini

open-weightModell, dessen trainierte Gewichte öffentlich herunterladbar sind, sodass man es selbst (lokal oder auf eigener Hardware) betreiben kann. Nicht zwingend vollständig quelloffen – die Lizenz bestimmt die erlaubte Nutzung.Mehr im Wissen →Text

SituativEin-Zweck-Modell hinter der Spracherkennung

Kein Allzweckmodell und will keines sein: 596 Mio. ParameterDie im Training gelernten „Stellschrauben“ eines Modells (gezählt in Milliarden). Mehr Parameter heißt grob mehr Kapazität, aber auch mehr Rechen- und Speicherbedarf – und sagt allein wenig über die Qualität.Mehr im Wissen →, feinabgestimmt auf Qwen3-0.6B, für genau eine Aufgabe – aus einem Roh-Transkript geschriebenen Text machen. Füllwörter raus, Selbstkorrekturen aufgelöst, Zahlen und E-Mail-Adressen in Schreibform. Als quantisiertes GGUF 462 MiB groß und damit lokal hinter jede vorhandene Spracherkennung zu hängen; die Anbieterangabe lautet 94,8 % Token-Genauigkeit auf 7.519 zurückgehaltenen englischen Fällen. Die Grenzen sind eng und offen benannt: nur Englisch, rund 1.000 Token Kontext, kein Chat-Verhalten.

  • Aufräumstufe hinter Whisper, Whisper.cpp, Parakeet oder eigener ASR
  • lokale Diktier-Ketten, bei denen das Transkript die Maschine nicht verlassen soll
  • Massenverarbeitung gesprochener Eingaben ohne Aufräum-API-Rechnung
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen →
1 KTokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →
Preis (Input / Output)
k. A. je 1 Mio. Token
WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen →
nicht ausgewiesen
Release
19. August 2026

Stärken

  • Winzig und lokal: 596 Mio. Parameter (0,44 Mrd. ohne Einbettungen), quantisiert 462 MiB – läuft laut Anbieter auf einer Laptop-CPU
  • Enger Auftrag als Schutz: „S1-mini is not a chat model and will not follow general instructions; it does one job“ – es kann das Transkript nicht umschreiben oder zusammenfassen
  • Deterministisch steuerbar über eine Steuerzeile statt über Prompts: `[Styling: …] [Structure: …] [Context: …]`
  • Offene Gewichte (Apache 2.0 mit Namensklausel) und GGUF-Bauten für llama.cpp, Ollama und LM Studio; dazu vLLM und SGLang

Schwächen

  • Nur Englisch – für mehrsprachige Transkript-Ketten in Version 1 nicht brauchbar
  • Kontext „Up to ~1,000 tokens“; längere Transkripte müssen selbst zerteilt werden
  • Betrieb setzt `enable_thinking=False` voraus; ohne diesen Schalter entsteht laut Modellkarte „no usable output at all“
  • Sämtliche Genauigkeitszahlen sind anbieter-selbstberichtet; eine unabhängige Messung liegt nicht vor

Typische Einsatzfälle

  • Nachbearbeitung von ASR-Ausgaben (Füllwörter, Selbstkorrekturen, Zahl-/Datums-/E-Mail-Formatierung)
  • lokale Diktier-Werkzeuge mit Datenhoheit
  • Vorstufe vor einem Coding- oder Chat-Agenten, damit die gesprochene Anweisung sauber ankommt

Benchmarks im Detail

Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →

  • Token-Genauigkeit (zurückgehaltener Satz, 7.519 englische Fälle, Q4_K_M-GGUF, gierige Dekodierung)

    94,8 %

    AnbieterangabeSuperwhisper – Modellkarte s1-mini (Hugging Face), abgerufen 2026-08-28

  • Text-Edit-Fehlerrate (Anbieterangabe)

    11,6 %

    AnbieterangabeSuperwhisper – „Introducing the S1 family of models“, abgerufen 2026-08-28

  • Erkennung von E-Mail-Grußzeile / Grußformel (Anbieterangabe)

    99,3 %

    / 97,9 %

    AnbieterangabeSuperwhisper – „Introducing the S1 family of models“, abgerufen 2026-08-28

Einordnung

  • Einordnung in die Familie: S1 besteht aus drei Modellen, von denen nur eines offen ist. S1-Voice (Spracherkennung) und S1-Language (Instruktionsmodell) laufen in der Cloud des Anbieters; S1-mini ist das Stück, das man herunterladen und selbst betreiben kann. Die Trennlinie verläuft damit genau dort, wo die Datenhoheit interessant wird: Die Erkennung bleibt beim Anbieter, die Aufräumstufe kann lokal bleiben.Beleg · Primärquelle
  • Verhältnis zur Basis: S1-mini ist ein Feintuning von Qwen/Qwen3-0.6B – dieselbe Bauform, aber auf eine einzige Transformation getrimmt. Die Modellkarte nennt 28 Schichten, 16 Aufmerksamkeitsköpfe für Q und 8 für KV, BF16. Das erklärt zugleich den Wert und die Grenze: Ein Allzweck-0.6B-Modell würde diese Aufgabe schlechter und unzuverlässiger erledigen, aber S1-mini kann eben auch nichts anderes.Beleg · Primärquelle
  • Verbreitung am Tag der Aufnahme: Die Hugging-Face-API meldete am 28.08.2026 für die Ablage 4.149 Downloads und 282 Likes bei letzter Änderung am 21.08.2026. Für ein neun Tage altes Spezialmodell ist das eine Nischen-, keine Massenverbreitung – die Zahl steht hier als Anker für spätere Vergleiche, nicht als Qualitätsurteil.Beleg · Primärquelle

Stimmen aus der Öffentlichkeit

Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.

ℹ️ Über den YouTube-Eingang gefunden (Better Stack, 27.08.2026, Tier C); Existenz, Parameterzahl, Basis, Lizenz, Kontextlänge und alle Kennzahlen an der Hugging-Face-Modellkarte und dem Anbieter-Blog gegengeprüft. Kein Preisfeld: Das Modell wird nicht als API verkauft. Keine AA-Kennzahlen – Artificial Analysis misst diese Modellklasse nicht.