Alle Depeschen

DepescheModelle

Superwhisper legt einen 596-Millionen-Parameter-Normalisierer offen – er räumt Transkripte auf und kann sonst nichts

Superwhisper hat am 19.08.2026 die Modellfamilie S1 vorgestellt und davon ein Modell mit offenen Gewichten auf Hugging Face gelegt: S1-mini, 596 Mio. Parameter (0,44 Mrd. ohne Einbettungen), feinabgestimmt auf Qwen3-0.6B, lizenziert unter „Apache 2.0 + naming clause“. Es ist ausdrücklich kein Chat-Modell, sondern eine einzige Verarbeitungsstufe hinter der Spracherkennung: Roh-Transkript hinein, geschriebener Text heraus – Füllwörter weg, Selbstkorrekturen aufgelöst, Zahlen, Daten und E-Mail-Adressen in Schreibform. Die Modellkarte weist 94,8 % Token-Genauigkeit auf einem zurückgehaltenen Satz von 7.519 englischen Fällen aus; die quantisierte Q4_K_M-GGUF-Datei ist 462 MiB groß.

Die Familie besteht aus drei Modellen mit unterschiedlichem Betriebsmodell: S1-Voice (Spracherkennung, Cloud), S1-Language (Instruktionsmodell, Cloud) und S1-mini – das einzige mit offenen Gewichten. Für S1-Voice nennt der Anbieter eine mittlere Wortfehlerrate von 6,8 % über acht Datensätze und 2,2 % auf LibriSpeech; das sind Anbieterangaben ohne unabhängige Nachmessung und hier nur der Vollständigkeit halber genannt.

Die technischen Eckdaten von S1-mini stehen auf der Modellkarte: „596M total (0.44B non-embedding)“, 28 Schichten, 16 Aufmerksamkeitsköpfe für Q und 8 für KV, BF16, Basis Qwen/Qwen3-0.6B. Der Kontext ist ausdrücklich knapp – „Up to ~1,000 tokens; chunk longer transcripts“. Gesteuert wird nicht per Prompt, sondern über eine Steuerzeile mit drei Achsen: Styling (casual bis formal), Structure (prose oder lists) und Context (general oder email), in der Form `[Styling: …] [Structure: …] [Context: …]` vor dem Transkript.

Die Messwerte: 94,8 % Token-Genauigkeit auf einem zurückgehaltenen Satz von 7.519 Fällen, gemessen mit gieriger Dekodierung auf dem Q4_K_M-GGUF; dazu nennt der Anbieter eine Text-Edit-Fehlerrate von 11,6 % sowie 99,3 % bzw. 97,9 % beim Erkennen von Grußzeile und Grußformel in E-Mails. Alle diese Zahlen stammen von Superwhisper selbst – eine unabhängige Messung liegt nicht vor.

Ungewöhnlich klar benennt die Modellkarte, was das Modell nicht kann: „S1-mini is not a chat model and will not follow general instructions; it does one job“. Der Betrieb setzt `enable_thinking=False` voraus – ohne diesen Schalter komme „no usable output at all“ heraus; reine Füllwort-Eingabe liefert nichts zurück. Unterstützt ist ausschließlich Englisch. Als Laufzeiten nennt der Anbieter vLLM, SGLang sowie über die GGUF-Bauten llama.cpp, Ollama und LM Studio. Die Lizenz ist Apache 2.0 mit einer Namensklausel: Das Modell muss den Namen „S1-mini“ von „Superwhisper“ in genau dieser Schreibweise behalten.

Aufmerksam wurden wir über den YouTube-Eingang (Better Stack, 27.08.2026, Tier C); der Kanal führt das Modell in einer lokalen Kette hinter MLX-Whisper vor und nennt dieselbe Dateigröße von rund 462 MB. Sämtliche hier genannten Zahlen stammen aus der Modellkarte bzw. dem Anbieter-Blog, nicht aus dem Video.