← Alle Werkzeuge

Werkzeug · Sprachsynthese

Breeze TTS 2

von BreezeBlue / RESONIA, INC.

Offenes Sprachsynthese-Modell mit 3 Mrd. Parametern, das eine Stimme aus reiner Textbeschreibung erzeugen oder eine geklonte Stimme in Ton und Emotion steuern kann – Rang 1 unter den offenen Modellen der Artificial-Analysis-Sprachbestenliste, aber unter einer Lizenz, die jede kommerzielle Nutzung ausschließt.

Open Weights (nicht-kommerziell)Hugging Facelokal (GPU)API/Hosting beim Anbieter

Einschätzung

Offene Spitze mit geschlossener Tür

Fachlich der stärkste offene Kandidat, den die Sprachbestenliste derzeit führt – und praktisch für die meisten Vorhaben unbrauchbar, weil die Lizenz nicht nur den Verkauf des Modells, sondern schon die kommerzielle Nutzung der erzeugten Audios unter Erlaubnisvorbehalt stellt. Wir führen es als Werkzeug für Forschung und Eigenbedarf; wer Produktionsaudio braucht, prüft die Erlaubnis oder nimmt ein anderes Modell.

Vier Funktionen, die zusammen den Unterschied zu älteren offenen TTS-Modellen ausmachen. Voice Design erzeugt eine Stimme aus einer reinen Sprachbeschreibung, ohne Referenzaudio („creates distinctive voice from natural-language description"). Voice Clone übernimmt laut Modellkarte „timbre, rhythm, emotion, and style" aus einer Referenzaufnahme. Voice Direction kombiniert beides: geklonte Stimme, aber in Ton, Emotion, Tempo und Vortrag gesteuert. Vocal Events setzt Lachen, Husten oder Seufzen inline – in englischem Text über runde, in chinesischem über eckige Klammern.

Die Zahlen. 3 Mrd. Parameter; die Modellkarte nennt „under 40 ms time to first audio (TTFA)" und „0.32 real-time factor (RTF)" auf einer NVIDIA H100. Die Gewichte liegen seit dem 25.08.2026 auf Hugging Face (Anlagedatum laut HF-API); am 01.09.2026 standen dort 2.236 Downloads und 272 Likes. Sprach-Tags des Repositoriums: en, zh – die offenen Gewichte sind auf Englisch und Chinesisch ausgewiesen.

⚠️ Die Lizenz ist der eigentliche Punkt. Der Quellcode steht unter Apache 2.0, die Gewichte nicht: Für sie gilt die „BreezeBlue Research and Non-Commercial License" (HF-Lizenz-Tag: `breezeblue-research-and-non-commercial-license`), die Modellkarte hält fest: „Commercial use requires written authorization from RESONIA, INC." Erfasst sind neben Gewichten und Checkpoints ausdrücklich auch Adapter, abgeleitete Modelle und selbst gehostete Ausgaben. Wer damit Spielvertonung, Assistenzstimmen oder Werbeaudio erzeugen will, braucht eine gesonderte Erlaubnis – auch beim Betrieb auf eigener Hardware. „Open weights" heißt hier: einsehbar und lokal lauffähig, nicht frei verwendbar.

Einordnung gegen die Anbieterangabe. Die Modellkarte behauptet Rang 1 unter den offenen Modellen „while outperforming frontier proprietary systems". Der erste Teil stimmt (Artificial Analysis, Elo 1212, Rang 1 von 16 offenen Modellen), der zweite überzieht: In der Gesamtbestenliste steht Breeze TTS 2 auf Rang 7 von 98 – über ihm sechs geschlossene Systeme, angeführt von Sonic 3.6 (1282). Gegenüber dem Feld der geschlossenen Anbieter insgesamt liegt es weit vorn, gegenüber deren Spitze nicht.

Wofür es gut ist

  • lokale Echtzeit-Sprachausgabe ohne Cloud-Anbindung (Forschung, private Nutzung)
  • Stimmen aus einer Textbeschreibung entwerfen, wenn kein Referenzaudio vorliegt
  • geklonte Stimme gezielt in Ton und Emotion steuern (Voice Direction)
  • Vergleichsmessungen gegen geschlossene Sprachsysteme mit einsehbaren Gewichten

Stärken

  • Rang 1 unter 16 offenen Modellen der Artificial-Analysis-Sprachbestenliste (Elo 1212, abgerufen 01.09.2026) – unabhängig gemessen über Blindvergleiche, nicht Anbieterangabe
  • Voice Design ohne Referenzaudio: Stimme entsteht aus einer Beschreibung (Alter, Akzent, Tonlage, Zustand)
  • Voice Direction steuert eine geklonte Stimme nachträglich in Emotion, Tempo und Vortrag
  • Niedrige Latenz laut Anbieter: unter 40 ms bis zum ersten Ton, Echtzeitfaktor 0,32 (H100); mit 3 Mrd. Parametern lokal betreibbar, Quantisierungen Dritter vorhanden

Schwächen

  • ⚠️ Kommerzielle Nutzung ausgeschlossen: Gewichte, Adapter, abgeleitete Modelle **und selbst gehostete Ausgaben** unter der „BreezeBlue Research and Non-Commercial License"; Freigabe nur schriftlich durch RESONIA, INC.
  • Anbieterbehauptung „outperforming frontier proprietary systems" hält der Messung nicht stand: Gesamtrang 7 von 98, sechs geschlossene Systeme darüber
  • Sprachumfang uneinheitlich ausgewiesen: Anbieterseite wirbt mit „50+ languages", die offenen Gewichte tragen nur die Tags „en, zh" – für andere Sprachen ist die Abdeckung nicht belegt
  • Braucht für Echtzeit eine leistungsfähige GPU; die genannten Latenzwerte beziehen sich auf eine H100

Stimmen aus der Community

Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.

Direkt ausprobieren

huggingface.co/BreezeBlue/Breeze-TTS-2

Zur offiziellen Seite ↗

ℹ️ Über den YouTube-Eingang gefunden (Sam Witteveen, 31.08.2026, Tier C). Lizenztexte, Parameterzahl, Fähigkeiten und Latenzangaben an der Modellkarte gegengeprüft (mit „steht dort nicht"-Gegenfrage), Anlagedatum/Downloads/Likes/Sprach-Tags an der Hugging-Face-API, die Bestenlisten-Position an Artificial Analysis. Die Angabe „50+ languages" stammt von der Anbieterseite breezeblue.ai und wird von der Modellkarte nicht gedeckt.

Verwandte Werkzeuge