Werkzeug · Sprachsynthese
Breeze TTS 2
von BreezeBlue / RESONIA, INC.
Offenes Sprachsynthese-Modell mit 3 Mrd. Parametern, das eine Stimme aus reiner Textbeschreibung erzeugen oder eine geklonte Stimme in Ton und Emotion steuern kann – Rang 1 unter den offenen Modellen der Artificial-Analysis-Sprachbestenliste, aber unter einer Lizenz, die jede kommerzielle Nutzung ausschließt.
Einschätzung
Offene Spitze mit geschlossener Tür
Wofür es gut ist
- lokale Echtzeit-Sprachausgabe ohne Cloud-Anbindung (Forschung, private Nutzung)
- Stimmen aus einer Textbeschreibung entwerfen, wenn kein Referenzaudio vorliegt
- geklonte Stimme gezielt in Ton und Emotion steuern (Voice Direction)
- Vergleichsmessungen gegen geschlossene Sprachsysteme mit einsehbaren Gewichten
Stärken
- Rang 1 unter 16 offenen Modellen der Artificial-Analysis-Sprachbestenliste (Elo 1212, abgerufen 01.09.2026) – unabhängig gemessen über Blindvergleiche, nicht Anbieterangabe
- Voice Design ohne Referenzaudio: Stimme entsteht aus einer Beschreibung (Alter, Akzent, Tonlage, Zustand)
- Voice Direction steuert eine geklonte Stimme nachträglich in Emotion, Tempo und Vortrag
- Niedrige Latenz laut Anbieter: unter 40 ms bis zum ersten Ton, Echtzeitfaktor 0,32 (H100); mit 3 Mrd. Parametern lokal betreibbar, Quantisierungen Dritter vorhanden
Schwächen
- ⚠️ Kommerzielle Nutzung ausgeschlossen: Gewichte, Adapter, abgeleitete Modelle **und selbst gehostete Ausgaben** unter der „BreezeBlue Research and Non-Commercial License"; Freigabe nur schriftlich durch RESONIA, INC.
- Anbieterbehauptung „outperforming frontier proprietary systems" hält der Messung nicht stand: Gesamtrang 7 von 98, sechs geschlossene Systeme darüber
- Sprachumfang uneinheitlich ausgewiesen: Anbieterseite wirbt mit „50+ languages", die offenen Gewichte tragen nur die Tags „en, zh" – für andere Sprachen ist die Abdeckung nicht belegt
- Braucht für Echtzeit eine leistungsfähige GPU; die genannten Latenzwerte beziehen sich auf eine H100
Stimmen aus der Community
Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.
- gemischtBetreibt das Modell vollständig lokal und ordnet es „up there around the sort of Quen 3 TTS level" ein – auf dem Arena-Leaderboard offene Spitze, aber „a little bit behind compared to some of the other models that are not open weights". Damit liegt er **näher an der Messung als die Modellkarte selbst**. Nennt die Lizenz als entscheidenden Mangel: „it’s basically a research and non-commercial license […] you cannot distill from it" – sonst „this would become the go-to model for doing a lot of different voice generation". Technischer Einwand: Die Signalverarbeitung sei vor dem Training nicht entfernt worden, weshalb erzeugte Stimmen oft eine Mikrofon-/EQ-Signatur mittrügen. ⚠️ Übernimmt die Anbieterangabe von 50 Sprachen ungefiltert als Eigenschaft des lokal laufenden Modells.Sam Witteveen (YouTube) – „BreezeTTS2 - 100% Local Real-Time Voice", 31.08.2026 (per oEmbed verifiziert, gegen das Transkript gelesen; Lizenz- und Leistungsaussagen an Modellkarte und Artificial Analysis gegengeprüft. Compute-Sponsoring durch Dell offengelegt) · Community, 2026-08-31
Direkt ausprobieren
huggingface.co/BreezeBlue/Breeze-TTS-2
ℹ️