Alle Depeschen

DepescheModelleneu

Alibabas Qwen-Audio-3.0-TTS-Plus führt Artificial Analysis’ Sprach-Arena an

Alibabas Tongyi Lab hat am 20. Juli 2026 Qwen-Audio-3.0-TTS veröffentlicht, ein gehostetes Text-to-Speech-Modell in den Stufen Flash (Echtzeit, rund 300 ms Erst-Paket-Latenz) und Plus (Qualität). Die Plus-Variante führt seither die unabhängige Text-to-Speech-Arena von Artificial Analysis für Provider-Stimmen an (Elo ≈ 1238, Stand 22. Juli 2026) und verweist Simba 3.2, Gemini 3.1 Flash TTS und Sonic 3.5 auf die Plätze. Das Modell spricht 16 Sprachen (inkl. Deutsch), erlaubt Stilsteuerung per Freitext und Inline-Tags wie [angry] oder [giggles] und kostet rund 27,60 US-Dollar je 1 Mio. Zeichen.

Alibabas Tongyi Lab hat Qwen-Audio-3.0-TTS am 20. Juli 2026 vorgestellt. Das Modell erscheint in zwei Stufen: Flash ist auf Echtzeit-Interaktion mit einer Erst-Paket-Latenz „at 300ms-level“ getrimmt, Plus auf hohe Qualität, „where naturalness and timbre fidelity matter“. Es beherrscht 16 Sprachen – darunter Deutsch, Englisch, Chinesisch, Japanisch, Koreanisch, Spanisch, Arabisch und Russisch – und verbessert laut Anbieter die Behandlung verrauschter oder verhallter Referenzaufnahmen beim Voice-Cloning, indem die Sprach-Verbesserung fest in den Klon-Pfad eingebaut ist. Die Plus-Stufe erreicht laut Lab eine mittlere Sprecher-Ähnlichkeit von 82,75 % über alle 16 Sprachen.

Der eigentliche Beleg kommt von außen: Auf der Text-to-Speech-Arena von Artificial Analysis – einer unabhängigen Rangliste, die Modelle per Elo aus paarweisen Blind-Hörvergleichen sortiert – führt Qwen-Audio-3.0-TTS-Plus die Kategorie „Provider Voices“ mit einem Elo von rund 1238 an (Stand 22. Juli 2026, Live-Leaderboard) und liegt damit knapp vor Simba 3.2 sowie vor Gemini 3.1 Flash TTS und Sonic 3.5. Weil die Arena auf Nutzer-Blindvotes beruht, ist das eine der wenigen anbieter-unabhängigen TTS-Wertungen.

Die Kehrseite steht in denselben Messwerten: Mit rund 16 Zeichen pro Sekunde generiert die Plus-Variante spürbar langsamer als Simba 3.2 (30,2), Gemini 3.1 Flash TTS (27) oder Sonic 3.5 (120) – für harte Echtzeit ist eher die Flash-Stufe gedacht. Der Listenpreis liegt bei rund 27,60 US-Dollar je 1 Mio. Zeichen über Alibaba Cloud Model Studio; laut Artificial Analysis ist das etwa ein Drittel dessen, was ElevenLabs und MiniMax für die überholten Stufen verlangen. Steuern lässt sich die Ausgabe per natürlicher Beschreibung sowie per Inline-Tags wie [angry], [giggles] oder [gasp].

Parallel meldete Alibabas Qwen-Team in derselben Woche den Bildgenerator Qwen-Image-3.0 (Prompts bis 4.500 Token, lesbarer Text bis hinab zu zehn Pixeln, zwölf native Sprachen). Diese Angaben sind allerdings anbieter-selbstberichtet, das Modell vorerst nur auf Einladung per API verfügbar und unabhängig noch nicht nachgemessen – anders als beim TTS-Modell fehlt hier bislang die externe Bestätigung.