Alibabas Tongyi Lab hat Qwen-Audio-3.0-TTS am 20. Juli 2026 vorgestellt. Das Modell erscheint in zwei Stufen: Flash ist auf Echtzeit-Interaktion mit einer Erst-Paket-Latenz „at 300ms-level“ getrimmt, Plus auf hohe Qualität, „where naturalness and timbre fidelity matter“. Es beherrscht 16 Sprachen – darunter Deutsch, Englisch, Chinesisch, Japanisch, Koreanisch, Spanisch, Arabisch und Russisch – und verbessert laut Anbieter die Behandlung verrauschter oder verhallter Referenzaufnahmen beim Voice-Cloning, indem die Sprach-Verbesserung fest in den Klon-Pfad eingebaut ist. Die Plus-Stufe erreicht laut Lab eine mittlere Sprecher-Ähnlichkeit von 82,75 % über alle 16 Sprachen.
Der eigentliche Beleg kommt von außen: Auf der Text-to-Speech-Arena von Artificial Analysis – einer unabhängigen Rangliste, die Modelle per Elo aus paarweisen Blind-Hörvergleichen sortiert – führt Qwen-Audio-3.0-TTS-Plus die Kategorie „Provider Voices“ mit einem Elo von rund 1238 an (Stand 22. Juli 2026, Live-Leaderboard) und liegt damit knapp vor Simba 3.2 sowie vor Gemini 3.1 Flash TTS und Sonic 3.5. Weil die Arena auf Nutzer-Blindvotes beruht, ist das eine der wenigen anbieter-unabhängigen TTS-Wertungen.
Die Kehrseite steht in denselben Messwerten: Mit rund 16 Zeichen pro Sekunde generiert die Plus-Variante spürbar langsamer als Simba 3.2 (30,2), Gemini 3.1 Flash TTS (27) oder Sonic 3.5 (120) – für harte Echtzeit ist eher die Flash-Stufe gedacht. Der Listenpreis liegt bei rund 27,60 US-Dollar je 1 Mio. Zeichen über Alibaba Cloud Model Studio; laut Artificial Analysis ist das etwa ein Drittel dessen, was ElevenLabs und MiniMax für die überholten Stufen verlangen. Steuern lässt sich die Ausgabe per natürlicher Beschreibung sowie per Inline-Tags wie [angry], [giggles] oder [gasp].
Parallel meldete Alibabas Qwen-Team in derselben Woche den Bildgenerator Qwen-Image-3.0 (Prompts bis 4.500 Token, lesbarer Text bis hinab zu zehn Pixeln, zwölf native Sprachen). Diese Angaben sind allerdings anbieter-selbstberichtet, das Modell vorerst nur auf Einladung per API verfügbar und unabhängig noch nicht nachgemessen – anders als beim TTS-Modell fehlt hier bislang die externe Bestätigung.