Die Primärdokumentation listet ein einziges Modell, „wan3.0-video“, beschrieben als All-in-One-Modell für Text-zu-Video, Bild-zu-Video (erstes Bild bzw. erstes und letztes Bild) und referenzbasierte Erzeugung, „up to 30 seconds long“. Ausgabeauflösungen sind 480p, 720p und 1080p, Standard ist 1080p. Auf der Eingabeseite stehen `first_frame` und `last_frame` (je maximal eines), `reference_image` (maximal zehn), `reference_video` (maximal fünf Clips, zusammen maximal 15 Sekunden), `reference_audio` (ebenfalls fünf Clips, zusammen maximal 15 Sekunden), Weblinks sowie `file` mit docx, doc, xlsx, xls, pptx, ppt, pdf, txt, key, pages, numbers und md. Dokumentiert sind die Regionen Singapur und Peking.
Preise nennt die API-Referenz nicht. The Decoder führt für den Standardtarif 0,05 bis 0,20 US-Dollar je Sekunde und für „Prime“ 0,068 bis 0,28 US-Dollar je Sekunde — für einen 30-Sekunden-Clip also 1,50 bis 6,00 beziehungsweise 2,04 bis 8,40 US-Dollar, je nach Auflösung. Denselben Beitrag ordnet der Decoder in Alibabas Investitionsphase ein: Der Quartalsgewinn sei laut Reuters im Jahresvergleich um 75 Prozent gefallen.
⚠️ Zum Veröffentlichungsdatum widersprechen sich die Quellen, wir lösen den Konflikt nicht auf. TNGlobal referiert am 10. August 2026 eine Alibaba-Mitteilung „on Monday“ mit dem Satz „users can apply for testing through Alibaba Cloud’s Model Studio and Qwen Cloud platforms“ — Zugang also per Antrag; die Model-Studio-Referenz trägt den Stand 6. August 2026. The Decoder rahmt die Vorstellung dagegen auf den 24. August 2026. Wir führen den Befund so: seit Anfang August an einer Alibaba-Primärquelle dokumentiert und antragsgebunden zugänglich, breite Rezeption ab dem 24. August. Die Verbraucherseite `wan.video` liefert für unseren Abruf nur ein JavaScript-Gerüst.
⚠️ Alle Fähigkeitsangaben stammen aus Alibabas eigener Dokumentation beziehungsweise deren Rezeption. Eine unabhängige Messung der Videoqualität, der Prompt-Treue oder der tatsächlichen Verarbeitung von Dokumenteneingaben liegt uns nicht vor.