Alibaba · Qwen
Qwen3.8-Flash-Next
Qwen/Qwen3.8-Flash-Next
Erste WahlDie Qwen4-Architektur im Vorlauf – 6 von 125 Mrd. Parametern aktiv
- agentische Ketten, bei denen Latenz zählt
- Massenbetrieb zum Flash-Preis
- Self-Hosting auf Unified-Memory-Rechnern (6 Mrd. aktive Parameter)
- lange Kontexte (262 144 nativ, bis 1 Mio.)
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen → - 262 K
TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → - Preis (Input / Output)
- $0.15 / $0.47 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → - 243,5 Indexpkt. je $/Mio. Token
WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen → - nicht ausgewiesen
- Release
- 26. August 2026
Stärken
Aktive Parameter je Token: 6 Mrd. von 125 Mrd. – das ist die Größe, an der Speicherbandbreite und Latenz hängen, nicht die Gesamtzahl. Artificial Analysis misst dafür 73,3 Token je Sekunde Ausgabe und 3,14 s bis zum ersten Token Schnellstes der beiden offenen Flash-Modelle vom 26.08.2026: 37,2 s Ende-zu-Ende gegen 51,7 s für GLM-5.3-Flash bei 1,7 Indexpunkten Rückstand Kosten je AA-Index-Aufgabe 0,0959 $ – knapp ein Zehntel von Qwen3.8 Max und rund ein Sechstel des dichten Qwen3.8-27B (0,369 $) Vier benannte Architektur-Neuerungen, die die Modellkarte als Vorgriff auf Qwen4 führt: „Hybrid Attention with QSA“ (Gated DeltaNet + Qwen Sparse Attention, Auswahl auf Mikroblock-Ebene statt je Token), „Gated Residual“ (vier Residualstränge mit dynamischem Gatter), „N-gram Embedding“ (51 Mrd. Parameter Nachschlagetabelle, auslagerbar in den Hostspeicher mit asynchronem Vorabruf) und ein eigenes Trainingsrezept aus Muon und AdamW Nimmt Bild und Video entgegen; Kontext 262 144 Token nativ, „extensible up to 1,000,000 tokens“
Schwächen
Die Lizenz ist eine Hauslizenz („qwen-community-1.0“), keine OSI-Standardlizenz – anders als beim dichten Qwen3.8-27B unter Apache 2.0. Wer auf Lizenzklarheit angewiesen ist, muss den Text selbst prüfen Sämtliche Benchmark-Werte der Modellkarte (DeepSWE 1.1 58,7 · SWE-bench Pro 62,5 · GPQA Diamond 91,7 · ClawEval-MM 64,4 · AndroidWorld 84,5) sind Anbieterangaben und von uns nicht nachgerechnet Im AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen → -Index liegt es mit 56,4 hinter GLM-5.3-Flash (58,2) – bei praktisch identischem Listenpreis. Wer agentische Ketten fährt und Latenz verkraftet, fährt mit dem Wettbewerber besserDer Trainingskosten-Vergleich der Modellkarte („about 1/9“ gegenüber Qwen3.7-Plus) ist eine Anbieterangabe zur eigenen Kostenrechnung, keine überprüfbare Leistungsaussage
Typische Einsatzfälle
agentisches Coding mit Latenzanspruch Massenbetrieb zum Flash-Preis Self-Hosting auf Unified-Memory-Hardware multimodale Auswertung (Bild/Video)
Leistung im Vergleich
Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die
AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 56AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 73AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen → 56
Benchmarks im Detail
Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →
Artificial Analysis Intelligence Index
55,8
unabhängigArtificial Analysis (v2-API), eigener Abruf 2026-08-29
Artificial Analysis Coding Index
73,1
unabhängigArtificial Analysis (v2-API), eigener Abruf 2026-08-29
Artificial Analysis Agentic Index
56,4
(GLM-5.3-Flash im selben Abruf: 58,2)
unabhängigArtificial Analysis (v2-API), eigener Abruf 2026-08-29
Kosten je AA-Index-Aufgabe
0,0959
$ (GLM-5.3-Flash: 0,0869 $ · Qwen3.8-27B: 0,369 $ · Kimi K3 max: 0,8375 $)
unabhängigArtificial Analysis (v2-API), eigener Abruf 2026-08-29
DeepSWE 1.1 (Anbieterangabe)
58,7
AnbieterangabeQwen – Modellkarte Qwen3.8-Flash-Next (Hugging Face), abgerufen 2026-08-29
SWE-bench Pro (Anbieterangabe)
62,5
AnbieterangabeQwen – Modellkarte Qwen3.8-Flash-Next (Hugging Face), abgerufen 2026-08-29
Einordnung
Die Modellkarte nennt „125B with 6B activated“ plus „51B n-gram embedding“ und beschreibt vier Änderungen an Aufmerksamkeit, Residualstrom, Einbettung und Optimierung. Die für den Eigenbetrieb interessanteste ist die N-Gram-Tabelle: Sie lässt sich in den Hostspeicher auslagern und per asynchronem Vorabruf mit der Rechnung überlappen – 51 der 125 Mrd. Parameter müssen also nicht im schnellen Speicher liegen. QSA wählt den relevanten Kontext nicht Token für Token aus (wie DeepSeeks DSA), sondern in Mikroblöcken über einen komprimierten Indexer. Beleg · PrimärquelleDie unabhängige Einordnung liefert Artificial Analysis seit dem Erscheinungstag: Intelligence 55,8, Coding 73,1, Agentic 56,4 bei 0,15 $ / 0,47 $ je Mio. Token und 0,0959 $ je Index-Aufgabe. Der aufschlussreiche Vergleich ist der mit GLM-5.3-Flash, das am selben Tag erschien und fast gleich viel kostet: Es liegt beim Index 1,7 Punkte und bei Agentic 1,8 Punkte vorn – ist dabei aber deutlich langsamer (49,8 gegen 73,3 Token je Sekunde, 51,7 gegen 37,2 s Ende-zu-Ende). Wer zwischen den beiden wählt, wählt nicht zwischen billig und teuer, sondern zwischen agentischer Genauigkeit und Antwortzeit. Beleg · Sekundärquelle
Stimmen aus der Öffentlichkeit
Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.
- positivErster gemessener Praxiswert aus dem Eigenbetrieb: Auf zwei gekoppelten NVIDIA DGX Sparks laufe das Modell „day one … about 38 tokens per second“. Der Kanal begründet, warum das MoE-Bauprinzip gerade auf dieser Klasse Hardware passt – „great for systems with lots of memory and slower memory bandwidth, like the DGX Spark“ – und ordnet QSA gegen DeepSeeks DSA ein: Qwen bündele Token in Blöcke und durchsuche nur diese. ⚠️ Die Bewertung „outperforms some of the best open-weight AI systems, maybe even DeepSeek 4 Pro“ ist unbelegte Einschätzung, kein Messwert; die Hardware ist laut eigener Angabe eine Leihgabe von Nvidia (offengelegt), der Beitrag trägt zudem einen Weights-&-Biases-Werbeblock.Two Minute Papers (YouTube) – „The Billion Dollar AI Gap Is Collapsing“, 28.08.2026 (per oEmbed verifiziert, gegen das Transkript gelesen) · Community, August 2026
ℹ️