← Alle Modelle

Alibaba · Qwen

Qwen3.8-Flash-Next

Qwen/Qwen3.8-Flash-Next

open-weightModell, dessen trainierte Gewichte öffentlich herunterladbar sind, sodass man es selbst (lokal oder auf eigener Hardware) betreiben kann. Nicht zwingend vollständig quelloffen – die Lizenz bestimmt die erlaubte Nutzung.Mehr im Wissen →TextBildVideo

Erste WahlDie Qwen4-Architektur im Vorlauf – 6 von 125 Mrd. Parametern aktiv

Alibaba legt am selben Tag wie Z.ai ein offenes Flash-Modell vor und nennt es ausdrücklich einen Vorgriff auf die nächste Architektur-Generation: 125 Mrd. Gesamtparameter, davon 6 Mrd. je Token aktiv, dazu 51 Mrd. Parameter in einer ausgelagerten N-Gram-Tabelle. Unabhängig gemessen steht es bei AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 55,8 / AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 73,1 / AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen → 56,4 zu 0,15 $ / 0,47 $ je Mio. Token. Der Unterschied zum am selben Tag erschienenen GLM-5.3-Flash liegt nicht im Index, sondern in der Geschwindigkeit: 73 gegen 50 Token je Sekunde und 37 gegen 52 Sekunden bis zur fertigen Antwort.

  • agentische Ketten, bei denen Latenz zählt
  • Massenbetrieb zum Flash-Preis
  • Self-Hosting auf Unified-Memory-Rechnern (6 Mrd. aktive Parameter)
  • lange Kontexte (262 144 nativ, bis 1 Mio.)
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen →
262 KTokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →
Preis (Input / Output)
$0.15 / $0.47 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen →
243,5 Indexpkt. je $/Mio. Token
WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen →
nicht ausgewiesen
Release
26. August 2026

Stärken

  • Aktive Parameter je Token: 6 Mrd. von 125 Mrd. – das ist die Größe, an der Speicherbandbreite und Latenz hängen, nicht die Gesamtzahl. Artificial Analysis misst dafür 73,3 Token je Sekunde Ausgabe und 3,14 s bis zum ersten Token
  • Schnellstes der beiden offenen Flash-Modelle vom 26.08.2026: 37,2 s Ende-zu-Ende gegen 51,7 s für GLM-5.3-Flash bei 1,7 Indexpunkten Rückstand
  • Kosten je AA-Index-Aufgabe 0,0959 $ – knapp ein Zehntel von Qwen3.8 Max und rund ein Sechstel des dichten Qwen3.8-27B (0,369 $)
  • Vier benannte Architektur-Neuerungen, die die Modellkarte als Vorgriff auf Qwen4 führt: „Hybrid Attention with QSA“ (Gated DeltaNet + Qwen Sparse Attention, Auswahl auf Mikroblock-Ebene statt je Token), „Gated Residual“ (vier Residualstränge mit dynamischem Gatter), „N-gram Embedding“ (51 Mrd. Parameter Nachschlagetabelle, auslagerbar in den Hostspeicher mit asynchronem Vorabruf) und ein eigenes Trainingsrezept aus Muon und AdamW
  • Nimmt Bild und Video entgegen; Kontext 262 144 Token nativ, „extensible up to 1,000,000 tokens“

Schwächen

  • Die Lizenz ist eine Hauslizenz („qwen-community-1.0“), keine OSI-Standardlizenz – anders als beim dichten Qwen3.8-27B unter Apache 2.0. Wer auf Lizenzklarheit angewiesen ist, muss den Text selbst prüfen
  • Sämtliche Benchmark-Werte der Modellkarte (DeepSWE 1.1 58,7 · SWE-bench Pro 62,5 · GPQA Diamond 91,7 · ClawEval-MM 64,4 · AndroidWorld 84,5) sind Anbieterangaben und von uns nicht nachgerechnet
  • Im AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen →-Index liegt es mit 56,4 hinter GLM-5.3-Flash (58,2) – bei praktisch identischem Listenpreis. Wer agentische Ketten fährt und Latenz verkraftet, fährt mit dem Wettbewerber besser
  • Der Trainingskosten-Vergleich der Modellkarte („about 1/9“ gegenüber Qwen3.7-Plus) ist eine Anbieterangabe zur eigenen Kostenrechnung, keine überprüfbare Leistungsaussage

Typische Einsatzfälle

  • agentisches Coding mit Latenzanspruch
  • Massenbetrieb zum Flash-Preis
  • Self-Hosting auf Unified-Memory-Hardware
  • multimodale Auswertung (Bild/Video)

Leistung im Vergleich

Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → oben ist daraus abgeleitet: AA-Intelligenz je AA-Blended-Preis (3:1) – entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis. AAs token-basiertes „Cost to Run Index“ ist nicht öffentlich abrufbar.

  • AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen →56
  • AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen →73
  • AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen →56

Benchmarks im Detail

Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →

  • Artificial Analysis Intelligence Index

    55,8

    unabhängigArtificial Analysis (v2-API), eigener Abruf 2026-08-29

  • Artificial Analysis Coding Index

    73,1

    unabhängigArtificial Analysis (v2-API), eigener Abruf 2026-08-29

  • Artificial Analysis Agentic Index

    56,4

    (GLM-5.3-Flash im selben Abruf: 58,2)

    unabhängigArtificial Analysis (v2-API), eigener Abruf 2026-08-29

  • Kosten je AA-Index-Aufgabe

    0,0959

    $ (GLM-5.3-Flash: 0,0869 $ · Qwen3.8-27B: 0,369 $ · Kimi K3 max: 0,8375 $)

    unabhängigArtificial Analysis (v2-API), eigener Abruf 2026-08-29

  • DeepSWE 1.1 (Anbieterangabe)

    58,7

    AnbieterangabeQwen – Modellkarte Qwen3.8-Flash-Next (Hugging Face), abgerufen 2026-08-29

  • SWE-bench Pro (Anbieterangabe)

    62,5

    AnbieterangabeQwen – Modellkarte Qwen3.8-Flash-Next (Hugging Face), abgerufen 2026-08-29

Einordnung

  • Die Modellkarte nennt „125B with 6B activated“ plus „51B n-gram embedding“ und beschreibt vier Änderungen an Aufmerksamkeit, Residualstrom, Einbettung und Optimierung. Die für den Eigenbetrieb interessanteste ist die N-Gram-Tabelle: Sie lässt sich in den Hostspeicher auslagern und per asynchronem Vorabruf mit der Rechnung überlappen – 51 der 125 Mrd. Parameter müssen also nicht im schnellen Speicher liegen. QSA wählt den relevanten Kontext nicht Token für Token aus (wie DeepSeeks DSA), sondern in Mikroblöcken über einen komprimierten Indexer.Beleg · Primärquelle
  • Die unabhängige Einordnung liefert Artificial Analysis seit dem Erscheinungstag: Intelligence 55,8, Coding 73,1, Agentic 56,4 bei 0,15 $ / 0,47 $ je Mio. Token und 0,0959 $ je Index-Aufgabe. Der aufschlussreiche Vergleich ist der mit GLM-5.3-Flash, das am selben Tag erschien und fast gleich viel kostet: Es liegt beim Index 1,7 Punkte und bei Agentic 1,8 Punkte vorn – ist dabei aber deutlich langsamer (49,8 gegen 73,3 Token je Sekunde, 51,7 gegen 37,2 s Ende-zu-Ende). Wer zwischen den beiden wählt, wählt nicht zwischen billig und teuer, sondern zwischen agentischer Genauigkeit und Antwortzeit.Beleg · Sekundärquelle

Stimmen aus der Öffentlichkeit

Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.

  • positivErster gemessener Praxiswert aus dem Eigenbetrieb: Auf zwei gekoppelten NVIDIA DGX Sparks laufe das Modell „day one … about 38 tokens per second“. Der Kanal begründet, warum das MoE-Bauprinzip gerade auf dieser Klasse Hardware passt – „great for systems with lots of memory and slower memory bandwidth, like the DGX Spark“ – und ordnet QSA gegen DeepSeeks DSA ein: Qwen bündele Token in Blöcke und durchsuche nur diese. ⚠️ Die Bewertung „outperforms some of the best open-weight AI systems, maybe even DeepSeek 4 Pro“ ist unbelegte Einschätzung, kein Messwert; die Hardware ist laut eigener Angabe eine Leihgabe von Nvidia (offengelegt), der Beitrag trägt zudem einen Weights-&-Biases-Werbeblock.Two Minute Papers (YouTube) – „The Billion Dollar AI Gap Is Collapsing“, 28.08.2026 (per oEmbed verifiziert, gegen das Transkript gelesen) · Community, August 2026

ℹ️ Aufgenommen am 29.08.2026 über den YouTube-Sweep (Fundstelle Two Minute Papers, `LBiNcdGNgrg`), Existenz und Eckdaten an der Modellkarte geprüft, Kennzahlen an der AA-Schnittstelle geholt. Der Katalog führt damit beide offenen Flash-Modelle vom 26.08.2026 – `glm-5-3-flash` und dieses – und sie sind das erste Paar, bei dem sich die Wahl nicht am Preis entscheidet: 0,15 $ Eingabe bei beiden, 0,47 gegen 0,50 $ Ausgabe. `kennzahlen` sind auf ganze Zahlen gerundet (55,8 → 56 · 73,1 → 73 · 56,4 → 56), die Rohwerte stehen in `benchmarks` und `einordnung`. Offen: eine unabhängige Nachrechnung der Anbieter-Benchmarks; ein Terminal-Bench-2.1- oder τ²-Wert liegt an der Free-Route der AA-Schnittstelle nicht vor.