Was gesichert ist, weil es in Qwens eigener Modellkarte und im Repository von QwenLM steht: „Qwen3.8-Flash-Next features a 125B-parameter main model, supplemented by an additional 51B N-gram embeddings, with 6B parameters activated per token.“ Die Modellkarte beziffert die N-Gramm-Schicht genauer – „N-gram Embedding: 20,000,000 (bigrams/trigrams at layer 2)“ – und nennt 512 Experten, von denen 11 aktiviert werden (10 geroutet, 1 geteilt), verteilt auf 48 Schichten im Muster „12 × (3 × Gated DeltaNet + 1 × Qwen Sparse Attention)“. Der Kontext beträgt nativ 262.144 Token und ist per YaRN auf 1.000.000 erweiterbar.
Der Anspruch, um den es geht, steht wörtlich im Repository: „training takes only about 1/9 as much“ – bezogen auf Qwen3.7-Plus, das The Decoder mit 397 Milliarden Parametern und 17 Milliarden aktivierten angibt. Und die Einordnung des Modells selbst: „a multimodal MoE model that also serves as an early preview of the architecture used in Qwen4“. Die Modellkarte formuliert es etwas ausführlicher als „this experimental preview of the architecture that will underpin Qwen4“. Es handelt sich also ausdrücklich nicht um ein fertiges Produkt, sondern um eine vorgezogene Architektur-Demonstration.
Die Leistungszahlen sind sämtlich anbieter-selbstberichtet; eine unabhängige Messung liegt nicht vor. Modellkarte und The-Decoder-Rezeption stimmen bei den Werten überein, die in beiden auftauchen: SWE-bench Pro 62,5, GPQA Diamond 91,7 und LiveCodeBench (v6) 91,9. The Decoder nennt zusätzlich DeepSWE mit 58,7 gegen DeepSeek-V4-Flash mit 54,4, CoWorkBench mit 73,9 gegen 45,1 und JobBench mit 55,7; die Modellkarte stellt SWE-bench Pro dem eigenen Qwen3.8-27B (61,7) gegenüber und führt AndroidWorld mit 84,5. Als Vergleichsmodelle tauchen Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4 und Claude Opus 4.6 auf – die Auswahl trifft Alibaba selbst.
Ein Namensunterschied, der beim Einkaufen zählt: Die offenen Gewichte heißen „Qwen3.8-Flash-Next“ und tragen 262.144 Token nativen Kontext. Am selben Tag hat Vercel in seinem Änderungsprotokoll ein Modell „Qwen3.8-Flash“ – ohne Zusatz, aufrufbar als „alibaba/qwen3.8-flash“ – in sein AI Gateway aufgenommen und gibt dafür ein Kontextfenster von einer Million Token und bis zu 65.000 Ausgabe-Token an, Text und Bild als Eingabe; Alibaba empfehle es „for coding, tool use, and multi-step agent workflows“. Ob das dasselbe Modell in einer anderen Bedienform ist oder ein zweites, sagt keine der von uns geöffneten Seiten. Wer den Namen bestellt, sollte den Zusatz mitbestellen.
Die Lizenz steht nur auf der Modellkarte, nicht im Repository – dort heißt es lediglich, man finde die Lizenzdatei „released with the model weights on Hugging Face Hub or ModelScope“. Auf Hugging Face ist sie als „qwen-community-1.0“ ausgewiesen. Das ist eine Hauslizenz, keine OSI-Lizenz; welche Schwellen sie enthält, haben wir für diese Meldung nicht ausgewertet.