Alibaba · Qwen
Qwen3.8-Max
qwen3.8-max
Solide WahlGrößtes offen verteiltes Modell – mit Lizenzhaken
- Eigenbetrieb ohne Anbieterbindung
- anspruchsvolles Coding
- agentische Workflows
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen → - 262 K
TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → - Preis (Input / Output)
- $2 / $6 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → - 18,7 Indexpkt. je $/Mio. Token
- Release
- 3. August 2026
Stärken
Gewichte frei herunterladbar (BF16 und FP8), lauffähig unter vLLM, SGLang und TokenSpeed; das größte offen verteilte Modell zum Zeitpunkt der Freigabe Im unabhängigen AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 56 – zehn Punkte über dem Vorgänger Qwen3.7-Max (46) und auf Höhe von Claude Opus 4.8Nativ 262 144 TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → Kontext, laut Modellkarte auf 1 010 000 erweiterbarFür die gehostete API günstig tarifiert: 2 $ Input / 6 $ Output je 1 Mio. Token
Schwächen
Keine Open-Source-Lizenz: Die „Qwen3.8-Max License“ verlangt ab 100 Mio. monatlich aktiven Nutzern bzw. 20 Mio. $ Monatsumsatz eine sichtbare Modell-Nennung und ab 50 Mio. $ Jahresumsatz eine gesonderte Lizenz für Model-as-a-Service-Geschäfte Die freigegebenen Gewichte sind ein reines Textmodell („Multimodal inputs are not supported“) – das gleichnamige API-Modell nimmt dagegen Bild, Text und Video entgegen Denkmodus nicht abschaltbar („thinking cannot be disabled“) – jede Antwort beginnt mit einer Argumentationsspur, was kurze latenzkritische Aufrufe teuer macht Hoher Verbrauch je Aufgabe: 150 Mio. Ausgabe-Token und 1.749,16 $ für den AA-Index-Durchlauf (Vorgänger: 100 Mio. / 1.056,43 $); 62 statt 202 Token/s Für den Eigenbetrieb praktisch unerreichbar: 2,4 Bio. Parameter brauchen Rechenzentrums-Hardware. Der kleinere Ableger Qwen3.8-27B liegt seit dem 14. August 2026 vor – und zwar unter Apache 2.0 statt unter der Hauslizenz, mit Bild- und Video-Verständnis statt reinem Text AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → ,AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen → und τ²-bench liegen für dieses Modell nicht vor
Typische Einsatzfälle
Eigenbetrieb ohne Anbieterbindung anspruchsvolles Coding agentische Workflows lange Kontexte
Leistung im Vergleich
Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die
AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 56
Benchmarks im Detail
Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →
Artificial Analysis Intelligence Index
56
unabhängigArtificial Analysis, Modellseite Qwen3.8 Max, abgerufen 2026-08-06 – gemessen am gehosteten API-Modell
GPQA Diamond
92,6
(Anbieterangabe)
AnbieterangabeHugging Face – Modellkarte Qwen/Qwen3.8-2.4T-A95B, abgerufen 2026-08-13
SWE-bench Pro
67,7
(Anbieterangabe)
AnbieterangabeHugging Face – Modellkarte Qwen/Qwen3.8-2.4T-A95B, abgerufen 2026-08-13
Terminal-Bench 2.1
86,6
(Anbieterangabe)
AnbieterangabeHugging Face – Modellkarte Qwen/Qwen3.8-2.4T-A95B, abgerufen 2026-08-13
DeepSWE 1.1
56,6
(Anbieterangabe)
AnbieterangabeHugging Face – Modellkarte Qwen/Qwen3.8-2.4T-A95B, abgerufen 2026-08-13
PaperBench
93,0
(Anbieterangabe)
AnbieterangabeHugging Face – Modellkarte Qwen/Qwen3.8-2.4T-A95B, abgerufen 2026-08-13
Einordnung
„Offen“ heißt hier: herunterladen und selbst betreiben ja, als Dienst weiterverkaufen ab einer bestimmten Größe nur mit gesonderter Erlaubnis. Das ist dasselbe Muster wie bei der „Kimi K3 License“ vom 28. Juli 2026 – zwei der größten offen verteilten Modelle stehen damit unter Hauslizenzen mit Umsatzschwelle statt unter Apache 2.0. Beleg · Primärquelle Beleg · SekundärquelleAA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 56 – auf Höhe von Claude Opus 4.8 (56), über GPT-5.5 (55), unter Claude Fable 5 (60) und knapp unter Kimi K3 (57). Der Zugewinn gegenüber Qwen3.7-Max (46) kommt nicht aus einem billigeren Modell, sondern aus mehr Arbeit je Aufgabe: eineinhalbfacher Token-Verbrauch für denselben Testsatz, zwei Drittel höhere Durchlaufkosten, ein Drittel der Ausgabegeschwindigkeit.Achtung bei der Gleichsetzung von Ablage und API: Die auf Hugging Face liegenden Gewichte sind laut Modellkarte ein reines Textmodell; Alibabas eigene Modellseite führt für das gleichnamige API-Modell Bild-, Text- und Video-Eingabe. Die unabhängige Messung von Artificial Analysis bezieht sich auf den API-Endpunkt, nicht auf die freigegebenen Gewichte. Beleg · PrimärquelleDer kleinere Ableger Qwen3.8-27B ist seit dem 14. August 2026 draußen – und in zwei Punkten die freizügigere Freigabe: Er steht unter Apache 2.0 statt unter der Hauslizenz mit ihren Umsatzschwellen, und er versteht Bild und Video, während dieses Modell hier als reines Textmodell vorliegt. Wer aus der Qwen3.8-Familie etwas selbst betreiben will, nimmt in aller Regel den kleinen, nicht diesen. Einen eigenen Katalog-Eintrag bekommt Qwen3.8-27B noch nicht: Es liegt keine unabhängige Messung vor – dieselbe Regel, die wir am 14.08.2026 auf GLM-5.3 angewandt haben. Beleg · Primärquelle
ℹ️