← Alle Modelle

Alibaba · Qwen

Qwen3.8-27B

Qwen/Qwen3.8-27B

open-weightModell, dessen trainierte Gewichte öffentlich herunterladbar sind, sodass man es selbst (lokal oder auf eigener Hardware) betreiben kann. Nicht zwingend vollständig quelloffen – die Lizenz bestimmt die erlaubte Nutzung.Mehr im Wissen →TextBildVideo

Erste WahlDas stärkste Modell, das auf eine Karte passt

27 Mrd. Parameter, dicht statt MoE (Mixture of Experts)Architektur, bei der je Anfrage nur ein Teil des Modells („Experten“) aktiv wird. So hat das Modell sehr viele Gesamt-Parameter, rechnet aber nur mit wenigen aktiven – das spart Rechenzeit.Mehr im Wissen →, unter Apache 2.0 – und im AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → auf 52, gleichauf mit GPT-5.6 Luna (max) und einen Punkt hinter GLM-5.2 (753 Mrd. Parameter). Für den Eigenbetrieb derzeit die beste Kombination aus Leistung, Lizenz und Hardware-Bedarf. Der Preis dafür ist Geschwätzigkeit: 160 Mio. Ausgabe-Token für den Index-Durchlauf, fast das Vierfache des Medians.

  • Eigenbetrieb auf einer Karte
  • Coding ohne Anbieterbindung
  • Arbeitsabläufe mit Bild und Video
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen →
262 KTokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →
Preis (Input / Output)
k. A. je 1 Mio. Token
Release
14. August 2026

Stärken

  • Apache 2.0 – keine Umsatzschwelle, kein Zustimmungsvorbehalt, keine Nennungspflicht; anders als das große Geschwistermodell Qwen3.8-Max mit seiner Hauslizenz
  • Erste unabhängige Messung liegt vor: AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 52 bei 27 Mrd. Parametern – dieselbe Punktzahl wie GPT-5.6 Luna (max), ein Punkt hinter GLM-5.2 (max) mit 753 Mrd. Parametern
  • Nimmt Bild und Video entgegen („Native support for image and video understanding, from STEM diagrams and documents to hour-scale videos“) – die freigegebenen Qwen3.8-Max-Gewichte sind reiner Text
  • Nativ 262 144 TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → Kontext, per YaRN auf 1 000 000 erweiterbar
  • Läuft auf beschaffbarer Hardware: heise nennt 64 GByte VRAM für FP16 und 22 GByte für die quantisierte Variante Q5_K_M; NVFP4 belegte im Test knapp halb so viel wie Q8_0 „ohne spürbar ungenauer oder schlechter“ zu sein

Schwächen

  • Hoher Token-Verbrauch je Aufgabe: 160 Mio. Ausgabe-Token für den AA-Index-Durchlauf gegen einen Median von 43 Mio. – wer nach Ausgabe-Token zahlt oder auf Latenz achtet, spürt das
  • Die Werkseinstellung ist die teuerste: Der Denkmodus läuft nicht nur voreingestellt („Qwen3.8 models operate in thinking mode by default“), sondern auf der höchsten Aufwandsstufe `xhigh` – Simon Willison misst dafür 21 Minuten gegen 137 Sekunden ohne Denkmodus für dieselbe Aufgabe und nennt es „a hilarious default … absolutely not a good way to run the model, especially on consumer hardware“. Abschalten geht, die Voreinstellung sagt es nur niemandem
  • Sämtliche Benchmark-Werte der Modellkarte sind Anbieterangaben, und Alibaba hat die Vergleichsmodelle bis auf eines selbst durchgemessen („all models are evaluated with the Claude Code harness“)
  • Gehostet nur über Dritte: Ein Anbieterpreis von Alibaba selbst fehlt weiterhin (die von der Modellkarte verlinkte QwenCloud-Seite lieferte am 14.08.2026 HTTP 404); wer nicht selbst betreibt, mietet über den Marktplatz OpenRouter – dort sieben Anbieter zu 0,40 $ Eingabe / 3,00 $ Ausgabe je Mio. Token (Stand 20.08.2026)
  • AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen →, AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen →, Terminal-Bench und τ²-bench liegen für dieses Modell nicht vor
  • Die AA-Ausgabegeschwindigkeit ist auf der Modellseite mit „N/A“ ausgewiesen – ein Durchsatzwert für den gehosteten Betrieb fehlt

Typische Einsatzfälle

  • Eigenbetrieb auf einer Karte
  • Coding ohne Anbieterbindung
  • agentische Workflows
  • Arbeitsabläufe mit Bild und Video

Leistung im Vergleich

Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar.

  • AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen →52
  • AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen →68
  • AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen →51

Benchmarks im Detail

Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →

  • Artificial Analysis Intelligence Index

    52

    (Stand 18.08.2026)

    unabhängigArtificial Analysis, Modellseite Qwen3.8 27B, abgerufen 2026-08-18 – 160 Mio. Ausgabe-Token für den Durchlauf gegen einen Median von 43 Mio.; Rang „#1 / 135“ in der Vergleichsgruppe

  • SWE-Bench Pro

    61,7

    (Anbieterangabe)

    AnbieterangabeHugging Face – Modellkarte Qwen/Qwen3.8-27B, abgerufen 2026-08-14 (Vergleichswerte der Karte: Qwen3.6-27B 53,5 · Qwen3.7-Plus 57,6 · Muse Glimmer-30B 51,2 · Opus4.6 Max 53,4)

  • LiveCodeBench v6

    90,3

    (Anbieterangabe)

    AnbieterangabeHugging Face – Modellkarte Qwen/Qwen3.8-27B, abgerufen 2026-08-14 (Qwen3.7-Plus 89,6 · Opus4.6 Max 88,8)

  • OSWorld-Verified

    84,3

    (Anbieterangabe)

    AnbieterangabeHugging Face – Modellkarte Qwen/Qwen3.8-27B, abgerufen 2026-08-14 (Qwen3.7-Plus 73,3 · Opus4.6 Max 72,7)

  • GPQA Diamond

    89,2

    (Anbieterangabe)

    AnbieterangabeHugging Face – Modellkarte Qwen/Qwen3.8-27B, abgerufen 2026-08-14 (Qwen3.7-Plus 90,3 · Opus4.6 Max 91,3 – hier liegt das Modell also hinten)

  • Terminal Bench 2.1 (Terminus)

    73,0

    (Anbieterangabe)

    AnbieterangabeHugging Face – Modellkarte Qwen/Qwen3.8-27B, abgerufen 2026-08-14 (Qwen3.7-Plus 64,0 · Opus4.6 Max 78,2)

Einordnung

  • Der eigentliche Befund ist das Verhältnis von Größe zu Punktzahl: 52 im Intelligence Index bei 27 Mrd. Parametern – dieselbe Punktzahl, die GPT-5.6 Luna (max) erreicht, und ein Punkt hinter GLM-5.2 (max) mit 753 Mrd. Parametern. Die Punkte kommen allerdings nicht umsonst: Der Index-Durchlauf verbrauchte 160 Mio. Ausgabe-Token gegen einen Median von 43 Mio. Das Modell denkt sich zur Leistung, es rechnet sich nicht dorthin.Beleg · Sekundärquelle
  • Innerhalb der eigenen Familie ist die kleinere Freigabe die freizügigere: Qwen3.8-27B steht unter Apache 2.0, Qwen3.8-Max unter einer Hauslizenz mit zwei Umsatzschwellen; und das 27-B-Modell nimmt Bild und Video entgegen, während die freigegebenen Max-Gewichte reiner Text sind. Wer aus der Qwen3.8-Familie etwas selbst betreiben will, nimmt in aller Regel dieses Modell.Beleg · Primärquelle
  • Seit dem 20.08.2026 ist das Modell auch gehostet zu haben – und der Betriebsbefund dazu ist wichtiger als der Preis. OpenRouter listet sieben Anbieter zu 0,40 $ Eingabe / 3,00 $ Ausgabe je Mio. TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →; damit ist die hier seit dem 14.08. vermerkte Lücke geschlossen. Der Preis steht bewusst nur hier und nicht in der vergleichenden Preisachse: Ein Marktplatzpreis ist kein Anbieterpreis. Der eigentliche Fund ist die Voreinstellung: Der Denkaufwand steht ab Werk auf `xhigh`. Simon Willison braucht damit 21 Minuten für ein SVG, das ohne Denkmodus in 137 Sekunden fertig ist – und das erklärt rückwirkend die 160 Mio. Ausgabe-Token des AA-Durchlaufs gegen einen Median von 43 Mio. Wer dieses Modell mit den Werkseinstellungen misst, misst die Voreinstellung mit.Beleg · Primärquelle
  • Der erste unabhängige Praxistest kam von heise: Q8_0 und NVFP4 unter Llama.cpp auf einer RTX Pro 6000 Blackwell, zwölf Minuten für eine funktionsfähige Warenwirtschafts-Schnittstelle ohne Rückfragen. Das Urteil des Testers – „Das Ergebnis dieses Experiments war nicht von Claudes Programmierkünsten zu unterscheiden.“ – ist ein Eindruck aus einem Durchlauf, keine Messung; welches Claude-Modell gemeint ist, sagt der Artikel nicht.Beleg · Sekundärquelle
  • Warum der Indexwert 52 nicht bedeutet, dass hier ein Spitzenmodell im Wohnzimmer steht: Nach der von uns nachgelesenen AA-Methodik speisen sich die Punkte aus mehreren Einzel-Benchmarks, von denen nur einer reines Faktenwissen abfragt – der Rest lässt Werkzeuge zu. Ein 27-Mrd.-Modell kann deshalb hoch punkten, ohne viel Wissen in den Gewichten zu tragen, solange es zuverlässig erkennt, wann es nachschlagen muss. Genau das beschreibt auch der Praxiseindruck: ohne Netzzugang halluziniert das Modell bei einfachen Faktenfragen, mit Werkzeugen und Netz greift es von sich aus zur Recherche. Für die Einordnung heißt das: Die Zahl misst Können unter Werkzeugeinsatz, nicht Wissen – und sie ist deshalb kein Versprechen für den werkzeuglosen Chat-Betrieb.Beleg · Sekundärquelle

Stimmen aus der Öffentlichkeit

Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.

ℹ️ Architektur laut Modellkarte: 27 Mrd. Parameter, dicht statt MoE (Mixture of Experts)Architektur, bei der je Anfrage nur ein Teil des Modells („Experten“) aktiv wird. So hat das Modell sehr viele Gesamt-Parameter, rechnet aber nur mit wenigen aktiven – das spart Rechenzeit.Mehr im Wissen →, 64 Schichten, Aufbau „16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))“; Kontext „262,144 natively and extensible up to 1,000,000 tokens“ per YaRN. Gewichte seit dem 14.08.2026 als Qwen/Qwen3.8-27B (BF16) und -FP8 auf Hugging Face, Lizenzkennung „apache-2.0“; kompatible Laufzeiten laut Karte Transformers, vLLM, SGLang und TokenSpeed. ✅ Nachtrag 2026-08-21 – die Kennzahl-Sperre ist aufgehoben. Zuvor stand hier bewusst kein `kennzahlen.aaIntelligenz`, weil die AA-Modellseiten seit dem 13.08.2026 Indexwerte rund zwei Punkte über dem eingefrorenen Katalogstand vom 05./06.08.2026 auswiesen und offen war, ob es sich um eine Neueichung oder um eine andere ausgewiesene Aufwandsstufe handelt. Der katalogweite Abgleich über die AA-Schnittstelle (`pnpm verify-bench`, Report `docs/recherche/verifikation-benchmarks-2026-08-21.md`) hat das geklärt: Die Schnittstelle weist den Intelligence-Index v4.1 aus, der eingefrorene Stand stammt aus der Vorgängerfassung. Es war also eine Neueichung. Sie trifft `aaIntelligenz` (rund +2 Punkte) und `aaAgentic` (rund +3) über den ganzen Katalog, während `aaCoding` weitgehend im Toleranzband blieb – ein Muster, das gegen eine bloß andere Aufwandsstufe spricht. Der Katalog ist am selben Tag geschlossen auf v4.1 nachgezogen worden; die hier eingetragenen 52 / 68,1 / 50,9 (gerundet 52 / 68 / 51) stammen aus derselben Abfrage und sind damit wieder vergleichbar. Ein Preis fehlt aus demselben Grund wie bei anderen reinen Gewichte-Freigaben: Es ist kein gehosteter Anbieter gelistet. Nachtrag 2026-08-20: Gehostet ist das Modell inzwischen zu haben – OpenRouter führt sieben Anbieter zu 0,40 $ / 3,00 $ je Mio. Token. `preisInput`/`preisOutput` bleiben trotzdem leer: In der vergleichenden Preisachse stehen Anbieter-API-Preise, ein Marktplatz-Kopfpreis ist etwas anderes und würde den Vergleich still verzerren. Der Wert steht deshalb in `einordnung`, `schwaechen` und in der Depesche `qwen3-8-27b-sieben-anbieter-xhigh-voreinstellung`. Ebenfalls neu belegt: Die Voreinstellung für den Denkaufwand ist `xhigh` (Simon Willison, 16.08.2026) – das erklärt die 160 Mio. Ausgabe-Token des AA-Durchlaufs und macht die zuvor hier offene Frage, ob der Denkmodus abschaltbar sei, gegenstandslos: Er ist es (137 Sekunden gegen 21 Minuten für dieselbe Aufgabe).