← Alle Modelle

Alibaba · Qwen

Qwen3-Max

qwen3-max

proprietärModell, das nur über die API oder das Produkt des Anbieters nutzbar ist; die Gewichte werden nicht veröffentlicht. Gegenstück zu open-weight.Mehr im Wissen →Text

Solide WahlAgentic-Allzweck (Alibaba Cloud)

Auf mehrstufige, tool-lastige Workflows ausgelegt, mit großem 256-K-Kontext und günstigem Kurz-Prompt-Preis. Nur über Alibaba Cloud nutzbar und bei langen Prompts gestaffelt teurer; im AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 24 (AA-Schätzung), AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 26, dazu Elo (LMArena)Human-Präferenz-Wertung aus der LMArena: Menschen vergleichen blind zwei Modellantworten, daraus entsteht – wie beim Schach – eine Elo-Zahl. Höher = häufiger bevorzugt. Misst Präferenz, nicht Korrektheit.Mehr im Wissen → 1435.

  • agentische, mehrstufige Workflows
  • Tool-Calling
  • lange Kontexte
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen →
262 KTokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →
Max. Ausgabe
65.536 K Token
Preis (Input / Output)
$1.2 / $6 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen →
10,0 Indexpkt. je $/Mio. Token

Stärken

  • Leistungsstärkstes Modell der Qwen-Reihe (Anbieterangabe)
  • Großes 256-K-Token-Kontextfenster (262 144)
  • Natives Tool-Calling, auf komplexe mehrstufige Aufgaben ausgelegt

Schwächen

  • Proprietär, nur über Alibaba Cloud Model Studio / DashScope nutzbar
  • Reine Text-Modalität
  • Gestaffelter Preis – über 32 K bzw. 128 K TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → deutlich teurer

Typische Einsatzfälle

  • Agentische, mehrstufige Workflows
  • Coding
  • lange Kontexte

Leistung im Vergleich

Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → oben ist daraus abgeleitet: AA-Intelligenz je AA-Blended-Preis (3:1) – entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis. AAs token-basiertes „Cost to Run Index“ ist nicht öffentlich abrufbar.

  • AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen →24
  • AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen →26
  • τ²-benchBenchmark für die Verlässlichkeit beim Werkzeug-Einsatz: dieselbe Aufgabe wird viele Male wiederholt, gemessen wird, wie konstant das Modell die Tools korrekt bedient (0–100 %).Mehr im Wissen →74
  • Elo (LMArena)Human-Präferenz-Wertung aus der LMArena: Menschen vergleichen blind zwei Modellantworten, daraus entsteht – wie beim Schach – eine Elo-Zahl. Höher = häufiger bevorzugt. Misst Präferenz, nicht Korrektheit.Mehr im Wissen →1435

Benchmarks im Detail

Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →

  • Artificial Analysis Intelligence Index

    24

    (AA-Schätzung)

    unabhängigArtificial Analysis (API), abgerufen 2026-06-16 – Schätzwert

  • Artificial Analysis Coding Index

    26

    unabhängigArtificial Analysis (API), abgerufen 2026-06-16

  • LMArena Text Arena (Elo)

    1435

    (Preview)

    unabhängigLMArena (arena.ai), Stand 2026-06-10

  • τ²-bench (Tool-Use-Verlässlichkeit)

    74 %

    unabhängigArtificial Analysis (API), abgerufen 2026-06-16

Einordnung

  • Großes 256-K-KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen → und natives Tool-CallingFähigkeit eines Modells, strukturiert externe Werkzeuge oder Funktionen aufzurufen (Suche, Code ausführen, APIs) und deren Ergebnisse weiterzuverwenden. Die Grundlage für Agenten.Mehr im Wissen →; günstig bei kurzen Prompts ($1,20 / $6), aber gestaffelt teurer bei langen und auf reine Text-Modalität beschränkt.
  • proprietärModell, das nur über die API oder das Produkt des Anbieters nutzbar ist; die Gewichte werden nicht veröffentlicht. Gegenstück zu open-weight.Mehr im Wissen → (nur über Alibaba Cloud Model Studio). Das neuere agenten-fokussierte Qwen3.7-Max ist im Rollout, hier aber bewusst nicht aufgenommen (primär noch unbelegt).

Stimmen aus der Öffentlichkeit

Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.

  • gemischtLäuft lokal solide – die rund 27B-Variante (Qwen 3.6 27B) auf einer RTX 5090 fühlt sich „Sonnet-4-Niveau“ an und taugt bei Datenschutzbedarf für Klassifikations- und Sub-Agenten-Tasks; Frontier ist es ausdrücklich nicht.Nerd Snipe (YouTube) · Community
  • positivQwen 3 VL gilt als „world-class“ und mit geschlossenen Modellen konkurrenzfähig bei Vision-Language-Reasoning und Szenenverständnis – phänomenale Arbeit des Alibaba-Qwen-Teams.Cognitive Revolution (YouTube) · Community

ℹ️ Gestaffelter Preis (International Deployment): Input $1,20 (0–32 K) / $2,40 (32–128 K) / $3 (128–252 K); Output $6 / $12 / $15 je 1 Mio. Token. Max. Input 258 048, max. Output 65 536 (ohne Thinking) bzw. 32 768 (mit Thinking). open-weightModell, dessen trainierte Gewichte öffentlich herunterladbar sind, sodass man es selbst (lokal oder auf eigener Hardware) betreiben kann. Nicht zwingend vollständig quelloffen – die Lizenz bestimmt die erlaubte Nutzung.Mehr im Wissen →-Varianten der Qwen-Reihe (Qwen3.6, Apache 2.0) liegen auf Hugging FaceDie zentrale Plattform, auf der offene KI-Modelle (ihre Gewichte) samt Spezifikation veröffentlicht und heruntergeladen werden – die „GitHub-Drehscheibe“ der open-weight-Szene.Mehr im Wissen →; das neuere agenten-fokussierte Qwen3.7-Max ist noch im Rollout und hier bewusst nicht aufgenommen (im offiziellen Modell-/Pricing-Register noch nicht belegt).