← Alle Modelle

Z.ai · GLM

GLM-5.3-Flash

glm-5.3-flash

open-weightModell, dessen trainierte Gewichte öffentlich herunterladbar sind, sodass man es selbst (lokal oder auf eigener Hardware) betreiben kann. Nicht zwingend vollständig quelloffen – die Lizenz bestimmt die erlaubte Nutzung.Mehr im Wissen →TextBildVideo

Erste WahlOffenes Agentik-Modell zum Flash-Preis (MIT)

Das Modell, das eine Woche lang anonym als „Ox Alpha“ lief: 320 Mrd. Gesamt- / 18 Mrd. aktive ParameterDie im Training gelernten „Stellschrauben“ eines Modells (gezählt in Milliarden). Mehr Parameter heißt grob mehr Kapazität, aber auch mehr Rechen- und Speicherbedarf – und sagt allein wenig über die Qualität.Mehr im Wissen →, MIT-Lizenz, erstes nativ multimodales Modell der GLM-5-Reihe. Unabhängig gemessen steht es im AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen →-Index bei 58 – Rang 6 von 175 gemessenen Modellen, vor GPT-5.6 Sol (max) und Claude Fable 5 – bei $0,15 / $0,50 je Mio. Token. Es überholt damit GLM-5.2 (max) auf allen drei AA-Achsen zu rund einem Neuntel des Preises. Der Haken steht im Praxistest, nicht im Index: Auf einem privaten Projekt-Benchmark landet es am unteren Ende, und ein Lauf dauert dort rund neun Minuten.

  • agentische Werkzeugketten zum Bruchteil des Frontier-Preises
  • Self-Hosting (MIT, ≈100 GB in BF16-Nachbarschaft)
  • multimodale Eingabe (Bild, Video, Dateien)
  • Massenbetrieb, wo Kosten je Aufgabe zählen
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen →
1 Mio.TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →
Max. Ausgabe
163.84 K Token
Preis (Input / Output)
$0.15 / $0.5 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen →
244,2 Indexpkt. je $/Mio. Token
WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen →
nicht ausgewiesen
Release
26. August 2026

Stärken

  • AA-Agentic-Index 58,2 – Rang 6 von 175 gemessenen Modellen, vor GPT-5.6 Sol (max) und Claude Fable 5, bei einem Bruchteil des Preises
  • MIT-Lizenz, Gewichte am Enttarnungstag auf Hugging FaceDie zentrale Plattform, auf der offene KI-Modelle (ihre Gewichte) samt Spezifikation veröffentlicht und heruntergeladen werden – die „GitHub-Drehscheibe“ der open-weight-Szene.Mehr im Wissen → (zai-org/GLM-5.3-Flash); erstes nativ multimodales Modell der GLM-5-Reihe
  • Kosten je Aufgabe im AA-Intelligence-Lauf: $0,0869 gegenüber $0,6829 für GLM-5.3 (max) – rund ein Achtel bei 2 Indexpunkten Abstand

Schwächen

  • Auf einem unabhängigen privaten Projekt-Benchmark (Tier C) landet es am unteren Ende der Tabelle – der Index-Rang bildet Praxis-Coding nicht ab
  • Langsam: AA misst 49 Token/s Ausgabe (GLM-5.3 max: 87) und 42 s bis zum ersten Antwort-Token; im Praxistest rund neun Minuten je Prompt
  • Kontextangaben gehen auseinander: Anbieter-Doku und OpenRouter nennen 1 Mio. Token, die Modellkarte wertet „with a maximum context length of 300,000 tokens“ aus
  • Benchmark-Werte der Modellkarte sind Anbieterangaben; die DeepSWE-Zahl 63,4 hat Together AI am 28.08.2026 über 448 Durchläufe allerdings exakt reproduziert (ein früherer Einzeldurchgang lag mit 58,4 % darunter)

Typische Einsatzfälle

  • agentisches Coding und lange Tool-Call-Ketten
  • Self-Hosting (MIT)
  • multimodale Auswertung (Bild/Video/Dateien)

Leistung im Vergleich

Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → oben ist daraus abgeleitet: AA-Intelligenz je AA-Blended-Preis (3:1) – entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis. AAs token-basiertes „Cost to Run Index“ ist nicht öffentlich abrufbar.

  • AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen →58
  • AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen →72
  • AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen →58

Benchmarks im Detail

Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →

  • Artificial Analysis Intelligence Index

    57,5

    unabhängigArtificial Analysis (API), abgerufen 2026-08-27

  • Artificial Analysis Coding Index

    71,5

    unabhängigArtificial Analysis (API), abgerufen 2026-08-27

  • Artificial Analysis Agentic Index

    58,2

    (Rang 6 von 175 gemessenen Modellen)

    unabhängigArtificial Analysis (API), abgerufen 2026-08-27

  • Deep SWE (vollständiger Satz, 113 Aufgaben)

    58,4 %

    (66 gelöst) – Modellkarte weist 63,4 aus

    unabhängigstealthmodelwatch.online, referiert von heise, abgerufen 2026-08-26

  • DeepSWE pass@1 (113 Aufgaben, 448 gewertete Durchläufe)

    63,4 %

    (± 4,1) – GLM-5.3 (max) im selben Lauf: 69,0 % (± 2,7)

    unabhängigTogether AI, „GLM-5.3 vs. GLM-5.3 Flash on DeepSWE“, abgerufen 2026-08-29 (Betreiber der Inferenz-Plattform, unabhängig vom Modellhersteller)

  • DeepSWE pass@4 (113 Aufgaben, vier Versuche)

    85,0 %

    gegenüber 87,6 % für GLM-5.3 (max) – bei 0,24 statt 3,99 $ je Durchlauf

    unabhängigTogether AI, „GLM-5.3 vs. GLM-5.3 Flash on DeepSWE“, abgerufen 2026-08-29 (Betreiber der Inferenz-Plattform, unabhängig vom Modellhersteller)

  • Terminal-Bench 2.1 (Anbieterangabe)

    84,3

    AnbieterangabeZ.ai – Modellkarte GLM-5.3-Flash (Hugging Face), abgerufen 2026-08-27

Einordnung

  • Herkunft: Das Modell lief ab dem 20.08.2026 eine Woche lang anonym als „Ox Alpha“ auf OpenRouter, teils gratis. Am 26.08.2026 schrieb OpenRouter die Enttarnung selbst auf die Stealth-Seite und Z.ai legte die Gewichte unter MIT auf Hugging FaceDie zentrale Plattform, auf der offene KI-Modelle (ihre Gewichte) samt Spezifikation veröffentlicht und heruntergeladen werden – die „GitHub-Drehscheibe“ der open-weight-Szene.Mehr im Wissen →. Die Modellkarte nennt „320B total parameters and just 18B active parameters“ und „the first natively multimodal model in the GLM-5 series“; als Architektur eine Mischung aus Sparse AttentionAufmerksamkeits-Mechanismus, der nicht jeden Token mit jedem vergleicht, sondern nur eine ausgewählte Teilmenge. Das senkt Rechen- und Speicheraufwand bei sehr langen Kontexten erheblich.Mehr im Wissen → und linearer Aufmerksamkeit plus „Manifold-Constrained Hyper-Connections (mHC)“. Ausgewertet wurde laut Karte „with a maximum context length of 300,000 tokens“ bei maximal 163.840 erzeugten Token – Anbieter-Doku und OpenRouter führen dagegen 1 Mio. Kontext.Beleg · Primärquelle
  • Die unabhängige Einordnung, die es bei der Enttarnung noch nicht gab: Artificial Analysis führt GLM-5.3-Flash seit dem 26.08.2026 mit Intelligence 57,5, Coding 71,5 und AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen → 58,2. Auf der Agentik-Achse ist das Rang 6 von 175 dort gemessenen Modellen – über ihm nur Claude Opus 5 in zwei Aufwandsstufen (59,2 / 58,4, $5/$25), GLM-5.3 (max) (59,1) und Grok 4.6 (high) sowie Qwen3.8 Max (58,7 / 58,4, je $2/$6). Direkt darunter: GPT-5.6 Sol (max) mit 57,8 ($4/$20) und Claude Fable 5 mit 56,6 ($10/$50). Der Preisabstand zu Fable 5 beträgt Faktor 67 (Eingabe) bzw. 100 (Ausgabe). Gegenüber GLM-5.2 (max) – bis dahin das stärkste offene Modell unseres Katalogs – gewinnt das Flash auf allen drei Achsen (52,6 / 68,8 / 45,7) und kostet dabei ein Neuntel des Eingabepreises.Beleg · Sekundärquelle
  • Was der Index nicht zeigt: Der Betrieb ist langsam. AA misst 49,3 Token/s Ausgabe (GLM-5.3 max: 86,5), 1,46 s bis zum ersten Token, aber 42 s bis zum ersten Antwort-Token und 52 s Gesamtantwortzeit – das Modell denkt lange. Umgekehrt fällt der Kostenvorteil drastisch aus: Der komplette AA-Intelligence-Lauf kostete für das Flash $138,02 gegenüber $1.238,50 für GLM-5.3 (max), je Aufgabe $0,0869 statt $0,6829.Beleg · Sekundärquelle
  • Preis-Divergenz dokumentiert: AA misst mit $0,15 / $0,50 je Mio. Token, OpenRouter listet exakt die Hälfte ($0,075 / $0,25, Cache-Read $0,015) und beschreibt die Eingabe als „text, images and video“. Z.ais eigene Doku erklärt die Mechanik: Im GLM Coding Plan verbraucht ein Aufruf zu Nebenzeiten 50 % der Standard-Punkte. Wir führen den AA-Wert, weil er über den ganzen Katalog vergleichbar erhoben ist, und halten die Hälfte-Angabe hier fest.Beleg · Primärquelle
  • Verhältnis zur Reihe: GLM-5.3 (max) – die geschlossene Schwester – steht bei AA mit 59,5 / 74,8 / 59,1 auf Agentik-Rang 2 hinter Claude Opus 5 (59,2), bei $1,40 / $4,40. Ihre Gewichte fehlen weiterhin: In der Organisation zai-org lagen am 27.08.2026 nur GLM-5.3-Flash und GLM-5.3-Flash-BF16 (beide angelegt 25.08.), keine Ablage „GLM-5.3“. Z.ai hatte am 14.08. offene Gewichte „in zwei Wochen“ angekündigt – das Flash kam zuerst.Beleg · Primärquelle
  • Cyber-Fähigkeiten der 5.3-Generation (Anbieterangabe, aber bemerkenswert eingeräumt): Z.ai weist GLM-5.3 auf CyberGym mit 84,5 % aus, vor Mythos 5 (83,8 %) und GPT-5.6 Sol (83,6 %), und schreibt dazu „What surprised us was how quickly the capability continued to develop as training scaled“. Die Gegenprobe steht in derselben Tabelle: Auf ExploitBench kommt GLM-5.3 auf 54,4 % gegenüber Mythos 5 mit 78,0 % und GPT-5.6 Sol mit 76,5 % – beim Ausnutzen bis zur Codeausführung bleibt der Abstand groß. Für GLM-5.2 hatten UK AISI/CAISI dort unabhängig 24 % gemessen.Beleg · Primärquelle

Aus der System-Card

Verdichtete Befunde aus der offiziellen System-CardDas offizielle Begleitdokument eines Anbieters zu einem Modell (auch „Model Card“): Fähigkeiten, Grenzen, Sicherheitsbewertung. Primärquelle – die Fähigkeitsangaben darin sind aber Eigenangaben, nicht unabhängig gemessen.Mehr im Wissen → des Anbieters (Primärquelle, Tier (A/B/C)Verlässlichkeits-Stufe einer Quelle in der KI-Depesche: A = Primärquelle (z. B. offizielle Doku), B = solide Sekundärquelle, C = subjektiv/Einzelstimme. Steuert, wie stark eine Aussage gewichtet wird.Mehr im Wissen →). Fähigkeitswerte sind Anbieterangaben – nicht unabhängig nachgemessen. Card-Stand 2026-08-26.

Fähigkeiten

  • Coding & AgentikLaut Karte 84,3 auf Terminal-BenchAusführungsbasierter Benchmark (0–100 %): das Modell löst echte Shell-/Terminal-Aufgaben in einer Sandbox, gewertet wird, ob das Ergebnis wirklich funktioniert. Dadurch kontaminationsärmer als reine Wissensquizze.Mehr im Wissen → 2.1, 63,4 auf Deep SWE und 55,3 auf HLE mit Werkzeugen (die letzten beiden mit Sternchen-Fußnote). Der einzige unabhängige Gegenwert liegt darunter: ein vollständiger Deep-SWE-Lauf über alle 113 Aufgaben ergab 66 gelöste Aufgaben, also 58,4 %.
  • Multimodalität„We introduce GLM-5.3-Flash, the first natively multimodal model in the GLM-5 series“ – Beispielcode verarbeitet Bild und Text; Z.ais Doku nennt „native multimodal input supporting images, videos, and files“, OpenRouter führt Text, Bild und Video als Eingabe.
  • KontextDie Karte wertet „with a maximum context length of 300,000 tokens, using a context management strategy“ aus und nennt maximal 163.840 erzeugte Token; Anbieter-Doku und OpenRouter führen dagegen ein 1-Mio.-Token-Fenster. Divergenz dokumentiert, nicht aufgelöst.

Verhalten & Sicherheit

  • Architektur„320B total parameters and just 18B active parameters“; hybride Architektur aus Sparse AttentionAufmerksamkeits-Mechanismus, der nicht jeden Token mit jedem vergleicht, sondern nur eine ausgewählte Teilmenge. Das senkt Rechen- und Speicheraufwand bei sehr langen Kontexten erheblich.Mehr im Wissen → und linearer Aufmerksamkeit, dazu ein Verfahren namens „Manifold-Constrained Hyper-Connections (mHC)“. Eine Schicht- oder Expertenzahl nennt die Karte nicht.
  • LizenzMIT. Gewichte am Tag der Enttarnung auf Hugging FaceDie zentrale Plattform, auf der offene KI-Modelle (ihre Gewichte) samt Spezifikation veröffentlicht und heruntergeladen werden – die „GitHub-Drehscheibe“ der open-weight-Szene.Mehr im Wissen → (zai-org/GLM-5.3-Flash und -BF16); die geschlossene Schwester GLM-5.3 (max) hat weiterhin keine offene Ablage.
  • SafetyKeine dedizierte Safety-Card mit Refusal-/Misuse-Evals. Cyber-Werte stehen nur in der Entwickler-Doku zu GLM-5.3 (CyberGym 84,5 %, ExploitBench 54,4 %) und sind anbieter-selbstberichtet.

Alle Karten-Werte sind anbieter-selbstberichtet. Die unabhängigen Zahlen stammen aus dem AA-API-Abruf vom 27.08.2026 (Intelligence 57,5 / Coding 71,5 / Agentic 58,2) und aus dem vollständigen Deep-SWE-Lauf (58,4 % gegenüber 63,4 auf der Karte). AA-Slug: glm-5-3-flash.

Z.ai – GLM-5.3-Flash (Model-Card, Hugging Face)· Primärquelle, abgerufen 2026-08-27

Stimmen aus der Öffentlichkeit

Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.

  • positivAusführlicher Praxisbericht eines Werkzeugbauers (Tier C, gesponsertes Video): Trennt bewusst zwischen „intelligence“ und „behavior“ und ordnet das Modell an einer für ihn neuen Stelle ein – „both genuinely stupid but also genuinely awesome to work with“. Es sei sein erstes kleines, billiges Modell, das er nicht bekämpfen müsse: „When I tell it to do a thing, it does it“, auch wenn man mitten in einer agentischen Aufgabe umsteuere. Als Beleg führt er einen Codex-Lauf über alle offenen Pull Requests seines Repositories vor: mehrere hundert PRs, sechs Sub-Agenten, drei davon mit Provider-Fehlern, worauf das Modell selbstständig auf direkte Bearbeitung umstellte; Dauer rund 20 Minuten. Die Abrechnung derselben Sitzung – rund 6 Mrd. Eingabe-Token, überwiegend aus dem Cache, 300k Ausgabe – beziffert er auf 12 Cent gegenüber „over $100“ für denselben, engeren Lauf mit Fable. Vision bestätigt er im Betrieb per Screenshot. Kritik nennt er zwei: die Token-Effizienz (auf Artificial Analysis rund 47k Token je Aufgabe gegenüber 20k bei GPT-5.6 Luna max und 17k bei Sol) und, dass die kursierenden Vergleichszahlen „misleading“ seien. ⚠️ Zwei Werbeblöcke im Video; die Kostenangabe ist eine Selbstauskunft aus dem eigenen Konto, nicht nachgerechnet.Theo – t3.gg (YouTube) – „Ox Alpha is INSANE“, 27.08.2026 (per oEmbed verifiziert, gegen das Transkript gelesen) · Community, 2026-08-27
  • gemischtErster Praxis-Nachtest nach der Enttarnung (Tier C, privater Projekt-Benchmark): Derselbe Tester, der GLM-5.3 (max) zwei Wochen zuvor einen „very big jump“ bescheinigt hatte, misst das Flash erneut – und findet dieselbe Position wie beim anonymen Ox Alpha: „towards the low end of the table“, 8,9 von 24 Punkten, „the difference in one or even two points on this leaderboard is not significant“. Neu sind die Betriebswerte, die es in der Gratisphase nicht gab: rund 2 Cent je Prompt (in einer Aktionsphase mit doppelter Anrechnung, real also eher 4) und im Schnitt neun Minuten je Prompt über 20 Prompts. In einem direkten Vergleich mit DeepSeek V4 Flash – ähnlicher Preis, ähnliche Dauer – gewinnt DeepSeek bei Testabdeckung und Randfällen, GLM-5.3-Flash aber bei der Code-Qualität (Urteil eines GPT-5.6-Sol-Richters: „GLM flash provides cleaner foundation for later phases“; DeepSeek fiel durch unidiomatisches Laravel-PHP, Duplikate und toten Code auf). ⚠️ Ein Tester, unveröffentlichte Methodik, LLM-Richter, Mitgliedschafts-Funnel im Video.AI Coding Daily (YouTube) – „I Tested NEW GLM-5.3-Flash (ex Ox Alpha) on 21 Coding Prompts“, 27.08.2026 (per oEmbed verifiziert, gegen das Transkript gelesen) · Community, 2026-08-27
  • neutralZum Self-Hosting (Tier C, weitergereichte Angabe): Der Tester referiert Berichte, das Modell brauche rund 100 GB und laufe auf zwei Nvidia DGX Spark, alternativ auf einem Mac mit 256 GB oder mehr; bei einem Straßenpreis von 3.000–5.000 $ je DGX Spark schätzt er die Hardware auf etwa 10.000 $. Er sagt ausdrücklich dazu, dass er diese Hardware nicht besitzt und es nicht selbst geprüft hat. ⚠️ Fremde Angabe aus einem Social-Media-Beitrag, von uns nicht gegengeprüft – als Größenordnung verwertbar, nicht als Spezifikation.AI Coding Daily (YouTube) – „I Tested NEW GLM-5.3-Flash (ex Ox Alpha) on 21 Coding Prompts“, 27.08.2026 (per oEmbed verifiziert, gegen das Transkript gelesen) · Community, 2026-08-27
  • gemischtRezeption der Enttarnung (Tier C): Ordnet die Modellkarten-Werte korrekt als Anbieterangaben ein („these are coming from z.ai, so take it with a grain of salt“) und nennt als Gegenlage die Kommentare auf Hacker News, wonach das Modell „can kind of struggle on certain edge case things“. Kein eigener Test.Chase AI (YouTube) – „The Secret AI Model OxAlpha Has Finally Been Revealed“, 27.08.2026 (per oEmbed verifiziert, gegen das Transkript gelesen) · Community, 2026-08-27
  • gemischtSicherheits-Panel zur 5.3-Generation (Tier C, aber fachlich besetzt): X-Force-Fachleute diskutieren, dass GLM-5.3 „by some measures better than GPT Sol and Anthropic Mythos when it comes to vulnerability discovery and validation“ sei, und betonen zugleich, dass Mythos und Sol „still beat 5.3 in many other benchmarks and measures“. Die von ihnen genannten CyberGym-Zahlen (84,5 / 83,8 / 83,6) decken sich mit Z.ais Doku; die als Zitat vorgetragene Formulierung „As we scaled post-training, cyber capability developed faster than we expected“ steht dort allerdings nicht wörtlich, sondern als „What surprised us was how quickly the capability continued to develop as training scaled“ – Substanz deckungsgleich, Wortlaut nicht.IBM Technology (YouTube) – „Who’s afraid of an open-weight model? GLM, context bombing and post-Black Hat attacks“, 26.08.2026 (per oEmbed verifiziert, gegen das Transkript gelesen) · Community, 2026-08-26

ℹ️ Aufgenommen am 27.08.2026, nachdem beide Bedingungen der Katalogregel aus dem GLM-5.2-Eintrag erfüllt waren: offene Gewichte (MIT, Hugging Face, 26.08.) und eine unabhängige Messung (Artificial Analysis, 26.08.). Vorgeschichte: eine Woche anonym als „Ox Alpha“ auf OpenRouter (Depesche „ox-alpha-enttarnt-glm-5-3-flash-mit-gewichten“). Preis: AA misst $0,15 / $0,50, OpenRouter listet die Hälfte (Off-Peak-Mechanik laut Z.ai-Doku) – wir führen den AA-Wert. Kontextfenster: 1 Mio. laut Anbieter-Doku/OpenRouter geführt, Modellkarten-Auswertung bei 300 K dokumentiert.