Z.ai · GLM
GLM-5.1
glm-5.1
Solide WahlOpen-Weight Agentic-Coding (MIT)
- agentisches Coding
- Self-Hosting (MIT)
- lange Reasoning-Aufgaben
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen → - 203 K
TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → - Max. Ausgabe
- 131.072 K Token
- Preis (Input / Output)
- $1.4 / $4.4 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → - 18,6 Indexpkt. je $/Mio. Token
WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen → - nicht ausgewiesen
- Release
- 7. April 2026
Stärken
Vollständig offene MIT-Lizenz – frei self-hostbar/lokal betreibbar Auf agentisches Coding ausgelegt (lange Tool-Call-Horizonte); MoE 744 Mrd. total / 40 Mrd. aktiv 200-K-Token-Kontext, 128-K-Output
Schwächen
Reines Text-Modell – multimodalEin Modell ist multimodal, wenn es mehr als nur Text verarbeitet – etwa Bilder, Audio oder Video als Eingabe versteht (manche erzeugen sie auch als Ausgabe).Mehr im Wissen → nur im separaten GLM-5V/-TurboSehr großes Gewichtspaket (744 Mrd. Parameter) fürs Self-Hosting
Typische Einsatzfälle
agentisches Coding Self-HostingEin (meist open-weight) Modell auf eigener Hardware oder in der eigenen Cloud betreiben, statt die API eines Anbieters zu nutzen. Bringt Datenhoheit und Kostenkontrolle, erfordert aber eigene Infrastruktur.Mehr im Wissen → (MIT)lange Thinking / ReasoningModus, in dem ein Modell vor der Antwort sichtbare Zwischenschritte „durchdenkt“. Das hebt die Qualität bei schweren Aufgaben, kostet aber mehr Tokens und Zeit – oft über einen Aufwand-Regler steuerbar.Mehr im Wissen → -Aufgaben
Leistung im Vergleich
Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die
AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 40AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 56Terminal-BenchAusführungsbasierter Benchmark (0–100 %): das Modell löst echte Shell-/Terminal-Aufgaben in einer Sandbox, gewertet wird, ob das Ergebnis wirklich funktioniert. Dadurch kontaminationsärmer als reine Wissensquizze.Mehr im Wissen → 62τ²-benchBenchmark für die Verlässlichkeit beim Werkzeug-Einsatz: dieselbe Aufgabe wird viele Male wiederholt, gemessen wird, wie konstant das Modell die Tools korrekt bedient (0–100 %).Mehr im Wissen → 98
Benchmarks im Detail
Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →
Artificial Analysis Intelligence Index
40
unabhängigArtificial Analysis (API), abgerufen 2026-06-16
Artificial Analysis Coding Index
56
unabhängigArtificial Analysis (API), abgerufen 2026-07-09
Terminal-Bench (agentische Shell-Aufgaben)
62 %
unabhängigArtificial Analysis (API), abgerufen 2026-06-16
τ²-bench (Tool-Use-Verlässlichkeit)
98 %
unabhängigArtificial Analysis (API), abgerufen 2026-06-16
DeepSWE (Long-Horizon Coding)
18 %
(±4)
unabhängigdeepswe.lol (kontaminationsfrei, mini-swe-agent), 2026-07-10
Einordnung
Beleg · Primärquelleopen-weightModell, dessen trainierte Gewichte öffentlich herunterladbar sind, sodass man es selbst (lokal oder auf eigener Hardware) betreiben kann. Nicht zwingend vollständig quelloffen – die Lizenz bestimmt die erlaubte Nutzung.Mehr im Wissen → -MoE (MIT) mit DeepSeek-Sparse-Attention: 744 Mrd. Gesamt- / 40 Mrd. aktive Parameter, 78 Layer; 200-K-Kontext, 128-K-Output. Reines Text-Modell (Vision im separaten GLM-5V).Im AA Intelligence Index 40 / Coding 56; Preis $1,40 / $4,40 (Cache-Input $0,26). Z.ai positioniert GLM-5.1 als Flaggschiff für agentisches Coding (Anbieterangabe; Eigenbenchmarks unabhängig nicht verifiziert). Beleg · Primärquelle
ℹ️