Der Wortlaut der Primärquelle. Die Übersichtsseite zu GLM-5.3-Flash in Z.ais Entwickler-Dokumentation beschreibt eine „Encode–Prefill–Decode (EPD) disaggregated architecture“, die „separates multimodal encoding, prompt prefill, and token-by-token decoding into independently scheduled and scalable worker pools, enabling efficient and reliable serving across tens of thousands of domestically developed accelerators“. Als Optimierungen listet sie „intra-node tensor parallelism for Linear Attention and the LM head, ReplaySSM, W8A8 quantization, hybrid INT8/FP8/BF16 cache quantization, and Layer Split“. Der Vergleichspunkt der 3-fachen Verbesserung ist ausdrücklich die eigene Ausgangsmessung auf derselben Hardware – nicht eine Nvidia-Referenz.
Was daneben berichtet wird. Die South China Morning Post (Minxiao Chang, 27. August 2026) schreibt, das System sei „entirely on a cluster of 100,000 domestically produced chips during a high-profile stealth trial“ gelaufen, und beziffert den Vorlauf: „the model processed 62 trillion tokens before its formal release on Wednesday“ – auf OpenRouter allein „more than 11 trillion tokens in its first three days“, nach dieser Darstellung der größte Start der Plattform bisher. Die Zhipu-Aktie schloss demnach „more than 12 per cent higher at HK$1,160“.
⚠️ Drei Zahlen, die nicht zusammenpassen, und wir lösen es nicht auf. Erstens: Z.ai selbst schreibt „tens of thousands“ Beschleuniger, die SCMP nennt 100.000 – beides kann stimmen, muss aber nicht dasselbe messen (Cluster gegen Gesamtflotte). Zweitens: The Decoder referiert unter Berufung auf SemiAnalysis „100 trillion tokens a day“; das steht quer zu 62 Billionen Token für die gesamte Vorlaufwoche. Drittens nennt keine der von uns geöffneten Quellen – Anbieter-Doku eingeschlossen – einen Chiphersteller. Wir führen die Angaben deshalb mit ihrer Herkunft nebeneinander, statt eine davon zur Tatsache zu erheben.
Was sich für die Praxis nicht ändert. Die Angaben betreffen den Betrieb bei Z.ai, nicht die Gewichte: GLM-5.3-Flash steht unverändert unter MIT-Lizenz auf Hugging Face, mit 320 Mrd. Gesamt- und 18 Mrd. aktiven Parametern und $0,15 / $0,50 je Million Token bei Z.ai. Wer das Modell selbst betreibt, betreibt es auf der eigenen Hardware – die Infrastruktur-Aussage ist eine Aussage über den Anbieter, nicht über das Modell. Unsere Katalog-Kennzahlen (AA-Agentic 58,2, Rang 6 von 175 gemessenen Modellen) sind davon unberührt.
Fundstelle war Tier C. Aufgefallen ist uns der Punkt über Matthew Bermans Video vom 29. August, das die Z.ai-Passage vorliest und um die SemiAnalysis-Zahl ergänzt. Belegt ist hier nichts davon durch das Video – belegt ist es durch die Anbieter-Dokumentation und die SCMP-Meldung, die wir daraufhin selbst geöffnet haben. Das Video hat den Hinweis geliefert, nicht den Beweis.