GLM-5.3-Flash löst je 100 Dollar 264 DeepSWE-Aufgaben, das große GLM-5.3 nur 17 – und die Anbieterzahl 63,4 hält der Nachmessung stand
Together AI hat am 28. August 2026 den dritten DeepSWE-Vergleich seiner Reihe veröffentlicht, diesmal GLM-5.3 gegen die offene Flash-Variante: 900 gewertete Durchläufe (452 für GLM-5.3, 448 für Flash) über 113 Aufgaben mit je vier Versuchen. Beim ersten Versuch kommt Flash auf 63,4 Prozent (± 4,1) gegen 69,0 Prozent (± 2,7); über vier Versuche schrumpft der Abstand auf 85,0 gegen 87,6 Prozent – 2,6 Punkte. Ein Durchlauf kostet 0,24 statt 3,99 US-Dollar, Faktor 17. Je 100 US-Dollar löst Flash damit 264 Aufgaben, das große Modell 17. Eine Kaskade – erst Flash, Eskalation an das große Modell nur, wenn ein Prüfer die Antwort verwirft – erreicht 80,9 Prozent zu 1,70 US-Dollar je Aufgabe.
Der Aufbau entspricht den beiden früheren Läufen vom 21. August: 113 langhorizontige Feature-Aufgaben aus DeepSWE, je vier Versuche pro Konfiguration, ausgewertet als pass@1 und pass@4. Gewertet wurden 900 Durchläufe, 452 für GLM-5.3 und 448 für GLM-5.3-Flash. Als Autoren nennt der Beitrag Zain Hasan und Shobhit Dixit.
Die Ergebnisse: GLM-5.3 kommt auf 69,0 Prozent pass@1 (± 2,7) und 87,6 Prozent pass@4, GLM-5.3-Flash auf 63,4 Prozent (± 4,1) und 85,0 Prozent. Der Abstand beträgt beim ersten Versuch 5,6 Punkte und über vier Versuche nur noch 2,6.
Die Kostenseite kippt das Bild: Ein Durchlauf kostet mit GLM-5.3 3,99 US-Dollar, mit Flash 0,24 US-Dollar – Faktor 17. In der Kennzahl „gelöste Aufgaben je 100 US-Dollar“ steht es 264 zu 17. Als Mittelweg beschreibt der Beitrag eine Kaskade: erst das Flash-Modell laufen lassen und nur dann an das große Modell eskalieren, wenn ein Prüfer die Antwort verwirft. Das ergibt 80,9 Prozent bei 1,70 US-Dollar je Aufgabe.
Für unseren Katalog ist die Nachmessung des Anbieterwerts der eigentliche Ertrag. Die Modellkarte von Z.ai weist für DeepSWE 63,4 Prozent aus; die einzige bis dahin verfügbare unabhängige Messung (stealthmodelwatch.online, von heise referiert) hatte 58,4 Prozent ergeben – 66 von 113 gelösten Aufgaben in einem einzigen Durchgang. Mit 448 Durchläufen landet Together AI genau auf der Anbieterzahl. Wir haben die betreffende Schwächen-Zeile im Katalogeintrag entsprechend korrigiert und die Messung als Benchmark aufgenommen.
⚠️ Einordnung: Together AI verkauft Inferenz für beide gemessenen Modelle und hat ein Interesse daran, günstige offene Modelle attraktiv aussehen zu lassen; die Kaskaden-Empfehlung ist zugleich ein Produktargument für Routing auf der eigenen Plattform. Unabhängig ist die Messung gegenüber dem Modellhersteller Z.ai, nicht gegenüber dem Betreiber. Die Fehlerangaben (± 2,7 bzw. ± 4,1) stammen aus dem Beitrag; welches Intervall sie bezeichnen, wird dort nicht ausgeführt.