Rang #7 Programmierung — KI, die Produktionscode schreibt
Z.ai (Zhipu AI)

GLM-5.3

Ein schwergewichtiges Open-Weight-Modell für genau den Teil der Softwareentwicklung, der nach der ersten Antwort beginnt: planen, editieren, testen, Rückschläge auffangen und sich auch bei langen Aufträgen in einem Repository nicht verirren.

Aktualisiert 30. August 2026 Coding AgentLong-Horizon1M Context

Ranglisten-Update Die Rangliste „Programmierung“ wurde seit der letzten Aktualisierung dieses Tests (30. August 2026) überarbeitet. Der oben angezeigte Rang ist immer aktuell. Aktuelle Nummer 1: GPT-6 Astra

Am besten für

Ein schwergewichtiges Open-Weight-Modell für genau den Teil der Softwareentwicklung, der nach der ersten Antwort beginnt: planen, editieren, testen, Rückschläge auffangen und sich auch bei langen Aufträgen in einem Repository nicht verirren.

Warum es gewinnt

Artificial Analysis bewertet GLM-5.3 mit 59,5 bei Intelligence, 74,8 bei Coding und 59,1 bei agentischer Arbeit – in allen drei Bereichen vor Qwen3.8-Max. Das neueste öffentliche Terminal-Bench-4.0-Leaderboard führt GLM mit 41,8 % auf Platz 3.

Zu beachten

Der offizielle Checkpoint umfasst ungefähr 753B Parameter insgesamt und 40B aktive Parameter, verarbeitet nur Text, denkt immer mit und belegt selbst in FP8 rund 756 GB. Viele detaillierte Coding- und Cyber-Werte stammen weiterhin aus Tests von Z.ai, und die individuelle Lizenz ist keine MIT-Lizenz.

01

Was es wirklich ist

Die einfachste Coding-Demonstration ist die erste Antwort. Man bittet um eine Funktion, sieht dem Modell bei der Ausgabe sauberen Codes zu und beendet die Aufnahme, bevor sich Abhängigkeiten widersprechen oder Tests eine falsche Annahme entlarven. Echte Softwareentwicklung beginnt dort, wo diese Vorführung aufhört. GLM-5.3 ist für den zweiten, zwanzigsten und hundertsten Schritt gebaut: auswerten, was geschehen ist, den Plan überarbeiten und genügend Zustand bewahren, um die Aufgabe abzuschließen.

Laut Z.ai verwendet das Foundation Model dieselbe Basis wie GLM-5.2. Die Verbesserung stammt aus dem Post-Training in mehr ausführbaren Umgebungen und mit längeren professionellen Aufgaben. Stellen Sie sich einen kenntnisreichen Hochschulabsolventen vor, der eine Lehre beginnt. Das Wissen in seinem Kopf ändert sich vielleicht kaum, doch die wiederholte Praxis lehrt ihn, wann er nachmessen, wann er einer Hypothese misstrauen und wann er eine Arbeit rückgängig machen sollte, die vor fünf Minuten noch raffiniert wirkte.

Diese Geschichte wird inzwischen von zwei Arten von Belegen gestützt. Z.ai meldet große Fortschritte bei Terminal-Bench, DeepSWE, AutomationBench und Sicherheitstests. Noch wichtiger: Artificial Analysis bewertet GLM-5.3 unabhängig mit 59,5 bei Intelligence, 74,8 bei Coding und 59,1 bei agentischer Arbeit – vor Qwen3.8-Max mit 58,1, 71,8 und 58,4. Die belastbare Schlussfolgerung lautet deshalb, dass GLM beim Coding vor Qwen gehört, auch wenn jedes Repository weiterhin einen direkten Vergleich unter gleichen Bedingungen verdient.

Die Veröffentlichung der Gewichte am 28. August verändert die Bewertung grundlegend. Vor diesem Datum bezeichnete „Open Weight“ eine Absicht. Nun lassen sich FP8- und BF16-Dateien, Konfiguration, Chat-Template und Serving-Rezepte untersuchen. Reproduzierbarkeit ist endlich möglich. Billig ist sie nicht: Der FP8-Checkpoint umfasst ungefähr drei Viertel Terabyte, und die offiziellen Rezepte weisen auf Maschinen mit mehreren Beschleunigern der H200-Klasse. Ein Modell kann herunterladbar sein und trotzdem einen kleinen Maschinenraum verlangen.

Ebenso klar sollte man über die Lizenz sprechen. GLM-5.3 ist nicht MIT-lizenziert. Die individuelle Lizenz gestattet Nutzung, Veränderung, Fine-Tuning, Deployment und Verkauf in weitem Umfang. Ihre ungewöhnliche Klausel greift, wenn ein Lizenznehmer oder verbundenes Unternehmen sowohl ein Model-as-a-Service-Geschäft betreibt als auch über zwölf aufeinanderfolgende Monate insgesamt mehr als zehn Milliarden US-Dollar Umsatz erzielt. Dieser Betreiber muss vor der kommerziellen Nutzung die Sicherheitsprüfung von Z.ai bestehen. Die meisten Einzelpersonen und gewöhnlichen Produktteams sind von dieser Schwelle weit entfernt; „Open Source ohne Bedingungen“ wäre dennoch falsch.

Bei Benchmarks kommt es auf die genaue Bezeichnung an. Z.ais 88,2 auf Terminal-Bench 2.1 und der niedrigere unabhängige Test können beide korrekt sein, denn in einem Agentensystem ist das Modell nur einer von mehreren Akteuren. In der neuesten fortlaufend aktualisierten Testsuite, Terminal-Bench 4.0, liegt GLM-5.3 mit 41,8 % ±3,2 auf Platz 3 – hinter Opus 5 und Fable 5, aber vor GPT-5.6 Sol und Grok 4.6. Für Qwen3.8-Max gibt es keinen veröffentlichten 4.0-Eintrag; diese Abwesenheit stärkt das Vertrauen in GLM, ohne zu einem direkten Kopf-an-Kopf-Ergebnis zu werden.

Im Betrieb lässt sich das gehostete Modell leichter erproben als die Gewichte. Es akzeptiert Low, High oder Max Reasoning Effort und verwendet standardmäßig Max. Das Denken lässt sich nicht abschalten. Bei schwierigen Aufträgen hilft das, doch ein falscher Weg kann dadurch teuer werden: Ein ausdauernder Agent ist nur dann nützlich, wenn er beharrlich den Belegen folgt. Streamen Sie lange Läufe, begrenzen Sie Schleifen, bewahren Sie den Reasoning-Zustand korrekt und verlangen Sie Tests, bevor Sie eine Abschlussmeldung akzeptieren.

GLM-5.3 verdient deshalb eine stärkere Empfehlung als am Tag seiner Veröffentlichung, aber keine magische. Es ist eine ernsthafte Open-Weight-Codingmaschine für Teams mit anspruchsvoller Terminalarbeit, langen Kontexten und entweder API-Budget oder Cluster-Infrastruktur. Es ist weder der beste visuelle Debugger noch das unkomplizierteste private Modell; ebenso wenig beweist es, dass jeder Anbieterbenchmark auf Ihr Repository übertragbar ist. Geben Sie ihm dieselben Werkzeuge, dasselbe Budget, dieselben Tests und denselben Review-Maßstab wie Ihrem derzeitigen Modell. Vergleichen Sie anschließend verifizierte Arbeit, nicht selbstbewusste Prosa.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Lange Aufträge sind der eigentliche Zweck: GLM-5.3 ist darauf trainiert, Fehlerursachen zu finden, Code zu ändern, Werkzeuge auszuführen, Fehlschläge zu untersuchen und sich über ausgedehnte Arbeitsabläufe hinweg zu erholen. Das ähnelt der Pflege eines echten Codebestands stärker als ein Wettbewerb, bei dem nach einem einzigen Prompt eine Funktion entstehen soll.
  • Die unabhängigen Gesamtbelege sind inzwischen stark: Artificial Analysis bewertet das Modell mit 59,5 bei Intelligence, 74,8 bei Coding und 59,1 bei agentischer Arbeit. Qwen3.8-Max liegt mit 58,1, 71,8 beziehungsweise 58,4 dahinter.
  • Die Gewichte sind tatsächlich verfügbar: Z.ai veröffentlichte am 28. August Checkpoints in FP8 und BF16. Teams können das Modell nun untersuchen, selbst bereitstellen und reproduzieren, statt offene Gewichte nur als künftiges Versprechen behandeln zu müssen.
  • Der gehostete Weg ist unkompliziert: Z.ai bietet 1M Kontext, die Reasoning-Stufen low, high und max, OpenAI- und Anthropic-kompatible Schnittstellen sowie Preise von $1.40/M Input, $0.26/M gecachtem Input und $4.40/M Output.

Ehrliche Einschränkungen

  • Open Weight bedeutet nicht Workstation-Format: Das offizielle FP8-Repository ist etwa 756 GB groß, BF16 rund 1,51 TB; die dokumentierten Deployments setzen Systeme mit mehreren Beschleunigern der H200-Klasse voraus. Dieses Modell gehört in einen privaten Cluster, nicht als Download auf einen Laptop.
  • Die meisten aufgabenspezifischen Schlagzeilen beruhen noch auf Anbietertests: Terminal-Bench 3.0, DeepSWE, AutomationBench, CyberGym und der private Z.ai Code Bench verwenden offengelegte, aber empfindlich auf die jeweilige Testumgebung reagierende Harnesses. Das sind nützliche Belege, keine universell gültigen Werte.
  • Es verarbeitet nur Text und denkt immer: Das Modell kann Screenshots oder aufgezeichnete Benutzeroberflächen nicht nativ untersuchen; Anfragen, die das Denken abschalten, schlagen fehl. Low Effort hilft bei einfachen Aufgaben, dennoch fällt bei jeder Anfrage eine gewisse Reasoning-Latenz an.
  • Die Lizenz muss wirklich gelesen werden: Kommerzielle Nutzung ist weitgehend erlaubt. Ein MaaS-Betreiber samt verbundener Unternehmen, der in beliebigen zwölf aufeinanderfolgenden Monaten mehr als $10B Umsatz erzielt, muss jedoch eine Sicherheitsprüfung von Z.ai bestehen. Die zutreffende Bezeichnung lautet Open Weight, nicht uneingeschränkt Open Source.
03

Benchmark-Übersicht

Artificial Analysis Intelligence / Coding / Agentic — 59,5 / 74,8 / 59,1

Die unabhängigen Gesamtwerte setzen GLM-5.3 vor Qwen3.8-Max mit 58,1 / 71,8 / 58,4 und stützen damit die geänderte Reihenfolge auf der Website.

Terminal-Bench 2.1 — 88,2 beim Anbieter; rund 83,9 unabhängig

Der Abstand veranschaulicht, wie empfindlich Ergebnisse auf das Harness reagieren. Nennen Sie Runner und Konfiguration, statt einen Wert als unveränderliche Eigenschaft des Modells darzustellen.

Terminal-Bench 4.0 — 41,8 % ±3,2, Platz 3

Das neueste öffentliche Terminal-Leaderboard führt GLM hinter Opus 5 und Fable 5, aber vor GPT-5.6 Sol und Grok 4.6. Für Qwen3.8-Max gibt es keinen veröffentlichten Eintrag; diese Abwesenheit liefert daher Kontext, ist aber kein direkter Vergleich.

DeepSWE v1.1 — 66,9 (Z.ai-Test)

Ein starker Beleg für langwierige Repository-Arbeit mit mini-swe-agent und einem Budget von sechs Stunden, der im offiziellen öffentlichen Artefakt bislang jedoch nicht unabhängig reproduziert wurde.

GDPval-AA v2 — Spitzengruppe, laufender Elo-Wert

Jüngste Momentaufnahmen verorten GLM-5.3 im mittleren 1700er-Bereich; die Konfidenzintervalle überschneiden sich mit GLM Flash und anderen Spitzenmodellen. Geben Sie das Abrufdatum an, da der Elo-Wert neu skaliert wird.

04

Das Fazit

GLM-5.3 steigt in der Kategorie Programmierung mit 9,2 Punkten auf Platz 5 (#5) – hinter Grok 4.6 auf Platz 4 (#4) und vor Qwen3.8-Max auf Platz 6 (#6) sowie GLM-5.3-Flash auf Platz 7 (#7). Ausschlaggebend sind die Belege: GLM schlägt Qwen in den Artificial-Analysis-Indizes für Intelligence, Coding und agentische Arbeit sowie in Z.ais direkt vergleichbaren Ergebnissen für Terminal-Bench 2.1 und DeepSWE. Wählen Sie es für schwierige, lang laufende Text- und Terminalaufträge, wenn Sie sich API oder Cluster leisten können; wählen Sie Flash, wenn multimodale Eingaben und Kosten wichtiger sind.

05

Häufig gestellte Fragen