Rang #7 Programmierung — KI, die Produktionscode schreibt
Z.ai (Zhipu AI)

GLM-5.3-Flash

Coding- und Agentenarbeit knapp unterhalb der Leistungsspitze zu ungewöhnlich niedrigen Preisen, mit nativer Bildverarbeitung und 1M Kontext. „Flash“ bedeutet hier effizient und günstig – nicht klein und auch nicht besonders schnell.

Aktualisiert 29. August 2026 Multimodal CodingOpen WeightsMIT
Am besten für

Coding- und Agentenarbeit knapp unterhalb der Leistungsspitze zu ungewöhnlich niedrigen Preisen, mit nativer Bildverarbeitung und 1M Kontext. „Flash“ bedeutet hier effizient und günstig – nicht klein und auch nicht besonders schnell.

Warum es gewinnt

Artificial Analysis bewertet GLM-5.3-Flash mit einem Intelligence Index von 57 bei Listenpreisen von rund $0.09 pro Indexaufgabe. Terminal-Bench 2.1 liegt bei etwa 84,3; MIT-lizenzierte Gewichte und multimodale Eingaben ermöglichen zudem Coding anhand von Screenshots.

Zu beachten

Bei schwierigen Aufgaben liegt das Modell hinter den stärksten geschlossenen Coding-Modellen und dem GLM-5.3-Flaggschiff. Die API von Z.ai erzeugt etwa 50 Token pro Sekunde, Reasoning ist immer aktiv, Ausgaben können weitschweifig werden, und die meisten detaillierten Werte zum Start stammen aus Anbietertests.

01

Was es wirklich ist

Stellen Sie sich zwei Entwickler vor. Der eine löst das schwierigste Rätsel etwas häufiger. Der andere ist fast ebenso fähig, kann auf den Bildschirm schauen und kostet so viel weniger, dass man ihn den ganzen Nachmittag suchen, testen und überprüfen lassen kann. GLM-5.3-Flash ist der zweite Entwickler. Sein Vorteil ist keine Trophäe für absolute Intelligenz, sondern die Menge nützlicher Arbeit, die sich mit einem Budget dauerhaft finanzieren lässt.

Der Name legt eine falsche Vermutung nahe. Auf der API von Z.ai misst Artificial Analysis ungefähr fünfzig Output-Token pro Sekunde – weniger als beim GLM-5.3-Flaggschiff. „Flash“ beschreibt eine neu gestaltete Effizienz- und Preisstufe. Das Modell umfasst insgesamt 320 Milliarden Parameter, aktiviert für jedes Token aber nur etwa 18 Milliarden. Es kombiniert Sparse Attention und Linear Attention, um die Kosten langer Kontexte zu senken. Ein Restaurant kann jede Mahlzeit mit einer kleinen Mannschaft servieren und trotzdem das gesamte Gebäude benötigen.

Diese Architektur unterstützt ein Kontextfenster von einer Million Token und native multimodale Eingaben. Beim Coding ist Vision keine Dekoration. Ein Modell kann ein fehlerhaftes Layout untersuchen, die Fehlermeldung in einem Screenshot lesen, ein Diagramm mit der erzeugenden Komponente vergleichen oder aus Videoframes den Ablauf einer Benutzeroberfläche erschließen. Das GLM-5.3-Flaggschiff kann dies nicht ohne einen externen Vision-Schritt.

Die unabhängigen Belege sind ermutigend. Artificial Analysis vergibt für Flash im aktuellen Intelligence Index 57 Punkte und misst auf Terminal-Bench 2.1 ungefähr 84,3. Z.ai meldet 63,4 auf DeepSWE, 78,4 auf Toolathlon Verified und 48,8 auf AutomationBench. Diese letzten Zeilen beschreiben echte Arten von Arbeit, stammen aber überwiegend vom Anbieter oder lassen sich nur teilweise prüfen. Eine gute Bewertung verwendet sie als klar beschriftete Hinweise, nicht als Ziegelsteine für ein Siegesdenkmal.

Die wirtschaftliche Seite ist ungewöhnlich transparent. Die Standardpreise der API betragen fünfzehn Cent pro Million Input-Token, drei Cent für gecachten Input und fünfzig Cent pro Million Output-Token. Bis zum 9. September 2026 um 24:00 Uhr UTC+8 halbiert Z.ai diese Preise. Artificial Analysis schätzt zu Listenpreisen ungefähr neun Cent pro Aufgabe des Intelligence Index; Z.ai nennt während der Aktion rund 4,5 Cent. Der Aktionspreis ist vorübergehend, die Leistungsfähigkeit nicht.

Während der kostenlosen Vorschau unter dem Namen Ox Alpha war die Nutzung auf OpenRouter enorm. Das Tokenvolumen ist jedoch keine Zufriedenheitsumfrage. Kostenloser Zugang, Prompts mit einer Million Token und ausführliches Reasoning treiben den Zähler allesamt nach oben. Die faire Schlussfolgerung lautet, dass Entwickler das Modell in bemerkenswertem Umfang ausprobierten und der bezahlte Weg stark begann – nicht, dass Billionen Token beweisen, jeder Nutzer habe es bevorzugt.

Reasoning lässt sich nicht abschalten. Anwendungen wählen Low, High oder Max Effort; zur Reproduktion der Benchmarks wurde Max eingesetzt. Das Modell kann viele Token mit Nachdenken verbringen, und eine hartnäckige falsche Idee kann selbst bei günstigen Stückpreisen zu einer teuren Schleife werden. Setzen Sie Budgets, erkennen Sie wiederholte Werkzeugaufrufe, verlangen Sie Tests und verwenden Sie Low Effort für gewöhnliche Umformungen.

GLM-5.3-Flash ist somit ein Preis-Leistungs-Spezialist mit einer Reichweite knapp unterhalb der Spitze. Stellen Sie es an die Werkbank für Wiederholbares: Repository durchsuchen, Screenshot untersuchen, Routinekorrektur umsetzen, Test ausführen und Ergebnis erklären. Halten Sie ein stärkeres Modell für den seltenen Fall bereit, in dem eine einzige zusätzliche gelöste Aufgabe wichtiger ist als die Kosten hundert gewöhnlicher Aufgaben. Diese Arbeitsteilung ist nützlicher als die Vorstellung, jede Modellveröffentlichung müsse einen König stürzen.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Kosten pro gelöster Aufgabe sind die eigentliche Schlagzeile: Der Listenpreis beträgt $0.15/M Input und $0.50/M Output; bis zum 9. September gilt vorübergehend ein Rabatt von 50 %. Damit werden lange Agentenschleifen so erschwinglich, dass man das Modell als Arbeitskraft statt nur zu besonderen Anlässen einsetzen kann.
  • Vision gehört mitten in die Coding-Schleife: Das Modell kann Screenshots, Diagramme, Dokumente und Videos als Kontext lesen. Frontend- und Supportagenten können dadurch verbinden, was die Oberfläche zeigt, mit dem, was im Repository steht.
  • Unabhängige Tests stützen die Leistung nahe der Spitze: Artificial Analysis vergibt 57 Punkte bei Intelligence und misst unabhängig rund 84,3 auf Terminal-Bench 2.1 – nahe an dem von Z.ai veröffentlichten Ergebnis.
  • MIT-lizenzierte Gewichte verringern Deployment-Hürden: Teams können das Modell unter einer bekannten freizügigen Lizenz untersuchen, verändern, hosten und kommerziell nutzen; als Serving-Wege stehen vLLM, SGLang, TokenSpeed und weitere Optionen bereit.

Ehrliche Einschränkungen

  • Flash ist eine Preisklasse, keine Stoppuhr: Im Test von Artificial Analysis liefert der Z.ai-eigene Endpunkt ungefähr 50 Token pro Sekunde. Schnellere Drittanbieter existieren, doch damit wird die Anbieterwahl Teil des Produkts.
  • Es ist günstiger als das Flaggschiff, nicht besser als das Flaggschiff: GLM-5.3 erzielt höhere Werte bei allgemeiner Intelligenz und schwierigen Tests über lange Zeithorizonte. Flash gewinnt in der Tabelle von Z.ai Toolathlon und einige Automatisierungszeilen, aber nicht den gesamten Vergleich.
  • Reasoning ist verpflichtend und ausführlich: Zur Wahl stehen Low, High und Max Effort, standardmäßig ist Max aktiv. Auch eine Routineänderung kann eine lange interne Suche auslösen; Anwendungen brauchen deshalb Budgets und Schleifenlimits.
  • Die Aussagekraft detaillierter Benchmarks schwankt: DeepSWE, Toolathlon, AutomationBench, HLE mit Werkzeugen und Vision-Werte wurden größtenteils von Z.ai ausgeführt oder sind nur teilweise unabhängig prüfbar. Ordnen Sie jeden Wert seiner Quelle zu, statt die Starttabelle als Konsens zu bezeichnen.
03

Benchmark-Übersicht

Artificial Analysis Intelligence Index — 57

Unabhängige Gesamtmessungen setzen Flash nahe an die Intelligenz der GPT-5.6-Terra-Klasse, aber zu einem Bruchteil der Tokenkosten; hinter Opus 5 und dem GLM-5.3-Flaggschiff bleibt es dennoch zurück.

Terminal-Bench 2.1 — rund 84,3

Eines der stärksten unabhängig gestützten aufgabenspezifischen Signale. Der kleine numerische Vorsprung gegenüber einem separat konfigurierten Flaggschiff-Lauf ist kein Ranking der reinen Modellqualität; Testumgebung und Sampling unterscheiden sich. Version 2.1 darf nicht mit dem erheblich schwierigeren Terminal-Bench 3.0 vermischt werden.

DeepSWE v1.1 — 63,4 (Z.ai-Test)

Ein großer Fortschritt gegenüber GLM-5.2 und ein starker Beleg für Repository-Agenten, im zitierten Vergleich jedoch unter GPT-5.6 Sol und bislang nicht unabhängig reproduziert.

Toolathlon Verified — 78,4 (offizieller Dienst / Z.ai-Bericht)

Flash führt den Vergleich von Z.ai bei dieser Testsuite für realen Werkzeugeinsatz an. Der gemeldete Durchschnitt umfasst drei Durchläufe, ein separates unabhängiges Artefakt wurde jedoch nicht gefunden.

GDPval-AA v2 — Spitzengruppe, laufender Elo-Wert

Momentaufnahmen von Ende August verorten Flash und das GLM-Flaggschiff statistisch überlappend hinter den stärksten Opus-Konfigurationen. Der laufende Elo-Wert sollte immer mit Datum genannt werden.

04

Das Fazit

GLM-5.3-Flash steigt in der Kategorie Programmierung mit 9,2 Punkten auf Platz 7 (#7) ein, direkt hinter dem GLM-5.3-Flaggschiff. Es ist nicht das Modell, das man wegen einer einzigen Tabelle krönen sollte. Es ist das Modell für Deployments, bei denen Tausende nützliche Agentenschritte wichtiger sind als die letzten Punkte einer Prüfung an der Leistungsspitze. Nutzen Sie es für Repository-Suche in großem Umfang, Routinekorrekturen, Frontendarbeit anhand von Screenshots, Werkzeugaufrufe und Verifikationsschleifen. Eskalieren Sie die schwierigsten reinen Textaufgaben an das GLM-5.3-Flaggschiff oder ein führendes geschlossenes Modell – und messen Sie die Geschwindigkeit des jeweiligen Anbieters, bevor Sie versprechen, „Flash“ werde sich schnell anfühlen.

05

Häufig gestellte Fragen