Rang #5 Lokale / Private KI — Ihr Gehirn, Ihre Maschine, Ihre Regeln
Z.ai (Zhipu AI)

GLM-5.3

Ein Modell nahe der Leistungsspitze, das man nun endlich besitzen kann – sofern Ihre Vorstellung von einem lokalen Computer ein Rack voller Beschleuniger einschließt. GLM-5.3 bietet hervorragende Intelligenz für private Cluster, 1M Kontext und herunterladbare Gewichte unter einer individuellen Lizenz.

Aktualisiert 29. August 2026 Open WeightsCustom License1M Context
Am besten für

Ein Modell nahe der Leistungsspitze, das man nun endlich besitzen kann – sofern Ihre Vorstellung von einem lokalen Computer ein Rack voller Beschleuniger einschließt. GLM-5.3 bietet hervorragende Intelligenz für private Cluster, 1M Kontext und herunterladbare Gewichte unter einer individuellen Lizenz.

Warum es gewinnt

Mit der Veröffentlichung in FP8 und BF16 am 28. August wurde GLM-5.3 vom Versprechen zum reproduzierbaren Open-Weight-Modell. Artificial Analysis bewertet es mit 60 Punkten bei Intelligence und rund 59 für agentische Arbeit – damit gehört es zu den stärksten gemessenen herunterladbaren Systemen.

Zu beachten

Der FP8-Checkpoint ist ungefähr 756 GB groß, BF16 etwa 1,51 TB; die offiziellen Serving-Rezepte zielen auf Maschinen mit mehreren Beschleunigern der H200-Klasse. Das Modell verarbeitet nur Text, denkt immer und unterliegt statt MIT oder Apache 2.0 einer individuellen MaaS-Klausel.

01

Was es wirklich ist

Das Wort lokal kann zwei sehr unterschiedliche Räume bezeichnen. Im einen steht ein Desktop-PC mit einer einzelnen Grafikkarte. Im anderen befindet sich ein abgeschlossenes Rack voller Beschleuniger, das Ihrem Unternehmen gehört. In beiden Fällen bleiben die Daten unter Ihrer Kontrolle. Die Räume deshalb gleichzusetzen wäre jedoch so, als behaupte man, ein Fahrrad und ein Güterzug ließen sich gleich leicht parken, nur weil keines von beiden ein Flugzeug ist.

GLM-5.3 gehört in den zweiten Raum. Z.ai veröffentlichte die offiziellen Gewichte am 28. August, zwei Wochen nach dem Start der gehosteten Version. Das FP8-Repository umfasst etwa 756 GB, die BF16-Variante rund 1,51 TB. Diese Zahlen beschreiben die Modelldateien, nicht das vollständige laufende System. Für das Serving kommen Puffer, Kommunikationsaufwand und ein KV-Cache hinzu – also der Arbeitsspeicher, der mit zunehmender Länge eines Gesprächs oder Repository-Kontexts wächst.

Die offiziellen Rezepte machen den Maßstab greifbar. Ein FP8-Deployment auf einem einzelnen Server zielt ungefähr auf acht Beschleuniger der H200- oder H20-Klasse, ein vollständiger KV-Speicher für eine Million Token auf acht B200. Für eine gut finanzierte Private Cloud ist das vollkommen „lokal“. Es ist kein Modell, das man am Freitag herunterlädt und am Wochenende beiläufig auf einem Mac mit 256 GB öffnet.

Warum sollte man diesen Aufwand dennoch treiben? Weil die Leistung real ist. Artificial Analysis bewertet GLM-5.3 mit 60 Punkten im Intelligence Index und ungefähr 59 bei agentischer Arbeit. Das Modell kann sich über lange Aufgaben mit Werkzeugeinsatz hinweg orientieren; sein Kontextfenster von einer Million Token bietet privaten Betreibern Platz für große Repositories, umfangreiche Logs oder Dokumentensammlungen. Die Veröffentlichung vom 28. August ermöglicht außerdem die wertvollste Art von Evaluation: dieselbe Hardware, dasselbe Harness, dieselben Werkzeuge – und kein verborgenes Anbieterupdate mitten im Test.

GLM-5.3 ist ungewöhnlich, weil es die Basis von GLM-5.2 hauptsächlich durch Post-Training verbessert. Die Fabrik wurde nicht zu einem größeren Gebäude; die Beschäftigten absolvierten eine anspruchsvollere Ausbildung. Sie übten längere Abläufe, arbeiteten in mehr ausführbaren Umgebungen und erhielten mehr Gelegenheiten zu erkennen, dass ihr erster Plan falsch war. Für Teams, die das Serving von GLM-5.2 bereits kennen, kann diese Abstammung architektonische Überraschungen verringern. Kleiner werden die Gewichtsdateien dadurch nicht.

Für die meisten gewöhnlichen Organisationen ist die Lizenz großzügig, dennoch entspricht sie keinem Standard für Open Source. Sie gewährt weitreichende Rechte zur Nutzung, Veränderung, Feinabstimmung, Bereitstellung, Verbreitung und zum Verkauf. Eine Sonderbedingung greift, wenn ein Lizenznehmer oder verbundenes Unternehmen ein Model-as-a-Service-Geschäft betreibt und der gemeinsame Umsatz in beliebigen zwölf aufeinanderfolgenden Monaten zehn Milliarden US-Dollar übersteigt: Z.ai verlangt dann vor der kommerziellen Nutzung eine Sicherheitsprüfung. Eingebettete Endnutzerprodukte und reine Weiterleitung werden im Text enger definiert. Das ist eine juristische Feinheit, kein Grund zur Panik; die ehrliche Bezeichnung lautet dennoch offene Gewichte unter der GLM-5.3 License.

Neben der Größe gibt es technische Kompromisse. Das Modell verarbeitet ausschließlich Text. Ein privater Engineering-Agent kann Quellcode, Terminalausgaben und Textlogs untersuchen, aber keinen Screenshot und kein Video direkt deuten. Auch das Reasoning lässt sich nicht abschalten. Zur Wahl stehen Low, High und Max Effort; zur Reproduktion der Benchmarks wurde Max verwendet. Langes Nachdenken kann bei schwierigen Aufgaben helfen, einer schlechten Hypothese aber ebenso mehr Zeit und Energie verschaffen.

Deshalb wird GLM-5.3 nicht allein wegen des erschienenen Download-Buttons zur Topempfehlung. Qwen3.8-27B ist dramatisch leichter zu besitzen. GLM-5.3-Flash ist multimodal, MIT-lizenziert und bei offizieller Präzision wesentlich kleiner. Qwen3.8-Flash-Next erreicht mit aggressiven Quantisierungen Systeme mit viel RAM und verwendet deutlich weniger aktive Rechenleistung. DeepSeek bleibt eine weitere fähige Serveroption.

Wählen Sie GLM-5.3, wenn die Frage nicht „Passt das unter meinen Schreibtisch?“ lautet, sondern „Welches ist das stärkste Text- und Agentenmodell, das innerhalb unserer Grenze bleiben kann?“. In dieser engeren und teuren Rolle ist es ausgezeichnet. Die Unterscheidung schützt vor einer verbreiteten KI-Illusion: Ein Modell kann kostenlos herunterzuladen sein und dennoch ein Vermögen kosten, wenn man es besitzen will.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Die Gewichte existieren jetzt: Z.ai veröffentlichte am 28. August offizielle Checkpoints in FP8 und BF16. Privates Deployment, Untersuchung, Fine-Tuning und ein vergleichbarer lokaler Test sind nun möglich.
  • Die unabhängig gemessene Leistung liegt nahe der Spitze: Artificial Analysis setzt GLM-5.3 auf 60 Punkte bei Intelligence und rund 59 im Agentic Index. Damit ist es eine ernsthafte Option für eine private Cloud und nicht bloß eine große herunterladbare Kuriosität.
  • Ein Upgrade auf derselben Basis kann die Migration erleichtern: GLM-5.3 behält die Grundlage von GLM-5.2 und verbessert sich durch Post-Training. Teams, die bereits Modelle dieser Familie betreiben, treffen auf vertraute Architekturkonzepte, auch wenn der tatsächliche Speicherbedarf weiterhin enorm ist.
  • Die Lizenz erlaubt die meiste gewöhnliche kommerzielle Nutzung: Einzelpersonen und die meisten Unternehmen dürfen das Modell nutzen, verändern, feinabstimmen und bereitstellen sowie darauf basierende Produkte verkaufen. Die ungewöhnliche Pflicht zur Sicherheitsprüfung ist eng gefasst, muss aber trotzdem korrekt offengelegt werden.

Ehrliche Einschränkungen

  • Das ist die Rechenzentrumsdefinition von lokal: Rund 756 GB FP8-Dateien oder 1,51 TB BF16-Gewichte müssen geladen werden, noch bevor Laufzeitzustand und KV-Cache hinzukommen. Offizielle Beispiele verwenden Systeme mit mehreren H200-Beschleunigern; für einen vollständigen KV-Speicher über 1M Token sind 8×B200 dokumentiert.
  • Die individuelle Lizenz bietet keine reibungslose Offenheit: Ein MaaS-Unternehmen, dessen verbundene Firmen in zwölf aufeinanderfolgenden Monaten mehr als $10B Umsatz erzielen, muss die Sicherheitsprüfung von Z.ai bestehen. Rechtsabteilungen sollten vor dem Start eines gehosteten Modells den tatsächlichen Text lesen.
  • Das Modell kann nicht sehen: GLM-5.3 nimmt Text entgegen und gibt Text aus. Private Arbeitsabläufe mit Screenshots, gescannten Dokumenten, Diagrammen oder Videos benötigen ein separates Vision-Modell oder das multimodale GLM-5.3-Flash.
  • Unabhängige Breite reproduziert nicht jede Aussage zum Start: Die Gesamtbelege für Intelligence und agentische Arbeit sind stark, doch die meisten detaillierten Coding-, Automatisierungs- und Cyber-Werte stammen weiterhin aus den von Z.ai gewählten Harnesses.
03

Benchmark-Übersicht

Artificial Analysis Intelligence Index — 60

Ein unabhängiger Gesamtindex platziert GLM-5.3 an der Open-Weight-Spitze und nahe bei den besten geschlossenen Systemen, wenn auch weiterhin hinter der stärksten Konfiguration von Opus 5.

Artificial Analysis Agentic Index — rund 59

Die Belege für ausdauernde professionelle Arbeit sind ungewöhnlich stark. Die gerundeten Werte liegen so nah beieinander, dass ein exakter Rang datiert und nicht als dauerhaft behandelt werden sollte.

Offizieller FP8-Checkpoint — rund 756 GB

Für viele Leser ist dies der wichtigste lokale Vergleichswert: Schon die Dateien sprengen eine normale Workstation, bevor Laufzeitspeicher oder Kontextcache berücksichtigt sind.

Terminal-Bench 2.1 — 88,2 beim Anbieter; rund 83,9 unabhängig

Unterschiedliche Harnesses erzeugen deutlich unterschiedliche Resultate. Nutzen Sie diese Spanne zur Planung eines eigenen vergleichbaren Deployment-Tests, statt einen universellen Wert zu versprechen.

GDPval-AA v2 — Spitzengruppe, laufender Elo-Wert

Momentaufnahmen von Ende August verorten GLM-5.3 im mittleren 1700er-Bereich; die Konfidenzintervalle überschneiden sich mit anderen Spitzenkandidaten. Die laufende Rangliste wird mit zunehmender Evidenz neu skaliert.

04

Das Fazit

GLM-5.3 fällt in der Kategorie „Lokale / Private KI“ trotz der nun verfügbaren Downloads auf Platz 5 (#5). Das ist keine Bestrafung für Offenheit, sondern eine ehrliche Bilanz der Menschen, die das Modell tatsächlich nutzen können. Qwen3.8-27B bleibt die praktische Standardempfehlung, GLM-5.3-Flash belegt den Premiumplatz für MIT-lizenzierte Cluster, Qwen3.8-Flash-Next bietet eine effiziente Zwischenstufe für Systeme mit viel RAM, und DeepSeek bleibt eine leichtere Text-und-Code-Option für Server. Wählen Sie das GLM-5.3-Flaggschiff, wenn maximale private Text- und Agentenleistung ein Rack mit mehreren Beschleunigern und eine Prüfung der individuellen Lizenz rechtfertigt. Für fast alle anderen liefern seine kleineren Geschwister mehr brauchbare Privatsphäre pro Kilogramm Hardware.

05

Häufig gestellte Fragen