Ranking-Guide

Programmierung — KI, die Produktionscode schreibt

Das sind Coding-Agenten, keine Autocomplete-Spielzeuge. GPT-6 Astra holt die #1, untermauert durch Arena.ais Code Arena (1.797 Punkte in WebDev), Terminal- und Computer-Use-Effizienz sowie geringe Kosten pro erledigter Aufgabe; Opus 5 bleibt der auf Verifikation ausgerichtete Experte auf #2. GLM-5.3 und das günstigere multimodale GLM-5.3-Flash erweitern die Auswahl am Open-Weight-Ende.

Die Entscheidung zuerst

Unser Ranking

Beginne mit dem Sieger und vergleiche dann die Abwägungen, die deine Wahl ändern könnten.

#1 Programmierung

GPT-6 Astra

OpenAI

GPT-6 Astra übernimmt die Coding-Krone auf die gleiche ehrliche Art, wie GPT-5.6 sie hielt: indem es agentenförmige Arbeit fertigstellt — Terminal-Sitzungen, scheiternde Pipelines, Incident-Forensik, ganze Desktop-Setups — nun untermauert durch den neuen 1. Platz auf Arena.ais Code Arena (WebDev mit 1.797 Pkt.) und bei rund einem Drittel von Sols Tokens.

Warum es gewinnt

Neuer 1. Platz auf Arena.ais Code Arena: WebDev mit 1.797 Punkten (+35 Punkte Vorsprung vor Claude Fable 5.1 Max bei 1.762, +109 vor Opus 5 Max bei 1.688 und +180 vor Sol auf Rang 13), führend in Data & Analytics, Consumer Product und Content Creation Tools. Gepaart mit Terminal-Bench 4.0 bei 57,7–57,9% (Fable 5.1: 55,8%), tabellenbesten 74,1% auf DeepSWE v1.1, 64,6% auf Terminal-Bench Science, SRE-Bench bei 88% pass@1 / 99,2% pass@4 und 100% auf ExploitBench. Auch wenn Artificial Analysis' eigener Agenten-Harness Fable 5.1 noch knapp vorn sieht (70 gegen 67), definiert Astra die Pareto-Grenze bei gemischten $40/Mtoken neu und verbraucht rund ein Drittel von Sols Tokens.

Der Haken

Selbst mit dem 1. Platz in der Code Arena für WebDev und Produktwerkzeuge hält Fable 5(.1) weiterhin den SWE-Bench-Pro-Rekord und führt im Agenten-Index von Artificial Analysis (70 gegen 67). Der API-Sticker liegt beim 2,5-Fachen von Sol bei $10/$50, Cache-Lesezugriffe kosten das Vierfache von Fable 5.1s $0,25, knappe Antworten überspringen Report-Politur-Schritte, und stärkere Cyber-Schutzvorkehrungen erschweren exploit-nahe Arbeit. Die Launch-Tabellen wanderten nach Veröffentlichung — behandeln Sie jede einzelne Zahl als ±1–2 Punkte.

9.9 Redaktionswertung
Test lesen
Am besten für

GPT-6 Astra übernimmt die Coding-Krone auf die gleiche ehrliche Art, wie GPT-5.6 sie hielt: indem es agentenförmige Arbeit fertigstellt — Terminal-Sitzungen, scheiternde Pipelines, Incident-Forensik, ganze Desktop-Setups — nun untermauert durch den neuen 1. Platz auf Arena.ais Code Arena (WebDev mit 1.797 Pkt.) und bei rund einem Drittel von Sols Tokens.

Warum es gewinnt

Neuer 1. Platz auf Arena.ais Code Arena: WebDev mit 1.797 Punkten (+35 Punkte Vorsprung vor Claude Fable 5.1 Max bei 1.762, +109 vor Opus 5 Max bei 1.688 und +180 vor Sol auf Rang 13), führend in Data & Analytics, Consumer Product und Content Creation Tools. Gepaart mit Terminal-Bench 4.0 bei 57,7–57,9% (Fable 5.1: 55,8%), tabellenbesten 74,1% auf DeepSWE v1.1, 64,6% auf Terminal-Bench Science, SRE-Bench bei 88% pass@1 / 99,2% pass@4 und 100% auf ExploitBench. Auch wenn Artificial Analysis' eigener Agenten-Harness Fable 5.1 noch knapp vorn sieht (70 gegen 67), definiert Astra die Pareto-Grenze bei gemischten $40/Mtoken neu und verbraucht rund ein Drittel von Sols Tokens.

Zu beachten

Selbst mit dem 1. Platz in der Code Arena für WebDev und Produktwerkzeuge hält Fable 5(.1) weiterhin den SWE-Bench-Pro-Rekord und führt im Agenten-Index von Artificial Analysis (70 gegen 67). Der API-Sticker liegt beim 2,5-Fachen von Sol bei $10/$50, Cache-Lesezugriffe kosten das Vierfache von Fable 5.1s $0,25, knappe Antworten überspringen Report-Politur-Schritte, und stärkere Cyber-Schutzvorkehrungen erschweren exploit-nahe Arbeit. Die Launch-Tabellen wanderten nach Veröffentlichung — behandeln Sie jede einzelne Zahl als ±1–2 Punkte.

#2

Claude Opus 5

Anthropic

Der nach aktueller Evidenz führende Frontier-Programmierer mit ungewöhnlich geduldiger Verifikation. Opus 5 bleibt bei uns nur deshalb #2, weil dieser Leitfaden GPT-6 Astra ausdrücklich den Tiebreak für Codex-Integration, Terminal- und Computer-Use-Effizienz sowie Kosten pro erledigter Aufgabe gibt.

9.9 Redaktionswertung
Test lesen
#3

Claude Fable 5.1

Anthropic

Die für agenten-basiertes Codieren verfeinerte Reasoning-Engine der Mythos-Klasse. Gleiche Gewichte wie das eingeschränkte Mythos 5.1, aber optimiert durch einen 75%igen Cache-Rabatt, der die Wirtschaftlichkeit von Langzeit-Engineering revolutioniert. Am besten in Claude Code eingesetzt, wo der AA Coding Agent-Score von 70 das Feld anführt.

9.8 Redaktionswertung
Test lesen
#4

Grok 4.6

xAI

Grok 4.6 ist ein ernstes Coding-Agent-Upgrade: besser bei Repository-Erkundung, langen Implementierungen und visuellen Erstentwürfen, weiterhin für $2/$6 und sofort in Cursor und Grok Build.

9.7 Redaktionswertung
Test lesen
#5

GLM-5.3

Z.ai (Zhipu AI)

Ein schwergewichtiges Open-Weight-Modell für genau den Teil der Softwareentwicklung, der nach der ersten Antwort beginnt: planen, editieren, testen, Rückschläge auffangen und sich auch bei langen Aufträgen in einem Repository nicht verirren.

9.2 Redaktionswertung
Test lesen
#6

Qwen3.8-Max

Alibaba / Qwen Team

Ein äußerst wertvoller Herausforderer für visuelles und kontextreiches Programmieren, der nach unabhängigen Tests, bei denen das Flaggschiff GLM-5.3 die Nase vorn hatte, nun auf Platz 6 rangiert. Sein herunterladbares Max-Tier-Checkpoint-Modell bleibt bemerkenswert, doch 2,4 Billionen Parameter machen das Self-Hosting zu einem echten Rechenzentrumsprojekt.

9.2 Redaktionswertung
Test lesen
#7

GLM-5.3-Flash

Z.ai (Zhipu AI)

Coding- und Agentenarbeit knapp unterhalb der Leistungsspitze zu ungewöhnlich niedrigen Preisen, mit nativer Bildverarbeitung und 1M Kontext. „Flash“ bedeutet hier effizient und günstig – nicht klein und auch nicht besonders schnell.

9.2 Redaktionswertung
Test lesen
Fragen und Antworten

Häufig gestellte Fragen