Rang #2 Programmierung — KI, die Produktionscode schreibt
Anthropic

Claude Opus 5.5

Claude Opus 5.5 ist das Programmiermodell für die großen, verworrenen Aufgaben: eine Migration über Hunderttausende Zeilen, ein Fehler, der sich durch fünf Dienste zieht, ein Altsystem, das niemand mehr ganz versteht. In Anthropics eigenen Benchmarks liegt es vor GPT-6 Astra; in unabhängigen Tests liegen beide gleichauf. Platz 2 statt Platz 1 hat es nur, weil Astra dieselbe Terminal-Arbeit mit deutlich weniger Token erledigt.

Aktualisiert 27. September 2026 Agentic CodingTerminal-Bench 4.0FrontierCode 54.4%
Am besten für

Claude Opus 5.5 ist das Programmiermodell für die großen, verworrenen Aufgaben: eine Migration über Hunderttausende Zeilen, ein Fehler, der sich durch fünf Dienste zieht, ein Altsystem, das niemand mehr ganz versteht. In Anthropics eigenen Benchmarks liegt es vor GPT-6 Astra; in unabhängigen Tests liegen beide gleichauf. Platz 2 statt Platz 1 hat es nur, weil Astra dieselbe Terminal-Arbeit mit deutlich weniger Token erledigt.

Warum es gewinnt

Anthropic meldet 66,4 % bei Terminal-Bench 4.0, 54,4 % bei FrontierCode v1.1 und 57,8 % bei CursorBench 4.0 – bei den ersten beiden vor GPT-6 Astra. Unabhängige Tests von Artificial Analysis sehen Opus 5.5 und Astra bei Terminal-Bench 4.0 mit 59,6 % exakt gleichauf. Frühe Tester berichten von einer Migration über 680.000 Zeilen in weniger als einem Tag und einem Audit über 200.000 Zeilen in unter drei Stunden. Token kosten $4/$20, das Lesen aus dem Cache $0,20.

Zu beachten

Bei maximalem Aufwand ist Opus 5.5 wortreich – Artificial Analysis maß pro Aufgabe etwa viermal so viele Ausgabe-Token wie bei GPT-6 Astra. Deshalb behält Astra unseren Platz 1 bei den Kosten pro erledigter Aufgabe. Die meisten Cybersicherheitsaufgaben leiten Anthropics Schutzmechanismen an Opus 4.8 weiter, und intensive Sitzungen können weiterhin an Nutzungslimits stoßen.

01

Was es wirklich ist

Es gibt einen Unterschied zwischen jemandem, der Code schreibt, und jemandem, der ein System versteht.

Die erste Person sieht die Fehlermeldung undefined is not a function, setzt eine if-Prüfung um die Zeile und macht weiter. Der Absturz verschwindet. Drei Tage später bricht etwas anderes zusammen, an einer Stelle, mit der niemand gerechnet hat.

Die zweite Person fragt, warum der Wert undefiniert war. Sie verfolgt ihn durch die Dienste zurück, findet heraus, dass ein Datenbank-Schreibvorgang abgeschlossen war, bevor eine Nachricht bestätigt wurde, und korrigiert die Reihenfolge, sodass der fehlerhafte Zustand gar nicht mehr entstehen kann.

Claude Opus 5.5 gehört eindeutig zur zweiten Sorte. Es erschien am 22. September 2026 und steht auf Platz 2 unserer Programmier-Rangliste – näher an Platz 1 als je ein Modell zuvor.

Worin es gut ist: große, verworrene Aufgaben

Die Berichte von Anthropics frühen Testern folgen alle demselben Muster: große Aufgaben, für die früher ein ganzes Team Wochen brauchte.

  • Ein Tester schloss eine Code-Migration über 680.000 Zeilen in weniger als einem Tag ab.
  • Ein anderer prüfte und reparierte eine Codebasis mit 200.000 Zeilen in unter drei Stunden. Opus 5 brauchte für dieselbe Aufgabe mehr als 20 Stunden und 2,5-mal so viele Token.
  • In einem internen Test schrieben Opus 5.5 und Fable 5.1 beide HAProxy, die weit verbreitete Software zur Lastverteilung von Webverkehr, von C nach Rust um, und beide bestanden fast alle HAProxy-eigenen Tests. Opus 5.5 war nach 9,5 statt 12 Stunden fertig, bei 51 % niedrigeren Kosten.

Das sind Anekdoten des Herstellers, keine unabhängigen Messungen – betrachten Sie sie also als Hinweis auf die Richtung, nicht als Garantie. Aber das Muster ist eindeutig: Je größer und chaotischer die Aufgabe, desto weiter zieht Opus 5.5 davon.

Außerdem erklärt es sich verständlich. Anthropics Ankündigung zeigt, wie es einen Abrechnungsfehler diagnostiziert. Statt einer Wand aus technischen Details beginnt es mit dem Geld: $1,50 des Umsatzrückgangs bei einem Kunden gingen auf eine Preisänderung zurück, die übrigen $9,92 auf einen Fehler in einem bestimmten Commit, der die Nutzung am letzten Tag jedes Monats nicht mehr mitzählte. Wenn ein Agent Ihren Code verändert, halten genau solche Berichte ihn ehrlich.

Die Benchmarks: ein Gleichstand – je nachdem, wer zählt

Hier lohnt es sich, langsamer zu werden, denn Herstellertabellen und unabhängige Tests erzählen leicht unterschiedliche Geschichten.

Anthropics Zahlen (September 2026):

  • Terminal-Bench 4.0 prüft mehrstufige Arbeit in einem Kommandozeilen-Terminal. Opus 5.5 erreichte 66,4 % (±2,6 Punkte), GPT-6 Astra 57,9 % – ein Wert, den OpenAI selbst gemeldet hat.
  • FrontierCode v1.1 prüft, ob Code-Änderungen gut genug zum Übernehmen sind: Opus 5.5 54,4 %, Astra 53,3 %.
  • CursorBench 4.0 umfasst längere Programmieraufgaben im Editor Cursor: Opus 5.5 57,8 %, Fable 5.1 51,8 %.

Unabhängige Zahlen: Artificial Analysis hat Terminal-Bench 4.0 selbst durchgeführt und 59,6 % für Opus 5.5 wie für Astra gemessen. Ein exakter Gleichstand.

Unsere Regel lautet: Unabhängige Messungen zählen mehr als Herstellertabellen. Bei der reinen Fähigkeit steht es damit unentschieden. Also entscheidet etwas anderes über die Rangfolge.

Warum GPT-6 Astra Platz 1 behält

Wenn zwei Modelle gleich gut sind, ordnen wir sie danach, was Sie eine erledigte Aufgabe kostet.

Hier hat Astra einen klaren Vorteil. Bei maximalem Aufwand maß Artificial Analysis für Opus 5.5 rund 119.000 Ausgabe-Token pro Aufgabe, für Astra etwa 27.000. Die Token von Opus sind billiger ($20 pro Million Ausgabe-Token gegenüber $50 bei Astra), aber es braucht etwa viermal so viele. Rechnet man das durch, kostet eine durchschnittliche Astra-Aufgabe bei Höchstleistung ungefähr die Hälfte.

Anthropic hält ein berechtigtes Argument dagegen. Auf der Standardstufe erreiche Opus 5.5 bei Terminal-Bench dasselbe wie Astra für etwa 40 % der Kosten und schlage es bei FrontierCode für etwa 20 % der Kosten. Bestätigen unabhängige Tests das, ändert sich die Rangfolge. Bis dahin ist es eine Herstellerangabe, und wir warten auf unabhängige Daten, bevor wir ein Modell nach oben setzen.

Die ehrlichen Einschränkungen

  • Heben Sie den maximalen Aufwand für schwierige Probleme auf. Bleibt Opus 5.5 bei Routinekorrekturen auf maximaler Stufe, schreibt es lange Denkprotokolle, die Sie bezahlen.
  • Sicherheitsarbeit wird umgeleitet. Opus 5.5 ist in Cybersicherheit so stark, dass Anthropic die meisten Sicherheitsaufgaben an Opus 4.8 weitergibt, sofern Sie nicht am Cyber Verification Program teilnehmen. Normale Fehlerbehebung ist nicht betroffen.
  • Lange Sitzungen stoßen weiter an Grenzen. Anthropic hat die Fünf-Stunden-Limits in den bezahlten Tarifen angehoben, aber ein mehrstündiger Agentenlauf über ein großes Repository kann trotzdem daran stoßen.

Wen Sie einstellen sollten

Nehmen Sie GPT-6 Astra, wenn Sie eine Warteschlange klar umrissener Tickets haben und diese so günstig wie möglich erledigt sehen wollen.

Nehmen Sie Claude Opus 5.5, wenn die Arbeit groß, mehrdeutig oder riskant ist: eine Framework-Migration, ein tiefes Audit oder ein Fehler, der über Dienstgrenzen hinweg auftritt. Bei solchen Aufgaben ist sorgfältiges Denken mehr wert als knappe Ausgaben. Es ist der Entwickler, dem wir das System anvertrauen würden, das sonst niemand anfassen will.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Gebaut für die großen Aufgaben: Anthropics Tester erledigten damit eine Code-Migration über 680.000 Zeilen in weniger als einem Tag und ein Audit über 200.000 Zeilen in unter drei Stunden – Opus 5 brauchte dafür über 20 Stunden und 2,5-mal so viele Token. Je größer und unübersichtlicher die Arbeit, desto deutlicher der Vorsprung.
  • Findet den eigentlichen Fehler: Es verfolgt einen Absturz bis zu seinem Ursprung zurück, statt das Symptom in ein try/catch zu packen. In Anthropics Beispiel erklärte es einen Abrechnungsfehler in klarer Sprache: was kaputtging, welcher Commit es verursachte und wie viel Geld verloren ging.
  • Merge-reife Änderungen: FrontierCode v1.1 prüft, ob die Code-Änderungen eines Modells gut genug sind, um in echte Projekte übernommen zu werden. Opus 5.5 erreicht in Anthropics Tabelle 54,4 %, knapp vor GPT-6 Astra mit 53,3 %.
  • Berichte, die man wirklich lesen kann: Anthropic hat neu trainiert, wie das Modell schreibt. Erklärungen beginnen mit der Schlussfolgerung und verzichten auf Jargon – das macht die Durchsicht der Arbeit eines Agenten deutlich schneller.
  • Schwerer hereinzulegen: Laut Anthropic teilt sich Opus 5.5 mit Fable 5.1 die niedrigste Erfolgsquote für Prompt-Injection-Angriffe in den Tests von Gray Swan, und es greift deutlich seltener als frühere Modelle zu schwer umkehrbaren Aktionen. Das zählt, wenn ein Agent unbeaufsichtigt in Ihrem Repository arbeitet.

Ehrliche Einschränkungen

  • Wortreich bei maximalem Aufwand: Artificial Analysis maß bei maximalem Aufwand etwa 119.000 Ausgabe-Token pro Aufgabe, bei GPT-6 Astra dagegen rund 27.000. Bei gleicher Spitzenleistung ist Astra damit trotz höheren Listenpreises das günstigere Modell pro erledigter Aufgabe.
  • Herstellerzahlen dominieren noch: Der Spitzenwert von 66,4 % bei Terminal-Bench stammt aus Anthropics eigenem Durchlauf (Standardfehler ±2,6 Punkte), und Astras Vergleichswert von 57,9 % kommt von OpenAI. Der unabhängige Durchlauf von Artificial Analysis zeigt einen Gleichstand, keinen Vorsprung.
  • Sicherheitsarbeit wird umgeleitet: Weil Opus 5.5 in Cybersicherheit sehr leistungsfähig ist, gehen die meisten Sicherheitsaufgaben an Opus 4.8, sofern Sie nicht an Anthropics Cyber Verification Program teilnehmen. Gewöhnliche Fehlerbehebung ist davon nicht betroffen.
  • Nutzungslimits bei langen Sitzungen: Anthropic hat die Fünf-Stunden-Limits in den bezahlten Tarifen angehoben, doch mehrstündige Agentenläufe über große Codebasen können trotzdem daran stoßen.
03

Benchmark-Übersicht

Terminal-Bench 4.0 — 59,6 % unabhängig gleichauf mit Astra (66,4 % laut Hersteller)

Komplexe mehrstufige Aufgaben in einem Kommandozeilen-Terminal. Artificial Analysis maß Opus 5.5 und GPT-6 Astra (xhigh) mit je 59,6 %. In Anthropics eigenem Durchlauf erreicht Opus 5.5 66,4 % (±2,6), Astra laut OpenAI 57,9 %.

FrontierCode v1.1 — 54,4 %

Ob Code-Änderungen reif sind, um in echte Codebasen übernommen zu werden. Anthropics Starttabelle: Opus 5.5 54,4 %, GPT-6 Astra 53,3 %, Fable 5.1 50,3 %, Opus 5 48,0 %.

CursorBench 4.0 — 57,8 %

Länger laufende Programmieraufgaben im Editor Cursor. Anthropic meldet 57,8 % gegenüber 51,8 % für Fable 5.1 und 41,7 % für GPT-5.6 Sol.

Ausgabe-Token pro Aufgabe — ~119k bei maximalem Aufwand

Messung von Artificial Analysis bei maximalem Aufwand, gegenüber ~27k bei GPT-6 Astra. Das ist der Grund, warum Astra unseren Platz 1 behält: dieselbe Spitzenleistung für etwa die Hälfte der Kosten pro Aufgabe.

Preis — $4 / $20 pro 1 Mio. Token, $0,20 Cache-Lesen

Das Lesen aus dem Cache, das die Rechnungen von Coding-Agenten dominiert, wurde gegenüber Opus 5 um 60 % billiger. Der Fast-Modus (bis zu 2,5-fache Geschwindigkeit) kostet $8/$40.

04

Das Fazit

Claude Opus 5.5 ist unser Programmiermodell auf Platz 2 – und der Abstand zu Platz 1 war noch nie so klein. Im unabhängigen Terminal-Bench-Test liegt es gleichauf mit GPT-6 Astra; in Anthropics eigenen Durchläufen von FrontierCode und Terminal-Bench liegt es vorn. Astra bleibt aus einem offen benannten Grund an der Spitze: Bei Höchstleistung erledigt es dieselbe Arbeit mit etwa einem Viertel der Ausgabe-Token, jede abgeschlossene Aufgabe kostet also weniger. Geht es um eine ausufernde Migration, ein tiefes Audit oder einen Fehler, den sonst niemand findet, würden wir Opus 5.5 die Arbeit anvertrauen – und auf der Standardstufe ist es günstiger denn je.

05

Häufig gestellte Fragen