Stellen Sie sich zwei Tischler vor. Der eine ist der Meister, den man ruft, wenn ein Haus eine neue Treppe braucht und noch niemand die Pläne gezeichnet hat. Der andere ist der verlässliche Handwerker, der in einer Woche vierzig Türen einhängt – und jede davon sitzt im Lot.
Die meiste Arbeit eines Softwareteams besteht aus Türen, nicht aus Treppen: ein fehlschlagender Test, ein Formular, das ein neues Feld braucht, eine API, die ihren Namen geändert hat. Claude Sonnet 5.5 ist für die Türen gebaut.
Anthropic hat es am 28. September 2026 veröffentlicht, als zweites Modell der Claude-5.5-Familie, eine Woche nach Opus 5.5. Es behält den Preis von Sonnet 5 bei: 2 US-Dollar pro Million Eingabe-Token und 10 US-Dollar pro Million Ausgabe-Token – die Hälfte von Opus 5.5. Laut Anthropic läuft es über 30 % schneller als Sonnet 5 und kostet pro Aufgabe bis zu 30 % weniger, weil es mit weniger Schritten ans Ziel kommt.
Die unabhängigen Zahlen
Für Coding-Agenten vertrauen wir am meisten dem Terminal-Bench 4.0: lange, mehrstufige Aufgaben in einer echten Kommandozeile, bei denen das Modell Dinge installieren, ausführen, Fehlermeldungen lesen und es erneut versuchen muss.
Artificial Analysis hat den Test im September 2026 unabhängig durchgeführt. Sonnet 5.5 erreichte 64 %, knapp vor Opus 5.5 und GPT-6 Astra mit je etwa 60 %. Anthropics eigener Lauf liegt höher, bei 70,6 %, aber Hersteller-Testumgebungen schmeicheln meist den eigenen Modellen – die unabhängigen 64 % sind die Zahl, die man sich merken sollte. So oder so ist es ein gewaltiger Sprung gegenüber Sonnet 5, das in Anthropics Tabelle auf 10,3 % kam.
Eine zweite unabhängige Quelle bestätigt das Gesamtbild. Vals AI setzt Sonnet 5.5 mit 69,22 % auf Platz 2 von 66 Modellen seines Index – weniger als einen halben Punkt hinter Opus 5.5, bei etwa zwei Dritteln der Kosten pro Test. Auf zwei Coding-Ranglisten liegt es vorn: Vibe Code Bench (kleine Apps nach einer Beschreibung bauen) mit 92,39 % und Code Migration mit 69,83 %.
Was Anthropics eigene Tests ergänzen
Anthropics Starttabelle liefert die Details:
- FrontierCode v1.1, das fragt, ob eine Code-Änderung ohne menschliches Zutun übernommen werden könnte: 52,1 % auf der Stufe xhigh. Opus 5.5 kommt auf 54,4 %, GPT-6 Sol auf 49,3 %.
- CursorBench 4.0, gebaut aus echten Sitzungen im Editor Cursor: 55,5 %, etwa zwei Punkte hinter Opus 5.5 und weit vor den 34,1 % von Sonnet 5.
Aufschlussreicher sind die Kostendiagramme, die für jedes Modell das Ergebnis gegen die Kosten pro Aufgabe auf jeder Aufwandsstufe auftragen. Zwei Befunde stechen heraus. Auf der Stufe High, dem API-Standard, erreicht Sonnet 5.5 das beste FrontierCode-Ergebnis von GPT-6 Sol für etwa ein Fünftel der Kosten pro Aufgabe. Und auf der Stufe Medium, dem Standard in Claude Code, übertrifft es das beste Terminal-Bench-Ergebnis von Sonnet 5 für weniger als ein Zehntel der Kosten.
Frühe Tester beschreiben dasselbe in einfacheren Worten. Lovable sah ungefähr halb so viele Shell-Befehle pro Aufgabe. Slack maß etwa 14 % weniger Ausgabe-Token als bei Sonnet 5. Unity, wo eine Aufgabe erst dann als erledigt gilt, wenn die Änderung zur Laufzeit tatsächlich funktioniert, berichtet, dass der Großteil der Arbeit von Sonnet 5.5 diese Prüfung bestand.
Der Aufwandsregler – und warum die höchste Stufe nach hinten losgeht
Wie Opus 5.5 hat Sonnet 5.5 einen Aufwandsregler mit fünf Stufen: low, medium, high, xhigh und max. Höhere Stufen lassen das Modell länger nachdenken und seine Arbeit gründlicher prüfen. Man würde erwarten, dass max am besten ist. Bei Sonnet 5.5 ist das oft nicht so.
Artificial Analysis hat die ganze Bandbreite in seinem Intelligence Index gemessen:
| Aufwand | Intelligence Index | Kosten pro Aufgabe |
|---|---|---|
| Low | 36 | 0,41 $ |
| Medium | 41 | 0,59 $ |
| High | 47 | 1,08 $ |
| Xhigh | 52 | 2,74 $ |
| Max | 56 | 7,60 $ |
Der Schritt von xhigh auf max bringt vier Punkte mehr für fast die dreifachen Kosten. Auf max schrieb Sonnet 5.5 etwa 193.000 Ausgabe-Token pro Aufgabe. Das ist der höchste Wert, den Artificial Analysis je gemessen hat: rund 60 % mehr als Opus 5.5 auf max und etwa siebenmal so viel wie GPT-6 Astra.
Schlimmer noch: Mehr Aufwand heißt nicht immer besserer Code. Bei FrontierCode erreicht Sonnet 5.5 52,1 % auf xhigh, aber nur 46,2 % auf max. Anthropic erklärt den Grund in einer Fußnote: Auf max startete das Modell häufiger die Code-Review-Routine von Claude Code, die die Prüfung auf viele Hilfsagenten verteilt. In einigen Fällen lief das in einen Timeout oder führte zu zusätzlichen Änderungen über die Aufgabe hinaus – und FrontierCode bestraft Änderungen, um die niemand gebeten hat.
Die Lehre ist einfach: Behandeln Sie xhigh als Obergrenze. Scheitert eine Aufgabe auch auf xhigh, ist der bessere nächste Schritt meist Opus 5.5, nicht max.
Der ehrliche Haken
Opus bleibt der Architekt. Anthropic sagt es offen: In mehreren Tests kommt Sonnet 5.5 auf max nahe an Opus 5.5 heran, doch in Anthropics eigenen Tests und denen externer Tester bleibt Opus 5.5 bei komplexer, offener Arbeit, die anhaltendes Urteilsvermögen verlangt, klar stärker. Auch bei FrontierCode und CursorBench behält Opus die Führung.
Die Claude-Code-Rechnung halbiert sich nicht. Coding-Agenten lesen Ihr Projekt ständig neu, und diese Lesevorgänge werden als Cache-Lesezugriffe abgerechnet – bei Sonnet 5.5 wie bei Opus 5.5 für 0,20 US-Dollar pro Million Token. Sie sparen bei neuer Eingabe und Ausgabe, aber eine lange, cache-lastige Sitzung spart weniger, als der „halbe Preis“ in der Schlagzeile vermuten lässt.
Sicherheitsarbeit wird umgeleitet. Sonnet 5.5 ist das erste Sonnet-Modell, das mit den Cyber-Schutzmechanismen ausgeliefert wird, die Anthropic bei seinen Spitzenmodellen einsetzt. Gewöhnliches Bugfixing ist nicht betroffen, doch riskantere Sicherheitsaufgaben fallen sichtbar auf Sonnet 5 zurück, sofern Ihr Team nicht über Anthropics Cyber Verification Program freigeschaltet ist.
Der Umstieg kostet etwas Arbeit. Anthropic nennt fünf inkompatible Änderungen gegenüber Sonnet 5. Erzwungene Tool-Nutzung liefert jetzt einen Fehler, nicht standardmäßige Temperature-Werte werden abgelehnt, und Text zwischen Tool-Aufrufen kommt in einem anderen Format zurück. Nichts davon ist schwer zu beheben, aber es ist kein Modelltausch in einer Zeile.
Wo es hinpasst
| Wenn die Aufgabe … ist | Nehmen Sie | Warum |
|---|---|---|
| ein klar umrissener Bug, ein Feature oder eine Migration | Claude Sonnet 5.5 | Schnell und günstig auf Medium oder High |
| offene Architektur oder ein Problem, das noch niemand eingegrenzt hat | Claude Opus 5.5 | Klar stärkeres Urteilsvermögen, laut Anthropic und Testern |
| lange unbeaufsichtigte Terminal-Arbeit zu den geringsten Kosten pro Aufgabe | GPT-6 Astra | Braucht in der Spitze nur einen Bruchteil der Token |
| Frontend-Feinschliff, Folien, kleine visuelle Projekte | Claude Sonnet 5.5 | Gutes Gespür für Design und schnelle Iteration |
Das Fazit
Claude Sonnet 5.5 ist das Modell, das die meisten Entwickler eingeschaltet lassen sollten. Es erledigt die Türen, alle vierzig, schnell und zum halben Tokenpreis des Spitzenmodells. Lassen Sie es auf Medium oder High laufen, nehmen Sie xhigh für die schweren Fälle – und wenn sich der Auftrag als Treppe entpuppt, rufen Sie Opus.