Rang #1 Alltags-Ökosystem — Die führenden KI-Assistenten
Anthropic

Claude Opus 5.5

Claude Opus 5.5 ist das Modell, dem wir eine unübersichtliche Aufgabe mit hohem Einsatz anvertrauen würden – im Vertrauen darauf, dass die richtige Antwort zurückkommt. Laut Anthropic erreicht es bei den meisten Aufgaben das Niveau des Premium-Modells Fable 5.1, kostet pro Token aber weniger als die Hälfte. Und es schreibt inzwischen wie eine besonnene Kollegin statt wie ein nervöser Berufseinsteiger.

Aktualisiert 27. September 2026 AA Index 58 #1Knowledge Work SOTAAdaptive Thinking
Am besten für

Claude Opus 5.5 ist das Modell, dem wir eine unübersichtliche Aufgabe mit hohem Einsatz anvertrauen würden – im Vertrauen darauf, dass die richtige Antwort zurückkommt. Laut Anthropic erreicht es bei den meisten Aufgaben das Niveau des Premium-Modells Fable 5.1, kostet pro Token aber weniger als die Hälfte. Und es schreibt inzwischen wie eine besonnene Kollegin statt wie ein nervöser Berufseinsteiger.

Warum es gewinnt

Höchster Wert im unabhängigen Artificial Analysis Intelligence Index zum Start (58, maximaler Aufwand). Führt bei GDPval-AA v2.1, einem Test echter Wissensarbeit, mit 1846 Elo vor Fable 5.1 (1735). Die Token-Preise sanken um 20 % auf $4/$20, das Lesen aus dem Cache um 60 % auf $0,20 – laut Anthropic werden typische Arbeitslasten dadurch rund 40 % günstiger als mit Opus 5. Die Ausgabe ist über 30 % schneller, und die Fünf-Stunden-Nutzungslimits in den bezahlten Tarifen wurden angehoben.

Zu beachten

Bei maximalem Aufwand denkt es sehr ausführlich laut nach: Artificial Analysis maß rund 119.000 Ausgabe-Token pro Aufgabe gegenüber etwa 27.000 bei GPT-6 Astra. Der niedrige Listenpreis zahlt sich also nur aus, wenn Routinearbeit auf der Standardstufe bleibt. Bilder erzeugt Claude nicht, das Nachdenken lässt sich nicht mehr ganz abschalten, und die meisten Cybersicherheitsanfragen werden stillschweigend an das ältere Opus 4.8 weitergereicht.

01

Was es wirklich ist

Die meisten KI-Assistenten verhalten sich wie ein sehr flinker Praktikant. Sie antworten sofort und klingen dabei überzeugt. Gibt man ihnen einen vierzigseitigen Mietvertrag, liefern sie eine ordentliche Zusammenfassung – und übergehen genau die Klausel auf Seite 37, auf die es ankommt.

Claude Opus 5.5 verhält sich eher wie die erfahrene Kollegin, die erst das ganze Dokument liest. Danach sagt sie Ihnen in zwei Sätzen, wo das Problem liegt und wo es steht.

Anthropic hat Opus 5.5 am 22. September 2026 als erstes Modell der Claude-5.5-Familie veröffentlicht. Es übernimmt unseren Platz 1 im Alltags-Ökosystem aus einem einfachen Grund: Es ist das Modell, das in unseren Messungen am sorgfältigsten denkt – und es kostet nicht mehr wie ein Luxusartikel.

Was die unabhängigen Tests sagen

Zwei Zahlen tragen hier das meiste Gewicht, und beide stammen von Artificial Analysis, nicht aus Anthropics Marketing.

Die erste ist der Artificial Analysis Intelligence Index, ein Gesamtwert aus zehn anspruchsvollen Tests zu logischem Denken, Naturwissenschaft, Programmierung und Wissen. Bei maximalem Aufwand erreichte Opus 5.5 im September 2026 58 Punkte. Das war zum Start die Spitze der Rangliste, vor GPT-6 Astra und vor Anthropics eigenem Premium-Modell Claude Fable 5.1. (Der Index wird von Zeit zu Zeit neu skaliert. Ein Wert sagt deshalb nur etwas im Vergleich mit Modellen aus demselben Zeitraum.)

Die zweite ist GDPval-AA v2.1, und sie liegt näher am echten Arbeitsleben. Statt Quizfragen zu beantworten, erstellen die Modelle echte Arbeitsergebnisse – ein Tabellenmodell, ein juristisches Memo, ein Briefing – aus 44 Berufen. Die Ergebnisse werden im direkten Vergleich gegeneinander bewertet, ähnlich wie Schachspieler. Opus 5.5 kam auf 1846 Elo. Fable 5.1 erreichte 1735, Opus 5 1708 und GPT-6 Astra 1542.

Anthropics eigene Tests zeigen in dieselbe Richtung. In einem davon schrieben drei Modelle einen Bericht über die Quartalszahlen eines Unternehmens. Dafür nutzten sie eine Kopie des Webs, in der die Pressemitteilung zu den Zahlen schwer zu finden war, und jede erfundene Zahl oder jedes erfundene Zitat bedeutete: durchgefallen. Opus 5.5 bestand 16 von 18 Mal. Fable 5.1 und Opus 5 bestanden kein einziges Mal. Genau diese Qualität will man von einem Assistenten: nicht nur klug, sondern vorsichtig mit dem, was er behauptet.

Die Preisgeschichte, genau erzählt

Vielleicht haben Sie gelesen, Opus 5.5 sei „40 % günstiger“. Das stimmt – aber es lohnt sich zu verstehen, wie diese Zahl zustande kommt.

  • Die Token-Preise sanken um 20 %: $4 pro Million Eingabe-Token und $20 pro Million Ausgabe-Token, vorher $5 und $25.
  • Das Lesen aus dem Cache wurde um 60 % billiger: auf $0,20 pro Million. Wenn Sie immer wieder Fragen zum selben langen Dokument stellen, liest das Modell es aus einem Zwischenspeicher neu ein. Dieses erneute Lesen macht bei Agenten und Programmierwerkzeugen den größten Teil der Rechnung aus.
  • Auf der Standardstufe verbraucht es weniger Token: Laut Anthropic landen typische Arbeitslasten dadurch rund 40 % unter Opus 5.

Zum Vergleich: Fable 5.1 kostet laut Preisliste $10/$50. Mit Opus 5.5 bekommen Sie den Großteil von Fables Fähigkeiten für 40 % des Token-Preises. Anthropic schreibt sogar, im eigenen Arbeitsalltag sei der Abstand zwischen beiden Modellen „kleiner, als diese Werte vermuten lassen“.

Es schreibt jetzt wie ein Mensch

Eine der häufigsten Beschwerden über Opus 5 war, dass seine Antworten schwer zu verfolgen waren: lang, voller Fachjargon, der entscheidende Punkt versteckt im vierten Absatz. Anthropic sagt, genau daran habe man gearbeitet. Opus 5.5 nennt zuerst das Ergebnis, wählt einfachere Worte und hält sich an die Stilregeln, die Sie ihm geben.

Das klingt nach Kosmetik, ist es aber nicht. Eine Antwort, die Sie in dreißig Sekunden lesen können, können Sie auch überprüfen. Eine brillante Antwort, die Sie erst entschlüsseln müssen, überfliegen Sie – und vertrauen ihr blind.

Der ehrliche Haken

Maximaler Aufwand ist durstig. Auf der höchsten Stufe erkundet Opus 5.5 viele Wege, bevor es antwortet. Artificial Analysis maß bei maximalem Aufwand rund 119.000 Ausgabe-Token pro Aufgabe, bei GPT-6 Astra dagegen etwa 27.000. Bei solchen Mengen garantiert ein niedrigerer Preis pro Token keine niedrigere Rechnung pro Antwort. Die Faustregel ist einfach: Lassen Sie es für die tägliche Arbeit auf der Standardstufe (mittel). Dort schlägt es laut Anthropic bei GDPval bereits Astra auf maximalem Aufwand – für etwa ein Fünftel der Kosten. Drehen Sie es nur hoch, wenn ein Problem wirklich schwierig ist.

Es erzeugt keine Bilder. Claude liest Diagramme, Screenshots und eingescannte PDFs sehr gut, erstellt aber weder Bilder noch Audio oder Video. Wer eine App für alles will, ist mit ChatGPT weiterhin breiter aufgestellt.

Manche Türen sind bewacht. Opus 5.5 ist in Cybersicherheit und Biologie so stark, dass Anthropic zusätzliche Schutzmechanismen einsetzt. Die meisten Sicherheitsaufgaben übernimmt im Hintergrund das ältere Opus 4.8, und manche biologische Forschung erfordert die Teilnahme an Anthropics Verifizierungsprogramm. Die meisten Menschen merken davon nie etwas; Sicherheitsteams schon.

Für wen es sich eignet

Wenn Ihr Tag so aussieht … Greifen Sie zu Warum
Verträge, Recherche, Berichte, Finanzmodelle Claude Opus 5.5 Beste gemessene Wissensarbeit; überprüfbare Antworten
„Bediene diese Software auf meinem Computer und erledige die Aufgabe“ GPT-6 Astra Stärkerer und sparsamerer Agent für die Computerbedienung
Eine App für Chat, Bilder und Sprache ChatGPT Breitestes Angebot für Privatnutzer
Riesige Mengen einfacher Anfragen GPT-6 Luna Bruchteil eines Cents pro Aufgabe

Das Alltagsfazit

Für kurze E-Mails und beiläufige Fragen reicht fast jeder moderne Assistent. Aber wenn die Dokumente unübersichtlich sind, die Frage mehrdeutig ist und eine falsche Antwort Folgen hat, ist Claude Opus 5.5 der Assistent, dem wir am meisten vertrauen – und zum ersten Mal ist dieses Vertrauen nicht mit einem Luxuspreis verbunden.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Der stärkste gemessene Allrounder: Artificial Analysis bewertete Opus 5.5 im September 2026 bei maximalem Aufwand mit 58 Punkten im Intelligence Index – die Spitze der Rangliste zum Start, vor GPT-6 Astra und Claude Fable 5.1.
  • Echte Büroarbeit, nicht nur Prüfungsfragen: Bei GDPval-AA v2.1, das fertige Arbeitsergebnisse aus 44 Berufen bewertet, erreicht es 1846 Elo, gegenüber 1735 für Fable 5.1 und 1708 für Opus 5. In einem Anthropic-Test, in dem jede Zahl auf eine Quelle zurückführbar sein musste, bestanden 16 von 18 seiner Rechercheberichte; Fable 5.1 und Opus 5 bestanden kein einziges Mal.
  • Fable-Ergebnisse zum kleineren Preis: $4 für Eingabe und $20 für Ausgabe pro Million Token sind 40 % dessen, was Fable 5.1 mit $10/$50 verlangt. Das Lesen aus dem Cache – also das wiederholte Einlesen desselben langen Dokuments oder Codes, das bei Agenten den Großteil der Kosten ausmacht – wurde um 60 % billiger, auf $0,20.
  • Leichter zu lesen: Anthropic hat überarbeitet, wie das Modell schreibt. Es nennt zuerst das Ergebnis, verzichtet auf Fachjargon und hält sich an Ihre Stilvorgaben. Frühe Tester bei Ramp und Deloitte hoben genau das hervor – und es zählt: Einen Bericht, den man überfliegen kann, kann man auch überprüfen.
  • Schneller und großzügiger: Die Ausgabe erscheint über 30 % schneller als bei Opus 5, und Anthropic hat die Fünf-Stunden-Limits in den Tarifen Pro, Max, Team und platzbasiertem Enterprise angehoben.

Ehrliche Einschränkungen

  • Maximaler Aufwand wird teuer: Auf der höchsten Stufe verfolgt Opus 5.5 viele Denkwege. Artificial Analysis maß bei maximalem Aufwand etwa 119.000 Ausgabe-Token pro Aufgabe, gegenüber rund 27.000 bei GPT-6 Astra. Ein billigerer Token bedeutet also nicht automatisch eine billigere Antwort. Anthropics eigene Zahlen zeigen: Die Ersparnis liegt auf der Standardstufe (mittel).
  • Keine Bilder, kein Tonstudio: Claude liest Bilder und Diagramme sehr gut, erzeugt aber weder Bilder noch Audio oder Video. Wer ein einziges Abo sucht, das auch zeichnet, ist mit ChatGPT weiterhin breiter aufgestellt.
  • Schutzmechanismen leiten manche Arbeit um: Weil Opus 5.5 in Cybersicherheit und Biologie sehr stark ist, werden die meisten Sicherheitsaufgaben an Opus 4.8 übergeben, und manche Biologiearbeit erfordert Anthropics Verifizierungsprogramm. Sicherheitsfachleute sollten bis zur Freischaltung mit Reibungsverlusten rechnen.
  • Das Nachdenken ist immer an: Die Aufwandsstufe lässt sich senken, das Nachdenken aber nicht mehr vollständig abschalten. Das kostet bei trivialen Anfragen etwas Wartezeit.
03

Benchmark-Übersicht

Artificial Analysis Intelligence Index — 58 (#1 zum Start)

Unabhängiger Gesamtwert bei maximalem Aufwand, gemessen im September 2026. Der höchste Wert der Rangliste zum Start. Artificial Analysis skaliert den Index von Zeit zu Zeit neu – vergleichen Sie ihn daher nur mit Modellen aus demselben Zeitraum.

GDPval-AA v2.1 — 1846 Elo

Reale berufliche Arbeitsergebnisse aus 44 Berufen, ausgewertet von Artificial Analysis. In Anthropics Starttabelle erreicht Fable 5.1 1735, Opus 5 1708 und GPT-6 Astra 1542.

Humanity's Last Exam — 67,7 % mit Werkzeugen

Anthropics Wert zum Start, mit aktivierten Werkzeugen. Fable 5.1 erreicht in derselben Tabelle 65,6 %, GPT-6 Astra 57,2 %. Schwierige fächerübergreifende Fragen, verfasst von Fachleuten.

OSWorld 2.0 — 81,8 % (Teilpunkte)

Anthropics Wert für die Bedienung eines echten Desktops: klicken, tippen, zwischen Apps wechseln. Bewertet mit Teilpunkten und daher nicht direkt mit OpenAIs Zahlen für vollständig erledigte Aufgaben vergleichbar.

Preis — $4 / $20 pro 1 Mio. Token, $0,20 Cache-Lesen

20 % unter Opus 5 bei den Token und 60 % darunter beim Lesen aus dem Cache. Anthropic schätzt die Kosten typischer Arbeitslasten rund 40 % niedriger, weil das Modell auf Standardstufe auch weniger Token verbraucht. Der Fast-Modus kostet $8/$40.

04

Das Fazit

Claude Opus 5.5 übernimmt unseren Platz 1 im Alltags-Ökosystem, weil es drei Dinge verbindet: den besten unabhängigen Intelligenzwert zum Start, das beste Ergebnis bei echter Wissensarbeit und einen Preis, der Urteilsvermögen auf Fable-Niveau endlich alltagstauglich macht. Eine Alles-in-einem-App ist es nicht: ChatGPT zeichnet weiterhin Bilder, und GPT-6 Astra bedient Software weiterhin effizienter. Aber wenn es darum geht, etwas Langes und Unübersichtliches zu lesen, sorgfältig nachzudenken und eine überprüfbare Antwort zu liefern, greifen wir zuerst zu Opus 5.5. Lassen Sie es auf der Standardstufe und heben Sie den maximalen Aufwand für die Probleme auf, die ihn verdienen.

05

Häufig gestellte Fragen