Rang #1 Alltags-Ökosystem — Die führenden KI-Assistenten
Anthropic

Claude — Opus 5

Der neue Alltagsführer für KI-Intelligenz: Opus 5 bringt Fable-ähnliches Urteilsvermögen in ein Modell, das Menschen und Unternehmen tatsächlich in großer Menge nutzen können. Es führt frühe unabhängige Tests an, kostet halb so viel wie Fable 5 und ist breit verfügbar.

Aktualisiert 25. Juli 2026 Knowledge Work SOTA1M ContextReasoning
Am besten für

Der neue Alltagsführer für KI-Intelligenz: Opus 5 bringt Fable-ähnliches Urteilsvermögen in ein Modell, das Menschen und Unternehmen tatsächlich in großer Menge nutzen können. Es führt frühe unabhängige Tests an, kostet halb so viel wie Fable 5 und ist breit verfügbar.

Warum es gewinnt

GDPval-AA v2 Elo 1861, ARC-AGI-3 30,2 %, BrowseComp 90,8 %, OSWorld 2.0 70,6 %, AutomationBench 26,0 % und HLE mit Werkzeugen 64,7 %. Artificial Analysis bewertet Max unabhängig mit 61 und Platz #1. 1M Kontext, 128k Ausgabe, 5/25 US-Dollar und keine allgemeine Datenspeicherungspflicht.

Zu beachten

Die Krone ist vorläufig: unabhängige Tests sind jünger als 48 Stunden. Fable gewinnt Spezialtests, GPT-5.6 bleibt das größere Verbraucher-Ökosystem, Claude erzeugt keine Bilder nativ. Max ist langsam und wortreich; Planlimits bleiben relevant.

01

Was es wirklich ist

Viele Chatbots wirken wie ein brillanter Praktikant an einem hektischen Montag: schnell, eifrig und durchaus fähig, eine makellos formatierte Tabelle vorzulegen, deren Gesamtsumme unbemerkt falsch ist. Claude Opus 5 ähnelt eher dem Kollegen, der vor dem Absenden noch einmal die Formeln prüft.

Darum springt es direkt auf Platz #1 im Alltag. Anthropics Tabelle nennt 1861 Elo auf GDPval-AA v2, einem Test nützlicher professioneller Arbeit. Fable 5 erreicht 1747, GPT-5.6 Sol 1736, Opus 4.8 nur 1593. Box berichtet acht Prozent Gesamtverbesserung gegenüber 4.8 und größere Gewinne bei Datenanalyse und Due Diligence. Ein Finanzkunde sah neun Punkte mehr Genauigkeit, weniger Arbeitsschritte und 60 Prozent weniger Zeit. Das sind frühe Kundenangaben, aber sie passen zum gleichen Muster: sorgfältiger arbeiten und seltener im Kreis laufen.

Mehr als eine belesene Schreibmaschine

Opus 5 erzielt 70,6 % auf OSWorld 2.0, wo ein Modell einen Computer tatsächlich bedienen muss. Auf AutomationBench sind es 26,0 %, etwa anderthalbmal der nächste Wert. Zapier berichtet, dass Opus 5 einen vollständigen Ablauf zur Kundenbindung abgeschlossen hat: Es las Daten zum Zustand der Kundenkonten, erkannte abwanderungsgefährdete Kunden, informierte die zuständigen Kundenbetreuer und erstellte eine Zusammenfassung. Frühere Modelle brachten diese gesamte Kette nicht zu Ende.

Besonders seltsam ist 30,2 % auf ARC-AGI-3. Dieser Test verlangt, unbekannte Regeln interaktiv zu entdecken—eher ein neues Brettspiel lernen als eine gespeicherte Tatsache aufsagen. GPT-5.6 Sol kam im selben Vergleich auf 7,8 %. Ein Benchmark ist keine Seele, aber dieser zeigt ungewöhnliche Stärke, sobald die Anleitung nicht mehr die Hand hält.

Artificial Analysis bestätigt die Richtung mit 61 Punkten und Platz eins bei Max. High erreicht 59, xhigh 60. So lässt sich für Vertrag oder Finanzmodell mehr Denkarbeit kaufen und für normale Entwürfe herunterregeln.

Warum vor Fable 5?

Fable bleibt in wenigen Disziplinen knapp besser: HLE ohne Werkzeuge, FrontierCode, maximales CursorBench und ein juristischer Test. Doch Fable kostet 10/50 US-Dollar pro Million Token; Opus 5 kostet 5/25, verlangt im allgemeinen Zugang keine Datenspeicherung und greift mit Klassifikatoren seltener ein. Fable ist der Rennprototyp, Opus 5 der fast gleich schnelle Straßenwagen mit halbem Verbrauch und Zulassung für mehr Straßen.

GPT-5.6 bleibt dennoch ein hervorragendes Gesamtsystem. ChatGPT bündelt Work, Codex, Bildgenerierung, Sites, Apps, Browser und Desktop. Claude kann keine Bilder erzeugen und hat engere Nutzungslimits. Unsere Rangliste sagt: Opus 5 bietet aktuell die beste Mischung aus Urteilsvermögen, professioneller Agency, Preis und Verfügbarkeit—nicht, dass jeder ChatGPT kündigen soll.

Mit 1M Kontext, 128k Ausgabe, Vision, PDFs, Dateien, Memory, Websuche und Computer Use ist die Werkbank groß. Unabhängige Daten sind aber jung, Max kann wortreich sein, und Web Fetch sowie Priority Tier fehlen. Opus 5 ist nicht einfach billiges Fable. Es ist die bessere Alltagsentscheidung.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Wissensarbeit als Hauptgewinn: 1861 Elo auf GDPval-AA v2, vor Fable 5 mit 1747 und GPT-5.6 Sol mit 1736. Frühe Kunden berichten bessere Finanz-, Rechts-, Tabellen- und Due-Diligence-Arbeit.
  • Es handelt statt nur zu antworten: 70,6 % auf OSWorld 2.0 und 26,0 % auf AutomationBench führen den Vergleich bei Computer- und Geschäftsabläufen an.
  • Neue Probleme liegen ihm: 30,2 % auf ARC-AGI-3 sind fast viermal Sols 7,8 %. Artificial Analysis setzt Max mit 61 auch im breiteren Index auf Platz eins.
  • Fable-Qualität ohne Fable-Steuer: 5/25 US-Dollar pro Million Token, halb so viel wie Fable. Dazu keine allgemeine Datenspeicherungspflicht und weniger oft eingreifende Sicherheitsklassifikatoren.
  • Ein ernsthafter Arbeitsplatz: 1M Kontext, 128k Ausgabe, Dokument- und Diagrammverständnis, komplexe Tabellen, Präsentationen, Websuche, Dateien, PDFs, Memory und Computer Use.

Ehrliche Einschränkungen

  • Eine Krone aus der Startwoche: Die meisten Einzelvergleiche stammen von Anthropic. Der unabhängige Index ist wichtig, aber kein ewiges Urteil.
  • ChatGPT ist die größere Plattform: Claude fehlen native Bilder und die vereinte Breite aus Work, Codex, Sites, Plugins, Browser und Desktop.
  • Fable behält Spezialgewinne: Ohne Werkzeuge bei HLE, auf FrontierCode, CursorBench und einem Legal-Agent-Test liegt Fable knapp vorne; Mythos bleibt bei offensivem Cyber und autonomer Biologie stärker.
  • Max ist hungrig: Artificial Analysis misst hohe Wortfülle und xhigh hat spürbare Latenz. Der Preis einer fertigen Aufgabe zählt, nicht nur die Tokenliste.
  • Integrationen brauchen Anpassungen: API Web Fetch und Priority Tier fehlen, Denken startet automatisch, Sampling ist eingeschränkt und Claude-Planlimits können lange Abläufe unterbrechen.
03

Benchmark-Übersicht

GDPval-AA v2 — 1861 Elo (#1)

Vor Fable 5 bei 1747, GPT-5.6 Sol bei 1736 und Opus 4.8 bei 1593 in Anthropics Wissensarbeitsvergleich.

ARC-AGI-3 — 30,2 % (#1)

Interaktive neuartige Problemlösung; fast viermal Sols 7,8 % und weit über Opus 4.8 mit 1,5 %.

OSWorld 2.0 — 70,6 % (#1)

Computerbedienung über Desktop-Anwendungen, vor Fable 5 mit 66,1 % und Sol mit 62,6 %.

AutomationBench — 26,0 % (#1)

End-to-End-Geschäftsabläufe; ungefähr 1,5-mal Fable 5 mit 17,4 %.

Artificial Analysis Intelligence Index — 61 (#1)

Unabhängiger Max-Verbund aus neun Tests; High 59, xhigh 60. Max verbraucht zugleich viele Token.

04

Das Fazit

Claude Opus 5 übernimmt Platz #1 im Alltag, knapp vor GPT-5.6 und klar vor Fable 5. Nicht weil es jede Prüfung gewinnt, sondern weil es Wissensarbeit, neue Probleme, Suche, Computerbedienung und Workflow-Abschluss am besten verbindet—zum halben Fable-Preis und mit weniger Einsatzhürden.

05

Häufig gestellte Fragen