Rang #1 Alltags-Ökosystem — Die führenden KI-Assistenten
Anthropic

Claude — Opus 5

Der neue Alltagsführer für KI-Intelligenz: Opus 5 bringt Fable-ähnliches Urteilsvermögen in ein Modell, das Menschen und Unternehmen tatsächlich in großer Menge nutzen können. Es führt frühe unabhängige Intelligenztests sowie Anthropics Vergleiche für Wissensarbeit und Computerbedienung an, kostet halb so viel wie Fable 5 und ist über Claude, Cloud-Plattformen und die API breit verfügbar.

Aktualisiert 29. August 2026 Knowledge Work SOTA1M ContextReasoning
Am besten für

Der neue Alltagsführer für KI-Intelligenz: Opus 5 bringt Fable-ähnliches Urteilsvermögen in ein Modell, das Menschen und Unternehmen tatsächlich in großer Menge nutzen können. Es führt frühe unabhängige Intelligenztests sowie Anthropics Vergleiche für Wissensarbeit und Computerbedienung an, kostet halb so viel wie Fable 5 und ist über Claude, Cloud-Plattformen und die API breit verfügbar.

Warum es gewinnt

GDPval-AA v2 Elo 1861 zum Start, ARC-AGI-3 30,2%, OSWorld 2.0 70,6% und 64,7% bei Humanity's Last Exam mit Werkzeugen. Artificial Analysis v4.1.1 bewertet Max inzwischen mit etwa 63 und Platz #1 insgesamt. Dazu kommen 1M Kontext, 128k Ausgabe und Preise von $5/$25.

Zu beachten

Fable 5 gewinnt weiterhin einige Spezialtests, GPT-5.6 bleibt das breitere Verbraucher-Ökosystem und Opus 5 erzeugt keine Bilder nativ. Max ist langsam und wortreich, Live-Elo-Werte verändern sich, und Claudes Nutzungsgrenzen in kostenlosen wie bezahlten Tarifen bleiben relevant.

01

Was es wirklich ist

Viele Chatbots wirken wie ein brillanter Praktikant an einem hektischen Montag: schnell, eifrig und durchaus fähig, eine makellos formatierte Tabelle vorzulegen, deren Gesamtsumme unbemerkt falsch ist. Claude Opus 5 ähnelt eher dem Kollegen, der vor dem Absenden noch einmal die Formeln prüft.

Darum springt es direkt auf Platz #1 im Alltag. Anthropics Tabelle nennt 1861 Elo auf GDPval-AA v2, einem Test nützlicher professioneller Arbeit. Fable 5 erreicht 1747, GPT-5.6 Sol 1736, Opus 4.8 nur 1593. Box berichtet acht Prozent Gesamtverbesserung gegenüber 4.8 und größere Gewinne bei Datenanalyse und Due Diligence. Ein Finanzkunde sah neun Punkte mehr Genauigkeit, weniger Arbeitsschritte und 60 Prozent weniger Zeit. Das sind frühe Kundenangaben, aber sie passen zum gleichen Muster: sorgfältiger arbeiten und seltener im Kreis laufen.

Mehr als eine belesene Schreibmaschine

Opus 5 erzielt 70,6 % auf OSWorld 2.0, wo ein Modell einen Computer tatsächlich bedienen muss. Auf AutomationBench sind es 26,0 %, etwa anderthalbmal der nächste Wert. Zapier berichtet, dass Opus 5 einen vollständigen Ablauf zur Kundenbindung abgeschlossen hat: Es las Daten zum Zustand der Kundenkonten, erkannte abwanderungsgefährdete Kunden, informierte die zuständigen Kundenbetreuer und erstellte eine Zusammenfassung. Frühere Modelle brachten diese gesamte Kette nicht zu Ende.

Besonders seltsam ist 30,2 % auf ARC-AGI-3. Dieser Test verlangt, unbekannte Regeln interaktiv zu entdecken—eher ein neues Brettspiel lernen als eine gespeicherte Tatsache aufsagen. GPT-5.6 Sol kam im selben Vergleich auf 7,8 %. Ein Benchmark ist keine Seele, aber dieser zeigt ungewöhnliche Stärke, sobald die Anleitung nicht mehr die Hand hält.

Unabhängige Tests stützen inzwischen mehr als nur die Richtung der Launch-Werte. Artificial Analysis v4.1.1 gibt Opus 5 mit maximalem Aufwand ungefähr 63 Punkte und derzeit Platz eins im Intelligence Index. Die genaue Rangfolge verändert sich mit der Evaluation; deshalb gehören Versionsnummer und Abrufdatum neben den Wert.

Warum vor Fable 5?

Fable bleibt in wenigen Disziplinen knapp besser: HLE ohne Werkzeuge, FrontierCode, maximales CursorBench und ein juristischer Test. Doch Fable kostet 10/50 US-Dollar pro Million Token; Opus 5 kostet 5/25, verlangt im allgemeinen Zugang keine Datenspeicherung und greift mit Klassifikatoren seltener ein. Fable ist der Rennprototyp, Opus 5 der fast gleich schnelle Straßenwagen mit halbem Verbrauch und Zulassung für mehr Straßen. Für die tägliche Arbeit ist der Straßenwagen das nützlichere Fahrzeug.

Warum ChatGPT immer noch in die Diskussion gehört

GPT-5.6 bleibt dennoch ein hervorragendes Gesamtsystem. ChatGPT bündelt Work, Codex, Bildgenerierung, Sites, Apps, Browser und Desktop. Claude kann keine Bilder erzeugen und hat engere Nutzungslimits. Unsere Rangliste sagt: Opus 5 bietet aktuell die beste Mischung aus Urteilsvermögen, professioneller Agency, Preis und Verfügbarkeit—nicht, dass jeder ChatGPT kündigen soll.

Mit 1M Kontext, 128k Ausgabe, Vision, PDFs, Dateien, Memory, Websuche und Computer Use ist die Werkbank groß. Unabhängige Daten sind aber jung, Max kann wortreich sein, und Web Fetch sowie Priority Tier fehlen. Opus 5 ist nicht einfach billiges Fable. Es ist die bessere Alltagsentscheidung.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Wissensarbeit als Hauptgewinn: 1861 Elo auf GDPval-AA v2, vor Fable 5 mit 1747 und GPT-5.6 Sol mit 1736. Frühe Kunden berichten bessere Finanz-, Rechts-, Tabellen- und Due-Diligence-Arbeit.
  • Es handelt statt nur zu antworten: 70,6 % auf OSWorld 2.0 und 26,0 % auf AutomationBench führen den Vergleich bei Computer- und Geschäftsabläufen an.
  • Neue Probleme liegen ihm: 30,2% auf ARC-AGI-3 sind fast viermal Sols 7,8%. Artificial Analysis setzt Max im breiteren Intelligence Index inzwischen mit etwa 63 auf Platz eins.
  • Fable-Qualität ohne Fable-Steuer: 5/25 US-Dollar pro Million Token, halb so viel wie Fable. Dazu keine allgemeine Datenspeicherungspflicht und weniger oft eingreifende Sicherheitsklassifikatoren.
  • Ein ernsthafter Arbeitsplatz: 1M Kontext, 128k Ausgabe, Dokument- und Diagrammverständnis, komplexe Tabellen, Präsentationen, Websuche, Dateien, PDFs, Memory und Computer Use.

Ehrliche Einschränkungen

  • Auch eine Krone braucht ein Datum: Die meisten aufgabenspezifischen Vergleiche stammen von Anthropic, während sich Live-Elo-Werte und Composite-Versionen weiter verändern. Platz eins bei Artificial Analysis ist starke unabhängige Evidenz, aber keine ewige Verfassung.
  • ChatGPT ist die größere Plattform: Claude fehlen native Bilder und die vereinte Breite aus Work, Codex, Sites, Plugins, Browser und Desktop.
  • Fable behält Spezialgewinne: Ohne Werkzeuge bei HLE, auf FrontierCode, CursorBench und einem Legal-Agent-Test liegt Fable knapp vorne; Mythos bleibt bei offensivem Cyber und autonomer Biologie stärker.
  • Max ist hungrig: Artificial Analysis misst hohe Wortfülle und xhigh hat spürbare Latenz. Der Preis einer fertigen Aufgabe zählt, nicht nur die Tokenliste.
  • Integrationen brauchen Anpassungen: API Web Fetch und Priority Tier fehlen, Denken startet automatisch, Sampling ist eingeschränkt und Claude-Planlimits können lange Abläufe unterbrechen.
03

Benchmark-Übersicht

GDPval-AA v2 — 1861 Elo (#1)

Vor Fable 5 bei 1747, GPT-5.6 Sol bei 1736 und Opus 4.8 bei 1593 in Anthropics Wissensarbeitsvergleich.

ARC-AGI-3 — 30,2 % (#1)

Interaktive neuartige Problemlösung; fast viermal Sols 7,8 % und weit über Opus 4.8 mit 1,5 %.

OSWorld 2.0 — 70,6 % (#1)

Computerbedienung über Desktop-Anwendungen, vor Fable 5 mit 66,1 % und Sol mit 62,6 %.

AutomationBench — 26,0 % (#1)

End-to-End-Geschäftsabläufe; ungefähr 1,5-mal Fable 5 mit 17,4 %.

Artificial Analysis Intelligence Index — etwa 63 (#1)

Aktueller unabhängiger Max-Composite aus v4.1.1. Der Launch-Wert 61 ist veraltet; Max verbraucht zugleich viele Token, weshalb die Wahl des Effort-Niveaus zählt.

04

Das Fazit

Claude Opus 5 übernimmt unseren #1-Platz für Alltagsintelligenz, knapp vor GPT-6 Astra und klar vor Fable 5. Nicht weil es jede Prüfung gewinnt, sondern weil es die relevanteste Mischung aus Wissensarbeit, neuartiger Problemlösung, Browsersuche, Computerbedienung und Workflow-Abschluss anführt—zum halben Fable-Preis und mit weniger Einsatzhürden. Wähle ChatGPT, wenn ein riesiges Verbraucher-Ökosystem am wichtigsten ist; wähle Fable nur für eine schmale Spitze, bei der sein kleiner Vorsprung den doppelten Preis rechtfertigt; wähle Opus 5 für unklare, dokumentenlastige Arbeit, die echtes Urteilsvermögen verdient.

05

Häufig gestellte Fragen