Viele Chatbots wirken wie ein brillanter Praktikant an einem hektischen Montag: schnell, eifrig und durchaus fähig, eine makellos formatierte Tabelle vorzulegen, deren Gesamtsumme unbemerkt falsch ist. Claude Opus 5 ähnelt eher dem Kollegen, der vor dem Absenden noch einmal die Formeln prüft.
Darum springt es direkt auf Platz #1 im Alltag. Anthropics Tabelle nennt 1861 Elo auf GDPval-AA v2, einem Test nützlicher professioneller Arbeit. Fable 5 erreicht 1747, GPT-5.6 Sol 1736, Opus 4.8 nur 1593. Box berichtet acht Prozent Gesamtverbesserung gegenüber 4.8 und größere Gewinne bei Datenanalyse und Due Diligence. Ein Finanzkunde sah neun Punkte mehr Genauigkeit, weniger Arbeitsschritte und 60 Prozent weniger Zeit. Das sind frühe Kundenangaben, aber sie passen zum gleichen Muster: sorgfältiger arbeiten und seltener im Kreis laufen.
Mehr als eine belesene Schreibmaschine
Opus 5 erzielt 70,6 % auf OSWorld 2.0, wo ein Modell einen Computer tatsächlich bedienen muss. Auf AutomationBench sind es 26,0 %, etwa anderthalbmal der nächste Wert. Zapier berichtet, dass Opus 5 einen vollständigen Ablauf zur Kundenbindung abgeschlossen hat: Es las Daten zum Zustand der Kundenkonten, erkannte abwanderungsgefährdete Kunden, informierte die zuständigen Kundenbetreuer und erstellte eine Zusammenfassung. Frühere Modelle brachten diese gesamte Kette nicht zu Ende.
Besonders seltsam ist 30,2 % auf ARC-AGI-3. Dieser Test verlangt, unbekannte Regeln interaktiv zu entdecken—eher ein neues Brettspiel lernen als eine gespeicherte Tatsache aufsagen. GPT-5.6 Sol kam im selben Vergleich auf 7,8 %. Ein Benchmark ist keine Seele, aber dieser zeigt ungewöhnliche Stärke, sobald die Anleitung nicht mehr die Hand hält.
Artificial Analysis bestätigt die Richtung mit 61 Punkten und Platz eins bei Max. High erreicht 59, xhigh 60. So lässt sich für Vertrag oder Finanzmodell mehr Denkarbeit kaufen und für normale Entwürfe herunterregeln.
Warum vor Fable 5?
Fable bleibt in wenigen Disziplinen knapp besser: HLE ohne Werkzeuge, FrontierCode, maximales CursorBench und ein juristischer Test. Doch Fable kostet 10/50 US-Dollar pro Million Token; Opus 5 kostet 5/25, verlangt im allgemeinen Zugang keine Datenspeicherung und greift mit Klassifikatoren seltener ein. Fable ist der Rennprototyp, Opus 5 der fast gleich schnelle Straßenwagen mit halbem Verbrauch und Zulassung für mehr Straßen.
GPT-5.6 bleibt dennoch ein hervorragendes Gesamtsystem. ChatGPT bündelt Work, Codex, Bildgenerierung, Sites, Apps, Browser und Desktop. Claude kann keine Bilder erzeugen und hat engere Nutzungslimits. Unsere Rangliste sagt: Opus 5 bietet aktuell die beste Mischung aus Urteilsvermögen, professioneller Agency, Preis und Verfügbarkeit—nicht, dass jeder ChatGPT kündigen soll.
Mit 1M Kontext, 128k Ausgabe, Vision, PDFs, Dateien, Memory, Websuche und Computer Use ist die Werkbank groß. Unabhängige Daten sind aber jung, Max kann wortreich sein, und Web Fetch sowie Priority Tier fehlen. Opus 5 ist nicht einfach billiges Fable. Es ist die bessere Alltagsentscheidung.