Jeder Flaggschiff-Launch kommt mit demselben Poster daher: das intelligenteste Modell, das je gebaut wurde. GPT-6 Astras Poster ist anders — und nützlicher. Es sagt: dieses hier übernimmt die Tastatur. Astra ist OpenAIs neues Flaggschiff für Arbeit außerhalb des Chatfensters — einen Browser bedienen, sich durch Desktop-Apps klicken, einen mehrstufigen beruflichen Workflow bis zum Ende tragen — und es prüft dabei seine eigenen Fakten deutlich besser.
Die gemessene Geschichte passt zur Ankündigung. Auf OSWorld 2.0, dem Benchmark für Desktop-Operationen, erzielt Astra 72,6% und ist in rund 40 Minuten fertig, wo GPT-5.6 Sol etwa 75 brauchte; Opus 5 liegt bei 70,2%. Auf Agents’ Last Exam, einer Langstrecken-Evaluation beruflicher Workflows über 55 Felder, erreicht es 59,3%. Und die Faktizitätsverfolgung von Artificial Analysis zeigt die Halluzinationsrate gegenüber Sol etwa halbiert bei höherer Genauigkeit. Weniger selbstbewusste Fehler, schneller erledigte Arbeit: Das ist das Upgrade, das man ab der ersten Woche spürt.
Hier das ehrliche Sternchen. Im Intelligence Index von Artificial Analysis erzielt Astra 61,2 — statistisch gleichauf mit Sols 60,9 —, während Claude Fable 5.1 mit 65,7 führt. Bei GDPval-AA-v2-Wissensarbeit liegt Astra mit rund 1629 hinter Opus 5 (1824) und Fable 5.1 (1853) — und hinter Sol. Wenn Ihr Tag aus Due Diligence, Memos und Urteilen besteht, ist das neue Flaggschiff nicht automatisch das bessere Werkzeug; es ist ein anderes. Und der API-Preis — $10/$50 pro Million Tokens, 2,5x Sol, mit $1 Cache-Lesezugriffen — macht diesen Unterschied unmissverständlich klar.
Die Arbeit routen
| Aufgabe | Route | Warum |
|---|---|---|
| „Mach es an meinem Rechner": Browser, Dateien, Desktop-Apps, bis zum Ende erledigt | Astra | Bestes gemessenes Computer Use, etwa doppelt so schnell pro Aufgabe |
| Urteilslastige Wissensarbeit, Due Diligence, lange Dokumente | Opus 5 | Höheres GDPval zu einem Viertel des API-Preises |
| Das schwerste reine Denken und unübersichtlich langer Kontext | Fable 5 / Fable 5.1 | Führt die unabhängigen Intelligenz-Komposite |
| Volumen, Routinentwürfe, das tägliche Fließband | Sol / Terra / Luna | Weiter verfügbar, weiter die günstigsten Plätze im Haus |
Der ehrliche Haken
Astra ist von Natur aus knapp im Ton. Dieser Geschwindigkeits-Stil gewinnt Coding-Evaluationen und verliert Rechts-, Finanz- und Steuer-Rubriken, die das Auflisten jedes Schritts belohnen; die Präsentationspolitur sank gegenüber Sol, obwohl die Analysequalität sprang. Der Rollout am ersten Tag war chaotisch — zahlende Nutzer trafen auf eine Zugriffslotterie, und Enterprise-Konten wurden mit deaktiviertem Astra ausgeliefert. Es gibt keine native Bildgenerierung und keine Audio- oder Videoausgabe. Und die deutlich stärkeren Cyber-Fähigkeiten (100% auf ExploitBench, mit zuvor unbekannten 0-Days, die während der Evaluation auftauchten) kommen mit strengeren Schutzvorkehrungen, die legitime sicherheitsnahe Arbeit verlangsamen können.
Die Gewinnerregel lautet also: Astra für den Fahrersitz, Opus für Urteilskraft, Fable für das harte Denken, Sol fürs Fließband. OpenAI hat kein größeres Gehirn gebaut; OpenAI hat bessere Hände gebaut. Für viel echte Arbeit ist genau das das Upgrade, das zählt.