Rang #2 Alltags-Ökosystem — Die führenden KI-Assistenten
OpenAI

GPT-6 Astra

GPT-6 Astra ist OpenAIs neues Flaggschiff für den Teil der Arbeit, der außerhalb des Chatfensters passiert. Es steuert den Browser, klickt sich durch Desktop-Apps, führt mehrstufige berufliche Workflows bis zum Ende aus und prüft seine eigenen Fakten etwa doppelt so gut wie GPT-5.6 Sol — im selben ChatGPT-, Codex- und API-Ökosystem, das Sie bereits kennen.

Aktualisiert 5. September 2026 AgenticChatGPT WorkComputer Use
Am besten für

GPT-6 Astra ist OpenAIs neues Flaggschiff für den Teil der Arbeit, der außerhalb des Chatfensters passiert. Es steuert den Browser, klickt sich durch Desktop-Apps, führt mehrstufige berufliche Workflows bis zum Ende aus und prüft seine eigenen Fakten etwa doppelt so gut wie GPT-5.6 Sol — im selben ChatGPT-, Codex- und API-Ökosystem, das Sie bereits kennen.

Warum es gewinnt

Unabhängige Tests von Artificial Analysis bewerten Astra mit 61,2 im Intelligence Index — statistisch gleichauf mit Sol —, während die Launch-Tabellen 72,6% auf OSWorld 2.0 (Computer Use) in etwa der halben Zeit von Sol zeigen, 59,3% auf Agents' Last Exam, 62,7% auf dem Standard-Harness von ARC-AGI-3 (99,9% nur mit OpenAIs eigenem Adapter), 64,6% auf Terminal-Bench Science und etwa halbierte Halluzinationen bei höherer Genauigkeit. Ab Tag eins verfügbar in ChatGPT, Codex, der API, Azure und Bedrock.

Zu beachten

Das ist ein Spezialisten-Upgrade, kein neuer IQ-Rekord. Unabhängige Wissensarbeits-Scores (GDPval-AA) rutschten unter Sol, Claude Fable 5.1 führt weiterhin die breiten Intelligenz-Komposite an, und der API-Preis liegt beim 2,5-Fachen von Sol bei $10/$50 pro Million Tokens mit $1 pro Cache-Lesezugriff. Astras knappe Antworten verloren bei Rechts-, Finanz- und Präsentationsprüfungen an Boden, und der Rollout am ersten Tag sperrte manche zahlende Nutzer aus.

01

Was es wirklich ist

Jeder Flaggschiff-Launch kommt mit demselben Poster daher: das intelligenteste Modell, das je gebaut wurde. GPT-6 Astras Poster ist anders — und nützlicher. Es sagt: dieses hier übernimmt die Tastatur. Astra ist OpenAIs neues Flaggschiff für Arbeit außerhalb des Chatfensters — einen Browser bedienen, sich durch Desktop-Apps klicken, einen mehrstufigen beruflichen Workflow bis zum Ende tragen — und es prüft dabei seine eigenen Fakten deutlich besser.

Die gemessene Geschichte passt zur Ankündigung. Auf OSWorld 2.0, dem Benchmark für Desktop-Operationen, erzielt Astra 72,6% und ist in rund 40 Minuten fertig, wo GPT-5.6 Sol etwa 75 brauchte; Opus 5 liegt bei 70,2%. Auf Agents’ Last Exam, einer Langstrecken-Evaluation beruflicher Workflows über 55 Felder, erreicht es 59,3%. Und die Faktizitätsverfolgung von Artificial Analysis zeigt die Halluzinationsrate gegenüber Sol etwa halbiert bei höherer Genauigkeit. Weniger selbstbewusste Fehler, schneller erledigte Arbeit: Das ist das Upgrade, das man ab der ersten Woche spürt.

Hier das ehrliche Sternchen. Im Intelligence Index von Artificial Analysis erzielt Astra 61,2 — statistisch gleichauf mit Sols 60,9 —, während Claude Fable 5.1 mit 65,7 führt. Bei GDPval-AA-v2-Wissensarbeit liegt Astra mit rund 1629 hinter Opus 5 (1824) und Fable 5.1 (1853) — und hinter Sol. Wenn Ihr Tag aus Due Diligence, Memos und Urteilen besteht, ist das neue Flaggschiff nicht automatisch das bessere Werkzeug; es ist ein anderes. Und der API-Preis — $10/$50 pro Million Tokens, 2,5x Sol, mit $1 Cache-Lesezugriffen — macht diesen Unterschied unmissverständlich klar.

Die Arbeit routen

Aufgabe Route Warum
„Mach es an meinem Rechner": Browser, Dateien, Desktop-Apps, bis zum Ende erledigt Astra Bestes gemessenes Computer Use, etwa doppelt so schnell pro Aufgabe
Urteilslastige Wissensarbeit, Due Diligence, lange Dokumente Opus 5 Höheres GDPval zu einem Viertel des API-Preises
Das schwerste reine Denken und unübersichtlich langer Kontext Fable 5 / Fable 5.1 Führt die unabhängigen Intelligenz-Komposite
Volumen, Routinentwürfe, das tägliche Fließband Sol / Terra / Luna Weiter verfügbar, weiter die günstigsten Plätze im Haus

Der ehrliche Haken

Astra ist von Natur aus knapp im Ton. Dieser Geschwindigkeits-Stil gewinnt Coding-Evaluationen und verliert Rechts-, Finanz- und Steuer-Rubriken, die das Auflisten jedes Schritts belohnen; die Präsentationspolitur sank gegenüber Sol, obwohl die Analysequalität sprang. Der Rollout am ersten Tag war chaotisch — zahlende Nutzer trafen auf eine Zugriffslotterie, und Enterprise-Konten wurden mit deaktiviertem Astra ausgeliefert. Es gibt keine native Bildgenerierung und keine Audio- oder Videoausgabe. Und die deutlich stärkeren Cyber-Fähigkeiten (100% auf ExploitBench, mit zuvor unbekannten 0-Days, die während der Evaluation auftauchten) kommen mit strengeren Schutzvorkehrungen, die legitime sicherheitsnahe Arbeit verlangsamen können.

Die Gewinnerregel lautet also: Astra für den Fahrersitz, Opus für Urteilskraft, Fable für das harte Denken, Sol fürs Fließband. OpenAI hat kein größeres Gehirn gebaut; OpenAI hat bessere Hände gebaut. Für viel echte Arbeit ist genau das das Upgrade, das zählt.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Computer Use, das zu Ende arbeitet: Astra erreicht 72,6% auf OSWorld 2.0 gegenüber Sols 65,7% und Opus 5s 70,2% und schafft den Aufgabensatz in rund 40 Minuten, wo Sol etwa 75 brauchte. In ChatGPT Work wird daraus ein Agent, der im Browser navigiert, klickt, tippt und Dateien verschiebt, bis die Aufgabe erledigt ist — mit Ihnen als genehmigender Instanz.
  • Etwa die halben Halluzinationen: Die Faktizitätsverfolgung von Artificial Analysis zeigt Astras Halluzinationsrate auf etwa die Hälfte von Sol reduziert, während die Genauigkeit um rund vier Punkte stieg. Für Berufsarbeit sind weniger selbstbewusste Fehler mehr wert als ein weiterer Prüfungspunkt.
  • Ein ernstzunehmender Wissenschaftskollege: Astra erzielt 64,6% auf Terminal-Bench Science — gegen Fable 5.1 mit 52,6% und Sol mit 22,4% — sowie rund 97,6% auf FrontierMath Tier 4. Während der Evaluation entstanden sogar Beweise für zwei der 68 offenen Erdős-Probleme — eine Forschungsanekdote, kein Produktversprechen.
  • Muskeln für neuartige Probleme: Auf dem Standard-Harness von ARC-AGI-3 erreicht Astra 62,7% — rund das Doppelte von Opus 5s 30,2%. Die 99,9%, die Sie vielleicht gesehen haben, erfordern OpenAIs Provider-Adapter mit Compaction; betrachten Sie 62,7% als die ehrliche, vergleichbare Zahl.
  • Ökosystem-Kontinuität: Astra sitzt ab Tag eins in ChatGPT Work, Codex, der Desktop-App und Sites, mit der API-Modell-ID gpt-6-astra, Azure- und Bedrock-Listings, Zero Data Retention für berechtigte API-Arbeit, einem Kontext von rund 1,05 Millionen Tokens und Tag-1-Unterstützung in Tools wie Devin.

Ehrliche Einschränkungen

  • Kein allgemeiner Intelligenzsprung: Artificial Analysis setzt Astra auf 61,2 gegenüber Sols 60,9 — ein Unentschieden —, während Claude Fable 5.1 mit 65,7 führt. Bei GDPval-AA-v2-Wissensarbeit liegt Astra mit rund 1629 hinter Opus 5 (1824) und Fable 5.1 (1853) — und hinter Sol. Wenn Ihr Tag aus Memos, Due Diligence und Urteilskraft besteht, ist Astra nicht automatisch die bessere Wahl.
  • Premium-Ökonomie: Die API kostet $10/$50 pro Million Eingabe-/Ausgabe-Tokens — das 2,5-Fache von Sol — mit $1 pro Cache-Lesezugriff (Fable 5.1 verlangt $0,25), $12,50 pro Cache-Schreibzugriff, verdoppeltem Eingabepreis für Prompts über 272k Tokens und 2x Preis im Fast-Modus. Artificial Analysis errechnet Astra pro Intelligence-Index-Aufgabe etwa 75% teurer als Sol, obwohl es rund 10% weniger Tokens verbraucht.
  • Reibungsverluste bei Stil und Verfügbarkeit: Astra ist knapp im Ton und verpasst deshalb Rubrik-Punkte in Rechts-, Finanz- und Steuerprüfungen; die Präsentationspolitur sank gegenüber Sol, obwohl die Analysequalität sprang. Der Rollout am ersten Tag war chaotisch — Enterprise-Zugang wurde standardmäßig deaktiviert ausgeliefert —, und es gibt keine native Bildgenerierung sowie keine Audio-/Video-Ausgabe. Stärkere Cyber-Schutzvorkehrungen bremsen manche legitime sicherheitsnahe Arbeit, und OpenAIs eigene Tabellen wanderten nach Veröffentlichung leicht — behandeln Sie jede einzelne Zelle als ±1–2 Punkte.
03

Benchmark-Übersicht

OSWorld 2.0 — Astra 72,6% in ~40 Min.

OpenAIs Computer-Use-Tabelle, gegen Sol mit 65,7% (~75 Min.) und Opus 5 mit 70,2%. Gemessen auf einem teilweisen, offline durchgeführten Aufgabensatz — ein starkes Richtungssignal, keine Garantie für Ihre spezifischen Apps.

Artificial Analysis Intelligence Index — 61,2

Unabhängiges Komposit: gleichauf mit GPT-5.6 Sol bei 60,9 und hinter Claude Fable 5.1 bei 65,7. Die ehrliche Schlagzeile lautet „handlungsfähiger (agentischer)“, nicht „klüger“.

AA-Faktizitätsverfolgung — Halluzinationen etwa halbiert

Unabhängige Messung mit rund der halben Halluzinationsrate von Sol bei etwa vier Punkten höherer Genauigkeit — die Zuverlässigkeitsveränderung, die Berufstätige tatsächlich spüren.

ARC-AGI-3 — 62,7% Standard / 99,9% Provider-Adapter

Neuartiges interaktives Problemlösen. 62,7% ist die vergleichbare Standard-Harness-Zahl (Opus 5: 30,2%); 99,9% beinhalten OpenAIs Responses-Harness und Compaction und sollten diese Fußnote immer tragen.

API-Preise — $10/$50 · Cache-Lesen $1 · -Schreiben $12,50

Pro 1M Eingabe-/Ausgabe-Tokens, plus 2x Eingabe / 1,5x Ausgabe für Prompts über 272k Tokens und 2x Fast-Modus. Vergleichen Sie Kosten pro erledigter Aufgabe und Cache-Verhalten, nicht Aufkleberpreise.

04

Das Fazit

GPT-6 Astra übernimmt den Alltagsplatz Nr. 2 von GPT-5.6, weil es der stärkste Computer-Use- und Wissenschaftsagent innerhalb der breitesten Consumer-Plattform ist — ChatGPT Work, Codex, Desktop, Sites und die API. Opus 5 hält Nr. 1 bei Urteilskraft pro Dollar für reine Wissensarbeit, und Fable 5 bleibt der Intelligenzspezialist. Wählen Sie Astra, wenn die Aufgabe heißt „mach es an meinem Rechner und fertig“; wählen Sie Opus 5, wenn das Ergebnis Urteilskraft ist; behalten Sie Sol, Terra und Luna für Volumen-Routing zu den alten Preisen.

05

Häufig gestellte Fragen