Die beste Coding-Modell-Frage im September 2026 ist weiterhin nicht „Welches ist am intelligentesten?", sondern: „Welches erledigt diese Art von Job?" GPT-6 Astra antwortet, indem es die Tastatur nimmt: Es lebt im Terminal, steuert Browser und Desktop, wenn das Terminal nicht reicht, und macht weiter nach dem ersten Fehlschlag — bei rund einem Drittel der Tokens, die GPT-5.6 Sol auf demselben Lauf verbrannt hätte.
Die Zahlen aus echter Entwicklerpraxis und synthetischen Tests, ehrlich datiert: In Arena.ais Code Arena holt Astra (Max) den Gesamtsieg mit 1.797 Punkten in WebDev — mit einem entscheidenden Vorsprung von +35 Punkten vor Claude Fable 5.1 Max (1.762 Pkt.) und +109 vor Opus 5 Max (1.688 Pkt.), führt in Data & Analytics, Consumer Product und Content Creation Tools und formt die Pareto-Grenze bei $40/Mtoken gemischt neu. Auf synthetischen Terminal-Benchmarks erzielt Astra 57,7–57,9% auf Terminal-Bench 4.0 (Fable 5.1: 55,8%), tabellenbeste 74,1% auf DeepSWE v1.1, 64,6% auf Terminal-Bench Science und 88% pass@1 / 99,2% pass@4 auf SRE-Bench. Artificial Analysis’ eigener Harness sieht weiterhin Fable 5.1 mit 70 gegen Astras 67 vorn — und AA hat sein Board zu Astras Launch neu skaliert. Die Harness-Wahl bewegt Coding-Scores derzeit stärker als Modell-Generationen.
Das Gegengewicht hat sich nicht bewegt, und wir wedeln es nicht weg. SWE-Bench-Pro-Repo-Auflösung bleibt Claude Fables Geschichte, und Anthropics Claude-Code-Harness ist das natürliche Zuhause für umfassende, langwierige Eingriffe in Repositories. Wenn Ihre Arbeit aussieht wie „löse diesen Issue-Tracker sauber", starten Sie mit Fable. Wenn sie aussieht wie „baue diese Web-App, repariere meinen Build, verfolge diesen Incident, richte die Maschine ein, führe das Experiment aus", starten Sie mit Astra.
Den Job routen
| Aufgabe | Nehmen Sie | Warum |
|---|---|---|
| Webentwicklung, Full-Stack-Tools, Datenanalyse | Astra | Nr. 1 auf Arena.ai Code Arena: WebDev (1.797 Pkt., +35 vor Fable 5.1) |
| Terminal-lastige Untersuchung, sture Migrationen, Incident-Forensik | Astra | Beste Terminal- und SRE-Evidenz, wenigste Tokens pro erledigter Aufgabe |
| Arbeit, die Browser oder Desktop braucht, nicht nur die Shell | Astra | Modernstes Computer Use in einem Coding-Agenten |
| Umfassende Refactorings, Issue-Auflösung im Claude Code | Fable 5 / Fable 5.1 | SWE-Bench Pro und der AA-Harness-Vorsprung |
| Alltägliche Tickets, PR-Review, Tests, Refactorings | Terra / Sol | Der sparsame GPT-Default zu alten Preisen |
| Mechanische Umformungen, Scaffolding, Batch-Checks | Luna | Schnell und günstig, wenn ein Test das Ergebnis prüfen kann |
Die Ökonomie verdient einen ehrlichen Absatz. Der Sticker lautet $10/$50 — 2,5x Sol — und Cache-Lesezugriffe zu $1 sind das Vierfache von Fable 5.1s Satz, was bei langen Agenten-Schleifen zählt. Aber Astra denkt in weniger Tokens: rund ein Drittel von Sols und ein Fünftel von Opus’ bei vergleichbaren Läufen, weshalb unabhängige Tester es immer wieder an der Kosten-/Fähigkeits-Frontier finden — manchmal günstiger pro erledigter Aufgabe als Fable 5. Schicken Sie Ihr eigenes Repository durch beide, bevor Sie einer der beiden Rechnungen glauben.
Der ehrliche Haken: Astras Knappheit überspringt die Politur-Schritte, die Prüfer und benotete Rubriken bemerken; seine Cyber-Fähigkeiten (100% ExploitBench, unbekannte 0-Days in der Evaluation) kommen mit Schutzvorkehrungen, die legitime exploit-nahe Arbeit verlangsamen; und der Day-1-Rollout war rau, mit Enterprise standardmäßig deaktiviert. Die Krone ist echt, die Krone ist knapp, und die Krone ist datiert. Prüfen Sie die Boards in zwei Wochen wieder — wir werden es tun.