Der nützlichste Satz über Coding-Modelle im Juli 2026 lautet nicht „welches ist am klügsten?“, sondern „welches kann diese Art von Job fertigstellen?“ GPT-5.6 erhält den Spitzenplatz, weil Sol ungewöhnlich stark ist, wenn Coding zu Agentenarbeit wird: Terminal-Befehle, Tool-Aufrufe, Fehler, Wiederholungen, Tests und eine Codebase, die sich weigert, ein sauberer Benchmark-Prompt zu sein.
In OpenAIs Release-Tabelle erreicht Sol mit max Reasoning 80 im Artificial Analysis Coding Agent Index, vor Claude Fable 5 mit 77,2. Sol erreicht 88,8% auf Terminal-Bench 2.1, die Parallel-Agenten-Konfiguration Ultra erreicht 91,9%. Auf DeepSWE liegt Sol bei 72,7%. Drei unterschiedliche Signale zeigen in dieselbe Richtung: Bei langer Engineering-Arbeit mit Tools ist dies bislang OpenAIs stärkste Coding-Familie.
Das bedeutet nicht, dass Sol jede Coding-Disziplin gewinnt. Dieselbe Tabelle nennt für Sol 64,6% auf SWE-Bench Pro gegenüber 80,3% für Claude Fable 5. Das ist ein zu großer Abstand, um ihn mit Launch-Konfetti wegzuwischen. Fable bleibt für Repository-Issue-Resolution eine ernsthafte Wahl. Die ehrliche Schlussfolgerung ist enger und nützlicher: GPT-5.6 führt die agentische Workflow-Spur an; Fable hat weiter die bessere veröffentlichte SWE-Bench-Pro-Geschichte.
Route den Job
| Aufgabe | Nutze | Warum |
|---|---|---|
| Mehrstufige Untersuchung, harter Terminal-Workflow, widerspenstige Migration | Sol | Höchste Einzelagenten-Fähigkeit in der Familie |
| Ein großes Projekt mit trennbaren Arbeitssträngen | Sol + ultra | Parallele Agenten können gemeinsam untersuchen und ausführen |
| Tickets, PR-Review, Tests, Refactors, alltägliche Codex-Arbeit | Terra | Ein günstigerer, GPT-5.5-kompetenter Standard |
| Mechanische Transformationen, Scaffolding, Docstrings, Batch-Checks | Luna | Schnell, günstig und ausreichend, wenn ein Test die Ausgabe prüfen kann |
Die neuen Regler lohnen sich. max gibt einem Agenten mehr Zeit zum Denken, Prüfen von Alternativen und Überarbeiten. ultra startet standardmäßig vier Agenten parallel. Das ist für ein Problem mit wirklich mehreren Fronten gedacht—nicht um ein Komitee für ein fehlendes Semikolon einzuberufen.
Für API-Teams ist Programmatic Tool Calling die leisere Verbesserung. GPT-5.6 kann ein kleines Programm im Speicher schreiben und ausführen, um Tools zu koordinieren und Zwischenergebnisse zu verarbeiten. Statt jede Logzeile durch eine weitere teure Modellrunde zu leiten, kann der Agent Relevantes filtern und den nächsten Schritt wählen. Deshalb geht es beim Release um Leistung pro erledigter Aufgabe, nicht nur um eine höhere Benchmark-Zahl.
Die Preise erlauben eine echte Routing-Regel: Sol $5/$30, Terra $2,50/$15, Luna $1/$6 pro Million Eingabe-/Ausgabe-Token. Starte normale Arbeit auf Terra. Eskaliere zu Sol, wenn die Aufgabe bereits bewiesen hat, dass sie das bessere Gehirn verdient. Schicke Volumenarbeit zu Luna. Miss die Gesamtkosten einer gemergten, getesteten Änderung—nicht nur die Kosten der ersten Antwort.
Codex lebt jetzt außerdem in der neuen ChatGPT-Desktop-App, mit Inline-Diff-Editing, PR-Review im Seitenpanel, schnellerem Computer Use und Multi-Repository-Projekten. Das macht das Modell an den Orten nützlicher, an denen Entwickler tatsächlich arbeiten, auch wenn Zugang zu Sol und ultra je nach Tarif und Oberfläche variiert.
Unterm Strich: GPT-5.6 ist eine Coding-Mannschaft, kein einzelnes Heldenmodell. Es nimmt #1, weil es dort führt, wohin modernes Coding geht—zu lang laufenden, tool-nutzenden Agenten—und seine Preisstufen sinnvolles Routing ermöglichen. Behalte nur die SWE-Bench-Einschränkung auf dem Whiteboard und prüfe es auf deinem eigenen Code, bevor die Agenten freie Hand bekommen.