Rang #5 Programmierung — KI, die Produktionscode schreibt
xAI

Grok 4.5

Grok 4.5 nimmt #4 im Coding, weil es frontiernahe Agenten-Schleifen wirtschaftlich normal macht. Kimi K3 liegt nun bei Rohfähigkeit und Frontend-Präferenz davor; Grok Build bleibt jedoch Dritter im Artificial-Analysis-Coding-Agent-Index und arbeitet zu einem Bruchteil der Kosten.

Aktualisiert 10. Juli 2026 Agentic CodingCursorGrok Build
Am besten für

Grok 4.5 nimmt #4 im Coding, weil es frontiernahe Agenten-Schleifen wirtschaftlich normal macht. Kimi K3 liegt nun bei Rohfähigkeit und Frontend-Präferenz davor; Grok Build bleibt jedoch Dritter im Artificial-Analysis-Coding-Agent-Index und arbeitet zu einem Bruchteil der Kosten.

Warum es gewinnt

Artificial Analysis bewertet Grok Build im Coding Agent Index mit 76—Platz drei, auf GPT-5.5-Codex-Niveau—und meldet $2,49 pro Aufgabe gegenüber $5,07 für GPT-5.5 und $11,80 für Fable 5. xAI nennt 83,3% auf Terminal-Bench 2.1, 29,0% auf SWE Marathon, 80 TPS, $2/$6-Preise und 4,2× weniger Output-Token pro SWE-Bench-Pro-Aufgabe als Opus 4.8 max. Grok 4.5 ist in Cursor auf allen Plänen, in Grok Build und über die API verfügbar.

Zu beachten

Die Platzierung auf #4 belohnt Wert und Effizienz, nicht einen Sieg über jeden Rivalen. SWE-Bench Pro und DeepSWE liegen hinter den Spitzenmodellen, und Kimi K3 hat nun den stärkeren Rohfähigkeitsfall. Günstiger Code braucht weiter Tests, Review und Security-Checks.

01

Was es wirklich ist

Einen Coding-Agenten kann man auf zwei Arten kaufen: den klügsten Auftragnehmer der Stadt für jedes Ticket mieten—oder einen sehr guten Ingenieur einstellen, der schnell und günstig genug für einen weiteren Versuch ist, wenn der erste verfehlt. Grok 4.5 ist die zweite Option, und das ist kein schwaches Lob.

Artificial Analysis setzt Grok Build mit 76 auf Platz drei seines Coding Agent Index: gleichauf mit GPT-5.5 in Codex, hinter Fable 5 in Claude Code. Dann kommt die Zahl, die die Kaufentscheidung verändert. Dieselbe Analyse schätzt $2,49 pro Agentenaufgabe für Grok Build, gegenüber $5,07 für GPT-5.5 in Codex und $11,80 für Fable 5 in Claude Code. Grok benötigte dafür deutlich weniger Token.

Deshalb bleibt Grok 4.5 nach dem Einstieg von Kimi K3 ein starker vierter Platz. xAIs eigene Tabelle zeigt es auf Terminal-Bench 2.1 mit 83,3% fast gleichauf mit den Führenden und auf SWE Marathon mit 29,0% pass@1 vor den zitierten Werten. Zudem ist es in Cursor auf allen Plänen verfügbar und Standard in Grok Build. Lange Agentenschleifen, Terminalarbeit, mehrstufiges Debugging und Repository-Erkundung werden damit erschwinglich genug für Wiederholungen.

Was nicht behauptet werden sollte

Grok 4.5 ist nicht der neue Rohscore-Monarch. Seine veröffentlichten 64,7% auf SWE-Bench Pro liegen hinter Fable 5 mit 80,4% und Opus 4.8 mit 69,2%. Auch die DeepSWE-Ergebnisse bleiben hinter Fable und GPT-5.5 zurück. Wenn dein Workflow aus reinem Benchmark-Lösen für Repository-Issues besteht, haben die Modelle darüber weiterhin den schärferen Lebenslauf.

Was man stattdessen tun sollte

Starte Grok 4.5 bei Aufgaben, in denen ein fähiger Agent durch eine weitere Schleife besser wird: Untersuchungen, Terminal-Aufgaben, Refaktorisierungen, Tests und iterative App-Entwicklung. Investiere die Ersparnis in gründliche Verifizierung. Eskaliere erst zu GPT-5.6 oder Fable 5, wenn die Aufgabe bewiesen hat, dass sie deren Obergrenze erfordert.

Das ist die wahre Coding-Geschichte: Grok 4.5 ist nicht der teuerste Hammer. Es ist das sehr gute Elektrowerkzeug, das man sich leisten kann, im Dauerbetrieb laufen zu lassen.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Unabhängiger dritter Platz statt nur Herstellerapplaus: Artificial Analysis setzt Grok Build mit 76 im Coding Agent Index auf Platz drei, auf GPT-5.5-Codex-Niveau und unter Fable 5 in Claude Code. Das ist die richtige Behauptung: ein Top-Praxisagent, kein erfundener Sweep.
  • Der Abstand bei Kosten pro Agentenaufgabe ist riesig: Artificial Analysis meldet $2,49 pro Coding-Agent-Index-Aufgabe für Grok Build, gegenüber $5,07 für GPT-5.5 in Codex und $11,80 für Fable 5 in Claude Code. Es verbrauchte 1,9M Token pro Aufgabe im Vergleich zu 6,2M bzw. 7,2M.
  • Terminal-Arbeit ist wirklich konkurrenzfähig: xAI meldet 83,3% auf Terminal-Bench 2.1—knapp hinter Fable 5 mit 84,3% und GPT-5.5 mit 83,4% im veröffentlichten Vergleich. Für Tools, Shell-Arbeit und Retry-Loops ist das eine sehr brauchbare Nachbarschaft.
  • Schnell und günstig fördert bessere Engineering-Gewohnheiten: xAI liefert Grok 4.5 mit 80 TPS zu $2/$6 pro 1M Eingabe-/Ausgabe-Token. Damit wird ein weiterer Test, eine zweite Implementierung oder eine Agenten-Untersuchung bezahlbar, bevor ein Mensch übernimmt.
  • Cursor und Grok Build geben dem Modell ein echtes Zuhause: Grok 4.5 ist Standard in Grok Build und in Cursor auf allen Plänen verfügbar, zusätzlich zur API. Es hat ein echtes Entwickler-Zuhause, statt erst ein maßgeschneidertes Harness zu erfordern.

Ehrliche Einschränkungen

  • Die Rohbenchmark-Führung liegt anderswo: xAI meldet 64,7% auf SWE-Bench Pro, hinter Fable 5 mit 80,4% und Opus 4.8 mit 69,2% in derselben Tabelle. Wer ausschließlich Repository-Issues löst, sollte diese Führenden nicht verwerfen.
  • DeepSWE ist konkurrenzfähig, nicht dominant: In xAIs Vergleich erreicht Grok 4.5 62,0% auf DeepSWE 1.0 und 53% auf 1.1, jeweils hinter Fable 5 und GPT-5.5. Der Value-Vorteil löscht die Rohscore-Lücke nicht.
  • EU-Teams können den Launch heute noch nicht nutzen: Laut xAI ist Grok 4.5 noch nicht über Produkte oder API-Konsole in der EU verfügbar. Mitte Juli ist ein Plan, keine heutige Verfügbarkeit.
  • Token-Effizienz garantiert keinen korrekten Code: Weniger Schritte und geringere Kosten helfen erst, nachdem die Änderung Tests, Review, Security-Checks und deinen echten Kontext bestanden hat.
  • Es ist ein frischer Release: Nutze private Holdout-Aufgaben, bevor du es standardisierst. Modell, Harness und Kostenkurve ersetzen deine CI nicht.
03

Benchmark-Übersicht

Artificial Analysis Coding Agent Index — 76 (#3)

Unabhängiges Grok-Build-Ergebnis: auf GPT-5.5 in Codex-Niveau und unter Fable 5 in Claude Code.

Coding-Agent-Index-Kosten — $2,49 pro Aufgabe

Artificial Analysis meldet $2,49 für Grok Build gegenüber $5,07 für GPT-5.5 in Codex und $11,80 für Fable 5 in Claude Code.

Terminal-Bench 2.1 — 83,3%

xAIs Vergleich setzt Grok nahe an Fable 5 mit 84,3% und GPT-5.5 mit 83,4% bei Terminal-Agentenarbeit.

SWE Marathon — 29,0% pass@1

xAI meldet Grok vor den zitierten Werten von Opus 4.8 und Fable 5 in dieser Langzeit-Engineering-Evaluation.

SWE-Bench Pro — 64,7%

Das wichtige Gegengewicht: xAIs Diagramm platziert Grok bei Repository-Issue-Resolution unter Fable 5 und Opus 4.8.

04

Das Fazit

Grok 4.5 ist #4, weil das Coding-Leaderboard Fähigkeit und wiederholbare Agentenkosten belohnen sollte. Kimi K3 besitzt nun die stärkeren Roh- und Frontend-Belege; Grok bleibt die schnelle Value-Alternative mit starker Terminal-Arbeit, unabhängigem drittem Agentenplatz, Cursor und geringen Kosten. Nutze K3, Fable 5 oder GPT-5.6 für die höhere Decke; Grok, wenn ein fähiger Agent weiterprobieren soll, ohne das Budget anzuzünden.

05

Häufig gestellte Fragen