Stellen Sie sich eine Billigfluglinie vor, die ihre Ticketpreise gleich lässt, aber still und leise ein größeres, besseres Flugzeug einsetzt.
Ungefähr das hat xAI mit Grok 4.7 gemacht, veröffentlicht am 21. September 2026. Der Preis hat sich nicht geändert: $2 pro Million Eingabe-Token und $6 pro Million Ausgabe-Token, genau wie bei Grok 4.6. Geändert hat sich das Modell darunter.
Was unter der Haube neu ist
xAI beschreibt drei Änderungen, einfach ausgedrückt:
- Ein größeres Basismodell. Laut xAI baut 4.7 auf einem größeren Fundament auf als 4.6. Eine Parameterzahl nennt die Ankündigung nicht – betrachten Sie konkrete Angaben, die Sie anderswo lesen, daher als unbestätigt.
- Längeres, härteres Training. Das Modell wurde mit bestärkendem Lernen (Reinforcement Learning) auf Aufgaben trainiert, die viele Stunden dauern – genau die Art Arbeit, bei der frühere Modelle auf halber Strecke den Faden verloren.
- Die eigene Arbeit prüfen. xAI hat es gezielt darauf trainiert, seine Antworten zu überprüfen und längere Dokumente zuverlässiger zu verarbeiten.
Das Ergebnis ist ein Modell, das bei einer langen Aufgabe besser am Ball bleibt und seine eigenen Fehler findet, bevor Sie es tun.
Wo es uns überrascht hat
Die interessantesten Zahlen in xAIs Starttabelle sind nicht die zum Programmieren. Sie stammen aus Bereichen, in denen man kein Preis-Leistungs-Modell an der Spitze erwarten würde.
- Juristische Arbeit. Beim Harvey Legal Agent Benchmark, einem Test, wie gut ein KI-Agent echte juristische Aufgaben bewältigt, erreichte Grok 4.7 19,6 %. Das liegt vor Claude Fable 5.1 (6,7 %) und GPT-5.6 Sol (2,5 %). Der Test ist brutal schwer und alle schneiden niedrig ab, aber Grok landete in diesem Vergleich vorn.
- Technische Mathematik. Bei EEBench, das Aufgaben aus der Elektrotechnik prüft, erzielte es 64,0 %, vor Fable 5.1 mit 56,4 %.
- Büroarbeit. Bei AA Briefcase, einem Test mehrstündiger Büroaufgaben wie dem Erstellen von Dokumenten und Präsentationen, erreichte es 1.657, knapp hinter den 1.678 von Fable 5.1 und weit über den 1.546 von Grok 4.6.
Einfach gesagt: Bei echter Büro- und Facharbeit spielt Grok 4.7 jetzt in derselben Liga wie Modelle, die ein Vielfaches kosten.
Sicherer als sein Ruf
Grok gilt als der Chatbot mit weniger Leitplanken. Für 4.7 ist dieser Ruf überholt. xAI hat nach eigenen Worten ein völlig neues Sicherheitssystem gebaut und nennt es sein bislang stärkstes Modell beim Ablehnen gefährlicher Anfragen und beim Widerstand gegen Jailbreaks. Zugleich soll das Modell legitime Arbeit, etwa defensive Sicherheitsforschung, nur selten blockieren.
Grok antwortet weiterhin eher direkt, statt seine Antworten in Warnhinweise zu verpacken. Das ist aber eine Stilfrage, kein Verzicht auf Sicherheit.
Der ehrliche Haken
Es hat die neuesten Konkurrenten noch nicht getroffen. xAIs Tabelle vergleicht Grok 4.7 mit GPT-5.6 Sol und Claude Fable 5.1. Einen Tag nach dem Start brachte Anthropic Claude Opus 5.5 und OpenAI GPT-6 Sol heraus – beides starke, günstig bepreiste Konkurrenten. Bis unabhängige Tests sie nebeneinanderstellen, ist Groks genaue Position unklar.
Lange Terminal-Arbeit bleibt eine Schwäche. Bei Terminal-Bench 4.0, das mehrstündige Arbeit auf der Kommandozeile prüft, erreichte Grok 4.7 37,6 %. Das ist fast das Doppelte von Grok 4.6, aber weit hinter den 57,9 % von Fable 5.1.
Medizin ist nicht seine Stärke. Bei HealthBench Professional, einem Test für klinisches Denken, erzielte es 56,7 % und liegt damit unter GPT-5.6 Sol und Fable 5.1.
Das sind alles Zahlen von xAI. Die Vorsprünge bei Recht und Technik sind spannend, aber wir würden sie gern unabhängig bestätigt sehen.
Für wen es sich eignet
Wenn Sie den ganzen Tag mit KI an Dokumenten, Analysen und technischen Fragen arbeiten und die Monatsrechnung eine Rolle spielt, verdient Grok 4.7 einen ernsthaften Test. Es liefert den Großteil der Qualität der Spitzenmodelle zu einem Bruchteil der Kosten.
Wenn Sie das sorgfältigste Urteil brauchen, das es gibt, nehmen Sie Claude Opus 5.5. Wenn ein Agent Software auf Ihrem Computer bedienen soll, nehmen Sie GPT-6 Astra. Für alles dazwischen ist Grok 4.7 das preiswerteste Modell nahe der Spitze.