Classé #6 Programmation — L'IA qui écrit du code de production
xAI

Grok 4.7

Grok 4.7 est le modèle de programmation sérieux le moins cher près du haut du classement. Pour 2 $ en entrée et 6 $ en sortie par million de tokens, il obtient 71,0 % sur DeepSWE et 46,3 % sur CursorBench 4.0, et il fonctionne nativement dans Cursor et Grok Build. C'est un excellent binôme de programmation au quotidien, mais pas encore l'agent qu'on laisse seul des heures dans un terminal.

Mis à jour 27 septembre 2026 DeepSWE 71.0%CursorBench 46.3%Cursor & Grok Build
9.7sur 10
Site officiel
Idéal pour

Grok 4.7 est le modèle de programmation sérieux le moins cher près du haut du classement. Pour 2 $ en entrée et 6 $ en sortie par million de tokens, il obtient 71,0 % sur DeepSWE et 46,3 % sur CursorBench 4.0, et il fonctionne nativement dans Cursor et Grok Build. C'est un excellent binôme de programmation au quotidien, mais pas encore l'agent qu'on laisse seul des heures dans un terminal.

Pourquoi ça Gagne

Dans le tableau de lancement de xAI : CursorBench 4.0 passe de 40,4 % à 46,3 %, DeepSWE v1.1 de 65,2 % à 71,0 % (effort élevé), et Terminal-Bench 4.0 double presque, de 20,3 % à 37,6 %. Le prix reste à 2 $/6 $, avec une variante rapide deux fois plus véloce pour deux fois le prix. Disponible dans Cursor, Grok Build (essai gratuit), l'API Grok et des outils de programmation tiers.

À surveiller

Sur le travail long et autonome en terminal, il reste nettement derrière les meilleurs : 37,6 % sur Terminal-Bench 4.0, contre 57,9 % pour Claude Fable 5.1 et 59,6 % pour GPT-6 Astra et Claude Opus 5.5 dans les tests indépendants. Sur CursorBench, il est derrière Fable 5.1 (51,8 %). Tous les chiffres de Grok viennent de xAI.

01

Ce que c'est réellement

Tout développeur a déjà travaillé à côté de deux types de collègues.

La première est brillante et méticuleuse, et vous fait un exposé d’un quart d’heure à chaque question. Le second se penche simplement sur votre clavier, tape quarante lignes, lance les tests et vous dit : « Essaie ça. »

Dans les gammes d’OpenAI et d’Anthropic, c’est la collègue méticuleuse et coûteuse qui rafle la plupart des titres. Grok 4.7, c’est le rapide, assez bon marché pour qu’on lui pose cent questions par jour.

Sorti le 21 septembre 2026, Grok 4.7 occupe la cinquième place de notre classement Programmation. Son rôle : être le binôme de programmation au meilleur rapport qualité-prix du peloton de tête.

Les progrès qui comptent pour les développeurs

Grok 4.6 était un challenger intéressant. Grok 4.7 marque un net progrès sur tous les tests de programmation publiés par xAI :

  • DeepSWE v1.1, des tâches d’ingénierie complexes dans de vraies bases de code : de 65,2 % à 71,0 % (en effort élevé). Dans le tableau de xAI, c’est légèrement devant les 70,0 % de Claude Fable 5.1.
  • CursorBench 4.0, des tâches de programmation plus longues dans l’éditeur Cursor : de 40,4 % à 46,3 %.
  • Terminal-Bench 4.0, un travail de plusieurs heures en ligne de commande : de 20,3 % à 37,6 %, presque le double.

xAI attribue ces progrès à un modèle de base plus grand, à un entraînement bien plus long sur des tâches qui durent des heures, et à un travail ciblé pour qu’il vérifie ses propres réponses et gère un long contexte. Concrètement, cela signifie moins de modifications à moitié faites et moins d’erreurs affirmées avec aplomb.

L’économie de la programmation dans l’éditeur

Quand vous programmez dans Cursor ou un éditeur similaire, l’IA n’est pas sollicitée une fois par jour, mais en permanence. Elle lit vos fichiers, propose des modifications, explique une erreur, réécrit une fonction, puis recommence.

À 2 $ par million de tokens en entrée et 6 $ par million en sortie, Grok 4.7 a le prix de sortie le plus bas parmi les meilleurs modèles de programmation. Pour comparaison : GPT-6 Sol coûte 10 $, Claude Opus 5.5 20 $ et GPT-6 Astra 50 $. Si vous passez la journée dans l’éditeur, cet écart représente de l’argent bien réel.

Il existe aussi une variante rapide qui produit du texte deux fois plus vite pour deux fois le prix. Elle est utile quand vous attendez chaque réponse.

Là où il ne suffit pas encore

Les longues exécutions sans surveillance. Terminal-Bench 4.0 est le test qui prédit le mieux si l’on peut laisser un agent seul des heures dans un terminal. Les 37,6 % de Grok 4.7 sont un grand progrès, mais GPT-6 Astra et Claude Opus 5.5 obtiennent tous deux 59,6 % dans les tests indépendants, et Fable 5.1 atteint 57,9 % dans le propre tableau de xAI. Pour du travail autonome pendant la nuit, ces modèles se perdent beaucoup moins souvent.

Les meilleurs résultats dans l’éditeur. Sur CursorBench 4.0, Grok est derrière Claude Fable 5.1 (51,8 %) et les 57,8 % annoncés par Anthropic pour Claude Opus 5.5.

Les rivaux les plus récents. xAI compare Grok 4.7 à GPT-5.6 Sol et Fable 5.1. GPT-6 Sol est sorti le lendemain à un prix similaire, et nous n’avons pas encore vu de comparaison directe indépendante. Tous les chiffres de Grok cités ici viennent de xAI.

Le verdict

Pour de longues exécutions d’agents sans surveillance, choisissez GPT-6 Astra. Pour un travail d’architecture en profondeur sur une grosse base de code, choisissez Claude Opus 5.5.

Mais pour les heures que vous passez chaque jour dans votre éditeur à corriger des bugs, écrire des tests et refactoriser des composants, Grok 4.7 est un binôme solide, rapide et très bon marché. Testez-le sur votre propre code face à GPT-6 Sol : l’un des deux deviendra probablement votre outil de tous les jours.

02

Forces et limites honnêtes

Points Forts

  • Le prix le plus bas près du sommet : 2 $ par million de tokens en entrée et 6 $ par million en sortie. En sortie, c’est moins cher que GPT-6 Sol (10 $), Claude Opus 5.5 (20 $) et GPT-6 Astra (50 $). Dans un éditeur qui appelle le modèle en permanence, la différence s’additionne vite.
  • Une correction de bugs solide sur de vrais projets : sur DeepSWE v1.1, qui évalue des tâches d’ingénierie complexes dans de vraies bases de code, Grok 4.7 obtient 71,0 % en effort élevé, contre 65,2 % pour Grok 4.6. Selon les chiffres de xAI, cela le place légèrement devant Claude Fable 5.1 (70,0 %).
  • Meilleur dans l’éditeur : CursorBench 4.0 mesure des tâches de programmation plus longues dans l’éditeur Cursor. Grok 4.7 est passé de 40,4 % à 46,3 %, et xAI le décrit comme « à la pointe du rapport qualité-prix » sur ce test.
  • Il garde le fil plus longtemps : xAI l’a entraîné sur des tâches qui durent de nombreuses heures et a amélioré sa façon de vérifier son propre travail et de gérer un long contexte. Ce sont précisément les compétences qui empêchent un agent de s’égarer au milieu d’une modification.
  • Disponible là où travaillent les développeurs : intégré à Cursor et Grok Build dès le premier jour, et accessible via l’API Grok, d’autres outils de programmation et des routeurs de modèles. Une variante rapide double la vitesse de sortie pour le travail interactif.

Limites Honnêtes

  • Pas encore prêt pour de longues sessions de terminal sans surveillance : Terminal-Bench 4.0, qui évalue un travail de plusieurs heures en ligne de commande, monte à 37,6 %. C’est un grand bond, mais encore loin des 58 à 60 % environ de Fable 5.1, GPT-6 Astra et Claude Opus 5.5.
  • Derrière les meilleurs sur les tâches d’éditeur : ses 46,3 % sur CursorBench 4.0 restent sous Fable 5.1 (51,8 %) et les 57,8 % annoncés par Anthropic pour Claude Opus 5.5.
  • Comparé aux rivaux du mois dernier : le tableau de xAI oppose Grok 4.7 à GPT-5.6 Sol et Fable 5.1, pas à GPT-6 Sol, sorti le lendemain à un prix similaire.
  • Uniquement des chiffres de l’éditeur : chaque chiffre de Grok cité ici vient de xAI. Nous mettrons l’article à jour dès que des résultats indépendants seront disponibles.
03

Aperçu des Benchmarks

DeepSWE v1.1 — 71,0 % (effort élevé)

Tâches d'ingénierie complexes dans de vraies bases de code. En hausse par rapport aux 65,2 % de Grok 4.6. Le tableau de xAI indique 70,0 % pour Claude Fable 5.1 et 72,7 % pour GPT-5.6 Sol (effort maximal).

CursorBench 4.0 — 46,3 %

Tâches de programmation plus longues dans l'éditeur Cursor. En hausse par rapport à 40,4 % ; dans le même tableau, Claude Fable 5.1 obtient 51,8 % et GPT-5.6 Sol 41,7 %.

Terminal-Bench 4.0 — 37,6 %

Travail de plusieurs heures en ligne de commande. Presque le double des 20,3 % de Grok 4.6, mais loin derrière les 57,9 % de Claude Fable 5.1 dans le tableau de xAI. (La propre exécution d'Anthropic place Fable 5.1 à 55,8 % ; les tests indépendants placent GPT-6 Astra et Claude Opus 5.5 à 59,6 %.)

Prix — 2 $ / 6 $ par million de tokens

Inchangé par rapport à Grok 4.6. La variante rapide double la vitesse de sortie pour un prix doublé.

04

Le Verdict

Grok 4.7 est notre modèle de programmation n° 5 et le meilleur choix si le coût par frappe au clavier est votre priorité. Pour le travail quotidien dans l’éditeur – corriger des bugs, écrire des tests, refactoriser –, c’est un binôme vraiment compétent, au prix de sortie le plus bas du peloton de tête. Sur les longues sessions de terminal sans surveillance, il reste nettement derrière GPT-6 Astra et Claude Opus 5.5. Avant de vous décider, testez-le sur votre propre code face à son concurrent le plus proche en prix, GPT-6 Sol.

05

Foire aux questions