Tout développeur a déjà travaillé à côté de deux types de collègues.
La première est brillante et méticuleuse, et vous fait un exposé d’un quart d’heure à chaque question. Le second se penche simplement sur votre clavier, tape quarante lignes, lance les tests et vous dit : « Essaie ça. »
Dans les gammes d’OpenAI et d’Anthropic, c’est la collègue méticuleuse et coûteuse qui rafle la plupart des titres. Grok 4.7, c’est le rapide, assez bon marché pour qu’on lui pose cent questions par jour.
Sorti le 21 septembre 2026, Grok 4.7 occupe la cinquième place de notre classement Programmation. Son rôle : être le binôme de programmation au meilleur rapport qualité-prix du peloton de tête.
Les progrès qui comptent pour les développeurs
Grok 4.6 était un challenger intéressant. Grok 4.7 marque un net progrès sur tous les tests de programmation publiés par xAI :
- DeepSWE v1.1, des tâches d’ingénierie complexes dans de vraies bases de code : de 65,2 % à 71,0 % (en effort élevé). Dans le tableau de xAI, c’est légèrement devant les 70,0 % de Claude Fable 5.1.
- CursorBench 4.0, des tâches de programmation plus longues dans l’éditeur Cursor : de 40,4 % à 46,3 %.
- Terminal-Bench 4.0, un travail de plusieurs heures en ligne de commande : de 20,3 % à 37,6 %, presque le double.
xAI attribue ces progrès à un modèle de base plus grand, à un entraînement bien plus long sur des tâches qui durent des heures, et à un travail ciblé pour qu’il vérifie ses propres réponses et gère un long contexte. Concrètement, cela signifie moins de modifications à moitié faites et moins d’erreurs affirmées avec aplomb.
L’économie de la programmation dans l’éditeur
Quand vous programmez dans Cursor ou un éditeur similaire, l’IA n’est pas sollicitée une fois par jour, mais en permanence. Elle lit vos fichiers, propose des modifications, explique une erreur, réécrit une fonction, puis recommence.
À 2 $ par million de tokens en entrée et 6 $ par million en sortie, Grok 4.7 a le prix de sortie le plus bas parmi les meilleurs modèles de programmation. Pour comparaison : GPT-6 Sol coûte 10 $, Claude Opus 5.5 20 $ et GPT-6 Astra 50 $. Si vous passez la journée dans l’éditeur, cet écart représente de l’argent bien réel.
Il existe aussi une variante rapide qui produit du texte deux fois plus vite pour deux fois le prix. Elle est utile quand vous attendez chaque réponse.
Là où il ne suffit pas encore
Les longues exécutions sans surveillance. Terminal-Bench 4.0 est le test qui prédit le mieux si l’on peut laisser un agent seul des heures dans un terminal. Les 37,6 % de Grok 4.7 sont un grand progrès, mais GPT-6 Astra et Claude Opus 5.5 obtiennent tous deux 59,6 % dans les tests indépendants, et Fable 5.1 atteint 57,9 % dans le propre tableau de xAI. Pour du travail autonome pendant la nuit, ces modèles se perdent beaucoup moins souvent.
Les meilleurs résultats dans l’éditeur. Sur CursorBench 4.0, Grok est derrière Claude Fable 5.1 (51,8 %) et les 57,8 % annoncés par Anthropic pour Claude Opus 5.5.
Les rivaux les plus récents. xAI compare Grok 4.7 à GPT-5.6 Sol et Fable 5.1. GPT-6 Sol est sorti le lendemain à un prix similaire, et nous n’avons pas encore vu de comparaison directe indépendante. Tous les chiffres de Grok cités ici viennent de xAI.
Le verdict
Pour de longues exécutions d’agents sans surveillance, choisissez GPT-6 Astra. Pour un travail d’architecture en profondeur sur une grosse base de code, choisissez Claude Opus 5.5.
Mais pour les heures que vous passez chaque jour dans votre éditeur à corriger des bugs, écrire des tests et refactoriser des composants, Grok 4.7 est un binôme solide, rapide et très bon marché. Testez-le sur votre propre code face à GPT-6 Sol : l’un des deux deviendra probablement votre outil de tous les jours.