Classé #5 Programmation — L'IA qui écrit du code de production
xAI

Grok 4.5

Grok 4.5 prend la 4e place en rendant économiquement normales les boucles d'agents frontier. Kimi K3 le dépasse désormais en capacité brute et en préférence frontend, mais Grok Build reste troisième sur l'indice des agents de codage et coûte une fraction par tâche.

Mis à jour 10 juillet 2026 Agentic CodingCursorGrok Build
9.7sur 10
Site officiel
Idéal pour

Grok 4.5 prend la 4e place en rendant économiquement normales les boucles d'agents frontier. Kimi K3 le dépasse désormais en capacité brute et en préférence frontend, mais Grok Build reste troisième sur l'indice des agents de codage et coûte une fraction par tâche.

Pourquoi ça Gagne

Artificial Analysis accorde à Grok Build la note de 76 sur son indice des agents de codage—troisième, à égalité avec GPT-5.5 dans Codex—et rapporte un coût de 2,49$ par tâche contre 5,07$ pour GPT-5.5 et 11,80$ pour Fable 5. xAI rapporte 83,3% sur Terminal-Bench 2.1, 29,0% sur SWE Marathon, 80 TPS, des prix de 2$/6$ et 4,2× moins de tokens de sortie par tâche sur SWE-Bench Pro qu'Opus 4.8 max. Il est disponible dans Cursor sur tous les abonnements, dans Grok Build et via l'API.

À surveiller

La 4e place récompense valeur et efficacité, pas une victoire sur tous. SWE-Bench Pro et DeepSWE restent derrière les leaders, et Kimi K3 possède désormais le meilleur dossier de capacité brute. Le code bon marché exige toujours tests et vérifications de sécurité.

01

Ce que c'est réellement

Il existe deux manières d’acheter un agent de codage. Vous pouvez louer le consultant le plus brillant de la ville pour chaque ticket, ou embaucher un excellent ingénieur assez rapide et abordable pour tenter une nouvelle approche lorsque le premier essai échoue. Grok 4.5 représente la seconde option, et ce n’est pas un mince compliment.

Artificial Analysis place Grok Build troisième sur son indice des agents de codage, avec 76 : à égalité avec GPT-5.5 dans Codex, derrière Fable 5 dans Claude Code. Vient ensuite le chiffre qui change la décision d’achat. La même analyse estime à 2,49$ par tâche d’agent le coût de Grok Build, contre 5,07$ pour GPT-5.5 dans Codex et 11,80$ pour Fable 5 dans Claude Code. Grok y est parvenu en consommant nettement moins de tokens.

C’est pourquoi Grok 4.5 reste un solide #4 après l’arrivée de Kimi K3. Le graphique officiel de xAI le montre au coude-à-coude avec les leaders sur Terminal-Bench 2.1 à 83,3%, et menant sur SWE Marathon à 29,0% pass@1. Il est aussi disponible dans Cursor sur tous les abonnements et par défaut dans Grok Build. Les longues boucles d’agents, le travail en terminal, le débogage multi-étapes et l’exploration de référentiels deviennent enfin abordables à répéter.

Ce qu’il ne faut pas affirmer

Grok 4.5 n’est pas le nouveau monarque des scores bruts. Son 64,7% sur SWE-Bench Pro reste derrière les 80,4% de Fable 5 et les 69,2% d’Opus 4.8. Ses scores sur DeepSWE suivent également Fable et GPT-5.5 dans la comparaison de xAI. Si votre flux de travail est un benchmark pur de résolution d’issues de référentiels, les modèles au-dessus conservent le CV le plus solide.

Que faire à la place

Lancez Grok 4.5 sur les tâches où un agent compétent s’améliore en faisant un tour de plus : investigation, tâches de terminal, refactorisations, tests et itérations de développement d’applications. Investissez les économies réalisées dans la vérification. Escaladez vers GPT-5.6 ou Fable 5 lorsque la tâche démontre qu’elle nécessite leur plafond technique.

Voilà la véritable histoire en codage : Grok 4.5 n’est pas le marteau le plus cher. C’est l’excellente machine-outil que vous pouvez vous permettre de laisser tourner.

02

Forces et limites honnêtes

Points Forts

  • Troisième place indépendante, pas une auto-promotion : Artificial Analysis classe Grok Build troisième sur son indice des agents de codage à 76, au niveau de GPT-5.5 dans Codex et sous Fable 5 dans Claude Code. C’est le bon niveau d’affirmation : un agent pratique de premier plan, pas un triomphe inventé.
  • L’écart de coût par tâche d’agent est colossal : Artificial Analysis rapporte 2,49$ par tâche d’indice d’agent pour Grok Build, contre 5,07$ pour GPT-5.5 dans Codex et 11,80$ pour Fable 5 dans Claude Code. Il a utilisé 1,9M de tokens par tâche contre 6,2M et 7,2M respectivement.
  • Le travail en terminal est véritablement compétitif : xAI rapporte 83,3% sur Terminal-Bench 2.1—juste derrière les 84,3% de Fable 5 et les 83,4% de GPT-5.5 dans sa comparaison officielle. Pour l’utilisation d’outils, le shell et les boucles de relance, c’est un niveau très performant.
  • Rapide et économique pour favoriser les bonnes pratiques : xAI sert Grok 4.5 à 80 TPS aux prix de 2$/6$ par million de tokens. Cela incite à lancer un test de plus, demander une deuxième implémentation ou laisser l’agent enquêter avant l’intervention humaine.
  • Cursor et Grok Build facilitent son déploiement : Grok 4.5 est le modèle par défaut dans Grok Build et est disponible dans Cursor sur toutes les formules, en plus de l’API. Il dispose d’un vrai environnement de développement au lieu d’exiger une infrastructure sur mesure.

Limites Honnêtes

  • Le leadership en score brut appartient à d’autres : xAI rapporte 64,7% sur SWE-Bench Pro, derrière les 80,4% de Fable 5 et les 69,2% d’Opus 4.8 dans le même tableau. Si votre seul critère est la résolution d’issues de référentiels, ne négligez pas ces leaders.
  • DeepSWE est compétitif, pas dominant : Dans la comparaison de xAI, Grok 4.5 obtient 62,0% sur DeepSWE 1.0 et 53% sur DeepSWE 1.1, derrière Fable 5 et GPT-5.5 dans les deux cas. L’argument de valeur n’efface pas l’écart de performance brute.
  • Les équipes européennes ne peuvent pas l’utiliser au lancement : Selon xAI, Grok 4.5 n’est pas encore dans l’UE via ses produits ou la console API. Mi-juillet est une prévision, pas une disponibilité actuelle.
  • L’efficacité en tokens ne garantit pas un code correct : Moins d’étapes et un coût inférieur sont des atouts uniquement une fois que le changement réussit vos tests, revues, contrôles de sécurité et votre contexte réel.
  • C’est une version récente : Utilisez des tâches d’évaluation privées avant de le généraliser. Le modèle est nouveau, le comportement du harnais importe et une courbe de coût ne remplace pas votre CI.
03

Aperçu des Benchmarks

Indice des agents de codage d'Artificial Analysis — 76 (#3)

Résultat indépendant pour Grok Build : à égalité avec GPT-5.5 dans Codex et sous Fable 5 dans Claude Code.

Coût sur l'indice des agents — 2,49$ par tâche

Artificial Analysis rapporte 2,49$ pour Grok Build contre 5,07$ pour GPT-5.5 dans Codex et 11,80$ pour Fable 5 dans Claude Code.

Terminal-Bench 2.1 — 83,3%

La comparaison officielle de xAI place Grok très proche de Fable 5 à 84,3% et GPT-5.5 à 83,4% sur le travail en terminal.

SWE Marathon — 29,0% pass@1

xAI place Grok devant les scores cités d'Opus 4.8 et Fable 5 sur cette évaluation d'ingénierie longue durée.

SWE-Bench Pro — 64,7%

Le contrepoids indispensable : le graphique de xAI place Grok sous Fable 5 et Opus 4.8 en résolution d'issues.

04

Le Verdict

Grok 4.5 occupe le #4 parce que le classement doit récompenser la capacité et un agent que l’on peut relancer sans ruiner l’équipe. Kimi K3 possède désormais les meilleures preuves brutes et frontend ; Grok reste l’alternative valeur-vitesse, forte au terminal, troisième dans l’indice agentique indépendant, disponible dans Cursor et peu coûteuse. Utilisez K3, Fable 5 ou GPT-5.6 pour un plafond supérieur ; Grok pour itérer sans exploser le budget.

05

Foire aux questions