Imaginez une compagnie aérienne low cost qui garde le prix de ses billets mais remplace discrètement ses avions par des appareils plus grands et plus performants.
C’est à peu près ce qu’a fait xAI avec Grok 4.7, sorti le 21 septembre 2026. Le prix n’a pas bougé : 2 $ par million de tokens en entrée et 6 $ par million en sortie, exactement comme Grok 4.6. Ce qui a changé, c’est le modèle en dessous.
Ce qui change sous le capot
xAI décrit trois changements, en termes simples :
- Un modèle de base plus grand. Selon xAI, la version 4.7 repose sur une fondation plus vaste que la 4.6. Son annonce ne donne pas de nombre de paramètres : considérez donc comme non confirmé tout chiffre précis lu ailleurs.
- Un entraînement plus long et plus exigeant. Le modèle a été entraîné par apprentissage par renforcement sur des tâches qui prennent de nombreuses heures, précisément le type de travail où les modèles précédents perdaient le fil à mi-parcours.
- Vérifier son propre travail. xAI l’a entraîné spécifiquement à contrôler ses réponses et à gérer les longs documents de façon plus fiable.
Résultat : un modèle qui tient mieux la distance sur une longue tâche et qui repère ses propres erreurs avant vous.
Là où il nous a surpris
Les chiffres les plus intéressants du tableau de lancement de xAI ne concernent pas la programmation. Ils se trouvent dans des domaines où l’on n’attendrait pas un modèle bon marché en tête.
- Le travail juridique. Sur le Harvey Legal Agent Benchmark, qui mesure la capacité d’un agent d’IA à mener de vraies tâches juridiques, Grok 4.7 obtient 19,6 %. C’est devant Claude Fable 5.1 (6,7 %) et GPT-5.6 Sol (2,5 %). Le test est d’une difficulté brutale et tout le monde y obtient des scores bas, mais Grok est arrivé en tête de cette comparaison.
- Les mathématiques d’ingénieur. Sur EEBench, qui évalue des problèmes de génie électrique, il obtient 64,0 %, devant les 56,4 % de Fable 5.1.
- Le travail de bureau. Sur AA Briefcase, un test de tâches de bureau de plusieurs heures comme la préparation de documents et de présentations, il atteint 1 657, juste derrière les 1 678 de Fable 5.1 et bien au-dessus des 1 546 de Grok 4.6.
En clair : sur le vrai travail de bureau et les tâches professionnelles, Grok 4.7 joue désormais dans la même cour que des modèles plusieurs fois plus chers.
Plus sûr que sa réputation
Grok a la réputation d’être le chatbot aux garde-fous les plus légers. Pour la version 4.7, cette réputation est dépassée. xAI dit avoir construit un système de sécurité entièrement nouveau et le présente comme son modèle le plus solide à ce jour pour refuser les demandes dangereuses et résister aux jailbreaks. L’entreprise affirme aussi qu’il bloque rarement le travail légitime, comme la recherche en sécurité défensive.
Grok continue de répondre franchement plutôt que d’enrober ses réponses d’avertissements. Mais c’est une question de style, pas une absence de sécurité.
Le bémol, en toute franchise
Il n’a pas encore affronté les rivaux les plus récents. Le tableau de xAI compare Grok 4.7 à GPT-5.6 Sol et à Claude Fable 5.1. Le lendemain de sa sortie, Anthropic a lancé Claude Opus 5.5 et OpenAI GPT-6 Sol, deux concurrents solides et bien placés en prix. Tant que des tests indépendants ne les auront pas mis côte à côte, la position exacte de Grok reste incertaine.
Le travail long en terminal reste un point faible. Sur Terminal-Bench 4.0, qui évalue un travail de plusieurs heures en ligne de commande, Grok 4.7 obtient 37,6 %. C’est presque le double de Grok 4.6, mais loin derrière les 57,9 % de Fable 5.1.
La médecine n’est pas son fort. Sur HealthBench Professional, un test de raisonnement clinique, il obtient 56,7 %, sous GPT-5.6 Sol et Fable 5.1.
Ce sont tous des chiffres de xAI. Ses avances en droit et en ingénierie sont enthousiasmantes, mais nous aimerions les voir confirmées de façon indépendante.
Pour qui ?
Si vous utilisez l’IA toute la journée pour des documents, des analyses et des questions techniques, et que la facture mensuelle compte, Grok 4.7 mérite un vrai essai. Il vous donne l’essentiel de la qualité des meilleurs modèles pour une fraction du coût.
Si vous avez besoin du jugement le plus minutieux qui soit, prenez Claude Opus 5.5. Si vous voulez qu’un agent pilote des logiciels sur votre ordinateur, prenez GPT-6 Astra. Pour tout ce qui se situe entre les deux, Grok 4.7 est le meilleur rapport qualité-prix près du sommet.