Classé #6 Écosystème du quotidien — Les assistants IA leaders
xAI

Grok 4.6

Grok 4.6 transforme l'argument économique de xAI en argument frontier : 61 à l'indice Artificial Analysis, excellent travail agentique au long cours et toujours $2/$6 par million de jetons.

Mis à jour 14 août 2026 AgenticKnowledge WorkOffice
9.5sur 10
Site officiel
Idéal pour

Grok 4.6 transforme l'argument économique de xAI en argument frontier : 61 à l'indice Artificial Analysis, excellent travail agentique au long cours et toujours $2/$6 par million de jetons.

Pourquoi ça Gagne

Artificial Analysis mesure 61 points, cinq de plus que Grok 4.5, $0,84 par tâche, 1753 Elo sur GDPVal-AA v2 et 1577 sur AA-Briefcase. Le modèle offre 500K de contexte et un accès via Grok Build, Cursor, l'API, OpenRouter, Vercel et Cloudflare.

À surveiller

Les gains les plus nets concernent le travail intellectuel agentique, pas une victoire totale en code ou en conversation. Les comparaisons mélangent plusieurs harnesses, et les premiers signalements de sécurité imposent sandbox, droits minimaux et relecture.

01

Ce que c'est réellement

Pendant longtemps, l’IA de pointe obéissait à une règle de restaurant : plus la carte était raffinée, plus il fallait surveiller l’addition. Grok 4.6 casse cette règle. Il atteint 61 à l’Intelligence Index d’Artificial Analysis, rejoint GPT-5.6 Sol et ne reste derrière que les configurations maximales d’Opus 5 et Fable 5. Pourtant, son tarif standard demeure à 2 dollars par million de jetons en entrée et 6 dollars en sortie. Le progrès de capacité n’arrive donc pas avec une nouvelle facture de palace.

L’information la plus intéressante se trouve sous le score composite. Sur GDPVal-AA v2, qui mesure le travail professionnel d’un agent, Grok obtient 1753 Elo. Sur AA-Briefcase, consacré aux longues tâches de recherche, d’analyse et de production de livrables, il atteint 1577 Elo. Artificial Analysis observe environ 53 tours et 0,5 milliard de jetons d’entrée par tâche. Opus 5 max en utilise près de 103 et 2,0 milliards. Imaginez deux équipes qui rendent des rapports de qualité voisine : l’une organise moitié moins de réunions et relit seulement un quart du dossier. Cette sobriété réduit la facture et limite aussi les occasions de perdre l’objectif au milieu d’une longue trajectoire.

xAI a précisément entraîné le modèle pour cette endurance. L’annonce décrit une phase supplémentaire plus longue, de nouvelles trajectoires de raisonnement et de logiciel, puis de l’apprentissage par renforcement sur le travail intellectuel, le code général, le développement web, la CAO et d’autres environnements à outils. Le modèle propose 500 000 jetons de contexte et quatre niveaux de raisonnement : low, medium, high et xhigh. Il est disponible dans Grok Build, Cursor, l’API xAI, OpenRouter, Vercel et Cloudflare. Une variante plus rapide réduit l’attente, mais double le prix par jeton.

Ces résultats ne forment pas un grand chelem. La preuve la plus solide concerne le travail intellectuel agentique. Dans le tableau xAI, les 65,9% sur DeepSWE v1.1 restent derrière GPT-5.6 Sol et Fable 5 ; les 26% sur Terminal-Bench v3.0 sont encore plus éloignés de leurs résultats proches de 34%. De plus, certaines valeurs concurrentes viennent de cartes de modèle ou de classements publics employant d’autres prompts, outils et règles d’arrêt. Un petit écart indique donc plutôt une même zone de performance qu’une mesure au millimètre.

Les premiers retours de terrain comptent également. Quelques développeurs signalent des modifications de sécurité dangereuses ou un comportement peu fiable après un échec. Ce sont des témoignages, pas une mesure de fréquence, mais ils décrivent le type d’erreur qu’une moyenne peut masquer. La réponse raisonnable est d’isoler l’agent, de lui donner le minimum d’identifiants, d’exiger de petits diffs, puis d’imposer tests et validation humaine. Un contexte de 500K peut contenir un projet complet ; il ne garantit ni que le modèle remarquera le fait décisif, ni qu’il attribuera correctement une source.

La conclusion pratique n’est donc pas « faire davantage confiance à Grok », mais « pouvoir mieux vérifier Grok ». Artificial Analysis mesure environ 0,84 dollar par tâche, ce qui rend un second passage, un contrôle des sources ou un modèle relecteur économiquement raisonnables. Pour la recherche, l’analyse, les documents professionnels et les agents au long cours, Grok 4.6 est désormais une véritable option de pointe avec un avantage de coût. Pour une affirmation à fort enjeu ou un accès à la production, un humain doit rester à la porte.

02

Forces et limites honnêtes

Points Forts

  • Retour à la pointe : Artificial Analysis lui donne 61 sur son indice de neuf tests : à égalité avec GPT-5.6 Sol, cinq points devant Grok 4.5 et derrière les configurations maximales d’Opus 5 et Fable 5.
  • Le travail long est le vrai titre : 1753 Elo sur GDPVal-AA v2 et 1577 sur AA-Briefcase étayent le travail professionnel ; xAI publie aussi 15,8% sur Harvey LAB, meilleur score du tableau.
  • Efficacité concrète : environ 53 tours et 0,5 milliard de jetons d’entrée par tâche Briefcase, contre 103 et 2,0 milliards pour Opus 5 max ; les $0,84 mesurés par tâche se placent sur la frontière de Pareto coût-intelligence.
  • Prix inchangé : $2/$6 par million, cache à $0,50 ; la variante rapide coûte le double.
  • Accès étendu : Grok Build, Cursor, API, OpenRouter, Vercel et Cloudflare, avec 500K de contexte.

Limites Honnêtes

  • Le leadership en code dépend du test : 65,9% sur DeepSWE et 26% sur Terminal-Bench v3 restent sous les meilleurs scores.
  • Les laboratoires diffèrent : cartes, classements et harnesses distincts rendent les petits écarts fragiles.
  • Les alertes de sécurité comptent : des utilisateurs rapportent des modifications risquées et une mauvaise gestion des échecs.
  • La préférence chat suit moins vite : les premiers signaux sont meilleurs en agents et développement web qu’en texte général.
  • 500K n’assurent pas la vérité : sources, jalons et critères d’acceptation restent indispensables.
03

Aperçu des Benchmarks

Artificial Analysis Intelligence Index — 61

Composite indépendant de neuf tests, à égalité avec GPT-5.6 Sol.

GDPVal-AA v2 — 1753 Elo

Résultat remarquable pour le travail professionnel agentique.

AA-Briefcase — 1577 Elo

Qualité proche de Fable avec beaucoup moins de tours et de jetons qu'Opus 5 max.

Coût mesuré — $0,84 par tâche

Calcul Artificial Analysis à partir de l'usage observé et du tarif $2/$6.

04

Le Verdict

Grok 4.6 est l’un des meilleurs rapports qualité-prix pour le travail intellectuel agentique : intelligence indépendante de pointe, excellente efficacité au long cours et assez de disponibilité pour l’essayer sans reconstruire la plateforme. Il ne gagne pas tous les tests et n’annule pas le risque des décisions importantes. Employez-le comme agent de projet capable d’un second passage, limitez ses droits et intégrez la vérification au travail.

05

Foire aux questions