Classé #1 Programmation — L'IA qui écrit du code de production
OpenAI

GPT-6 Astra

GPT-6 Astra s'empare de la couronne du code grâce au vote des développeurs et à l'épreuve du terrain : nouveau nº 1 sur la Code Arena d'Arena.ai (1 797 pts en WebDev), sessions de terminal, analyse d'incidents et configuration de poste en consommant environ un tiers des tokens de Sol.

Mis à jour 5 septembre 2026 Arena #1Coding AgentAgentic
9.9sur 10
Site officiel
Idéal pour

GPT-6 Astra s'empare de la couronne du code grâce au vote des développeurs et à l'épreuve du terrain : nouveau nº 1 sur la Code Arena d'Arena.ai (1 797 pts en WebDev), sessions de terminal, analyse d'incidents et configuration de poste en consommant environ un tiers des tokens de Sol.

Pourquoi ça Gagne

Nº 1 au classement général et en WebDev sur la Code Arena d'Arena.ai avec 1 797 pts (+35 pts d'avance sur Claude Fable 5.1 Max et +109 sur Opus 5 Max), nº 1 en Data & Analytics, Consumer Product et outils de création de contenu ; plus 57,7–57,9% sur Terminal-Bench 4.0, score record de 74,1% sur DeepSWE v1.1, 64,6% sur Terminal-Bench Science et 88% pass@1 / 99,2% pass@4 sur SRE-Bench.

À surveiller

Sur le banc d'essai synthétique d'Artificial Analysis, Fable 5.1 devance encore légèrement Astra (70 contre 67), et SWE-Bench Pro demeure le bastion historique de Claude Fable. Le tarif API est de 10/50 $ (2,5× Sol), les lectures de cache coûtent quatre fois plus cher (1 $ contre 0,25 $ chez Fable 5.1), la concision néglige parfois la mise en forme des rapports et les garde-fous cyber ralentissent certains prompts d'analyse de vulnérabilités.

01

Ce que c'est réellement

La meilleure question sur les modèles de code en septembre 2026 n’est toujours pas « lequel est le plus intelligent ? » C’est « lequel mène ce travail jusqu’au bout ? » GPT-6 Astra répond en prenant directement les commandes du clavier : il vit dans le terminal, pilote le navigateur et le bureau quand le shell ne suffit plus, et poursuit l’exécution après une première erreur — en dépensant environ un tiers des tokens que GPT-5.6 Sol aurait brûlés pour la même tâche.

Les chiffres du monde réel et des tests synthétiques, datés honnêtement : sur la Code Arena d’Arena.ai, Astra (Max) décroche la 1re place absolue avec 1 797 points en WebDev, creusant une nette avance de +35 points sur Claude Fable 5.1 Max (1 762 pts) et +109 points sur Opus 5 Max (1 688 pts), domine en Data & Analytics, Consumer Product et création de contenu, et redéfinit la frontière de Pareto à 40 $/Mtoken. Sur benchmarks de terminal synthétiques, Astra affiche 57,7–57,9% sur Terminal-Bench 4.0 (Fable 5.1 : 55,8%), un score record de 74,1% sur DeepSWE v1.1, 64,6% sur Terminal-Bench Science et 88% pass@1 / 99,2% pass@4 sur SRE-Bench. Le banc d’essai propriétaire d’Artificial Analysis place encore Fable 5.1 à 70 contre 67 pour Astra — et AA a recalibré son tableau au lancement d’Astra. Aujourd’hui, le choix du banc d’essai d’évaluation fait bouger les scores de code plus que les générations de modèles.

Le contrepoids n’a pas bougé, et nous ne l’escamotons pas. La résolution d’issues SWE-Bench Pro reste le point fort historique de Claude Fable, et l’environnement Claude Code d’Anthropic reste le foyer naturel des refactorings en profondeur sur tout un dépôt. Si votre besoin consiste à solder proprement des tickets complexes sur un tracker d’issues, commencez par Fable. S’il s’agit de concevoir cette application web, réparer un build défaillant, élucider un incident de production, configurer une machine ou lancer une campagne d’expériences, commencez avec Astra.

Aiguiller le travail

Tâche Prenez Pourquoi
Développement web, outils full-stack, analyse de données Astra Nº 1 sur Arena.ai Code Arena : WebDev (1 797 pts, +35 devant Fable 5.1)
Investigations complexes en terminal, migrations ardues, analyse d’incidents Astra Meilleurs résultats mesurés sur terminal et SRE, consommation minimale de tokens par tâche finie
Travail qui exige navigateur ou bureau, pas seulement le shell Astra Le meilleur usage de l’ordinateur dans un agent de code
Refactorings profonds de dépôts, résolution d’issues dans Claude Code Fable 5 / Fable 5.1 SWE-Bench Pro et avance sur le banc d’essai d’AA
Tickets du quotidien, revue de PR, tests, refactors Terra / Sol Le défaut GPT économique aux anciens tarifs
Transformations mécaniques, scaffolding, vérifications par lots Luna Rapide et bon marché quand un test peut vérifier le résultat

L’économie mérite un paragraphe honnête. L’étiquette dit 10/50 $ — 2,5 fois Sol — et les lectures de cache à 1 $ valent quatre fois le tarif de Fable 5.1, ce qui pèse sur les longues boucles d’agent. Mais Astra pense avec moins de tokens : environ un tiers de Sol et un cinquième d’Opus sur des exécutions comparables — voilà pourquoi les testeurs indépendants le retrouvent sans cesse sur la frontière coût/capacité, parfois moins cher par tâche finie que Fable 5. Passez votre propre dépôt dans les deux avant de croire l’une ou l’autre facture.

Le hic honnête : la concision d’Astra saute les étapes de finition que remarquent relecteurs et grilles notées ; ses capacités cyber (100% ExploitBench, 0-days inconnus révélés à l’évaluation) arrivent avec des garde-fous qui ralentissent le travail légitime proche de l’exploit ; et le lancement du premier jour a été rugueux, avec Enterprise désactivé par défaut. La couronne est réelle, la couronne est étroite, et la couronne est datée. Revérifiez les tableaux dans deux semaines — nous le ferons.

02

Forces et limites honnêtes

Points Forts

  • Nouveau leader incontesté dans l’arène des développeurs et en terminal : Astra (Max) décroche la 1re place de la Code Arena d’Arena.ai avec 1 797 points en WebDev — une solide avance de +35 points sur Claude Fable 5.1 Max (1 762 pts) et de +109 sur Opus 5 Max (1 688 pts), dominant en Data & Analytics, Consumer Product et création de contenu, tout en redéfinissant la frontière de Pareto à 40 $/Mtoken mixte. Sur benchmarks synthétiques, il confirme : 57,7–57,9% sur Terminal-Bench 4.0 et un score record de 74,1% sur DeepSWE v1.1.
  • Il code comme un scientifique : 64,6% sur Terminal-Bench Science contre 52,6% pour Fable 5.1 et 22,4% pour Sol, plus environ 97,6% sur FrontierMath Tier 4. Pour l’ingénierie calculatoire, gourmande en données et proche de la recherche, l’écart n’est pas cosmétique.
  • L’efficacité en tokens change la facture : le suivi indépendant d’agents place Astra à environ un tiers des tokens de Sol et un cinquième de ceux d’Opus sur des exécutions comparables. Sur les agents de code, Astra est sur la frontière coût/capacité et peut finir moins cher que Fable 5 malgré l’étiquette plus lourde — mesurez sur votre dépôt, pas sur la grille tarifaire.
  • De l’ingénierie SRE et sécurité réellement utilisable : 88% pass@1 et 99,2% pass@4 sur SRE-Bench, 100% sur ExploitBench, et des 0-days inconnus révélés pendant l’évaluation. Les équipes défensives et de fiabilité y gagnent une vraie capacité — avec plus de refus sur les prompts à double usage comme impôt visible.
  • Une mise à niveau sans déménagement : le même Codex, le même ChatGPT Work, la même Responses API (gpt-6-astra), plus Azure, Bedrock, la rétention zéro des données pour les usages API éligibles, un contexte d’environ 1,05 million de tokens et des intégrations dès le premier jour comme Devin. Rien dans votre pipeline n’a à déménager.

Limites Honnêtes

  • L’avantage au banc d’essai propriétaire appartient aujourd’hui à Anthropic : le banc d’essai d’Artificial Analysis note Fable 5.1 à 70 contre 67 pour Astra (configuration Codex), et l’historique SWE-Bench Pro reste celui de Fable (80,3% contre 64,6% pour Sol dans la comparaison publiée de GPT-5.6). Les refactorings profonds et de longue haleine sur l’ensemble d’un dépôt dans l’environnement Claude Code favorisent toujours Fable.
  • L’étiquette est premium : 10/50 $ par million de tokens entrée/sortie — 2,5 fois Sol — avec des lectures de cache à 1 $ contre 0,25 $ pour Fable 5.1, ce qui domine les factures d’agents à nombreux tours ; les prompts de plus de 272k tokens coûtent 2x entrée / 1,5x sortie, et le mode rapide double le prix. L’efficacité gagne le calcul le plus souvent, pas toujours.
  • La friction est réelle : les réponses laconiques sautent les politesses de rubrique et de rapport que remarquent les évaluations notées et les relecteurs humains ; le lancement du premier jour a été chaotique et Enterprise est arrivé désactivé par défaut ; les garde-fous cyber ralentissent certains prompts légitimes proches de l’exploit ; et il n’y a pas de génération d’images native pour les assets.
03

Aperçu des Benchmarks

Arena.ai Code Arena: WebDev — Astra (Max) 1 797 pts (Nº 1)

Vote des développeurs sur des cas d'usage réels, début septembre 2026. Astra devance Claude Fable 5.1 Max (1 762 pts) de +35 points et Claude Opus 5 Max (1 688 pts) de +109 points ; nº 1 en Data & Analytics, Consumer Product et outils de création de contenu.

Artificial Analysis Coding Agent Index — Astra 67 · Fable 5.1 70

Banc d'essai propriétaire d'AA, daté du 4 septembre 2026. Le tableau a été recalibré depuis les chiffres du lancement de GPT-5.6 (l'ère du 77,4 de Sol), donc les comparaisons entre époques ne sont pas de même à même ; le choix du banc d'essai fait plus bouger ces scores que les mises à jour de modèles.

Terminal-Bench 4.0 — Astra 57,7–57,9%

Le tableau d'OpenAI a bougé après publication, d'où la fourchette. Fable 5.1 est à 55,8%. Le test public le plus proche du vrai travail d'ingénierie en shell.

DeepSWE v1.1 — Astra 74,1%

Meilleur score du tableau actuel mais très resserré : Opus 5 à 73,7%, Gemini 3.8 Flash à 73,8%, Fable 5.1 à 67,4%. Une avance, pas un raz-de-marée.

Terminal-Bench Science — Astra 64,6%

Contre 52,6% pour Fable 5.1 et 22,4% pour Sol. L'écart le plus net du lot de lancement — mesure fournisseur, donc datez-la et revérifiez sur vos charges.

SRE-Bench — 88% pass@1 · 99,2% pass@4

Ingénierie de fiabilité en conditions d'incident réelles. Avec le 100% sur ExploitBench, la voie sécurité est le vrai saut de cette version.

04

Le Verdict

GPT-6 Astra est notre nº 1 du code : son statut de nº 1 sur la Code Arena indépendante d’Arena.ai (1 797 pts), son efficacité terminale, sa profondeur d’intégration et son coût maîtrisé par tâche finie l’emportent sur le léger avantage de Fable sur le banc d’essai synthétique d’AA. Confiez à Astra le développement web, le travail agentique, l’automatisation du poste et les calculs scientifiques ; gardez Fable 5 pour les refactorings complexes dans Claude Code ; gardez Sol, Terra et Luna comme options économiques par défaut. Les bancs d’essai divergent davantage que les modèles eux-mêmes — mesurez sur votre propre dépôt avant de trancher.

05

Foire aux questions