La meilleure question sur les modèles de code en septembre 2026 n’est toujours pas « lequel est le plus intelligent ? » C’est « lequel mène ce travail jusqu’au bout ? » GPT-6 Astra répond en prenant directement les commandes du clavier : il vit dans le terminal, pilote le navigateur et le bureau quand le shell ne suffit plus, et poursuit l’exécution après une première erreur — en dépensant environ un tiers des tokens que GPT-5.6 Sol aurait brûlés pour la même tâche.
Les chiffres du monde réel et des tests synthétiques, datés honnêtement : sur la Code Arena d’Arena.ai, Astra (Max) décroche la 1re place absolue avec 1 797 points en WebDev, creusant une nette avance de +35 points sur Claude Fable 5.1 Max (1 762 pts) et +109 points sur Opus 5 Max (1 688 pts), domine en Data & Analytics, Consumer Product et création de contenu, et redéfinit la frontière de Pareto à 40 $/Mtoken. Sur benchmarks de terminal synthétiques, Astra affiche 57,7–57,9% sur Terminal-Bench 4.0 (Fable 5.1 : 55,8%), un score record de 74,1% sur DeepSWE v1.1, 64,6% sur Terminal-Bench Science et 88% pass@1 / 99,2% pass@4 sur SRE-Bench. Le banc d’essai propriétaire d’Artificial Analysis place encore Fable 5.1 à 70 contre 67 pour Astra — et AA a recalibré son tableau au lancement d’Astra. Aujourd’hui, le choix du banc d’essai d’évaluation fait bouger les scores de code plus que les générations de modèles.
Le contrepoids n’a pas bougé, et nous ne l’escamotons pas. La résolution d’issues SWE-Bench Pro reste le point fort historique de Claude Fable, et l’environnement Claude Code d’Anthropic reste le foyer naturel des refactorings en profondeur sur tout un dépôt. Si votre besoin consiste à solder proprement des tickets complexes sur un tracker d’issues, commencez par Fable. S’il s’agit de concevoir cette application web, réparer un build défaillant, élucider un incident de production, configurer une machine ou lancer une campagne d’expériences, commencez avec Astra.
Aiguiller le travail
| Tâche | Prenez | Pourquoi |
|---|---|---|
| Développement web, outils full-stack, analyse de données | Astra | Nº 1 sur Arena.ai Code Arena : WebDev (1 797 pts, +35 devant Fable 5.1) |
| Investigations complexes en terminal, migrations ardues, analyse d’incidents | Astra | Meilleurs résultats mesurés sur terminal et SRE, consommation minimale de tokens par tâche finie |
| Travail qui exige navigateur ou bureau, pas seulement le shell | Astra | Le meilleur usage de l’ordinateur dans un agent de code |
| Refactorings profonds de dépôts, résolution d’issues dans Claude Code | Fable 5 / Fable 5.1 | SWE-Bench Pro et avance sur le banc d’essai d’AA |
| Tickets du quotidien, revue de PR, tests, refactors | Terra / Sol | Le défaut GPT économique aux anciens tarifs |
| Transformations mécaniques, scaffolding, vérifications par lots | Luna | Rapide et bon marché quand un test peut vérifier le résultat |
L’économie mérite un paragraphe honnête. L’étiquette dit 10/50 $ — 2,5 fois Sol — et les lectures de cache à 1 $ valent quatre fois le tarif de Fable 5.1, ce qui pèse sur les longues boucles d’agent. Mais Astra pense avec moins de tokens : environ un tiers de Sol et un cinquième d’Opus sur des exécutions comparables — voilà pourquoi les testeurs indépendants le retrouvent sans cesse sur la frontière coût/capacité, parfois moins cher par tâche finie que Fable 5. Passez votre propre dépôt dans les deux avant de croire l’une ou l’autre facture.
Le hic honnête : la concision d’Astra saute les étapes de finition que remarquent relecteurs et grilles notées ; ses capacités cyber (100% ExploitBench, 0-days inconnus révélés à l’évaluation) arrivent avec des garde-fous qui ralentissent le travail légitime proche de l’exploit ; et le lancement du premier jour a été rugueux, avec Enterprise désactivé par défaut. La couronne est réelle, la couronne est étroite, et la couronne est datée. Revérifiez les tableaux dans deux semaines — nous le ferons.