GPT-6 Astra s'empare de la couronne du code grâce au vote des développeurs et à l'épreuve du terrain : nouveau nº 1 sur la Code Arena d'Arena.ai (1 797 pts en WebDev), sessions de terminal, analyse d'incidents et configuration de poste en consommant environ un tiers des tokens de Sol.
Nº 1 au classement général et en WebDev sur la Code Arena d'Arena.ai avec 1 797 pts (+35 pts d'avance sur Claude Fable 5.1 Max et +109 sur Opus 5 Max), nº 1 en Data & Analytics, Consumer Product et outils de création de contenu ; plus 57,7–57,9% sur Terminal-Bench 4.0, score record de 74,1% sur DeepSWE v1.1, 64,6% sur Terminal-Bench Science et 88% pass@1 / 99,2% pass@4 sur SRE-Bench.
Sur le banc d'essai synthétique d'Artificial Analysis, Fable 5.1 devance encore légèrement Astra (70 contre 67), et SWE-Bench Pro demeure le bastion historique de Claude Fable. Le tarif API est de 10/50 $ (2,5× Sol), les lectures de cache coûtent quatre fois plus cher (1 $ contre 0,25 $ chez Fable 5.1), la concision néglige parfois la mise en forme des rapports et les garde-fous cyber ralentissent certains prompts d'analyse de vulnérabilités.