GPT-6 Astra toma la corona de programación del mismo modo honesto en que la tenía GPT-5.6: terminando el trabajo con forma de agente —sesiones de terminal, pipelines rotos, forensia de incidentes, configuraciones completas de escritorio— ahora respaldado por su nuevo nº 1 en la Code Arena de Arena.ai (WebDev con 1.797 pts) mientras consume aproximadamente un tercio de los tokens de Sol.
Nuevo nº 1 en la Code Arena de Arena.ai: WebDev con 1.797 pts (ventaja de +35 pts sobre Claude Fable 5.1 Max con 1.762, +109 sobre Opus 5 Max con 1.688 y +180 sobre Sol en el puesto 13), liderando en Data & Analytics, Consumer Product y Content Creation Tools. A ello se suma Terminal-Bench 4.0 en 57,7–57,9% (Fable 5.1: 55,8%), el mejor de la tabla en DeepSWE v1.1 con 74,1%, Terminal-Bench Science en 64,6%, SRE-Bench en 88% pass@1 / 99,2% pass@4 y 100% en ExploitBench. Aunque el arnés propio de Artificial Analysis aún puntúa ligeramente por delante a Fable 5.1 (70 frente a 67), Astra redefine la frontera de Pareto a 40 $/Mtoken combinado y gasta alrededor de un tercio de los tokens de Sol.
Incluso con la corona de nº 1 en Code Arena para WebDev y herramientas de producto, Fable 5(.1) sigue ostentando el récord de resolución de issues en SWE-Bench Pro y lidera en el índice de arnés propio de Artificial Analysis (70 frente a 67). El precio de la API es 2,5 veces el de Sol a 10/50 dólares, las lecturas de caché cuestan cuatro veces los 0,25 $ de Fable 5.1, las respuestas breves se saltan pasos de pulido de informes, y las salvaguardas cibernéticas más fuertes añaden fricción al trabajo cercano a exploits. Las tablas de lanzamiento se movieron tras publicarse: trata cualquier número aislado como ±1–2 puntos.