Puesto #1 Programación — IA que Escribe Software de Producción
OpenAI

GPT-6 Astra

GPT-6 Astra toma la corona de programación del mismo modo honesto en que la tenía GPT-5.6: terminando el trabajo con forma de agente —sesiones de terminal, pipelines rotos, forensia de incidentes, configuraciones completas de escritorio— ahora respaldado por su nuevo nº 1 en la Code Arena de Arena.ai (WebDev con 1.797 pts) mientras consume aproximadamente un tercio de los tokens de Sol.

Actualizado 5 de septiembre de 2026 Arena #1Coding AgentAgentic
Ideal para

GPT-6 Astra toma la corona de programación del mismo modo honesto en que la tenía GPT-5.6: terminando el trabajo con forma de agente —sesiones de terminal, pipelines rotos, forensia de incidentes, configuraciones completas de escritorio— ahora respaldado por su nuevo nº 1 en la Code Arena de Arena.ai (WebDev con 1.797 pts) mientras consume aproximadamente un tercio de los tokens de Sol.

Por qué gana

Nuevo nº 1 en la Code Arena de Arena.ai: WebDev con 1.797 pts (ventaja de +35 pts sobre Claude Fable 5.1 Max con 1.762, +109 sobre Opus 5 Max con 1.688 y +180 sobre Sol en el puesto 13), liderando en Data & Analytics, Consumer Product y Content Creation Tools. A ello se suma Terminal-Bench 4.0 en 57,7–57,9% (Fable 5.1: 55,8%), el mejor de la tabla en DeepSWE v1.1 con 74,1%, Terminal-Bench Science en 64,6%, SRE-Bench en 88% pass@1 / 99,2% pass@4 y 100% en ExploitBench. Aunque el arnés propio de Artificial Analysis aún puntúa ligeramente por delante a Fable 5.1 (70 frente a 67), Astra redefine la frontera de Pareto a 40 $/Mtoken combinado y gasta alrededor de un tercio de los tokens de Sol.

Ten en cuenta

Incluso con la corona de nº 1 en Code Arena para WebDev y herramientas de producto, Fable 5(.1) sigue ostentando el récord de resolución de issues en SWE-Bench Pro y lidera en el índice de arnés propio de Artificial Analysis (70 frente a 67). El precio de la API es 2,5 veces el de Sol a 10/50 dólares, las lecturas de caché cuestan cuatro veces los 0,25 $ de Fable 5.1, las respuestas breves se saltan pasos de pulido de informes, y las salvaguardas cibernéticas más fuertes añaden fricción al trabajo cercano a exploits. Las tablas de lanzamiento se movieron tras publicarse: trata cualquier número aislado como ±1–2 puntos.

01

Lo que realmente es

La mejor pregunta sobre modelos de código en septiembre de 2026 sigue sin ser «¿cuál es el más listo?». Es «¿cuál termina este tipo de trabajo?» GPT-6 Astra responde tomando el teclado: vive en la terminal, conduce el navegador y el escritorio cuando la terminal no basta, y sigue tras el primer fallo — gastando aproximadamente un tercio de los tokens que habría quemado GPT-5.6 Sol en la misma ejecución.

Los números reales y sintéticos, con fecha honesta: En la Code Arena de Arena.ai, Astra (Max) conquista el nº 1 absoluto con 1.797 pts en WebDev —abriendo una sólida ventaja de +35 pts sobre Claude Fable 5.1 Max (1.762 pts) y +109 sobre Opus 5 Max (1.688 pts), además de situarse nº 1 en Data & Analytics, Consumer Product y Content Creation Tools, y reconfigurar la frontera de Pareto a 40 $/Mtoken combinado. En benchmarks sintéticos de terminal, Astra registra 57,7–57,9% en Terminal-Bench 4.0 (Fable 5.1 queda en 55,8%), un récord de tabla con 74,1% en DeepSWE v1.1, 64,6% en Terminal-Bench Science y 88% pass@1 / 99,2% pass@4 en SRE-Bench. El arnés propio de Artificial Analysis todavía pone a Fable 5.1 en 70 frente a los 67 de Astra —y AA reescaló su tabla con el lanzamiento de Astra. Hoy la elección de arnés mueve las puntuaciones de código más que las generaciones de modelos.

El contrapeso no se ha movido, y no lo vamos a quitar de en medio con un gesto. La resolución de issues de SWE-Bench Pro sigue siendo la historia de Claude Fable, y el arnés Claude Code de Anthropic es el hogar natural de la cirugía larga de repos. Si tu trabajo parece «resuelve bien este issue tracker», empieza con Fable. Si parece «crea esta app web, arregla mi build, persigue este incidente, prepara la máquina, ejecuta el experimento», empieza con Astra.

Encamina el trabajo

Tarea Usa Por qué
Desarrollo web, herramientas full-stack, data & analytics Astra Nº 1 en Code Arena: WebDev (1.797 pts, +35 sobre Fable 5.1)
Investigación intensiva de terminal, migraciones testarudas, forensia de incidentes Astra La mejor evidencia de terminal y SRE, los menos tokens por tarea terminada
Trabajo que necesita navegador o escritorio, no solo la shell Astra El mejor uso de ordenador en un agente de código
Cirugía larga de repo, resolución de issues en Claude Code Fable 5 / Fable 5.1 SWE-Bench Pro y el liderazgo del arnés propio de AA
Tickets del día a día, revisión de PR, tests, refactors Terra / Sol El GPT económico por defecto a los precios antiguos
Transformaciones mecánicas, scaffolding, comprobaciones por lotes Luna Rápido y barato cuando un test puede verificar el resultado

La economía merece un párrafo honesto. El precio dice 10/50 dólares —2,5 veces Sol—, y las lecturas de caché a 1 $ son cuatro veces la tarifa de Fable 5.1, lo que pesa en los bucles largos de agente. Pero Astra piensa con menos tokens: aproximadamente un tercio de los de Sol y un quinto de los de Opus en ejecuciones comparables, y por eso los testers independientes lo siguen encontrando en la frontera coste/capacidad, a veces más barato por tarea terminada que Fable 5. Pasa tu propio repositorio por ambos antes de creerte cualquiera de las dos facturas.

La pega honesta: la parquedad de Astra se salta los pasos de pulido que notan los revisores y las rúbricas graduadas; sus capacidades ciber (100% en ExploitBench, 0-days desconocidos en la evaluación) llegan con salvaguardas que ralentizan el trabajo legítimo cercano a exploits; y el despliegue del primer día fue accidentado, con Enterprise desactivado por defecto. La corona es real, la corona es estrecha y la corona tiene fecha. Vuelve a mirar las tablas en dos semanas — nosotros lo haremos.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Nº 1 en Code Arena y el carril de terminal: Astra conquistó el nº 1 absoluto en Code Arena: WebDev de Arena.ai con 1.797 pts —abriendo una ventaja decisiva de +35 pts sobre Fable 5.1 Max (1.762) y +109 sobre Opus 5 Max (1.688), además del nº 1 en Data & Analytics, Consumer Product y Content Creation Tools. Combinado con 57,7–57,9% en Terminal-Bench 4.0 y 74,1% en DeepSWE v1.1, la preferencia a ciegas de desarrolladores reales respalda con solidez su liderazgo sintético.
  • Programa como un científico: 64,6% en Terminal-Bench Science frente al 52,6% de Fable 5.1 y el 22,4% de Sol, más un 97,6% aproximado en FrontierMath Tier 4. Para la ingeniería computacional, cargada de datos y cercana a la investigación, la distancia no es cosmética.
  • La eficiencia en tokens cambia la factura: El seguimiento independiente de agentes sitúa a Astra en torno a un tercio de los tokens de Sol y un quinto de los de Opus en ejecuciones comparables. En agentes de código Astra está en la frontera coste/capacidad y puede terminar más barato que Fable 5 a pesar del precio mayor — mide en tu repositorio, no en la página de precios.
  • Ingeniería de SRE y seguridad realmente utilizable: 88% pass@1 y 99,2% pass@4 en SRE-Bench, 100% en ExploitBench, y 0-days desconocidos que afloraron durante la evaluación. Los equipos defensivos y de fiabilidad ganan capacidad real aquí, con más rechazos en prompts de doble uso como impuesto visible.
  • Una actualización sin mudanza: El mismo Codex, el mismo ChatGPT Work, la misma Responses API (gpt-6-astra), más Azure, Bedrock, Zero Data Retention para trabajo API elegible, un contexto de unos 1,05 millones de tokens e integraciones del primer día como Devin. Nada de tu pipeline tiene que moverse.

Limitaciones honestas

  • El liderazgo del índice de arnés propio es hoy de Anthropic: El arnés propio de Artificial Analysis puntúa a Fable 5.1 con 70 frente a los 67 de Astra (configuración Codex), y la historia de SWE-Bench Pro sigue siendo de Fable (80,3% frente al 64,6% de Sol en la comparación publicada de GPT-5.6). La cirugía larga de repositorios dentro del arnés Claude Code sigue favoreciendo a Fable.
  • El precio es premium: 10/50 dólares por millón de tokens —2,5 veces Sol— con lecturas de caché a 1 dólar frente a los 0,25 $ de Fable 5.1, lo que domina las facturas de agentes de muchos turnos; los prompts de más de 272k tokens cuestan 2x entrada / 1,5x salida, y el modo rápido duplica el precio. La eficiencia suele ganar la cuenta, no siempre.
  • La fricción es real: Las respuestas breves se saltan las cortesías de rúbrica e informe que notan las evaluaciones graduadas y los revisores humanos; el despliegue del primer día fue caótico y Enterprise llegó desactivado por defecto; las salvaguardas cibernéticas ralentizan algunos prompts legítimos cercanos a exploits; y no hay generación nativa de imágenes para trabajos de recursos.
03

Resumen de Benchmarks

Arena.ai Code Arena: WebDev — 1.797 pts (nº 1)

Nuevo nº 1 en la Code Arena colaborativa de Arena.ai (+35 pts sobre Claude Fable 5.1 con 1.762, +109 sobre Opus 5 con 1.688 y +180 sobre Sol en el nº 13), liderando en WebDev, datos y herramientas de consumo, y redefiniendo la frontera de Pareto a 40 $/Mtoken combinado.

Artificial Analysis Coding Agent Index — Astra 67 · Fable 5.1 70

Arnés propio de AA, con fecha del 4 de septiembre de 2026. La tabla se reescaló desde los números del lanzamiento de GPT-5.6 (la era del 77,4 de Sol), así que las comparaciones entre épocas no son equivalente con equivalente; la elección de arnés mueve estas puntuaciones más que las actualizaciones de modelos.

Terminal-Bench 4.0 — Astra 57,7–57,9%

La tabla de OpenAI se movió tras publicarse, de ahí el rango. Fable 5.1 queda en 55,8%. La prueba pública más cercana al trabajo real de ingeniería desde la shell.

DeepSWE v1.1 — Astra 74,1%

El mejor de la tabla actual pero muy agrupado: Opus 5 con 73,7%, Gemini 3.8 Flash con 73,8%, Fable 5.1 con 67,4%. Una ventaja, no una avalancha.

Terminal-Bench Science — Astra 64,6%

Frente al 52,6% de Fable 5.1 y el 22,4% de Sol. La distancia más limpia del conjunto de lanzamiento — del proveedor, así que ponle fecha y compruébalo en tus cargas.

SRE-Bench — 88% pass@1 · 99,2% pass@4

Ingeniería de fiabilidad bajo condiciones reales de incidente. Junto al 100% en ExploitBench, el carril de seguridad es el verdadero salto de este lanzamiento.

04

El Veredicto

GPT-6 Astra es nuestro nº 1 para programación sobre la base dual más sólida disponible: el liderazgo colaborativo en la Code Arena de Arena.ai en WebDev, analítica y herramientas de producto, junto con una eficiencia de terminal superior, profundidad de integración y menor coste por tarea terminada. Encamina a Astra el desarrollo web, el trabajo agéntico de terminal, el uso de ordenador y las tareas científicas; conserva Fable 5 para la cirugía larga de repos en el arnés Claude Code; y conserva Sol, Terra y Luna como opciones económicas por defecto. Los arneses discrepan más que los modelos: mide en tu propio repositorio antes de reencaminar a tu equipo.

05

Preguntas frecuentes