La mejor pregunta sobre modelos de código en septiembre de 2026 sigue sin ser «¿cuál es el más listo?». Es «¿cuál termina este tipo de trabajo?» GPT-6 Astra responde tomando el teclado: vive en la terminal, conduce el navegador y el escritorio cuando la terminal no basta, y sigue tras el primer fallo — gastando aproximadamente un tercio de los tokens que habría quemado GPT-5.6 Sol en la misma ejecución.
Los números reales y sintéticos, con fecha honesta: En la Code Arena de Arena.ai, Astra (Max) conquista el nº 1 absoluto con 1.797 pts en WebDev —abriendo una sólida ventaja de +35 pts sobre Claude Fable 5.1 Max (1.762 pts) y +109 sobre Opus 5 Max (1.688 pts), además de situarse nº 1 en Data & Analytics, Consumer Product y Content Creation Tools, y reconfigurar la frontera de Pareto a 40 $/Mtoken combinado. En benchmarks sintéticos de terminal, Astra registra 57,7–57,9% en Terminal-Bench 4.0 (Fable 5.1 queda en 55,8%), un récord de tabla con 74,1% en DeepSWE v1.1, 64,6% en Terminal-Bench Science y 88% pass@1 / 99,2% pass@4 en SRE-Bench. El arnés propio de Artificial Analysis todavía pone a Fable 5.1 en 70 frente a los 67 de Astra —y AA reescaló su tabla con el lanzamiento de Astra. Hoy la elección de arnés mueve las puntuaciones de código más que las generaciones de modelos.
El contrapeso no se ha movido, y no lo vamos a quitar de en medio con un gesto. La resolución de issues de SWE-Bench Pro sigue siendo la historia de Claude Fable, y el arnés Claude Code de Anthropic es el hogar natural de la cirugía larga de repos. Si tu trabajo parece «resuelve bien este issue tracker», empieza con Fable. Si parece «crea esta app web, arregla mi build, persigue este incidente, prepara la máquina, ejecuta el experimento», empieza con Astra.
Encamina el trabajo
| Tarea | Usa | Por qué |
|---|---|---|
| Desarrollo web, herramientas full-stack, data & analytics | Astra | Nº 1 en Code Arena: WebDev (1.797 pts, +35 sobre Fable 5.1) |
| Investigación intensiva de terminal, migraciones testarudas, forensia de incidentes | Astra | La mejor evidencia de terminal y SRE, los menos tokens por tarea terminada |
| Trabajo que necesita navegador o escritorio, no solo la shell | Astra | El mejor uso de ordenador en un agente de código |
| Cirugía larga de repo, resolución de issues en Claude Code | Fable 5 / Fable 5.1 | SWE-Bench Pro y el liderazgo del arnés propio de AA |
| Tickets del día a día, revisión de PR, tests, refactors | Terra / Sol | El GPT económico por defecto a los precios antiguos |
| Transformaciones mecánicas, scaffolding, comprobaciones por lotes | Luna | Rápido y barato cuando un test puede verificar el resultado |
La economía merece un párrafo honesto. El precio dice 10/50 dólares —2,5 veces Sol—, y las lecturas de caché a 1 $ son cuatro veces la tarifa de Fable 5.1, lo que pesa en los bucles largos de agente. Pero Astra piensa con menos tokens: aproximadamente un tercio de los de Sol y un quinto de los de Opus en ejecuciones comparables, y por eso los testers independientes lo siguen encontrando en la frontera coste/capacidad, a veces más barato por tarea terminada que Fable 5. Pasa tu propio repositorio por ambos antes de creerte cualquiera de las dos facturas.
La pega honesta: la parquedad de Astra se salta los pasos de pulido que notan los revisores y las rúbricas graduadas; sus capacidades ciber (100% en ExploitBench, 0-days desconocidos en la evaluación) llegan con salvaguardas que ralentizan el trabajo legítimo cercano a exploits; y el despliegue del primer día fue accidentado, con Enterprise desactivado por defecto. La corona es real, la corona es estrecha y la corona tiene fecha. Vuelve a mirar las tablas en dos semanas — nosotros lo haremos.