Guía clasificada

Programación — IA que Escribe Software de Producción

Son agentes de programación, no simples herramientas de autocompletado. GPT-6 Astra se corona nº 1 respaldado por la Code Arena de Arena.ai (1.797 pts en WebDev), su eficiencia en terminal y uso del ordenador, y su menor coste por tarea terminada; Opus 5 ocupa el nº 2 como el verificador con mayor respaldo empírico. GLM-5.3 y su variante multimodal más económica, GLM-5.3-Flash, refuerzan las opciones de pesos abiertos de esta selección.

Primero, la decisión

Nuestro ranking

Empieza por el ganador y compara después las concesiones que podrían cambiar tu elección.

#1 Programación

GPT-6 Astra

OpenAI

GPT-6 Astra toma la corona de programación del mismo modo honesto en que la tenía GPT-5.6: terminando el trabajo con forma de agente —sesiones de terminal, pipelines rotos, forensia de incidentes, configuraciones completas de escritorio— ahora respaldado por su nuevo nº 1 en la Code Arena de Arena.ai (WebDev con 1.797 pts) mientras consume aproximadamente un tercio de los tokens de Sol.

Por qué gana

Nuevo nº 1 en la Code Arena de Arena.ai: WebDev con 1.797 pts (ventaja de +35 pts sobre Claude Fable 5.1 Max con 1.762, +109 sobre Opus 5 Max con 1.688 y +180 sobre Sol en el puesto 13), liderando en Data & Analytics, Consumer Product y Content Creation Tools. A ello se suma Terminal-Bench 4.0 en 57,7–57,9% (Fable 5.1: 55,8%), el mejor de la tabla en DeepSWE v1.1 con 74,1%, Terminal-Bench Science en 64,6%, SRE-Bench en 88% pass@1 / 99,2% pass@4 y 100% en ExploitBench. Aunque el arnés propio de Artificial Analysis aún puntúa ligeramente por delante a Fable 5.1 (70 frente a 67), Astra redefine la frontera de Pareto a 40 $/Mtoken combinado y gasta alrededor de un tercio de los tokens de Sol.

La Trampa

Incluso con la corona de nº 1 en Code Arena para WebDev y herramientas de producto, Fable 5(.1) sigue ostentando el récord de resolución de issues en SWE-Bench Pro y lidera en el índice de arnés propio de Artificial Analysis (70 frente a 67). El precio de la API es 2,5 veces el de Sol a 10/50 dólares, las lecturas de caché cuestan cuatro veces los 0,25 $ de Fable 5.1, las respuestas breves se saltan pasos de pulido de informes, y las salvaguardas cibernéticas más fuertes añaden fricción al trabajo cercano a exploits. Las tablas de lanzamiento se movieron tras publicarse: trata cualquier número aislado como ±1–2 puntos.

9.9 Nota editorial
Leer reseña
Ideal para

GPT-6 Astra toma la corona de programación del mismo modo honesto en que la tenía GPT-5.6: terminando el trabajo con forma de agente —sesiones de terminal, pipelines rotos, forensia de incidentes, configuraciones completas de escritorio— ahora respaldado por su nuevo nº 1 en la Code Arena de Arena.ai (WebDev con 1.797 pts) mientras consume aproximadamente un tercio de los tokens de Sol.

Por qué gana

Nuevo nº 1 en la Code Arena de Arena.ai: WebDev con 1.797 pts (ventaja de +35 pts sobre Claude Fable 5.1 Max con 1.762, +109 sobre Opus 5 Max con 1.688 y +180 sobre Sol en el puesto 13), liderando en Data & Analytics, Consumer Product y Content Creation Tools. A ello se suma Terminal-Bench 4.0 en 57,7–57,9% (Fable 5.1: 55,8%), el mejor de la tabla en DeepSWE v1.1 con 74,1%, Terminal-Bench Science en 64,6%, SRE-Bench en 88% pass@1 / 99,2% pass@4 y 100% en ExploitBench. Aunque el arnés propio de Artificial Analysis aún puntúa ligeramente por delante a Fable 5.1 (70 frente a 67), Astra redefine la frontera de Pareto a 40 $/Mtoken combinado y gasta alrededor de un tercio de los tokens de Sol.

Ten en cuenta

Incluso con la corona de nº 1 en Code Arena para WebDev y herramientas de producto, Fable 5(.1) sigue ostentando el récord de resolución de issues en SWE-Bench Pro y lidera en el índice de arnés propio de Artificial Analysis (70 frente a 67). El precio de la API es 2,5 veces el de Sol a 10/50 dólares, las lecturas de caché cuestan cuatro veces los 0,25 $ de Fable 5.1, las respuestas breves se saltan pasos de pulido de informes, y las salvaguardas cibernéticas más fuertes añaden fricción al trabajo cercano a exploits. Las tablas de lanzamiento se movieron tras publicarse: trata cualquier número aislado como ±1–2 puntos.

#2

Claude Opus 5

Anthropic

El programador de frontera que lidera la evidencia y verifica con una paciencia inusual. Opus 5 sigue como nuestro #2 solo porque esta guía concede a GPT-6 Astra un desempate explícito por integración con Codex, eficiencia en terminal y uso del ordenador, y coste por tarea terminada.

9.9 Nota editorial
Leer reseña
#3

Claude Fable 5.1

Anthropic

El motor de razonamiento de clase Mythos refinado para la codificación basada en agentes. Los mismos pesos que el restringido Mythos 5.1, pero optimizado con un descuento de caché del 75% que transforma la economía de la ingeniería a largo plazo. Se implementa mejor en Claude Code, donde su puntaje de 70 en el AA Coding Agent lidera el campo.

9.8 Nota editorial
Leer reseña
#4

Grok 4.6

xAI

Grok 4.6 es una mejora seria para agentes de código: mejor explorando repositorios, sosteniendo implementaciones y creando primeras versiones visuales, con precio de $2/$6 y acceso inmediato en Cursor y Grok Build.

9.7 Nota editorial
Leer reseña
#5

GLM-5.3

Z.ai (Zhipu AI)

Un agente de programación de pesos abiertos y gran tamaño, entrenado para la parte que viene después de la primera respuesta: planificar, editar, probar, recuperarse y mantener la orientación durante trabajos largos en repositorios.

9.2 Nota editorial
Leer reseña
#6

Qwen3.8-Max

Alibaba / Qwen Team

Un retador de alto valor, visual y de contexto largo para programación, que ahora se ubica en el puesto #6 luego de que pruebas independientes colocaran al modelo insignia GLM-5.3 por delante. Su punto de control del nivel Max descargable sigue siendo extraordinario, pero sus 2.4 billones de parámetros hacen que alojarlo uno mismo sea un proyecto digno de un centro de datos.

9.2 Nota editorial
Leer reseña
#7

GLM-5.3-Flash

Z.ai (Zhipu AI)

Programación y trabajo agéntico cerca de la frontera a precios excepcionalmente bajos, con visión nativa y un contexto de 1M. Aquí «Flash» significa eficiente y barato, no pequeño ni especialmente rápido.

9.2 Nota editorial
Leer reseña
Preguntas respondidas

Preguntas frecuentes