Puesto #2 Programación — IA que Escribe Software de Producción
Anthropic

Claude Opus 5

El programador de frontera práctico: Opus 5 combina el criterio de Fable con el precio de Opus y una verificación especialmente paciente. Es nuestro #2 porque lidera Frontier-Bench, casi iguala a Fable 5 en CursorBench y cuesta la mitad por token.

Actualizado 25 de julio de 2026 Agentic CodingFrontier-Bench SOTARoot-Cause Debugging
Ideal para

El programador de frontera práctico: Opus 5 combina el criterio de Fable con el precio de Opus y una verificación especialmente paciente. Es nuestro #2 porque lidera Frontier-Bench, casi iguala a Fable 5 en CursorBench y cuesta la mitad por token.

Por qué gana

43,3% en Frontier-Bench v0.1, por delante de GPT-5.6 Sol (34,4%) y Fable 5 (33,7%). En esfuerzo máximo queda a 0,5 puntos del pico de Fable en CursorBench 3.2 con la mitad de costo por tarea. DeepSWE 68,8%, FrontierCode 53,4%, contexto de 1M, salida de 128k y $5/$25 por millón de tokens.

Ten en cuenta

No es campeón absoluto: GPT-5.6 Sol lidera DeepSWE y Terminal-Bench y, en la comparación actual de Artificial Analysis, termina cada tarea más rápido y por menos dinero, aunque ambos sistemas empatan con 67 en el Coding Agent Index. Fable conserva ventajas mínimas en FrontierCode y CursorBench; los datos independientes aún son recientes y max puede ser verboso.

01

Lo que realmente es

Imagine a dos técnicos frente a una mancha de humedad. Uno la pinta por encima y cierra la incidencia. El otro sigue la marca hasta la tubería que pierde agua, la repara y después revisa la habitación contigua. Claude Opus 5 está diseñado para programar como el segundo técnico.

Por eso el número clave es 43,3% en Frontier-Bench v0.1. La evaluación pide resolver ingeniería desconocida usando terminal y herramientas. En la comparación de Anthropic, GPT-5.6 Sol logró 34,4%, Fable 5 33,7% y Opus 4.8 21,1%. Opus 5 no se limita a sustituir a 4.8: casi duplica su resultado.

Un ejemplo ilustra su carácter. Debía reconstruir una pieza mecánica desde un dibujo que no podía ver directamente. Escribió su propia canalización de visión, extrajo geometría de los píxeles y fabricó el modelo en FreeCAD. En otro caso encontró la causa raíz de un fallo y un borde que el parche de la comunidad había omitido. Son ejemplos del proveedor, no leyes universales, pero muestran el objetivo: investigar hasta que las pruebas coincidan.

Por qué supera a Fable 5

Fable todavía gana algunas fotos de meta: 53,5% en FrontierCode contra 53,4%, y cerca de medio punto más en el máximo de CursorBench. Pero una clasificación es una decisión de compra, no un museo de decimales. Opus 5 cuesta $5/$25 por millón de tokens, exactamente la mitad de Fable, no exige retención general de datos y aplica clasificadores menos restrictivos.

Artificial Analysis aporta la primera señal independiente: 61 y primer lugar con max. High y xhigh obtienen 59 y 60. La advertencia es importante: max generó muchísimos tokens. Un modelo a mitad de precio aún puede producir una factura completa si escribe una novela para arreglar un botón.

Por qué se queda por poco sin el #1

GPT-5.6 Sol lidera DeepSWE v1.1 con 72,7%, frente a 69,7% de Fable y 68,8% de Opus 5. Sin embargo, en la comparación directa actual de Artificial Analysis, Claude Code con Opus 5 y Codex con GPT-5.6 Sol empatan con 67 en el Coding Agent Index general. El reparto aclara más que el empate: GPT gana DeepSWE y Terminal-Bench y termina las tareas más rápido y por menos dinero; Opus gana la prueba de comprensión del repositorio. GPT-5.6 ocupa por tanto el primer puesto por un desempate de eficiencia y terminal, no porque programe claramente mejor que Opus 5 en todo.

La ruta sensata es sencilla: Opus 5 para errores vagos, causas raíz, cambios multarchivo y verificación visual; Sol para maratones de terminal; Fable solo cuando su diminuta ventaja máxima compensa el doble de precio.

La migración conserva contexto de 1M, salida de 128k, visión, PDF, caché, lotes y herramientas. El pensamiento adaptativo está activo por defecto. Solo faltan web fetch y Priority Tier. Opus 5 reemplaza por completo a Opus 4.8 y hace difícil justificar Fable para el volumen cotidiano.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Líder en Frontier-Bench: 43,3% frente a 34,4% de Sol, 33,7% de Fable 5 y 21,1% de Opus 4.8. Mide a un agente que vive en la terminal, usa herramientas y termina ingeniería desconocida.
  • Verifica antes de celebrar: Encontró causas raíz, construyó un banco de pruebas sin datos en vivo y revisó interfaces en escritorio y móvil antes de declararlas listas.
  • Casi Fable por la mitad: A esfuerzo máximo queda a 0,5 puntos de Fable en CursorBench, con tokens a $5/$25 en vez de $10/$50.
  • El repositorio cabe en la mesa: Contexto predeterminado de 1M y salida máxima de 128k, con instrucciones, herramientas y razonamiento estables en contexto largo.
  • Disponible donde trabajan los equipos: claude-opus-5 llega a Claude Code, API, Bedrock, Vertex AI y Microsoft Foundry. Fast mode ofrece unas 2,5× más velocidad al doble de precio base.

Limitaciones honestas

  • GPT-5.6 domina carriles importantes: 68,8% en DeepSWE frente a 72,7% de Sol. En la comparación directa de Artificial Analysis empatan 67 a 67, pero GPT-5.6 gana DeepSWE y Terminal-Bench y acaba las tareas antes y por menos dinero. Esa eficiencia decide nuestro estrecho desempate por el #1.
  • Fable retiene picos estrechos: 53,5% frente a 53,4% en FrontierCode y un máximo ligeramente mayor en CursorBench.
  • Max puede comerse el ahorro: Artificial Analysis observó mucha verbosidad. Un token barato no ayuda si el agente consume el doble.
  • Dos tropiezos de migración: Sin web fetch ni Priority Tier; pensamiento activado por defecto, parámetros de muestreo personalizados rechazados y prompts que conviene reevaluar.
  • Los límites de seguridad se notan: Puede hallar vulnerabilidades en código fuente, pero bloquea pentesting, generación de exploits y escaneo binario fuera de programas aprobados.
03

Resumen de Benchmarks

Frontier-Bench v0.1 — 43,3% (#1)

Ejecución de Anthropic con mini-SWE-agent y cinco intentos por tarea; supera a Sol (34,4%) y Fable 5 (33,7%).

CursorBench 3.2 — a 0,5 puntos de Fable 5

Casi empate a esfuerzo máximo y mitad de costo; Cursor advierte que diferencias pequeñas pueden no ser significativas.

DeepSWE v1.1 — 68,8%

Fuerte trabajo prolongado en repositorios, detrás de Fable 5 (69,7%) y Sol (72,7%).

FrontierCode 1.1 Main — 53,4%

Empate práctico con Fable 5 (53,5%) y por delante de Sol (47,5%).

Artificial Analysis Intelligence Index — 61 (#1)

Resultado independiente temprano en nueve evaluaciones; apoya la capacidad y también alerta sobre el consumo de tokens.

04

El Veredicto

Claude Opus 5 es nuestro #2 en programación: supera a Fable 5 y está prácticamente empatado con GPT-5.6 en capacidad general. Opus gana Frontier-Bench y la prueba de comprensión de repositorios, casi iguala los picos de Fable y cuesta la mitad que Fable. GPT-5.6 vence en nuestro estrecho desempate gracias a DeepSWE, Terminal-Bench y una ejecución más rápida y barata. Use Opus 5 cuando el trabajo sea ambiguo, multarchivo y exija criterio y verificación.

05

Preguntas frecuentes