Puesto #2 Programación — IA que Escribe Software de Producción
Anthropic

Claude Opus 5

El programador de frontera que lidera la evidencia y verifica con una paciencia inusual. Opus 5 sigue como nuestro #2 solo porque esta guía concede a GPT-6 Astra un desempate explícito por integración con Codex, eficiencia en terminal y uso del ordenador, y coste por tarea terminada.

Actualizado 29 de agosto de 2026 Agentic CodingFrontier-Bench SOTARoot-Cause Debugging
Ideal para

El programador de frontera que lidera la evidencia y verifica con una paciencia inusual. Opus 5 sigue como nuestro #2 solo porque esta guía concede a GPT-6 Astra un desempate explícito por integración con Codex, eficiencia en terminal y uso del ordenador, y coste por tarea terminada.

Por qué gana

La evidencia del período de lanzamiento del Artificial Analysis Coding Agent Index situó a Opus cerca de 78,0, apenas por encima del 77,4 de GPT-5.6 Sol; el tablero se reescaló con el lanzamiento de GPT-6 Astra en septiembre (Fable 5.1 en torno a 70, Astra 67), así que esas generaciones de números no son comparables. El tablero público de Terminal-Bench 3.0 registra alrededor de 42,7%, mientras Intelligence Index v4.1.1 ronda 63. Conserva contexto de 1M, salida de 128k y precio de $5/$25.

Ten en cuenta

Su puesto #2 es una decisión editorial de producto, no el orden actual de los benchmarks. GPT-6 Astra todavía lidera Terminal-Bench, DeepSWE y los carriles científico y de SRE, mientras Opus con esfuerzo max puede ser verboso y más lento. Las puntuaciones de lanzamiento de Anthropic y los tableros públicos actuales son fotografías relacionadas, pero no cifras intercambiables.

01

Lo que realmente es

Imagine a dos técnicos frente a una mancha de humedad. Uno la pinta por encima y cierra la incidencia. El otro sigue la marca hasta la tubería que pierde agua, la repara y después revisa la habitación contigua. Claude Opus 5 está diseñado para programar como el segundo técnico.

Aquella evaluación de lanzamiento se llama ahora Terminal-Bench 3.0. Anthropic informó originalmente de 43,3%; el tablero público actual muestra alrededor de 42,7% para Opus 5 y 34,6% para la configuración citada de GPT-5.6 Sol. Las fotografías difieren un poco, pero ambas sostienen la misma conclusión: Opus es especialmente bueno ante trabajo de terminal desconocido.

Un ejemplo ilustra su carácter. Debía reconstruir una pieza mecánica desde un dibujo que no podía ver directamente. Escribió su propia canalización de visión, extrajo geometría de los píxeles y fabricó el modelo en FreeCAD. En otro caso encontró la causa raíz de un fallo y un borde que el parche de la comunidad había omitido. Son ejemplos del proveedor, no leyes universales, pero muestran el objetivo: investigar hasta que las pruebas coincidan.

Por qué supera a Fable 5

Fable todavía gana algunas fotos de meta: 53,5% en FrontierCode contra 53,4%, y cerca de medio punto más en el máximo de CursorBench. Pero una clasificación es una decisión de compra, no un museo de decimales. Opus 5 cuesta $5/$25 por millón de tokens, exactamente la mitad de Fable, no exige retención general de datos y aplica clasificadores menos restrictivos.

La señal independiente se ha fortalecido. Artificial Analysis v4.1.1 da a Opus 5 aproximadamente 63 y el primer lugar de su Intelligence Index, mientras su Coding Agent Index ronda 78,0. La misma prueba mantiene la etiqueta de advertencia: el esfuerzo max puede generar una enorme cantidad de tokens.

Por qué se queda por poco sin el #1

GPT-6 Astra lidera DeepSWE v1.1 con 74,1%, apenas por delante del 73,7% de Opus 5 en las tablas de septiembre, además de Terminal-Bench 4.0 con 57,9% y el mejor uso del ordenador del mercado. Artificial Analysis reescaló su tablero de agentes de programación con el lanzamiento de Astra (Fable 5.1 en torno a 70, Astra 67), de modo que los números antiguos de la era de Opus no son celdas comparables. Nuestro #1 sigue siendo Astra por un desempate de Codex, eficiencia y valor de ejecución, no porque programe claramente mejor que Opus.

La ruta sensata depende del trabajo:

Trabajo Mejor punto de partida
Error vago, búsqueda de causa raíz, cambio multarchivo, verificación visual del frontend Opus 5
Trabajo intensivo en terminal donde mandan la velocidad, el coste por tarea terminada y la ejecución GPT-6 Astra
Una tarea de pico en CursorBench o FrontierCode donde el presupuesto sea secundario Fable 5
Tickets normales con un límite de coste firme Empieza con esfuerzo bajo y escala después

La ruta de actualización es benigna. Opus 5 conserva 1M de contexto, 128k de salida máxima, visión, PDF, caché de prompts, procesamiento por lotes y las herramientas de Claude. El pensamiento es adaptativo y viene activo; el esfuerzo va de low a max. Los prompts de Opus 4.8 deberían transferirse en su mayoría, pero web fetch de API y Priority Tier no están disponibles en el lanzamiento.

La conclusión es sencilla: Opus 5 reemplaza por completo a Opus 4.8 y hace más difícil justificar Fable 5 para el volumen cotidiano de producción. Fable sigue siendo el especialista caro con unas pocas ventajas estrechas. Opus 5 es el modelo que puedes dar a más ingenieros, para más tareas y durante más tiempo, sin dejar de pagar el ciclo de verificación que vuelve valioso su criterio.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Liderazgo en Terminal-Bench 3.0: El benchmark presentado antes como Frontier-Bench sitúa ahora a Opus 5 alrededor de 42,7% en su tablero público, por delante del 34,6% de la configuración citada de GPT-5.6 Sol. Premia a un agente capaz de vivir en la terminal y terminar trabajo de ingeniería desconocido.
  • Verifica antes de celebrar: En los ejemplos de Anthropic, Opus 5 encontró causas raíz que otro modelo solo parcheó en la superficie, construyó su propio banco de pruebas cuando no existía un flujo de datos en vivo, y revisó interfaces web en anchos de escritorio y móvil antes de declararlas terminadas.
  • Casi Fable por la mitad del precio por token: A esfuerzo max queda a 0,5 puntos porcentuales del mejor resultado de Fable 5 en CursorBench 3.2, según Anthropic, mientras los tokens de entrada y salida cuestan $5/$25 en vez de $10/$50.
  • El repositorio completo cabe en la mesa: La ventana de contexto de 1M de tokens viene por defecto, la salida máxima es de 128k, y Anthropic afirma que el seguimiento de instrucciones, el uso de herramientas y el razonamiento se mantienen coherentes a lo largo de un contexto extenso. Eso es fundamental para migraciones e investigaciones en múltiples archivos.
  • Disponible donde ya trabajan los equipos: El identificador del modelo es claude-opus-5; llega en Claude Code y la API de Claude, con presencia en Amazon Bedrock, Google Cloud Vertex AI y Microsoft Foundry. Fast mode cobra el doble del precio base a cambio de unas 2,5× más velocidad.

Limitaciones honestas

  • GPT-6 Astra conserva carriles importantes: Opus 5 obtiene 73,7% en DeepSWE v1.1, justo por detrás del 74,1% de Astra en las tablas de septiembre; Astra lidera además Terminal-Bench 4.0 con 57,9% y consume cerca de un tercio de los tokens de Sol. Artificial Analysis reescaló su tablero de programación con el lanzamiento de Astra (Fable 5.1 en torno a 70, Astra 67), así que las comparaciones de índice entre épocas no son equivalentes — pero la integración con Codex y la eficiencia en tokens de Astra siguen siendo nuestro desempate por el #1.
  • Fable conserva picos estrechos: Fable 5 logra 53,5% frente al 53,4% de Opus 5 en FrontierCode 1.1 Main, y Anthropic sitúa a Opus 5 justo por debajo del máximo de Fable en CursorBench. Las pequeñas diferencias no son verdades universales, pero tampoco deben borrarse.
  • Max puede comerse el ahorro: Las pruebas independientes de Artificial Analysis encontraron que Opus 5 max es muy capaz, pero verboso. Un token más barato no sirve si el agente consume el doble; prueba distintos niveles de esfuerzo con tus propias tareas.
  • La migración tiene dos tropiezos de plataforma: Web fetch y Priority Tier no están disponibles en el lanzamiento. El pensamiento viene activado por defecto, se rechazan los parámetros de muestreo no predeterminados y los equipos que migran desde Claude anteriores deben volver a probar presupuestos de tokens y prompts.
  • Los límites de seguridad siguen visibles: Opus 5 puede hallar vulnerabilidades en código fuente, pero los clasificadores bloquean pentesting, generación de exploits y análisis de vulnerabilidades en binarios fuera de programas aprobados. Los especialistas defensivos aún pueden sufrir falsos positivos.
03

Resumen de Benchmarks

Terminal-Bench 3.0 — cerca de 42,7%

El resultado público actual sucede a la ejecución de lanzamiento de Frontier-Bench, que marcó 43,3%. La fotografía y el harness difieren, así que conviene usar el nombre actual y fechar la puntuación.

CursorBench 3.2 — a 0,5 puntos de Fable 5

Casi empate a esfuerzo máximo y mitad de costo; Cursor advierte que diferencias pequeñas pueden no ser significativas.

DeepSWE v1.1 — 68,8%

Fuerte trabajo prolongado en repositorios, detrás de Fable 5 (69,7%) y Sol (72,7%).

FrontierCode 1.1 Main — 53,4%

Empate práctico con Fable 5 (53,5%) y por delante de Sol (47,5%).

Artificial Analysis Intelligence Index — cerca de 63 (#1)

La evidencia independiente actual de la versión 4.1.1 coloca a Opus 5 en la frontera de inteligencia general. La puntuación de lanzamiento de 61 ya está obsoleta.

04

El Veredicto

Claude Opus 5 es nuestro modelo de programación #2 aunque la evidencia independiente amplia actual lo sitúa por poco en primer lugar. Es deliberado: esta guía concede a GPT-6 Astra un desempate de producto por integración con Codex, eficiencia en terminal y uso del ordenador, enrutamiento y coste por tarea terminada. Empieza con Opus para trabajo vago y multarchivo donde importen la arquitectura y la verificación; empieza con Astra para rendimiento intensivo en terminal y trabajo de escritorio. El ranking expone su ponderación en lugar de reescribir el tablero en vivo.

05

Preguntas frecuentes