Imagine a dos técnicos frente a una mancha de humedad. Uno la pinta por encima y cierra la incidencia. El otro sigue la marca hasta la tubería que pierde agua, la repara y después revisa la habitación contigua. Claude Opus 5 está diseñado para programar como el segundo técnico.
Aquella evaluación de lanzamiento se llama ahora Terminal-Bench 3.0. Anthropic informó originalmente de 43,3%; el tablero público actual muestra alrededor de 42,7% para Opus 5 y 34,6% para la configuración citada de GPT-5.6 Sol. Las fotografías difieren un poco, pero ambas sostienen la misma conclusión: Opus es especialmente bueno ante trabajo de terminal desconocido.
Un ejemplo ilustra su carácter. Debía reconstruir una pieza mecánica desde un dibujo que no podía ver directamente. Escribió su propia canalización de visión, extrajo geometría de los píxeles y fabricó el modelo en FreeCAD. En otro caso encontró la causa raíz de un fallo y un borde que el parche de la comunidad había omitido. Son ejemplos del proveedor, no leyes universales, pero muestran el objetivo: investigar hasta que las pruebas coincidan.
Por qué supera a Fable 5
Fable todavía gana algunas fotos de meta: 53,5% en FrontierCode contra 53,4%, y cerca de medio punto más en el máximo de CursorBench. Pero una clasificación es una decisión de compra, no un museo de decimales. Opus 5 cuesta $5/$25 por millón de tokens, exactamente la mitad de Fable, no exige retención general de datos y aplica clasificadores menos restrictivos.
La señal independiente se ha fortalecido. Artificial Analysis v4.1.1 da a Opus 5 aproximadamente 63 y el primer lugar de su Intelligence Index, mientras su Coding Agent Index ronda 78,0. La misma prueba mantiene la etiqueta de advertencia: el esfuerzo max puede generar una enorme cantidad de tokens.
Por qué se queda por poco sin el #1
GPT-6 Astra lidera DeepSWE v1.1 con 74,1%, apenas por delante del 73,7% de Opus 5 en las tablas de septiembre, además de Terminal-Bench 4.0 con 57,9% y el mejor uso del ordenador del mercado. Artificial Analysis reescaló su tablero de agentes de programación con el lanzamiento de Astra (Fable 5.1 en torno a 70, Astra 67), de modo que los números antiguos de la era de Opus no son celdas comparables. Nuestro #1 sigue siendo Astra por un desempate de Codex, eficiencia y valor de ejecución, no porque programe claramente mejor que Opus.
La ruta sensata depende del trabajo:
| Trabajo | Mejor punto de partida |
|---|---|
| Error vago, búsqueda de causa raíz, cambio multarchivo, verificación visual del frontend | Opus 5 |
| Trabajo intensivo en terminal donde mandan la velocidad, el coste por tarea terminada y la ejecución | GPT-6 Astra |
| Una tarea de pico en CursorBench o FrontierCode donde el presupuesto sea secundario | Fable 5 |
| Tickets normales con un límite de coste firme | Empieza con esfuerzo bajo y escala después |
La ruta de actualización es benigna. Opus 5 conserva 1M de contexto, 128k de salida máxima, visión, PDF, caché de prompts, procesamiento por lotes y las herramientas de Claude. El pensamiento es adaptativo y viene activo; el esfuerzo va de low a max. Los prompts de Opus 4.8 deberían transferirse en su mayoría, pero web fetch de API y Priority Tier no están disponibles en el lanzamiento.
La conclusión es sencilla: Opus 5 reemplaza por completo a Opus 4.8 y hace más difícil justificar Fable 5 para el volumen cotidiano de producción. Fable sigue siendo el especialista caro con unas pocas ventajas estrechas. Opus 5 es el modelo que puedes dar a más ingenieros, para más tareas y durante más tiempo, sin dejar de pagar el ciclo de verificación que vuelve valioso su criterio.