Muchos chatbots recuerdan a un becario brillante en un lunes caótico: rápidos, entusiastas y perfectamente capaces de entregar una hoja de cálculo impecable cuyo total final está, sin que nadie lo note, mal calculado. Claude Opus 5 se parece más al compañero que vuelve a comprobar las fórmulas antes de pulsar «Enviar».
Ese criterio lo lleva directamente al #1 cotidiano. La tabla de Anthropic le da 1861 Elo en GDPval-AA v2, una evaluación de tareas profesionales útiles. Fable 5 obtiene 1747, GPT-5.6 Sol 1736 y Opus 4.8 1593. Box informa un 8% de mejora general frente a 4.8, más en análisis y diligencia debida. Un cliente financiero vio nueve puntos más de precisión, menos pasos y 60% menos tiempo. Son informes iniciales, pero dibujan lo mismo: más cuidado y menos vueltas.
Más que una máquina de escribir culta
Opus 5 logra 70,6% en OSWorld 2.0, donde debe usar un ordenador de verdad. En AutomationBench alcanza 26,0%, cerca de una vez y media el siguiente resultado. Zapier informa de que Opus 5 completó de principio a fin un proceso para retener clientes: leyó los indicadores de salud de las cuentas, identificó a los clientes con riesgo de marcharse, avisó a los responsables de esas cuentas y preparó un resumen. Los modelos anteriores no lograban terminar toda la cadena.
El número más extraño es 30,2% en ARC-AGI-3. Mide aprender problemas desconocidos de forma interactiva, más parecido a descubrir las reglas de un juego que recordar un dato. Sol obtuvo 7,8%. Un benchmark no es un alma, pero sí sugiere talento cuando las instrucciones dejan de llevarlo de la mano.
Artificial Analysis respalda la dirección: 61 y primer puesto con max; high 59 y xhigh 60. Puede comprar más reflexión para un contrato o modelo financiero y bajar el dial para un borrador.
Por qué supera a Fable 5
Fable gana por poco en HLE sin herramientas, FrontierCode, el máximo CursorBench y una prueba legal. Si su evaluación privada coincide, úselo. Pero Fable cuesta $10/$50 por millón; Opus 5 cuesta $5/$25, no exige retención general y tiene clasificadores menos restrictivos. Fable es el prototipo de carreras; Opus 5 es el coche de carretera casi igual de rápido, con medio consumo y permiso para circular por más sitios.
GPT-5.6 sigue siendo un sistema excelente. ChatGPT une Work, Codex, imágenes, Sites, apps, navegador y escritorio. Claude no genera imágenes y sus límites pueden ser más estrechos. El ranking afirma que Opus 5 ofrece hoy la mejor mezcla de criterio, agencia profesional, precio y disponibilidad; no que todos deban cancelar ChatGPT.
El banco de trabajo incluye 1M de contexto, 128k de salida, visión, PDF, archivos, memoria, búsqueda web y uso del ordenador. Pero los datos independientes son jóvenes, max puede hablar demasiado y faltan web fetch y Priority Tier. Opus 5 no es Fable barato: es la mejor decisión cotidiana.