Puesto #1 Ecosistema Diario — Los Asistentes Líderes
Anthropic

Claude — Opus 5

El nuevo líder cotidiano en inteligencia: Opus 5 lleva criterio cercano a Fable a un modelo que personas y empresas pueden usar a escala. Lidera pruebas independientes iniciales, cuesta la mitad que Fable 5 y está ampliamente disponible.

Actualizado 25 de julio de 2026 Knowledge Work SOTA1M ContextReasoning
Ideal para

El nuevo líder cotidiano en inteligencia: Opus 5 lleva criterio cercano a Fable a un modelo que personas y empresas pueden usar a escala. Lidera pruebas independientes iniciales, cuesta la mitad que Fable 5 y está ampliamente disponible.

Por qué gana

GDPval-AA v2 Elo 1861, ARC-AGI-3 30,2%, BrowseComp 90,8%, OSWorld 2.0 70,6%, AutomationBench 26,0% y HLE con herramientas 64,7%. Artificial Analysis puntúa max con 61 y #1. Contexto 1M, salida 128k, $5/$25 y sin requisito general de retención.

Ten en cuenta

La corona es provisional: hay menos de 48 horas de datos independientes. Fable gana pruebas especializadas, GPT-5.6 conserva el mayor ecosistema de consumo y Claude no genera imágenes. Max es lento y verboso; los límites de los planes siguen importando.

01

Lo que realmente es

Muchos chatbots recuerdan a un becario brillante en un lunes caótico: rápidos, entusiastas y perfectamente capaces de entregar una hoja de cálculo impecable cuyo total final está, sin que nadie lo note, mal calculado. Claude Opus 5 se parece más al compañero que vuelve a comprobar las fórmulas antes de pulsar «Enviar».

Ese criterio lo lleva directamente al #1 cotidiano. La tabla de Anthropic le da 1861 Elo en GDPval-AA v2, una evaluación de tareas profesionales útiles. Fable 5 obtiene 1747, GPT-5.6 Sol 1736 y Opus 4.8 1593. Box informa un 8% de mejora general frente a 4.8, más en análisis y diligencia debida. Un cliente financiero vio nueve puntos más de precisión, menos pasos y 60% menos tiempo. Son informes iniciales, pero dibujan lo mismo: más cuidado y menos vueltas.

Más que una máquina de escribir culta

Opus 5 logra 70,6% en OSWorld 2.0, donde debe usar un ordenador de verdad. En AutomationBench alcanza 26,0%, cerca de una vez y media el siguiente resultado. Zapier informa de que Opus 5 completó de principio a fin un proceso para retener clientes: leyó los indicadores de salud de las cuentas, identificó a los clientes con riesgo de marcharse, avisó a los responsables de esas cuentas y preparó un resumen. Los modelos anteriores no lograban terminar toda la cadena.

El número más extraño es 30,2% en ARC-AGI-3. Mide aprender problemas desconocidos de forma interactiva, más parecido a descubrir las reglas de un juego que recordar un dato. Sol obtuvo 7,8%. Un benchmark no es un alma, pero sí sugiere talento cuando las instrucciones dejan de llevarlo de la mano.

Artificial Analysis respalda la dirección: 61 y primer puesto con max; high 59 y xhigh 60. Puede comprar más reflexión para un contrato o modelo financiero y bajar el dial para un borrador.

Por qué supera a Fable 5

Fable gana por poco en HLE sin herramientas, FrontierCode, el máximo CursorBench y una prueba legal. Si su evaluación privada coincide, úselo. Pero Fable cuesta $10/$50 por millón; Opus 5 cuesta $5/$25, no exige retención general y tiene clasificadores menos restrictivos. Fable es el prototipo de carreras; Opus 5 es el coche de carretera casi igual de rápido, con medio consumo y permiso para circular por más sitios.

GPT-5.6 sigue siendo un sistema excelente. ChatGPT une Work, Codex, imágenes, Sites, apps, navegador y escritorio. Claude no genera imágenes y sus límites pueden ser más estrechos. El ranking afirma que Opus 5 ofrece hoy la mejor mezcla de criterio, agencia profesional, precio y disponibilidad; no que todos deban cancelar ChatGPT.

El banco de trabajo incluye 1M de contexto, 128k de salida, visión, PDF, archivos, memoria, búsqueda web y uso del ordenador. Pero los datos independientes son jóvenes, max puede hablar demasiado y faltan web fetch y Priority Tier. Opus 5 no es Fable barato: es la mejor decisión cotidiana.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • El trabajo profesional manda: 1861 Elo en GDPval-AA v2, por encima de Fable 5 (1747) y Sol (1736), con mejoras tempranas en finanzas, derecho, hojas de cálculo y diligencia debida.
  • Opera, no solo responde: 70,6% en OSWorld 2.0 y 26,0% en AutomationBench lideran navegación de software y flujos empresariales.
  • Resuelve problemas nuevos: 30,2% en ARC-AGI-3, casi cuatro veces el 7,8% de Sol; Artificial Analysis lo coloca primero con 61.
  • Calidad Fable sin impuesto Fable: $5/$25, la mitad del precio; sin retención general y con clasificadores menos frecuentes.
  • Un espacio profesional serio: 1M de contexto, 128k de salida, visión de documentos, hojas complejas, presentaciones, búsqueda web, archivos, PDF, memoria y uso del ordenador.

Limitaciones honestas

  • Corona de semana de lanzamiento: La mayoría de comparaciones individuales son de Anthropic; un índice independiente no es una constitución eterna.
  • ChatGPT sigue siendo la plataforma mayor: Claude carece de imágenes nativas y de la unión de Work, Codex, Sites, plugins, navegador y escritorio.
  • Fable conserva victorias especialistas: HLE sin herramientas, FrontierCode, CursorBench y legal; Mythos sigue más fuerte en ciber ofensivo y biología autónoma.
  • Max tiene hambre: Mucha verbosidad y latencia xhigh. Compare el costo de la tarea acabada, no solo la tarifa por token.
  • Hay ajustes de integración: Sin web fetch ni Priority Tier, pensamiento activo, muestreo limitado y topes de uso que pueden cortar tareas largas.
03

Resumen de Benchmarks

GDPval-AA v2 — 1861 Elo (#1)

Por delante de Fable 5 (1747), Sol (1736) y Opus 4.8 (1593) en trabajo profesional.

ARC-AGI-3 — 30,2% (#1)

Problemas interactivos nuevos: casi cuatro veces Sol (7,8%) y muy por encima de 4.8 (1,5%).

OSWorld 2.0 — 70,6% (#1)

Uso de aplicaciones de escritorio, delante de Fable 5 (66,1%) y Sol (62,6%).

AutomationBench — 26,0% (#1)

Flujos empresariales completos, alrededor de 1,5 veces Fable 5 (17,4%).

Artificial Analysis Intelligence Index — 61 (#1)

Compuesto independiente de nueve pruebas; high 59, xhigh 60, con alto consumo en max.

04

El Veredicto

Claude Opus 5 ocupa nuestro #1 cotidiano, apenas por delante de GPT-5.6 y claramente sobre Fable 5. Lidera la mezcla más útil de trabajo profesional, problemas nuevos, búsqueda, ordenador y automatización, a mitad de precio que Fable y con menos restricciones.

05

Preguntas frecuentes