Puesto #1 Ecosistema Diario — Los Asistentes Líderes
Anthropic

Claude — Opus 5

El nuevo líder cotidiano en inteligencia: Opus 5 lleva un criterio parecido al de Fable a un modelo que personas y empresas pueden usar realmente a escala. Encabeza las primeras pruebas independientes de inteligencia y las comparaciones de Anthropic en trabajo profesional y uso del ordenador, cuesta la mitad que Fable 5 y está ampliamente disponible en Claude, las nubes y la API.

Actualizado 29 de agosto de 2026 Knowledge Work SOTA1M ContextReasoning
Ideal para

El nuevo líder cotidiano en inteligencia: Opus 5 lleva un criterio parecido al de Fable a un modelo que personas y empresas pueden usar realmente a escala. Encabeza las primeras pruebas independientes de inteligencia y las comparaciones de Anthropic en trabajo profesional y uso del ordenador, cuesta la mitad que Fable 5 y está ampliamente disponible en Claude, las nubes y la API.

Por qué gana

GDPval-AA v2 Elo 1861 en el lanzamiento, ARC-AGI-3 30,2%, OSWorld 2.0 70,6% y 64,7% en Humanity's Last Exam con herramientas. Artificial Analysis v4.1.1 puntúa ahora el esfuerzo max alrededor de 63 y #1 general. Opus también ofrece contexto de 1M, salida de 128k y precio de $5/$25.

Ten en cuenta

Fable 5 todavía gana algunas evaluaciones especializadas, GPT-5.6 conserva el ecosistema de consumo más amplio y Opus 5 no genera imágenes de forma nativa. Max es lento y verboso, los valores Elo en vivo cambian y los límites de uso de los planes gratuitos y de pago de Claude siguen importando.

01

Lo que realmente es

Muchos chatbots recuerdan a un becario brillante en un lunes caótico: rápidos, entusiastas y perfectamente capaces de entregar una hoja de cálculo impecable cuyo total final está, sin que nadie lo note, mal calculado. Claude Opus 5 se parece más al compañero que vuelve a comprobar las fórmulas antes de pulsar «Enviar».

Ese criterio lo lleva directamente al #1 cotidiano. La tabla de Anthropic le da 1861 Elo en GDPval-AA v2, una evaluación de tareas profesionales útiles. Fable 5 obtiene 1747, GPT-5.6 Sol 1736 y Opus 4.8 1593. Box informa un 8% de mejora general frente a 4.8, más en análisis y diligencia debida. Un cliente financiero vio nueve puntos más de precisión, menos pasos y 60% menos tiempo. Son informes iniciales, pero dibujan lo mismo: más cuidado y menos vueltas.

Más que una máquina de escribir culta

Opus 5 logra 70,6% en OSWorld 2.0, donde debe usar un ordenador de verdad. En AutomationBench alcanza 26,0%, cerca de una vez y media el siguiente resultado. Zapier informa de que Opus 5 completó de principio a fin un proceso para retener clientes: leyó los indicadores de salud de las cuentas, identificó a los clientes con riesgo de marcharse, avisó a los responsables de esas cuentas y preparó un resumen. Los modelos anteriores no lograban terminar toda la cadena.

El número más extraño es 30,2% en ARC-AGI-3. Mide aprender problemas desconocidos de forma interactiva, más parecido a descubrir las reglas de un juego que recordar un dato. Sol obtuvo 7,8%. Un benchmark no es un alma, pero sí sugiere talento cuando las instrucciones dejan de llevarlo de la mano.

Las pruebas independientes ya respaldan algo más que la dirección del lanzamiento. Artificial Analysis v4.1.1 da a Opus 5 con esfuerzo max aproximadamente 63, actualmente el primer lugar de su Intelligence Index. La escala exacta cambia a medida que evoluciona la evaluación, así que la versión y la fecha de consulta deben acompañar a la puntuación.

Por qué supera a Fable 5

Fable gana por poco en HLE sin herramientas, FrontierCode, el máximo CursorBench y una prueba legal. Si tu evaluación privada coincide, úsalo. Pero Fable cuesta $10/$50 por millón de tokens de entrada/salida. Opus 5 cuesta $5/$25, no exige retención general de datos y se espera que sus clasificadores intervengan con mucha menos frecuencia.

Piensa en Fable como un prototipo de carreras y en Opus 5 como el coche de carretera que es casi igual de rápido, cuesta la mitad de mantener y puede circular legalmente mucho más allá del circuito. Para el trabajo diario, el coche de carretera es la máquina más útil.

Por qué ChatGPT sigue siendo relevante

GPT-5.6 sigue siendo un sistema excelente. ChatGPT une Work, Codex, generación de imágenes, Sites, apps conectadas, navegador y uso del ordenador de escritorio en un ecosistema enorme. Claude no genera imágenes de forma nativa y los límites de sus planes pueden ser más estrechos. El ranking afirma que Opus 5 ofrece hoy la mejor mezcla de calidad de razonamiento, agencia profesional, precio y facilidad de despliegue; no que todos deban cancelar ChatGPT.

El banco de trabajo incluye 1M de tokens de contexto por defecto, 128k de salida máxima, visión para gráficos y documentos, PDF, archivos, memoria, búsqueda web, herramientas y uso del ordenador. El modelo de API es claude-opus-5, con soporte en la plataforma de Anthropic y las principales nubes. Fast mode funciona unas 2,5 veces más rápido al doble del precio base por token.

Hay matices. Los datos independientes siguen siendo jóvenes. Max puede ser verboso y xhigh tiene una latencia apreciable hasta el primer token. Web fetch de API y Priority Tier faltan en el lanzamiento. La práctica sensata es empezar más abajo, verificar el resultado y subir el esfuerzo solo cuando el coste de equivocarse sea mayor que el coste de pensar.

Opus 5 no es solo un Fable 5 más barato: es la mejor decisión cotidiana. Sustituye a Opus 4.8, gana suficientes pruebas importantes para desafiar a la frontera absoluta y vuelve asequible el criterio cuidadoso de la IA para un martes cualquiera, no solo para el proyecto que recibe un cheque en blanco.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • El trabajo profesional manda: Opus 5 alcanza 1861 Elo en GDPval-AA v2 en la comparación de lanzamiento de Anthropic, por encima de Fable 5 con 1747 y GPT-5.6 Sol con 1736. Los primeros clientes también informan de mejoras en finanzas, derecho, hojas de cálculo y diligencia debida.
  • Opera, no solo responde: El modelo obtiene 70,6% en OSWorld 2.0 y 26,0% en AutomationBench, liderando los modelos comparados. Es evidencia sobre navegar software y completar flujos empresariales, no solo sobre redactar un párrafo ingenioso.
  • Resuelve problemas nuevos de verdad: Su 30,2% en ARC-AGI-3 es casi cuatro veces el 7,8% de GPT-5.6 Sol en la tabla de Anthropic. Artificial Analysis sitúa ahora el esfuerzo max primero en su Intelligence Index amplio, con alrededor de 63.
  • Calidad cercana a Fable sin el impuesto Fable: La API cuesta $5/$25 por millón de tokens de entrada/salida, la mitad que Fable 5. Opus 5 tampoco exige retención de datos para el acceso general, mientras Fable puede requerir aceptarla en ciertos despliegues.
  • Un espacio profesional serio: Un millón de tokens de contexto, 128k de salida, buena visión de documentos y gráficos, hojas de cálculo con varias pestañas, presentaciones, búsqueda web, archivos, PDF, memoria y uso del ordenador lo hacen útil más allá del chat.

Limitaciones honestas

  • Toda corona necesita fecha: Anthropic proporcionó la mayoría de las comparaciones por tarea, mientras los valores Elo y las versiones de los compuestos siguen cambiando. El #1 de Artificial Analysis es evidencia independiente sólida, no una constitución permanente.
  • ChatGPT sigue siendo la plataforma de consumo mayor: Claude carece de generación de imágenes nativa y no iguala la combinación de Chat, Work, Codex, Sites, plugins, navegador y escritorio de ChatGPT. Opus 5 lidera nuestra puntuación de calidad y valor; GPT-5.6 aún puede ser la suscripción única más sencilla.
  • Fable conserva victorias especializadas: Fable 5 aventaja por poco en Humanity’s Last Exam sin herramientas, FrontierCode, CursorBench y una prueba legal reservada; Mythos sigue más fuerte en ciberseguridad ofensiva y biología autónoma.
  • El esfuerzo máximo tiene hambre: Artificial Analysis midió max como muy verboso, mientras xhigh fue más lento que el promedio. Empieza con high o xhigh solo cuando la tarea lo merezca y compara el coste total de la tarea terminada, no solo la tarifa por token.
  • Algunas integraciones exigen ajustes: Web fetch de API y Priority Tier faltan en el lanzamiento. El pensamiento viene activo, los controles de muestreo están restringidos y los topes de uso de Claude todavía pueden interrumpir un flujo largo.
03

Resumen de Benchmarks

GDPval-AA v2 — 1861 Elo (#1)

Por delante de Fable 5 (1747), Sol (1736) y Opus 4.8 (1593) en trabajo profesional.

ARC-AGI-3 — 30,2% (#1)

Problemas interactivos nuevos: casi cuatro veces Sol (7,8%) y muy por encima de 4.8 (1,5%).

OSWorld 2.0 — 70,6% (#1)

Uso de aplicaciones de escritorio, delante de Fable 5 (66,1%) y Sol (62,6%).

AutomationBench — 26,0% (#1)

Flujos empresariales completos, alrededor de 1,5 veces Fable 5 (17,4%).

Artificial Analysis Intelligence Index — cerca de 63 (#1)

Compuesto independiente actual de la versión 4.1.1 con esfuerzo max. La puntuación de 61 de la semana de lanzamiento está obsoleta; max también usa muchos tokens, así que el nivel de esfuerzo importa.

04

El Veredicto

Claude Opus 5 obtiene nuestro #1 en inteligencia cotidiana, apenas por delante de GPT-6 Astra y claramente por encima de Fable 5. No se debe a que gane todos los exámenes, sino a que lidera la mezcla más relevante de trabajo profesional, resolución de problemas nuevos, búsqueda en el navegador, uso del ordenador y ejecución de flujos; después cobra la mitad que Fable con menos restricciones de despliegue. Elige ChatGPT si importa más un enorme ecosistema de consumo; Fable solo para un pico estrecho donde su ventaja pague el doble de precio; Opus 5 cuando el trabajo sea ambiguo, cargado de documentos y lo bastante importante para exigir criterio.

05

Preguntas frecuentes