Puesto #3 Programación — IA que Escribe Software de Producción
Anthropic

Claude Fable 5.1

El motor de razonamiento de clase Mythos refinado para la codificación basada en agentes. Los mismos pesos que el restringido Mythos 5.1, pero optimizado con un descuento de caché del 75% que transforma la economía de la ingeniería a largo plazo. Se implementa mejor en Claude Code, donde su puntaje de 70 en el AA Coding Agent lidera el campo.

ReasoningLong-ContextAgentic
Ideal para

El motor de razonamiento de clase Mythos refinado para la codificación basada en agentes. Los mismos pesos que el restringido Mythos 5.1, pero optimizado con un descuento de caché del 75% que transforma la economía de la ingeniería a largo plazo. Se implementa mejor en Claude Code, donde su puntaje de 70 en el AA Coding Agent lidera el campo.

Por qué gana

AA Coding Agent 70 (en Claude Code). CursorBench 3.2 73.4%. FrontierSWE v2 0.57. Terminal-Bench 4.0 55.8%. Las lecturas de caché se redujeron un 75% a $0.25/MTok, desbloqueando búsquedas profundas en repositorios.

Ten en cuenta

El esfuerzo máximo puede degradar el rendimiento SWE a través de la sobre-edición (el esfuerzo medio supera al máximo en FrontierCode). La puntuación de DeepSWE 1.1 bajó a 67.4% debido a la sobre-implementación. El alto costo base ($10/$50) agota rápidamente los límites en cachés frías.

01

Lo que realmente es

Cuando se lanzó Fable 5, demostró que una arquitectura de razonamiento de clase Mythos podía dominar los puntos de referencia de ingeniería de software si se le daba suficiente tiempo para pensar. Claude Fable 5.1 no reinventa esa rueda; en cambio, refina la economía y la integración de ese proceso de razonamiento. Al combinar los mismos pesos que el altamente restringido Mythos 5.1 con un descuento masivo del 75% en las lecturas de caché, Anthropic ha convertido un agente de horizonte largo prohibitivamente costoso en una herramienta práctica para el trabajo profundo en repositorios.

En el entorno adecuado, Fable 5.1 es virtualmente incomparable. Dentro de Claude Code, publica un puntaje de 70 en el Agente de Codificación de Artificial Analysis, estableciéndose como el principal asistente autónomo. Empuja el estado del arte en CursorBench 3.2 a 73.4% y salta a 55.8% en Terminal-Bench 4.0, una mejora masiva sobre el 42.0% de Fable 5. En FrontierSWE v2, que mide la ejecución de ingeniería sin restricciones, su puntaje de 0.57 supera cómodamente a Opus 5 (0.52) y deja a competidores como Astra Sol (0.32) muy atrás. Los usuarios avanzados, en particular aquellos que navegan por complejas bases de código estilo Jane Street, informan que Fable 5.1 sobresale en mantener la coherencia a través de desordenados rastros de ejecución de 40 archivos sin perder el hilo.

Sin embargo, el pensamiento adaptativo siempre activo de Fable 5.1 viene con una advertencia significativa: más esfuerzo puede de hecho degradar el rendimiento de la ingeniería de software. Los datos de la tarjeta del sistema confirman que en FrontierCode, el esfuerzo “medio” (50.9%) supera al esfuerzo “máximo” (50.3%). Esto se debe a que, al máximo esfuerzo, Fable 5.1 tiende a sobre-dimensionar las soluciones: realizando ediciones de archivos superficiales, agregando documentación innecesaria y diseñando complejos trabajos de CI cuando se solicitó una simple corrección de errores. Esta sobre-implementación es la razón por la que su puntaje de DeepSWE 1.1 cayó ligeramente al 67.4%. Para obtener lo mejor de Fable 5.1, necesitas limitarlo; fíjalo al esfuerzo medio para tareas estándar, y solo desata el esfuerzo máximo cuando ya tengas pruebas robustas para guiar su razonamiento.

Los costos operativos también requieren una gestión cuidadosa. Si bien el precio de lectura de caché de $0.25/MTok es una revelación, Fable 5.1 es notoriamente verboso, generando aproximadamente 1.7 veces más tokens que su predecesor. Los usuarios de MineBench han informado haber visto 3 veces el costo y el doble de la latencia en comparación con Fable 5. Además, el precio base sigue siendo $10/$50 por millón de tokens; colocar un repositorio masivo en una caché fría agotará rápidamente tus límites de uso de Claude. Y debido a que ejecuta los clasificadores de seguridad estándar, las tareas que tocan la seguridad ofensiva o el desarrollo de doble uso se enrutarán silenciosamente a Opus.

Claude Fable 5.1 no es el modelo que quieres autocompletando cada línea de tu componente React. Astra lidera en el uso de computadoras y la automatización de navegadores, y Opus 5 es significativamente más barato para la codificación diaria de esfuerzo medio. Pero cuando te enfrentas a un error arquitectónico profundamente arraigado, necesitas un planificador de nivel senior o requieres un modelo que pueda sintetizar un repositorio masivo en una sesión de varias horas, Fable 5.1 es la herramienta que llevas a la batalla.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • El campeón de Claude Code: Cuando se utiliza en el propio Claude Code de Anthropic, Fable 5.1 alcanza una puntuación de 70 en el Agente de Codificación de Artificial Analysis, superando tanto a su predecesor como a las alternativas basadas en Codex.
  • Maestría en CursorBench y Terminal: Obtiene 73.4% en CursorBench 3.2 y 55.8% en Terminal-Bench 4.0, consolidando su posición como un agente de primer nivel para tareas IDE profundamente integradas.
  • Economía de caché para SWE: La reducción del 75% en el precio de lectura de caché ($0.25/MTok) hace que la depuración iterativa y las búsquedas de contexto largo en todo el repositorio sean económicamente viables para la ingeniería diaria.
  • Líder en FrontierSWE: Alcanza un 0.57 en FrontierSWE v2, demostrando una capacidad superior en el manejo de tareas complejas de ingeniería de software sin restricciones en comparación con Opus 5 (0.52).
  • Resistencia estilo Jane Street: Los usuarios avanzados informan que Fable 5.1 resuelve problemas de codificación más complejos que Opus 5 y, de manera crucial, se mantiene legible y coherente en rastros de ejecución largos y de múltiples archivos.

Limitaciones honestas

  • La trampa de la sobre-edición: Más esfuerzo no significa mejor código. Las pruebas de FrontierCode muestran que el esfuerzo ‘medio’ (50.9%) supera al ‘máximo’ (50.3%) porque el modelo tiende a hacer ediciones superficiales en archivos y soluciones excesivas.
  • Hambre de tokens y latencia: El modelo es notoriamente verboso. Los usuarios de MineBench vieron ~3× el costo y 2× la latencia en comparación con Fable 5, ya que el modelo genera ~1.7× más tokens en promedio.
  • Astra gana las guerras de SO/Navegador: Si bien Fable 5.1 sobresale en codificación pura, se queda corto frente a Astra en tareas de OSWorld 2.0 y uso de computadoras, lo que lo hace menos ideal para la automatización de navegadores de extremo a extremo.
  • Límites de caché fría: El precio de lectura fría de $10/MTok significa que colocar un repositorio masivo sin calentar la caché consumirá rápidamente los límites de uso de Claude y los presupuestos de la API.
  • Los clasificadores de seguridad se entrometen: Puede encontrar vulnerabilidades pero no escribirá exploits. La investigación legítima de seguridad ofensiva o las tareas de codificación de doble uso se enviarán automáticamente a Opus.
03

Resumen de Benchmarks

AA Coding Agent — 70

Logrado dentro del entorno de Claude Code, estableciéndolo como el principal asistente de codificación basado en agentes.

CursorBench 3.2 — 73.4%

Una mejora sólida sobre Fable 5 (70.5%), demostrando su valor en tareas IDE a largo plazo.

FrontierSWE v2 — 0.57

Lidera sobre Opus 5 (0.52) y Astra Sol (0.32) en desafíos de ingeniería de software sin restricciones.

Terminal-Bench 4.0 — 55.8%

Salto masivo desde el 42.0% de Fable 5, aunque va detrás del Mythos 5.1 sin restricciones (60.9%).

04

El Veredicto

Claude Fable 5.1 es un bisturí que ocasionalmente intenta ser una motosierra. En los benchmarks que importan para la codificación basada en agentes (CursorBench, FrontierSWE y AA Coding Agent), es un peso pesado innegable. El descuento del 75% en la lectura de caché hace que el trabajo de repositorios a largo plazo sea viable por primera vez. Pero su tendencia a sobre-implementar a alto esfuerzo, combinada con un hambre de tokens significativa, significa que requiere un prompt disciplinado y un entorno adecuado (como Claude Code) para brillar. El consejo de Anthropic se mantiene: usa Opus 5 para tu trabajo diario de esfuerzo medio, pero cuando necesites un revisor senior, un planificador, o tengas un error complejo con pruebas ya escritas, llama a Fable 5.1.