Actualización del 25 de julio: Opus 5 mueve Fable 5 al #3. Fable conserva SWE-Bench Pro y ventajas diminutas en CursorBench/FrontierCode; Opus 5 gana Frontier-Bench y ofrece casi paridad a mitad de precio por token. La reseña de junio sigue siendo evidencia útil, no el orden general actual.
Hay un número que hace fácil escribir esta reseña: 80,3%. Eso es Claude Fable 5 en SWE-Bench Pro — el benchmark al que no le importan los problemas de juguete, solo si la IA puede arreglar bugs reales en bases de código de producción reales. GPT-5.5 marca 58,6%. El rey anterior, Opus 4.8, marcó 69,2%. Fable 5 no solo gana — gana por un margen que lo hace a uno verificar los números dos veces.
Pero SWE-Bench Pro es solo la mitad de la historia. FrontierCode Diamond — el benchmark de Cognition para saber si los modelos pueden escribir código de producción eficiente en tokens — cuenta la otra mitad. Fable 5: 29,3%. Opus 4.8: 13,4%. GPT-5.5: 5,7%. Eso no es una ventaja; es un deporte diferente. Y el modelo alcanza estas puntuaciones con esfuerzo de razonamiento medio, lo que significa que quema menos tokens para producir mejor código. El modelo caro que en realidad es más barato por tarea real.
El caso de estudio de Stripe no es una fantasía de comunicado de prensa. Una base de código Ruby de 50 millones de líneas — el tipo de monolito que hace sudar a los ingenieros — fue migrada en un solo día. Trabajo que le hubiera tomado a un equipo completo dos meses. El modelo planificó, ejecutó, se auto-verificó y entregó. En CursorBench, el CEO de Cursor dijo que “abrió una clase de problemas de largo horizonte que estaban fuera del alcance de modelos anteriores.” En el Senior Engineer Benchmark, marcó 91/100 — mientras GPT-5.5 y Opus 4.8 ambos quedaron en los bajos 60s.
Esto es lo que la arquitectura de clase Mythos se ve cuando la envuelves en barandillas de seguridad y se la entregas a los desarrolladores. Las barandillas son reales — las consultas sobre ciberseguridad, biología y química se redirigen a Opus 4.8 (sigue siendo excelente, pero no el motor completo). Pero para el 95%+ del trabajo de coding que no activa los clasificadores de seguridad, estás trabajando con el modelo más capaz jamás lanzado al público. La era del coding agéntico acaba de encontrar a su campeón más claro.