Imagina a dos carpinteros. Uno es el maestro al que llamas cuando una casa necesita una escalera nueva y nadie ha dibujado todavía los planos. El otro es el profesional constante capaz de colgar cuarenta puertas en una semana, todas perfectamente a escuadra.
La mayor parte de la semana de un equipo de software son puertas, no escaleras: una prueba que falla, un formulario que necesita un campo nuevo, una API que ha cambiado de nombre. Claude Sonnet 5.5 está hecho para las puertas.
Anthropic lo lanzó el 28 de septiembre de 2026 como segundo modelo de la familia Claude 5.5, una semana después de Opus 5.5. Mantiene el precio de Sonnet 5: 2 dólares por millón de tokens de entrada y 10 dólares por millón de salida, la mitad que Opus 5.5. Anthropic dice que funciona más de un 30 % más rápido que Sonnet 5 y cuesta hasta un 30 % menos por tarea porque termina en menos pasos.
Las cifras independientes
Para los agentes de programación, la prueba en la que más confiamos es Terminal-Bench 4.0: trabajos largos de varios pasos en una línea de comandos real, donde el modelo tiene que instalar cosas, ejecutarlas, leer los errores y volver a intentarlo.
Artificial Analysis la realizó de forma independiente en septiembre de 2026. Sonnet 5.5 obtuvo un 64 %, algo por delante de Opus 5.5 y GPT-6 Astra, en torno al 60 % cada uno. La ejecución propia de Anthropic es más alta, un 70,6 %, pero los entornos de prueba de los fabricantes tienden a favorecer a sus propios modelos, así que el 64 % independiente es la cifra que conviene recordar. En cualquier caso, es un salto enorme respecto a Sonnet 5, que obtuvo un 10,3 % en la tabla de Anthropic.
Una segunda fuente independiente coincide en lo esencial. Vals AI sitúa a Sonnet 5.5 en el segundo puesto de 66 modelos en su índice, con un 69,22 %, a menos de medio punto de Opus 5.5 y con un coste por prueba de unas dos terceras partes. Es primero en dos clasificaciones de programación: Vibe Code Bench (crear pequeñas aplicaciones a partir de una descripción), con un 92,39 %, y Code Migration, con un 69,83 %.
Lo que añaden las pruebas de Anthropic
La tabla de lanzamiento de Anthropic completa los detalles:
- FrontierCode v1.1, que pregunta si un cambio de código podría integrarse sin que nadie lo toque: 52,1 % con esfuerzo xhigh. Opus 5.5 obtiene un 54,4 % y GPT-6 Sol un 49,3 %.
- CursorBench 4.0, construido a partir de sesiones reales en el editor Cursor: 55,5 %, unos dos puntos por detrás de Opus 5.5 y muy por delante del 34,1 % de Sonnet 5.
Lo más útil son los gráficos de coste, que enfrentan la puntuación de cada modelo con su coste por tarea en cada nivel de esfuerzo. Destacan dos hallazgos. Con esfuerzo High, el predeterminado de la API, Sonnet 5.5 iguala la mejor puntuación de GPT-6 Sol en FrontierCode por aproximadamente una quinta parte del coste por tarea. Y con esfuerzo Medium, el predeterminado en Claude Code, supera la mejor puntuación de Sonnet 5 en Terminal-Bench por menos de una décima parte del coste.
Los primeros evaluadores lo cuentan con palabras más sencillas. Lovable vio aproximadamente la mitad de comandos de shell por tarea. Slack midió alrededor de un 14 % menos de tokens de salida que con Sonnet 5. Unity, que solo da una tarea por terminada cuando el cambio funciona de verdad en ejecución, dice que la mayoría del trabajo de Sonnet 5.5 superó esa comprobación.
El control de esfuerzo, y por qué el nivel más alto sale caro
Igual que Opus 5.5, Sonnet 5.5 tiene un control de esfuerzo con cinco niveles: low, medium, high, xhigh y max. Los niveles altos permiten al modelo pensar más tiempo y revisar mejor su trabajo. Cabría esperar que max fuera el mejor. Con Sonnet 5.5, a menudo no lo es.
Artificial Analysis midió toda la escala en su Intelligence Index:
| Esfuerzo | Intelligence Index | Coste por tarea |
|---|---|---|
| Low | 36 | 0,41 $ |
| Medium | 41 | 0,59 $ |
| High | 47 | 1,08 $ |
| Xhigh | 52 | 2,74 $ |
| Max | 56 | 7,60 $ |
Pasar de xhigh a max aporta cuatro puntos más por casi el triple de coste. En max, Sonnet 5.5 escribió unos 193.000 tokens de salida por tarea. Es la cifra más alta que Artificial Analysis ha medido nunca: alrededor de un 60 % más que Opus 5.5 en max y unas siete veces lo de GPT-6 Astra.
Peor aún, más esfuerzo no siempre significa mejor código. En FrontierCode, Sonnet 5.5 obtiene un 52,1 % en xhigh pero un 46,2 % en max. Anthropic explica el motivo en una nota al pie: en max, el modelo lanzaba con más frecuencia la rutina de revisión de código de Claude Code, que reparte la revisión entre muchos agentes auxiliares. En algunos casos eso agotó el tiempo o hizo cambios de más, y FrontierCode penaliza los cambios que nadie ha pedido.
La lección es sencilla: trata xhigh como el techo. Si una tarea sigue fallando en xhigh, el mejor siguiente paso suele ser Opus 5.5, no max.
La pega honesta
Opus sigue siendo el arquitecto. Anthropic lo dice sin rodeos: en varias pruebas, Sonnet 5.5 en max se acerca a Opus 5.5, pero en las pruebas internas de Anthropic y en las de evaluadores externos, Opus 5.5 sigue siendo claramente más fuerte en el trabajo complejo y abierto que exige un criterio sostenido. Opus también conserva el liderazgo en FrontierCode y CursorBench.
La factura de Claude Code no se reducirá a la mitad. Los agentes de programación releen tu proyecto constantemente, y esas relecturas se cobran como lecturas de caché, que cuestan 0,20 dólares por millón de tokens tanto en Sonnet 5.5 como en Opus 5.5. Ahorras en la entrada y la salida nuevas, pero una sesión larga que tira mucho de caché ahorra menos de lo que sugiere el titular de «mitad de precio».
El trabajo de seguridad se desvía. Sonnet 5.5 es el primer Sonnet que llega con las salvaguardas de ciberseguridad que Anthropic aplica a sus modelos más potentes. La corrección de errores habitual no se ve afectada, pero las tareas de seguridad de mayor riesgo pasan visiblemente a Sonnet 5, salvo que tu equipo esté aprobado a través del Cyber Verification Program de Anthropic.
Migrar exige un poco de trabajo. Anthropic enumera cinco cambios incompatibles respecto a Sonnet 5. Forzar el uso de herramientas devuelve ahora un error, los valores de temperatura no predeterminados se rechazan y el texto entre llamadas a herramientas llega en otro formato. Nada de esto es difícil de arreglar, pero no basta con cambiar una línea.
Dónde encaja
| Si el trabajo es… | Usa | Por qué |
|---|---|---|
| Un error, una función o una migración bien acotados | Claude Sonnet 5.5 | Rápido y barato con esfuerzo medium o high |
| Arquitectura abierta o un problema que nadie ha acotado | Claude Opus 5.5 | Criterio claramente más fuerte, según Anthropic y los evaluadores |
| Trabajo largo en terminal sin supervisión al menor coste por tarea | GPT-6 Astra | Gasta una fracción de los tokens en su mejor nivel |
| Pulir el front-end, diapositivas, pequeños proyectos visuales | Claude Sonnet 5.5 | Buen ojo para el diseño e iteración rápida |
El veredicto
Claude Sonnet 5.5 es el modelo que la mayoría de desarrolladores debería dejar encendido. Se encarga de las puertas, las cuarenta, rápido y a la mitad del precio por token del modelo insignia. Déjalo en medium o high, usa xhigh para los casos difíciles y, cuando el encargo resulte ser una escalera, llama a Opus.