La mayoría de los asistentes de IA se comportan como un becario muy rápido. Responden al instante y suenan seguros de sí mismos. Pásales un contrato de alquiler de cuarenta páginas y te devolverán un resumen impecable que se salta justo la cláusula de la página 37, la que de verdad importa.
Claude Opus 5.5 se parece más a la colega veterana que primero se lee el documento entero. Después te dice, en dos frases, cuál es el problema y dónde encontrarlo.
Anthropic lanzó Opus 5.5 el 22 de septiembre de 2026 como primer modelo de su familia Claude 5.5. Se queda con nuestro primer puesto en Ecosistema cotidiano por una razón sencilla: es el modelo que mejor razona con cuidado de todos los que podemos medir, y ya no tiene precio de artículo de lujo.
Qué dicen las pruebas independientes
Dos cifras sostienen casi todo el argumento, y ambas proceden de Artificial Analysis, no del marketing de Anthropic.
La primera es el Artificial Analysis Intelligence Index, una puntuación que combina diez evaluaciones exigentes de razonamiento, ciencia, programación y conocimiento. Con esfuerzo máximo, Opus 5.5 obtuvo 58 en septiembre de 2026. Era el primer puesto de la tabla en su lanzamiento, por delante de GPT-6 Astra y del propio modelo premium de Anthropic, Claude Fable 5.1. (El índice se reescala cada cierto tiempo, así que una puntuación solo tiene sentido al lado de modelos medidos en la misma época).
La segunda es GDPval-AA v2.1, que se parece más a la vida real. En lugar de responder preguntas de examen, los modelos producen entregables auténticos —un modelo en hoja de cálculo, un memorando jurídico, un informe ejecutivo— de 44 profesiones, y los resultados se enfrentan por parejas, como en una clasificación de ajedrez. Opus 5.5 logró 1846 Elo. Fable 5.1 sacó 1735, Opus 5 1708 y GPT-6 Astra 1542.
Las pruebas internas de Anthropic apuntan en la misma dirección. En una de ellas, tres modelos redactaron un informe sobre los resultados trimestrales de una empresa usando una copia de la web en la que costaba encontrar la nota de resultados, y cualquier cifra o cita inventada significaba suspender. Opus 5.5 aprobó 16 veces de 18. Fable 5.1 y Opus 5 no aprobaron ninguna. Eso es exactamente lo que se le pide a un asistente: no solo que sea listo, sino que tenga cuidado con lo que afirma.
El precio, contado con precisión
Quizá hayas leído que Opus 5.5 es «un 40 % más barato». Es cierto, pero conviene entender de dónde sale esa cifra.
- El precio por token bajó un 20 %: $4 por millón de tokens de entrada y $20 por millón de salida, frente a $5 y $25.
- La lectura desde caché bajó un 60 %: hasta $0,20 por millón. Cuando haces pregunta tras pregunta sobre el mismo documento largo, el modelo lo vuelve a leer desde una memoria intermedia, y esa relectura es la mayor parte de la factura de los agentes y las herramientas de programación.
- Con el esfuerzo predeterminado usa menos tokens: según Anthropic, eso es lo que deja las cargas de trabajo típicas un 40 % por debajo de Opus 5.
Para comparar: Fable 5.1 cuesta $10/$50 según su tarifa. Con Opus 5.5 obtienes casi toda la capacidad de Fable por el 40 % de su precio por token. Anthropic llega a decir que, en su propio uso diario, la distancia entre ambos es «menor de lo que sugieren estas puntuaciones».
Ahora escribe como una persona
Una de las quejas más frecuentes sobre Opus 5 era que sus respuestas costaban de seguir: largas, llenas de jerga y con la idea importante escondida en el cuarto párrafo. Anthropic dice que ha trabajado justo en eso. Opus 5.5 empieza por la respuesta, usa palabras más sencillas y sigue las reglas de estilo que le des.
Parece un detalle estético, pero no lo es. Una respuesta que puedes leer en treinta segundos es una respuesta que puedes comprobar. Una respuesta brillante que tienes que descifrar acabarás leyéndola por encima y creyéndotela a ciegas.
La pega, sin rodeos
El esfuerzo máximo tiene mucha sed. En su nivel más alto, Opus 5.5 explora muchos caminos antes de responder. Artificial Analysis midió unos 119.000 tokens de salida por tarea en esfuerzo máximo, frente a unos 27.000 de GPT-6 Astra. Con esos volúmenes, un precio por token más bajo no garantiza una factura por respuesta más baja. La regla práctica es sencilla: déjalo en el esfuerzo predeterminado (medio) para el trabajo diario, donde según Anthropic ya supera en GDPval a Astra con esfuerzo máximo por aproximadamente una quinta parte del coste. Súbelo solo cuando un problema sea de verdad difícil.
No crea imágenes. Claude lee muy bien gráficos, capturas de pantalla y PDF escaneados, pero no genera imágenes, audio ni vídeo. Si quieres una aplicación que lo haga todo, ChatGPT sigue siendo más completo.
Algunas puertas tienen vigilancia. Opus 5.5 es tan capaz en ciberseguridad y biología que Anthropic le aplica salvaguardas adicionales. La mayoría de las tareas de seguridad las resuelve en segundo plano el antiguo Opus 4.8, y ciertas investigaciones de biología exigen unirse al programa de verificación de Anthropic. A la mayoría de la gente nunca le afectará; a los equipos de seguridad, sí.
A quién le conviene
| Si tu día consiste en… | Recurre a | Por qué |
|---|---|---|
| Contratos, investigación, informes, modelos financieros | Claude Opus 5.5 | El mejor trabajo profesional medido; respuestas que se pueden comprobar |
| «Maneja este programa en mi ordenador y termina el trabajo» | GPT-6 Astra | Un agente de uso del ordenador más potente y más económico |
| Una sola aplicación para chat, imágenes y voz | ChatGPT | La oferta más amplia para el consumidor |
| Enormes volúmenes de peticiones sencillas | GPT-6 Luna | Una fracción de céntimo por tarea |
El veredicto para el día a día
Para correos rápidos y preguntas informales, casi cualquier asistente moderno sirve. Pero cuando los documentos son un lío, la pregunta es ambigua y equivocarse tiene consecuencias, Claude Opus 5.5 es el asistente en el que más confiamos, y por primera vez esa confianza no viene con precio de lujo.