La frase útil sobre modelos de código en julio de 2026 no es “¿cuál es más inteligente?”, sino “¿cuál puede terminar esta clase de trabajo?” GPT-5.6 ocupa el primer puesto porque Sol es especialmente fuerte cuando programar se convierte en trabajo de agente: comandos de terminal, llamadas a herramientas, fallos, reintentos, tests y un repositorio que se niega a ser un prompt limpio.
En la tabla de lanzamiento de OpenAI, Sol con max obtiene 80 en el Artificial Analysis Coding Agent Index, por delante del 77,2 de Claude Fable 5. Sol alcanza 88,8% en Terminal-Bench 2.1 y la configuración paralela Ultra 91,9%. En DeepSWE, Sol publica 72,7%. Tres señales distintas apuntan igual: para ingeniería larga que usa herramientas, es la familia de código más fuerte de OpenAI hasta ahora.
Eso no significa que Sol gane todas las disciplinas. La misma tabla da a Sol 64,6% en SWE-Bench Pro frente a 80,3% de Claude Fable 5. La distancia es demasiado grande para esconderla con confeti de lanzamiento. La conclusión honesta es más estrecha: GPT-5.6 lidera el carril de flujo agéntico; Fable conserva la mejor historia publicada de SWE-Bench Pro.
Enruta el trabajo
| Trabajo | Usa | Por qué |
|---|---|---|
| Investigación de varios pasos, terminal difícil, migración obstinada | Sol | Máxima capacidad de un agente en la familia |
| Proyecto grande con frentes separables | Sol + ultra | Agentes paralelos pueden investigar y ejecutar juntos |
| Tickets, revisión de PR, tests, refactors, trabajo cotidiano en Codex | Terra | Un valor por defecto competitivo con GPT-5.5 y más barato |
| Transformaciones mecánicas, scaffolding, docstrings, comprobaciones por lote | Luna | Rápida, barata y suficiente si un test verifica el resultado |
Los nuevos controles merecen aprenderse. max indica a un agente que dedique más tiempo a razonar, comprobar alternativas y revisar. ultra inicia por defecto con cuatro agentes en paralelo. Está pensado para un problema que realmente tiene varios frentes, no para convocar un comité por un punto y coma que falta.
Para los equipos de API, Programmatic Tool Calling es la mejora más silenciosa. GPT-5.6 puede escribir y ejecutar un pequeño programa en memoria para coordinar herramientas y procesar los resultados intermedios. En lugar de pasar cada línea de registro por otro costoso ciclo de modelo, el agente filtra lo importante y decide su siguiente movimiento.
Los precios ofrecen una política real de enrutamiento: Sol $5/$30, Terra $2,50/$15, Luna $1/$6 por millón de tokens de entrada/salida. Empieza el trabajo normal en Terra. Escala a Sol cuando la tarea demuestre que merece el cerebro superior. Envía las tareas de volumen a Luna. Mide el coste total de un cambio fusionado y probado, no solo el coste de la primera respuesta.
Codex ahora también reside dentro de la nueva aplicación de escritorio de ChatGPT, con edición en línea de diffs, revisión de PR en el panel lateral, uso más rápido del ordenador y proyectos multi-repositorio. Esto convierte al modelo en una mejor herramienta en los lugares donde los desarrolladores trabajan realmente, aunque el acceso a Sol y ultra varía según el plan y la plataforma.
En resumen: GPT-5.6 es un equipo completo de programación, no un único modelo héroe. Ocupa el puesto #1 porque lidera hacia donde se dirige el desarrollo moderno — agentes de larga duración que usan herramientas — mientras que sus niveles de precio permiten un enrutamiento sensato. Simplemente mantén la advertencia de SWE-Bench en la pizarra y verifícalo en tu propio código antes de dar vía libre a los agentes en producción.