Imagina una obra en construcción con dos operadores de grúa.
Uno es el veterano al que llaman para los levantamientos que nadie más se atreve a realizar: deslizar una viga de acero entre dos torres durante un viento cruzado. El otro operador es casi igual de bueno y cobra una fracción de la tarifa diaria. Para cualquier levantamiento ordinario, palés de ladrillos, vigas para techos, o simplemente el trabajo del día a día, sería una tontería contratar al veterano.
GPT-6.1 Sol es ese segundo operador, y este mes la diferencia de habilidad entre los dos se volvió muy estrecha.
Un lanzamiento que surgió de una cancelación
OpenAI lanzó GPT-6.1 Sol en su evento DevDay el 29 de septiembre de 2026, solo una semana después de GPT-6 Sol. El momento tuvo su propia historia de fondo. El día anterior, OpenAI había cancelado el lanzamiento planeado de GPT-6.1 Astra luego de que las pruebas internas demostraran que ese modelo no se mantenía confiablemente dentro del alcance y los permisos de sus tareas. Sol 6.1 es un modelo distinto, más pequeño, y su propio reporte de seguridad luce más limpio: en la prueba de OpenAI sobre si un agente admite que su herramienta de búsqueda está rota en lugar de tratar de adivinar, GPT-6.1 Sol no lo hizo en el 2.1% de los casos, en comparación con el 4.9% de GPT-6 Sol y el 1.5% de GPT-6 Astra.
La propuesta comercial de OpenAI es directa: una inteligencia similar a la de Astra por una quinta parte del precio.
¿Está realmente cerca de Astra?
Esta es la parte que importa, y por una vez, no tenemos que depender únicamente de la palabra del fabricante.
Artificial Analysis, una empresa independiente de evaluación de IA, ejecutó sus pruebas el mismo día del lanzamiento. En su Índice de Inteligencia, que combina diez evaluaciones de alto nivel, GPT-6.1 Sol con esfuerzo máximo alcanzó 52 puntos, a solo uno de los 53 de GPT-6 Astra y cuatro por encima de GPT-6 Sol. En su Índice de Agentes de Programación, el resultado es aún más ajustado: con el esfuerzo al máximo (Max Effort), Sol se ubica 2 puntos por detrás de Astra, y en la segunda configuración más alta, xhigh, superó a Astra por un punto gastando menos del 15% del costo por tarea.
Cognition, la empresa detrás del agente de programación Devin, lo puso a prueba en FrontierCode 1.1, un punto de referencia que hace una pregunta estricta: ¿un ingeniero de software experimentado realmente integraría (merge) este cambio? La mejor puntuación de GPT-6.1 Sol es de 60.4%, prácticamente igual a GPT-6 Sol (60.7%). La diferencia es el dinero. A un nivel de esfuerzo medio, invierte $0.31 por tarea, un 81% menos de lo que gastó GPT-6 Sol al máximo esfuerzo para lograr su mejor marca. A bajo esfuerzo obtiene el 58.1% por tan solo $0.21, una mejora comparado con el 50.5% que logró GPT-6 Sol bajo la misma configuración.
Los propios datos de OpenAI muestran la misma tendencia. En DeepSWE v1.1, donde se resuelven tareas de ingeniería complejas en repositorios reales, su tabla refleja un 75.2% a un nivel de esfuerzo alto (High Effort) por $0.65 por tarea. Eso equivale a 6.4 puntos por encima de la mejor marca de GPT-6 Sol y un poquito por arriba del mejor puntaje de Astra (74.1%), el cual cuesta $4.43 por tarea. Cabe destacar una rareza: en xhigh y en max, GPT-6.1 Sol en realidad puntúa más bajo, 71.9%. Procesar más no siempre significa procesar mejor.
Así que el resumen honesto es: programación de nivel casi Astra, y la misma calidad de integración que el modelo Sol de la semana pasada, pero a un precio drásticamente menor por cada trabajo terminado.
Por qué el precio del caché es el verdadero titular
Un agente de programación nunca lee tu proyecto una sola vez. Cada vez que corre una prueba, lee el error e intenta de nuevo, relee los mismos archivos, instrucciones y el historial. A lo largo de una sesión extensa, eso se traduce en que los mismos cientos de miles de tokens regresan al modelo docenas de veces.
Es esto exactamente lo que la entrada almacenada en caché (Cached Input) abarca: el texto que el modelo ha leído recientemente durante esta sesión. GPT-6.1 Sol cobra $0.10 por millón de tokens almacenados en caché, un descuento del 95% respecto a los $2 habituales y la mitad del precio del caché que tenía GPT-6 Sol. Los costos habituales de entrada y salida permanecen en $2 y $10 por millón, lo que equivale a la quinta parte de los $10/$50 de GPT-6 Astra.
Suma todo eso y obtendrás la cifra que más importa: Artificial Analysis estimó que correr su índice de evaluación con GPT-6.1 Sol cuesta unos $0.72 por tarea, frente a $3.26 de GPT-6 Astra, $5.98 de Claude Opus 5.5 y $7.60 de Claude Sonnet 5.5. Hay una sola advertencia: si las solicitudes superan los 272,000 tokens de entrada, cuestan el doble por entrada y 1.5 veces por salida, haciendo que las peticiones individuales masivas sean más caras.
No lleves el indicador hasta el límite
GPT-6.1 Sol ofrece cinco configuraciones de esfuerzo: bajo (low), medio (medium - el valor por defecto), alto (high), muy alto (xhigh) y máximo (max). Es muy fácil creer que “max” siempre será la mejor opción. Sin embargo, según el Índice de Agentes de Programación de Artificial Analysis, esto no es así: xhigh obtuvo mayor puntuación que max y su costo es menor. Para correcciones habituales, un nivel de esfuerzo bajo o medio suele ser suficiente; como lo demuestra el resultado de Cognition de un 58.1% por tan solo $0.21. Guarda el nivel “xhigh” para aquellos problemas que realmente demanden el poder analítico adicional.
Sus límites honestos
- Un valor superior, no un mejor código. En FrontierCode 1.1, la calidad de integración no varía si lo comparas frente a GPT-6 Sol y GPT-5.6 Sol. Si tu queja era que los parches de Sol no eran suficientemente buenos, 6.1 no va a solucionarlo. Solo logra que esos mismos parches sean muchísimo más baratos.
- La ciencia sigue siendo el terreno de Astra. En el Terminal-Bench Science 0.1 de OpenAI (análisis de datos, simulaciones y comprobación de teoremas dentro de una terminal) GPT-6.1 Sol consigue 57.0% de puntuación a esfuerzo máximo. Es más del doble que GPT-6 Sol (27.6%), aunque bastante por detrás de GPT-6 Astra (68.1%) y Claude Opus 5.5 (63.3%). Cuesta $5.47 por tarea, frente a unos $23 de cualquiera de sus dos rivales.
- Claude encabeza las pruebas en el índice general. Tanto Claude Opus 5.5 (58) como Claude Sonnet 5.5 (56) siguen manteniendo la ventaja frente a GPT-6.1 Sol (52) en el Índice de Inteligencia de Artificial Analysis. Aunque dicha entidad registró que GPT-6.1 Sol avanzó 12 puntos en el Terminal-Bench 4.0 respecto a GPT-6 Sol, el 64% inicial de Sonnet en esa prueba aún prevalece. Sin embargo, Sonnet logra todo esto gastando muchos más tokens, lo cual indica que Sol es el ganador respecto al costo final por tarea.
- Fuera del chat estándar. Dentro de ChatGPT, GPT-6.1 Sol está disponible mediante ChatGPT Work y Codex para usuarios de Plus, Pro, Business, Enterprise, así como Edu. Los desarrolladores pueden emplearlo usando la API bajo la denominación
gpt-6.1-sol. Según OpenAI, una modalidad “Ultrafast” más rápida, pensada para Codex, está en preparación pero todavía no se encuentra disponible.
¿A quién está dirigido?
| Si tu flujo de trabajo se asemeja a… | Recurre a | El motivo |
|---|---|---|
| Bugs, pruebas, refactorizaciones y agentes trabajando todo el día en tu CI | GPT-6.1 Sol | Programación casi al nivel de Astra por una fracción del costo por tarea |
| Computación científica y las tareas de uso de computadora más difíciles | GPT-6 Astra | Sigue claramente por delante en la terminal científica |
| Arquitectura abierta y decisiones de criterio | Claude Opus 5.5 | La puntuación más alta en el índice independiente general |
| Sesiones largas en la terminal donde el gasto de tokens no importa | Claude Sonnet 5.5 | Mejor puntuación independiente en terminal, pero más consumo de tokens |
Conclusión para los programadores
GPT-6.1 Sol no eleva el techo. Lo que hace es poner ese techo al alcance de un presupuesto normal. Las pruebas independientes lo sitúan a uno o dos puntos del modelo insignia de OpenAI por menos de una cuarta parte del costo por tarea, y su precio de caché está pensado para la forma en que realmente trabajan los agentes de programación. Dale el trabajo pendiente, ponlo en xhigh para los tickets difíciles y llama a Astra u Opus solo cuando se atasque.