Puesto #4 Programación — IA que Escribe Software de Producción
OpenAI

GPT-6.1 Sol

GPT-6.1 Sol es el agente de programación que puedes dejar funcionando todo el día sin preocuparte por la factura. En pruebas independientes se sitúa a solo un punto o dos de GPT-6 Astra, el modelo insignia de OpenAI, pero el costo de una tarea típica es menos de una cuarta parte. El precio del token no ha cambiado respecto a GPT-6 Sol ($2 de entrada, $10 de salida por millón), pero releer el código almacenado en caché ahora cuesta solo $0.10 por millón de tokens, y es exactamente en los grandes repositorios donde se nota este ahorro.

Actualizado 30 de septiembre de 2026 Value Coding AgentDeepSWE 75.2%$0.10 Cached Input
Ideal para

GPT-6.1 Sol es el agente de programación que puedes dejar funcionando todo el día sin preocuparte por la factura. En pruebas independientes se sitúa a solo un punto o dos de GPT-6 Astra, el modelo insignia de OpenAI, pero el costo de una tarea típica es menos de una cuarta parte. El precio del token no ha cambiado respecto a GPT-6 Sol ($2 de entrada, $10 de salida por millón), pero releer el código almacenado en caché ahora cuesta solo $0.10 por millón de tokens, y es exactamente en los grandes repositorios donde se nota este ahorro.

Por qué gana

Artificial Analysis (29 de septiembre de 2026) lo situó a un punto por debajo de GPT-6 Astra en su Índice de Inteligencia (52 vs 53) por $0.72 por tarea frente a $3.26. En el Índice de Agentes de Programación, su configuración xhigh superó a Astra por un punto por menos del 15% del costo. OpenAI reporta un 75.2% en DeepSWE v1.1 con esfuerzo alto, y en FrontierCode 1.1 de Cognition obtiene un 58.1% con esfuerzo bajo por $0.21 por tarea, el mejor resultado por debajo de los $0.30 en esa clasificación.

Ten en cuenta

Su puntuación de calidad de integración (merge) no mejoró: en FrontierCode 1.1 obtiene un 60.4%, igual que GPT-6 Sol. La ventaja es el costo, no un límite superior más alto. Las propias tablas de OpenAI muestran que GPT-6 Astra sigue claramente a la cabeza en trabajo científico en la terminal. Claude Sonnet 5.5 obtiene puntuaciones más altas en el índice general de Artificial Analysis, aunque cuesta mucho más por tarea. En ChatGPT, solo está disponible en Work y Codex dentro de los planes de pago.

01

Lo que realmente es

Imagina una obra en construcción con dos operadores de grúa.

Uno es el veterano al que llaman para los levantamientos que nadie más se atreve a realizar: deslizar una viga de acero entre dos torres durante un viento cruzado. El otro operador es casi igual de bueno y cobra una fracción de la tarifa diaria. Para cualquier levantamiento ordinario, palés de ladrillos, vigas para techos, o simplemente el trabajo del día a día, sería una tontería contratar al veterano.

GPT-6.1 Sol es ese segundo operador, y este mes la diferencia de habilidad entre los dos se volvió muy estrecha.

Un lanzamiento que surgió de una cancelación

OpenAI lanzó GPT-6.1 Sol en su evento DevDay el 29 de septiembre de 2026, solo una semana después de GPT-6 Sol. El momento tuvo su propia historia de fondo. El día anterior, OpenAI había cancelado el lanzamiento planeado de GPT-6.1 Astra luego de que las pruebas internas demostraran que ese modelo no se mantenía confiablemente dentro del alcance y los permisos de sus tareas. Sol 6.1 es un modelo distinto, más pequeño, y su propio reporte de seguridad luce más limpio: en la prueba de OpenAI sobre si un agente admite que su herramienta de búsqueda está rota en lugar de tratar de adivinar, GPT-6.1 Sol no lo hizo en el 2.1% de los casos, en comparación con el 4.9% de GPT-6 Sol y el 1.5% de GPT-6 Astra.

La propuesta comercial de OpenAI es directa: una inteligencia similar a la de Astra por una quinta parte del precio.

¿Está realmente cerca de Astra?

Esta es la parte que importa, y por una vez, no tenemos que depender únicamente de la palabra del fabricante.

Artificial Analysis, una empresa independiente de evaluación de IA, ejecutó sus pruebas el mismo día del lanzamiento. En su Índice de Inteligencia, que combina diez evaluaciones de alto nivel, GPT-6.1 Sol con esfuerzo máximo alcanzó 52 puntos, a solo uno de los 53 de GPT-6 Astra y cuatro por encima de GPT-6 Sol. En su Índice de Agentes de Programación, el resultado es aún más ajustado: con el esfuerzo al máximo (Max Effort), Sol se ubica 2 puntos por detrás de Astra, y en la segunda configuración más alta, xhigh, superó a Astra por un punto gastando menos del 15% del costo por tarea.

Cognition, la empresa detrás del agente de programación Devin, lo puso a prueba en FrontierCode 1.1, un punto de referencia que hace una pregunta estricta: ¿un ingeniero de software experimentado realmente integraría (merge) este cambio? La mejor puntuación de GPT-6.1 Sol es de 60.4%, prácticamente igual a GPT-6 Sol (60.7%). La diferencia es el dinero. A un nivel de esfuerzo medio, invierte $0.31 por tarea, un 81% menos de lo que gastó GPT-6 Sol al máximo esfuerzo para lograr su mejor marca. A bajo esfuerzo obtiene el 58.1% por tan solo $0.21, una mejora comparado con el 50.5% que logró GPT-6 Sol bajo la misma configuración.

Los propios datos de OpenAI muestran la misma tendencia. En DeepSWE v1.1, donde se resuelven tareas de ingeniería complejas en repositorios reales, su tabla refleja un 75.2% a un nivel de esfuerzo alto (High Effort) por $0.65 por tarea. Eso equivale a 6.4 puntos por encima de la mejor marca de GPT-6 Sol y un poquito por arriba del mejor puntaje de Astra (74.1%), el cual cuesta $4.43 por tarea. Cabe destacar una rareza: en xhigh y en max, GPT-6.1 Sol en realidad puntúa más bajo, 71.9%. Procesar más no siempre significa procesar mejor.

Así que el resumen honesto es: programación de nivel casi Astra, y la misma calidad de integración que el modelo Sol de la semana pasada, pero a un precio drásticamente menor por cada trabajo terminado.

Por qué el precio del caché es el verdadero titular

Un agente de programación nunca lee tu proyecto una sola vez. Cada vez que corre una prueba, lee el error e intenta de nuevo, relee los mismos archivos, instrucciones y el historial. A lo largo de una sesión extensa, eso se traduce en que los mismos cientos de miles de tokens regresan al modelo docenas de veces.

Es esto exactamente lo que la entrada almacenada en caché (Cached Input) abarca: el texto que el modelo ha leído recientemente durante esta sesión. GPT-6.1 Sol cobra $0.10 por millón de tokens almacenados en caché, un descuento del 95% respecto a los $2 habituales y la mitad del precio del caché que tenía GPT-6 Sol. Los costos habituales de entrada y salida permanecen en $2 y $10 por millón, lo que equivale a la quinta parte de los $10/$50 de GPT-6 Astra.

Suma todo eso y obtendrás la cifra que más importa: Artificial Analysis estimó que correr su índice de evaluación con GPT-6.1 Sol cuesta unos $0.72 por tarea, frente a $3.26 de GPT-6 Astra, $5.98 de Claude Opus 5.5 y $7.60 de Claude Sonnet 5.5. Hay una sola advertencia: si las solicitudes superan los 272,000 tokens de entrada, cuestan el doble por entrada y 1.5 veces por salida, haciendo que las peticiones individuales masivas sean más caras.

No lleves el indicador hasta el límite

GPT-6.1 Sol ofrece cinco configuraciones de esfuerzo: bajo (low), medio (medium - el valor por defecto), alto (high), muy alto (xhigh) y máximo (max). Es muy fácil creer que “max” siempre será la mejor opción. Sin embargo, según el Índice de Agentes de Programación de Artificial Analysis, esto no es así: xhigh obtuvo mayor puntuación que max y su costo es menor. Para correcciones habituales, un nivel de esfuerzo bajo o medio suele ser suficiente; como lo demuestra el resultado de Cognition de un 58.1% por tan solo $0.21. Guarda el nivel “xhigh” para aquellos problemas que realmente demanden el poder analítico adicional.

Sus límites honestos

  • Un valor superior, no un mejor código. En FrontierCode 1.1, la calidad de integración no varía si lo comparas frente a GPT-6 Sol y GPT-5.6 Sol. Si tu queja era que los parches de Sol no eran suficientemente buenos, 6.1 no va a solucionarlo. Solo logra que esos mismos parches sean muchísimo más baratos.
  • La ciencia sigue siendo el terreno de Astra. En el Terminal-Bench Science 0.1 de OpenAI (análisis de datos, simulaciones y comprobación de teoremas dentro de una terminal) GPT-6.1 Sol consigue 57.0% de puntuación a esfuerzo máximo. Es más del doble que GPT-6 Sol (27.6%), aunque bastante por detrás de GPT-6 Astra (68.1%) y Claude Opus 5.5 (63.3%). Cuesta $5.47 por tarea, frente a unos $23 de cualquiera de sus dos rivales.
  • Claude encabeza las pruebas en el índice general. Tanto Claude Opus 5.5 (58) como Claude Sonnet 5.5 (56) siguen manteniendo la ventaja frente a GPT-6.1 Sol (52) en el Índice de Inteligencia de Artificial Analysis. Aunque dicha entidad registró que GPT-6.1 Sol avanzó 12 puntos en el Terminal-Bench 4.0 respecto a GPT-6 Sol, el 64% inicial de Sonnet en esa prueba aún prevalece. Sin embargo, Sonnet logra todo esto gastando muchos más tokens, lo cual indica que Sol es el ganador respecto al costo final por tarea.
  • Fuera del chat estándar. Dentro de ChatGPT, GPT-6.1 Sol está disponible mediante ChatGPT Work y Codex para usuarios de Plus, Pro, Business, Enterprise, así como Edu. Los desarrolladores pueden emplearlo usando la API bajo la denominación gpt-6.1-sol. Según OpenAI, una modalidad “Ultrafast” más rápida, pensada para Codex, está en preparación pero todavía no se encuentra disponible.

¿A quién está dirigido?

Si tu flujo de trabajo se asemeja a… Recurre a El motivo
Bugs, pruebas, refactorizaciones y agentes trabajando todo el día en tu CI GPT-6.1 Sol Programación casi al nivel de Astra por una fracción del costo por tarea
Computación científica y las tareas de uso de computadora más difíciles GPT-6 Astra Sigue claramente por delante en la terminal científica
Arquitectura abierta y decisiones de criterio Claude Opus 5.5 La puntuación más alta en el índice independiente general
Sesiones largas en la terminal donde el gasto de tokens no importa Claude Sonnet 5.5 Mejor puntuación independiente en terminal, pero más consumo de tokens

Conclusión para los programadores

GPT-6.1 Sol no eleva el techo. Lo que hace es poner ese techo al alcance de un presupuesto normal. Las pruebas independientes lo sitúan a uno o dos puntos del modelo insignia de OpenAI por menos de una cuarta parte del costo por tarea, y su precio de caché está pensado para la forma en que realmente trabajan los agentes de programación. Dale el trabajo pendiente, ponlo en xhigh para los tickets difíciles y llama a Astra u Opus solo cuando se atasque.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Programación cercana al modelo insignia, comprobada independientemente: Artificial Analysis midió el Índice de Agentes de Programación el 29 de septiembre de 2026. GPT-6.1 Sol, a esfuerzo máximo, se sitúa a 2 puntos por debajo de GPT-6 Astra, y su configuración xhigh superó a Astra en 1 punto por menos del 15% del costo por tarea.
  • Barato por tarea terminada, no solo por token: Ejecutar el índice completo de Artificial Analysis cuesta aproximadamente $0.72 por tarea con GPT-6.1 Sol, en comparación con $3.26 de GPT-6 Astra, $5.98 de Claude Opus 5.5 y $7.60 de Claude Sonnet 5.5, todos ellos a máximo esfuerzo (Max Effort).
  • Precio de caché diseñado para bases de código grandes: Releer texto que el modelo ya ha visto, como tu repositorio, cuesta $0.10 por millón de tokens: un 95% de descuento sobre el precio de entrada normal y la mitad del precio de caché de GPT-6 Sol. Los agentes de programación releen los mismos archivos constantemente, por lo que es aquí donde recae la mayor parte del ahorro.
  • Potente incluso con bajo esfuerzo: En FrontierCode 1.1 de Cognition, que califica si los cambios de código son lo suficientemente buenos para integrarse (merge), GPT-6.1 Sol obtiene un 58.1% con esfuerzo bajo por $0.21 por tarea, lo que supone un aumento frente al 50.5% de GPT-6 Sol con la misma configuración. En todos los niveles de esfuerzo es entre un 44% y un 57% más barato por tarea que GPT-6 Sol.
  • Un salto mayor en tareas reales de ingeniería: En DeepSWE v1.1, la tabla de OpenAI muestra un 75.2% con esfuerzo alto (High Effort) por $0.65 por tarea, 6.4 puntos por encima del mejor resultado de GPT-6 Sol (68.8% al máximo, $2.74) y ligeramente por encima del mejor resultado de GPT-6 Astra (74.1% en xhigh, $4.43).

Limitaciones honestas

  • La calidad de integración no ha variado: En FrontierCode 1.1, su mejor puntuación del 60.4% iguala a la de GPT-6 Sol (60.7%) y GPT-5.6 Sol (60.6%). Obtienes la misma calidad de código listo para integrar por mucho menos dinero, pero no un mejor código.
  • No es el modelo para terminales científicas: En Terminal-Bench Science 0.1 de OpenAI, que cubre análisis de datos, simulaciones y demostración de teoremas, GPT-6.1 Sol obtiene un 57.0% con esfuerzo máximo, más del doble que GPT-6 Sol (27.6%) pero claramente detrás de GPT-6 Astra (68.1%) y Claude Opus 5.5 (63.3%).
  • Claude sigue liderando el índice general: En el Índice de Inteligencia de Artificial Analysis, Claude Opus 5.5 (58) y Claude Sonnet 5.5 (56) obtienen una puntuación mayor que GPT-6.1 Sol (52). Artificial Analysis midió un avance de 12 puntos en Terminal-Bench 4.0 respecto a GPT-6 Sol, pero la puntuación de lanzamiento de Sonnet 5.5 del 64% sigue siendo más alta, aunque Sonnet gasta muchos más tokens para conseguirla.
  • El esfuerzo máximo no es la mejor configuración: En el Índice de Agentes de Programación de Artificial Analysis, xhigh puntuó más que max. La propia tabla DeepSWE de OpenAI muestra el mismo patrón: 75.2% con esfuerzo alto, pero baja al 71.9% en xhigh y max, que son más caros.
  • Muchas de las cifras destacadas son de OpenAI: DeepSWE, OSWorld, GDP.pdf y AutomationBench provienen de las tablas de lanzamiento de OpenAI. Los resultados de Artificial Analysis y Cognition son independientes, y coinciden en términos generales.
03

Resumen de Benchmarks

Índice de Agentes de Programación de Artificial Analysis — supera a GPT-6 Astra en xhigh

Independiente, 29 de septiembre de 2026. Con esfuerzo xhigh, GPT-6.1 Sol supera a GPT-6 Astra por 1 punto por menos del 15% del costo por tarea de Astra. En máximo se sitúa 2 puntos por debajo de Astra y 3 por encima de GPT-6 Sol.

Índice de Inteligencia de Artificial Analysis — 52 (Esfuerzo máximo)

Índice independiente que combina 10 evaluaciones, incluyendo Terminal-Bench 4.0 y SciCode. Un punto por debajo de GPT-6 Astra (53), frente a los 48 de GPT-6 Sol, a $0.72 por tarea frente a $3.26 de Astra.

FrontierCode 1.1 — 60.4% de máximo; 58.1% a $0.21 (Esfuerzo bajo)

El punto de referencia de Cognition para código listo para integrar, publicado el 29 de septiembre de 2026. Mejor puntuación al nivel de GPT-6 Sol. El resultado de bajo esfuerzo es el más alto de todos los modelos por debajo de $0.30 por tarea en esa clasificación.

DeepSWE v1.1 — 75.2% (Esfuerzo alto, $0.65 por tarea)

Tabla de OpenAI para tareas complejas de ingeniería en bases de código reales. El mejor resultado de GPT-6 Astra es del 74.1% en xhigh por $4.43; el de GPT-6 Sol es del 68.8% en max por $2.74. GPT-6.1 Sol cae al 71.9% en xhigh y max.

Terminal-Bench Science 0.1 — 57.0% (Esfuerzo máximo, $5.47 por tarea)

Flujos de trabajo científicos en una terminal, según la tabla de OpenAI. GPT-6 Astra lidera con un 68.1% ($23.80 por tarea), Claude Opus 5.5 obtiene un 63.3% ($23.21) y GPT-6 Sol un 27.6% ($12.18).

Precio — $2 / $10 por 1M de tokens, $0.10 en caché

El mismo precio por token que GPT-6 Sol y una quinta parte de los $10/$50 de GPT-6 Astra. Las solicitudes (prompts) de más de 272K tokens de entrada cuestan 2× la entrada y 1.5× la salida; Batch y Flex tienen un 50% de descuento.

04

El Veredicto

GPT-6.1 Sol está pensado para los equipos que desean agentes de programación cercanos al nivel insignia funcionando todo el día a precios de nivel medio. Pruebas independientes lo sitúan a solo uno o dos puntos de GPT-6 Astra por menos de una cuarta parte del costo por tarea. Se clasifica justo por debajo de Claude Sonnet 5.5 debido a que Sonnet obtiene mejores puntuaciones en el índice general independiente y en el trabajo de terminal, y porque la puntuación de calidad de integración de Sol no mejoró frente a GPT-6 Sol. Supera a Claude Fable 5.1 en programación diaria en términos de costo por tarea completada. Reserva GPT-6 Astra para las terminales científicas y las tareas de uso de computadora más difíciles. Asígnale a GPT-6.1 Sol el trabajo atrasado, y prueba con xhigh antes que max.

05

Preguntas frecuentes