Puesto #6 Programación — IA que Escribe Software de Producción
xAI

Grok 4.7

Grok 4.7 es el modelo de programación serio más barato cerca de lo más alto de la clasificación. Por $2 de entrada y $6 de salida por millón de tokens, obtiene un 71,0 % en DeepSWE y un 46,3 % en CursorBench 4.0, y funciona de forma nativa en Cursor y Grok Build. Es un gran compañero de programación para el día a día, aunque todavía no es el agente al que dejarías solo en una terminal durante horas.

Actualizado 27 de septiembre de 2026 DeepSWE 71.0%CursorBench 46.3%Cursor & Grok Build
Ideal para

Grok 4.7 es el modelo de programación serio más barato cerca de lo más alto de la clasificación. Por $2 de entrada y $6 de salida por millón de tokens, obtiene un 71,0 % en DeepSWE y un 46,3 % en CursorBench 4.0, y funciona de forma nativa en Cursor y Grok Build. Es un gran compañero de programación para el día a día, aunque todavía no es el agente al que dejarías solo en una terminal durante horas.

Por qué gana

En la tabla de lanzamiento de xAI: CursorBench 4.0 sube del 40,4 % al 46,3 %, DeepSWE v1.1 del 65,2 % al 71,0 % (esfuerzo alto) y Terminal-Bench 4.0 casi se duplica, del 20,3 % al 37,6 %. El precio se mantiene en $2/$6, con una variante rápida que va al doble de velocidad por el doble de precio. Disponible en Cursor, Grok Build (gratis para probar), la API de Grok y herramientas de programación de terceros.

Ten en cuenta

En el trabajo largo y autónomo de terminal sigue muy por detrás de los líderes: 37,6 % en Terminal-Bench 4.0 frente al 57,9 % de Claude Fable 5.1 y el 59,6 % de GPT-6 Astra y Claude Opus 5.5 en pruebas independientes. En CursorBench queda por detrás de Fable 5.1 (51,8 %). Todas las cifras de Grok son de la propia xAI.

01

Lo que realmente es

Todo desarrollador ha trabajado al lado de dos tipos de compañero.

Una es brillante y minuciosa, y te suelta una charla de quince minutos cada vez que le haces una pregunta. El otro simplemente se inclina sobre tu teclado, escribe cuarenta líneas, ejecuta las pruebas y dice: «prueba con esto».

En las alineaciones de OpenAI y Anthropic, la compañera cuidadosa y cara se lleva la mayoría de los títulos. Grok 4.7 es el rápido, lo bastante barato como para preguntarle cien veces al día.

Lanzado el 21 de septiembre de 2026, Grok 4.7 ocupa el quinto puesto de nuestra clasificación de programación. Su papel es ser el compañero de programación con mejor relación calidad-precio del grupo de cabeza.

Las mejoras que importan a quien programa

Grok 4.6 era un aspirante interesante. Grok 4.7 da un paso claro adelante en todas las pruebas de programación que ha publicado xAI:

  • DeepSWE v1.1, tareas de ingeniería complejas en bases de código reales: del 65,2 % al 71,0 % (con esfuerzo alto). En la tabla de xAI, eso queda ligeramente por delante del 70,0 % de Claude Fable 5.1.
  • CursorBench 4.0, tareas de programación más largas dentro del editor Cursor: del 40,4 % al 46,3 %.
  • Terminal-Bench 4.0, trabajo de varias horas en la línea de comandos: del 20,3 % al 37,6 %, casi el doble.

xAI atribuye las mejoras a un modelo base más grande, a un entrenamiento mucho más largo con tareas que duran horas y a un trabajo específico para que revise sus propias respuestas y maneje el contexto largo. En la práctica, eso significa menos cambios a medio terminar y menos errores dichos con total seguridad.

Las cuentas de programar dentro del editor

Cuando programas en Cursor o en un editor similar, la IA no se consulta una vez al día, sino constantemente. Lee tus archivos, propone cambios, explica un error, reescribe una función y vuelve a empezar.

A $2 por millón de tokens de entrada y $6 por millón de salida, Grok 4.7 tiene el precio de salida más bajo entre los mejores modelos de programación. Para comparar: GPT-6 Sol cuesta $10, Claude Opus 5.5 $20 y GPT-6 Astra $50. Si trabajas todo el día en el editor, esa diferencia es dinero de verdad.

También hay una variante rápida que genera texto al doble de velocidad por el doble de precio. Es útil cuando estás esperando cada respuesta.

Dónde todavía se queda corto

Las ejecuciones largas sin supervisión. Terminal-Bench 4.0 es la prueba que mejor predice si puedes dejar a un agente solo en una terminal durante horas. El 37,6 % de Grok 4.7 es una gran mejora, pero GPT-6 Astra y Claude Opus 5.5 obtienen ambos un 59,6 % en pruebas independientes, y Fable 5.1 logra un 57,9 % en la propia tabla de xAI. Para el trabajo autónomo durante la noche, esos modelos se pierden mucho menos.

Los mejores resultados en el editor. En CursorBench 4.0, Grok queda por detrás de Claude Fable 5.1 (51,8 %) y del 57,8 % que Anthropic atribuye a Claude Opus 5.5.

Los rivales más nuevos. xAI compara Grok 4.7 con GPT-5.6 Sol y Fable 5.1. GPT-6 Sol salió al día siguiente a un precio similar y todavía no hemos visto una comparación directa independiente. Todas las cifras de Grok de este artículo son de la propia xAI.

El veredicto

Para ejecuciones largas de agentes sin supervisión, elige GPT-6 Astra. Para trabajo profundo de arquitectura en una base de código grande, elige Claude Opus 5.5.

Pero para las horas que pasas cada día en tu editor, corrigiendo errores, escribiendo pruebas y refactorizando componentes, Grok 4.7 es un compañero fuerte, rápido y muy barato. Pruébalo con tu propio código frente a GPT-6 Sol; lo más probable es que uno de los dos se convierta en tu herramienta de cada día.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • El precio más bajo cerca de la cima: $2 por millón de tokens de entrada y $6 por millón de salida. En salida es más barato que GPT-6 Sol ($10), Claude Opus 5.5 ($20) y GPT-6 Astra ($50). En un editor que llama al modelo constantemente, eso se nota.
  • Corrección de errores sólida en proyectos reales: En DeepSWE v1.1, que evalúa tareas de ingeniería complejas en bases de código reales, Grok 4.7 obtuvo un 71,0 % con esfuerzo alto, frente al 65,2 % de Grok 4.6. Según las cifras de xAI, eso lo deja ligeramente por delante de Claude Fable 5.1 (70,0 %).
  • Mejor en el trabajo dentro del editor: CursorBench 4.0 mide tareas de programación más largas dentro del editor Cursor. Grok 4.7 pasó del 40,4 % al 46,3 %, y xAI lo describe como «en la vanguardia de la relación calidad-precio» en esa prueba.
  • Se mantiene centrado más tiempo: xAI lo entrenó con tareas que duran muchas horas y mejoró cómo revisa su propio trabajo y cómo maneja el contexto largo. Son justo las habilidades que evitan que un agente se despiste a mitad de un cambio.
  • Disponible donde trabajan los desarrolladores: Integrado en Cursor y Grok Build desde el primer día, y disponible mediante la API de Grok, otras herramientas de programación y enrutadores de modelos. Una variante rápida duplica la velocidad de salida para el trabajo interactivo.

Limitaciones honestas

  • Aún no está listo para largas sesiones de terminal sin supervisión: Terminal-Bench 4.0, que evalúa trabajo de varias horas en la línea de comandos, subió al 37,6 %. Es un gran salto, pero sigue muy lejos del 58–60 % aproximado de Fable 5.1, GPT-6 Astra y Claude Opus 5.5.
  • Por detrás de los líderes en tareas de editor: Su 46,3 % en CursorBench 4.0 queda por debajo de Fable 5.1 (51,8 %) y del 57,8 % que Anthropic atribuye a Claude Opus 5.5.
  • Comparado con los rivales del mes pasado: La tabla de xAI enfrenta a Grok 4.7 con GPT-5.6 Sol y Fable 5.1, no con GPT-6 Sol, que salió al día siguiente a un precio similar.
  • Solo cifras del fabricante: Todas las cifras de Grok proceden de xAI. Actualizaremos el artículo cuando lleguen resultados independientes.
03

Resumen de Benchmarks

DeepSWE v1.1 — 71,0 % (esfuerzo alto)

Tareas de ingeniería complejas en bases de código reales. Sube desde el 65,2 % de Grok 4.6. La tabla de xAI muestra a Claude Fable 5.1 con un 70,0 % y a GPT-5.6 Sol (esfuerzo máximo) con un 72,7 %.

CursorBench 4.0 — 46,3 %

Tareas de programación más largas en el editor Cursor. Sube desde el 40,4 %; en la misma tabla, Claude Fable 5.1 obtiene un 51,8 % y GPT-5.6 Sol un 41,7 %.

Terminal-Bench 4.0 — 37,6 %

Trabajo de varias horas en la línea de comandos. Casi el doble del 20,3 % de Grok 4.6, pero muy por detrás del 57,9 % de Claude Fable 5.1 en la tabla de xAI. (La ejecución propia de Anthropic sitúa a Fable 5.1 en el 55,8 %; las pruebas independientes sitúan a GPT-6 Astra y Claude Opus 5.5 en el 59,6 %).

Precio — $2 / $6 por millón de tokens

Sin cambios respecto a Grok 4.6. La variante rápida ofrece el doble de velocidad de salida por el doble de precio.

04

El Veredicto

Grok 4.7 es nuestro modelo de programación número 5 y la mejor opción si lo que más te importa es el coste por pulsación de tecla. Para el trabajo diario en el editor —corregir errores, escribir pruebas, refactorizar— es un compañero de programación realmente capaz, con el precio de salida más bajo del grupo de cabeza. En sesiones largas de terminal sin supervisión todavía se queda muy por detrás de GPT-6 Astra y Claude Opus 5.5. Antes de decidirte, pruébalo con tu propio código frente a su rival más cercano en precio, GPT-6 Sol.

05

Preguntas frecuentes