Puesto #5 Programación — IA que Escribe Software de Producción
xAI

Grok 4.5

Grok 4.5 ocupa el puesto #4 porque vuelve normales los bucles de agentes frontier. Kimi K3 ahora lo supera en capacidad bruta y preferencia frontend, pero Grok Build sigue tercero en el Índice de Agentes de Programación y cuesta una fracción por tarea.

Actualizado 10 de julio de 2026 Agentic CodingCursorGrok Build
Ideal para

Grok 4.5 ocupa el puesto #4 porque vuelve normales los bucles de agentes frontier. Kimi K3 ahora lo supera en capacidad bruta y preferencia frontend, pero Grok Build sigue tercero en el Índice de Agentes de Programación y cuesta una fracción por tarea.

Por qué gana

Artificial Analysis puntúa a Grok Build con 76 en su Índice de Agentes de Programación—tercero, al nivel de GPT-5.5 en Codex—e informa $2.49 por tarea frente a $5.07 de GPT-5.5 y $11.80 de Fable 5. xAI reporta un 83.3% en Terminal-Bench 2.1, 29.0% en SWE Marathon, 80 TPS, precios de $2/$6 y 4.2× menos tokens de salida por tarea en SWE-Bench Pro que Opus 4.8 max. Está en Cursor en todos los planes, Grok Build y la API.

Ten en cuenta

El puesto #4 premia valor y eficiencia, no una victoria sobre todos. SWE-Bench Pro y DeepSWE quedan tras los líderes, y Kimi K3 posee ahora el argumento más fuerte de capacidad bruta. El código barato todavía exige pruebas y revisión de seguridad.

01

Lo que realmente es

Hay dos formas de comprar un agente de programación. Puedes alquilar al contratista más inteligente de la ciudad para cada ticket, o contratar a un ingeniero muy bueno que sea lo bastante rápido y asequible como para intentar de nuevo cuando el primer intento falla. Grok 4.5 es la segunda opción, y no es un elogio menor.

Artificial Analysis sitúa a Grok Build tercero en su Índice de Agentes de Programación, con 76: al nivel de GPT-5.5 en Codex, por debajo de Fable 5 en Claude Code. Luego aparece la cifra que cambia la decisión de compra. El mismo análisis estima $2.49 por tarea de agente para Grok Build, frente a $5.07 de GPT-5.5 en Codex y $11.80 de Fable 5 en Claude Code. Grok utilizó muchos menos tokens para llegar ahí.

Por eso Grok 4.5 sigue siendo un sólido #4 tras la llegada de Kimi K3. El gráfico oficial de xAI lo muestra casi empatado con los líderes en Terminal-Bench 2.1 con 83.3% y liderando las cifras citadas en SWE Marathon con 29.0% pass@1. Además, está disponible en Cursor en todos los planes y es el predeterminado en Grok Build. Los bucles largos de agentes, el trabajo en terminal, la depuración multietapa y la exploración de repositorios se vuelven asequibles de repetir.

Lo que no se debe afirmar

Grok 4.5 no es el nuevo monarca en puntuación bruta. Su 64.7% en SWE-Bench Pro queda detrás del 80.4% de Fable 5 y el 69.2% de Opus 4.8. Sus resultados en DeepSWE también siguen a Fable y GPT-5.5 en la comparación de xAI. Si tu flujo de trabajo es un benchmark puro de resolución de issues de repositorios, los modelos superiores mantienen un historial más sólido.

Lo que se debe hacer en su lugar

Inicia Grok 4.5 en trabajos donde un agente capaz mejora con un ciclo adicional: investigación, tareas de terminal, refactorizaciones, pruebas e iteraciones de aplicaciones. Invierte el ahorro en verificación. Escala a GPT-5.6 o Fable 5 cuando la tarea demuestre que necesita su techo técnico.

Esa es la verdadera historia en programación: Grok 4.5 no es el martillo más caro. Es la excelente herramienta eléctrica que puedes permitirte mantener encendida.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Tercer puesto independiente, no aplauso del proveedor: Artificial Analysis sitúa a Grok Build tercero en su Índice de Agentes de Programación con 76, al nivel de GPT-5.5 en Codex y bajo Fable 5 en Claude Code. Es el reclamo correcto: un agente práctico de primer nivel, no un barrido inventado.
  • La diferencia en costo por tarea de agente es enorme: Artificial Analysis reporta $2.49 por tarea en el Índice de Agentes de Programación para Grok Build, frente a $5.07 de GPT-5.5 en Codex y $11.80 de Fable 5 en Claude Code. Consumió 1.9M de tokens por tarea frente a 6.2M y 7.2M respectivamente.
  • El trabajo en terminal es genuinamente competitivo: xAI reporta 83.3% en Terminal-Bench 2.1—muy cerca del 84.3% de Fable 5 y el 83.4% de GPT-5.5 en su comparación oficial. Para uso de herramientas, comandos de shell y reintentos, es un rendimiento sumamente útil.
  • Rápido y económico para fomentar mejores prácticas de ingeniería: xAI sirve Grok 4.5 a 80 TPS con precios de $2/$6 por 1M de tokens. Facilita ejecutar más pruebas, pedir una segunda implementación o dejar que el agente investigue antes de que intervenga un humano.
  • Cursor y Grok Build facilitan su despliegue: Grok 4.5 es predeterminado en Grok Build y está disponible en Cursor en todos los planes, además de la API. Tiene un entorno real de desarrollo sin requerir infraestructura personalizada.

Limitaciones honestas

  • El liderazgo en puntuación bruta pertenece a otros: xAI reporta 64.7% en SWE-Bench Pro, tras el 80.4% de Fable 5 y el 69.2% de Opus 4.8 en la misma tabla. Si solo resuelves issues de repositorios, no descartes a esos líderes.
  • DeepSWE es competitivo, no dominante: En la comparación de xAI, Grok 4.5 logra 62.0% en DeepSWE 1.0 y 53% en DeepSWE 1.1, por detrás de Fable 5 y GPT-5.5 en ambos. El argumento de valor no borra la brecha en puntuación bruta.
  • Los equipos en la UE no pueden usar el lanzamiento hoy: Según xAI, Grok 4.5 aún no está en la UE en productos ni consola API. Mediados de julio es un plan, no disponibilidad actual.
  • La eficiencia en tokens no garantiza código correcto: Menos pasos y menor costo son ventajas solo después de que el cambio supere pruebas, revisiones, análisis de seguridad y tu contexto real.
  • Es una versión reciente: Utiliza tareas de prueba antes de estandarizarlo. El modelo es nuevo, el comportamiento del entorno importa y la curva de costos no sustituye a tu CI.
03

Resumen de Benchmarks

Índice de Agentes de Programación de Artificial Analysis — 76 (#3)

Resultado independiente para Grok Build: al nivel de GPT-5.5 en Codex y por debajo de Fable 5 en Claude Code.

Costo en el Índice de Agentes de Programación — $2.49 por tarea

Artificial Analysis reporta $2.49 para Grok Build frente a $5.07 de GPT-5.5 en Codex y $11.80 de Fable 5 en Claude Code.

Terminal-Bench 2.1 — 83.3%

La comparación oficial de xAI sitúa a Grok muy cerca de Fable 5 con 84.3% y GPT-5.5 con 83.4% en trabajo de terminal.

SWE Marathon — 29.0% pass@1

xAI reporta a Grok por encima de las cifras citadas de Opus 4.8 y Fable 5 en esta evaluación de ingeniería de larga duración.

SWE-Bench Pro — 64.7%

El contrapeso importante: el gráfico de xAI sitúa a Grok por debajo de Fable 5 y Opus 4.8 en resolución de issues de repositorios.

04

El Veredicto

Grok 4.5 ocupa el #4 porque la tabla debe premiar capacidad y agentes repetibles sin arruinar al equipo. Kimi K3 tiene ahora mejor evidencia bruta y frontend; Grok sigue siendo la alternativa de valor y velocidad, con terminal fuerte, tercer puesto agéntico independiente, Cursor y costo muy bajo. Usa K3, Fable 5 o GPT-5.6 para un techo mayor; Grok para iterar sin incendiar el presupuesto.

05

Preguntas frecuentes