Imagina una aerolínea de bajo coste que mantiene el precio de sus billetes pero, sin hacer ruido, cambia a un avión más grande y mejor.
Eso es, más o menos, lo que hizo xAI con Grok 4.7, lanzado el 21 de septiembre de 2026. El precio no ha cambiado: $2 por millón de tokens de entrada y $6 por millón de salida, exactamente igual que Grok 4.6. Lo que ha cambiado es el modelo que hay debajo.
Qué hay de nuevo bajo el capó
xAI describe tres cambios, dicho en palabras sencillas:
- Un modelo base más grande. xAI dice que la versión 4.7 se apoya en unos cimientos más grandes que la 4.6. No publica el número de parámetros en su anuncio, así que toma como no confirmada cualquier cifra concreta que leas en otra parte.
- Un entrenamiento más largo y más duro. El modelo se entrenó con aprendizaje por refuerzo en tareas que tardan muchas horas en completarse, justo el tipo de trabajo en el que los modelos anteriores perdían el hilo a mitad de camino.
- Revisar su propio trabajo. xAI lo entrenó específicamente para comprobar sus respuestas y manejar con más fiabilidad los documentos largos.
El resultado es un modelo que aguanta mejor una tarea larga y detecta sus propios errores antes que tú.
Dónde nos sorprendió
Las cifras más interesantes de la tabla de lanzamiento de xAI no son las de programación. Están en áreas donde no esperarías ver en cabeza a un modelo económico.
- Trabajo jurídico. En Harvey Legal Agent Benchmark, una prueba de lo bien que un agente de IA resuelve tareas jurídicas reales, Grok 4.7 obtuvo un 19,6 %. Eso está por delante de Claude Fable 5.1 (6,7 %) y GPT-5.6 Sol (2,5 %). Es una prueba brutalmente difícil y todos puntúan bajo, pero Grok quedó primero en esa comparación.
- Matemáticas de ingeniería. En EEBench, que evalúa problemas de ingeniería eléctrica, logró un 64,0 %, por delante del 56,4 % de Fable 5.1.
- Trabajo de oficina. En AA Briefcase, una prueba de tareas de oficina de varias horas, como elaborar documentos y presentaciones, obtuvo 1.657, justo por detrás del 1.678 de Fable 5.1 y muy por encima del 1.546 de Grok 4.6.
En pocas palabras: en trabajo real de oficina y profesional, Grok 4.7 ya juega en la misma liga que modelos que cuestan varias veces más.
Más seguro de lo que dice su fama
Grok tiene fama de ser el chatbot con menos barreras. Con la versión 4.7, esa fama se ha quedado anticuada. xAI construyó lo que describe como un sistema de seguridad completamente nuevo y afirma que es su modelo más sólido hasta la fecha para rechazar peticiones peligrosas y resistir jailbreaks. También asegura que el modelo rara vez bloquea trabajo legítimo, como la investigación en seguridad defensiva.
Grok sigue tendiendo a responder de forma directa en lugar de envolver sus respuestas en advertencias. Pero eso es una cuestión de estilo, no de falta de seguridad.
La pega, sin rodeos
Todavía no se ha medido con los rivales más nuevos. La tabla de xAI compara Grok 4.7 con GPT-5.6 Sol y Claude Fable 5.1. Un día después de su lanzamiento, Anthropic sacó Claude Opus 5.5 y OpenAI sacó GPT-6 Sol, dos competidores fuertes y con buen precio. Hasta que las pruebas independientes los pongan lado a lado, la posición exacta de Grok es incierta.
El trabajo largo de terminal sigue siendo un punto débil. En Terminal-Bench 4.0, que evalúa trabajo de varias horas en la línea de comandos, Grok 4.7 obtuvo un 37,6 %. Es casi el doble que Grok 4.6, pero muy por detrás del 57,9 % de Fable 5.1.
La medicina no es su fuerte. En HealthBench Professional, una prueba de razonamiento clínico, logró un 56,7 %, por debajo de GPT-5.6 Sol y de Fable 5.1.
Todas son cifras de xAI. Sus ventajas en derecho e ingeniería son emocionantes, pero nos gustaría verlas confirmadas de forma independiente.
A quién le conviene
Si usas IA todo el día para documentos, análisis y preguntas técnicas, y la factura mensual importa, Grok 4.7 merece una prueba seria. Te da la mayor parte de la calidad de los mejores modelos por una fracción del coste.
Si necesitas el criterio más cuidadoso disponible, elige Claude Opus 5.5. Si quieres un agente que maneje programas en tu ordenador, elige GPT-6 Astra. Para todo lo que queda en medio, Grok 4.7 es la mejor relación calidad-precio cerca de la cima.