Puesto #6 Ecosistema Diario — Los Asistentes Líderes
xAI

Grok 4.6

Grok 4.6 convierte la historia de precio de xAI en una historia de frontera: 61 puntos en Artificial Analysis, trabajo autónomo de largo recorrido y el mismo precio de API de $2/$6.

Actualizado 14 de agosto de 2026 AgenticKnowledge WorkOffice
Ideal para

Grok 4.6 convierte la historia de precio de xAI en una historia de frontera: 61 puntos en Artificial Analysis, trabajo autónomo de largo recorrido y el mismo precio de API de $2/$6.

Por qué gana

Artificial Analysis mide 61 puntos, cinco más que Grok 4.5, $0.84 por tarea, 1753 Elo en GDPVal-AA v2 y 1577 en AA-Briefcase. Ofrece 500K de contexto y acceso en Grok Build, Cursor, API, OpenRouter, Vercel y Cloudflare.

Ten en cuenta

Las mejoras más claras están en trabajo de conocimiento con agentes, no en una victoria total de programación o chat. Las comparaciones mezclan harnesses y los primeros informes de seguridad exigen sandbox, permisos mínimos y revisión humana.

01

Lo que realmente es

Durante años, la IA de frontera siguió una regla de restaurante: cuanto más elegante era el menú, más atención exigía la cuenta. Grok 4.6 rompe ese patrón. Obtiene 61 puntos en el Índice de Inteligencia de Artificial Analysis, empata con GPT-5.6 Sol y solo queda por detrás de las configuraciones máximas de Opus 5 y Fable 5. Sin embargo, conserva el precio de $2 por millón de tokens de entrada y $6 por millón de salida. Esta vez, el salto de capacidad no viene acompañado de una tarifa de lujo.

La historia más reveladora aparece debajo del índice compuesto. En GDPVal-AA v2, que evalúa trabajo profesional realizado por agentes, Grok alcanza 1753 Elo. En AA-Briefcase, centrado en tareas largas de investigación, análisis y creación de entregables, obtiene 1577 Elo. Artificial Analysis observó una media aproximada de 53 rondas y 0.5 mil millones de tokens de entrada por tarea. Opus 5 max necesitó alrededor de 103 rondas y 2.0 mil millones. Imagina dos equipos que entregan informes de calidad parecida: uno celebra la mitad de reuniones y relee solo una cuarta parte del archivo. Esa eficiencia reduce la factura y también disminuye las oportunidades de que el agente olvide el objetivo durante una trayectoria larga.

xAI entrenó expresamente para este tipo de resistencia. El anuncio describe una fase suplementaria más larga, nuevas trayectorias de razonamiento y software, y aprendizaje por refuerzo en trabajo de conocimiento, programación general, desarrollo web, diseño asistido por ordenador y otros entornos con herramientas. El modelo dispone de 500.000 tokens de contexto y niveles de razonamiento low, medium, high y xhigh. Está disponible en Grok Build, Cursor, la API de xAI, OpenRouter, Vercel y Cloudflare. Existe una variante rápida para reducir la espera, aunque cobra el doble por token.

Nada de esto equivale a ganar todas las disciplinas. La evidencia más clara de Grok está en el trabajo de conocimiento con agentes. En la tabla de xAI, su 65.9% en DeepSWE v1.1 queda detrás de GPT-5.6 Sol y Fable 5; su 26% en Terminal-Bench v3.0 queda todavía más lejos de los resultados de ambos, situados alrededor del 34%. Además, varios resultados rivales proceden de tarjetas de modelo o clasificaciones públicas con herramientas, prompts y reglas de parada distintas. Una diferencia pequeña debe leerse como una zona de rendimiento similar, no como una medida exacta al milímetro.

Los primeros testimonios de uso también merecen atención. Algunos desarrolladores describen cambios de seguridad peligrosos o una reacción poco fiable después de un fallo. Son anécdotas, no una estimación de frecuencia, pero muestran una clase de error que un promedio de benchmark puede esconder. La respuesta prudente es ejecutar al agente en un entorno aislado, ofrecerle las mínimas credenciales, exigir cambios pequeños, inspeccionar los diffs y mantener pruebas y aprobación humana. Un contexto de 500K puede contener un proyecto entero; no garantiza que el modelo detecte el dato decisivo ni que cite correctamente una fuente.

Por eso la conclusión práctica no es «confía más en Grok», sino «puedes permitirte verificar Grok mejor». Artificial Analysis mide unos $0.84 por tarea, de modo que una segunda ejecución, una comprobación de fuentes o un modelo revisor resultan razonables. Para investigación, análisis, documentos de trabajo y agentes prolongados, Grok 4.6 ya es una opción real de frontera con ventaja económica. Cuando una afirmación tenga consecuencias serias o el agente pueda tocar producción, una persona debe seguir en la puerta.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Vuelve a la frontera: Artificial Analysis le otorga 61 en su índice de nueve pruebas: empatado con GPT-5.6 Sol, cinco puntos sobre Grok 4.5 y detrás de las configuraciones máximas de Opus 5 y Fable 5.
  • El trabajo largo es el titular: 1753 Elo en GDPVal-AA v2 y 1577 en AA-Briefcase respaldan su trabajo profesional; xAI también publica 15.8% en Harvey LAB, el mejor valor de esa comparación.
  • Eficiencia práctica: unas 53 rondas y 0.5B tokens de entrada por tarea Briefcase, frente a 103 y 2.0B de Opus 5 max; sus $0.84 medidos por tarea quedan en la frontera de Pareto entre inteligencia y costo.
  • El precio no sube: $2/$6 por millón de tokens, caché a $0.50; la variante rápida cuesta el doble.
  • Acceso amplio: Grok Build, Cursor, API, OpenRouter, Vercel y Cloudflare, con 500K de contexto.

Limitaciones honestas

  • No lidera toda la programación: 65.9% en DeepSWE y 26% en Terminal-Bench v3 quedan bajo los mejores resultados publicados.
  • No todo usa el mismo laboratorio: tarjetas, leaderboards y harnesses distintos hacen que las diferencias pequeñas sean inciertas.
  • Hay alertas tempranas de seguridad: algunos usuarios informan cambios arriesgados y mala gestión de fallos. No miden frecuencia, pero justifican aislar agentes y revisar diffs sensibles.
  • El chat general va por detrás: la señal inicial es más fuerte en agentes y desarrollo web que en preferencia de texto amplia.
  • 500K no garantizan verdad: siguen haciendo falta fuentes, hitos y criterios de aceptación.
03

Resumen de Benchmarks

Artificial Analysis Intelligence Index — 61

Compuesto independiente de nueve pruebas, empatado con GPT-5.6 Sol.

GDPVal-AA v2 — 1753 Elo

Resultado sobresaliente en trabajo profesional con agentes.

AA-Briefcase — 1577 Elo

Calidad cercana a Fable con muchas menos rondas y tokens que Opus 5 max.

Costo medido — $0.84 por tarea

Cálculo de Artificial Analysis con uso observado y precios de $2/$6.

04

El Veredicto

Grok 4.6 es una de las mejores opciones de precio-rendimiento para trabajo de conocimiento con agentes: inteligencia independiente de frontera, gran eficiencia a largo plazo y suficiente distribución para probarlo sin reconstruir la plataforma. No gana toda prueba ni elimina el riesgo en decisiones serias. Úsalo como agente de proyecto que puede permitirse otra pasada, limita sus permisos y convierte la verificación en parte del trabajo.

05

Preguntas frecuentes