Un buen agente de programación se parece menos al autocompletado y más a un ingeniero junior que recibe un ticket. Debe inspeccionar el repositorio, formular una hipótesis, ejecutar comandos, interpretar los errores y recordar el objetivo después del duodécimo desvío. Grok 4.6 fue entrenado para ese ciclo largo. xAI habla de trabajo sobre bases de código completas, investigación de dominios desconocidos, desarrollo web, aplicaciones visuales, varias rondas de feedback y más comprobaciones propias que en Grok 4.5. La meta no es escribir un fragmento elegante, sino llevar la tarea hasta un resultado que pueda verificarse.
El patrón de resultados respalda una mejora generacional real. CursorBench v3.2 pasa de 66.7% a 69.9%, DeepSWE v1.1 de 54% a 65.9% y FrontierCode v1.1 de 56.6% a 61.3%. También aumentan APEX-Agents, APEX-SWE y Terminal-Bench v3. Una sola fila favorable podría depender de un prompt o de un entorno especialmente adecuado; mejorar en seis evaluaciones de programación y agentes es una señal bastante más sólida.
Aun así, Grok no se convierte en el rey universal del código. En la comparación de xAI, GPT-5.6 Sol obtiene 73% en DeepSWE y Fable 5 alcanza 70%. En Terminal-Bench v3, el 26% de Grok queda por debajo del 34.6% y 34.1% publicados para sus rivales. Fable también conserva ventajas pequeñas en CursorBench, FrontierCode, APEX-Agents y APEX-SWE. El lanzamiento no ofrece un resultado completo de SWE-bench Verified. No conviene rellenar ese hueco con otro benchmark: reparar repositorios, manejar una terminal y construir una interfaz son capacidades relacionadas, pero no idénticas.
El precio y la disponibilidad sí cambian la decisión práctica. Grok 4.6 apareció desde el primer día en Cursor y Grok Build, además de la API de xAI, OpenRouter, Vercel y Cloudflare. La tarifa estándar continúa en $2 por millón de tokens de entrada y $6 por millón de salida; la variante rápida duplica esos importes. Artificial Analysis mide alrededor de $0.84 por tarea para el modelo general. Cuando un agente necesita investigar tres veces, intentar dos reparaciones y pasar una revisión final, el costo de cada vuelta se convierte en una característica de ingeniería.
Precisamente por eso no debe cambiarse el ahorro por menos protección. Los primeros informes prácticos mencionan modificaciones de seguridad peligrosas y respuestas improductivas después de fallar. No son datos controlados sobre frecuencia, pero describen un riesgo plausible. Empieza con exploración del repositorio en modo de solo lectura, mantén los secretos fuera de su alcance, limita la escritura a una rama aislada, exige diffs pequeños y ejecuta CI tras cada cambio importante. Amplía la autonomía únicamente cuando el modelo supere tareas internas que no haya visto.
Una comparación justa también debe evaluar el sistema completo: el mismo ticket, las mismas herramientas, el mismo límite de tiempo y reintentos, y los mismos tests. No midas solo si apareció un parche que funciona; registra cuántas rondas, tokens y minutos de revisión humana fueron necesarios para obtener un cambio fusionable. Grok 4.6 se entiende mejor como un agente de código frontier con gran valor: capaz de trabajo serio de varios pasos, barato para repetir y disponible en herramientas reales. Su ventaja solo existe cuando el flujo de trabajo comprueba rigurosamente lo que escribe.