Puesto #4 Programación — IA que Escribe Software de Producción
Moonshot AI

Kimi K3

Kimi K3 ocupa provisionalmente el puesto #3 en programación porque tres pistas cuentan la misma historia: un primer lugar preliminar en las pruebas ciegas de frontend de Arena, resultados independientes sólidos y puntuaciones inusualmente buenas de Moonshot en tareas largas de ingeniería. La entrada de imágenes y el millón de tokens de contexto resultan especialmente útiles cuando un trabajo dura lo suficiente para que un chatbot normal olvide algo importante.

Actualizado 18 de julio de 2026 Agentic CodingFrontend LeaderLong-Horizon
Ideal para

Kimi K3 ocupa provisionalmente el puesto #3 en programación porque tres pistas cuentan la misma historia: un primer lugar preliminar en las pruebas ciegas de frontend de Arena, resultados independientes sólidos y puntuaciones inusualmente buenas de Moonshot en tareas largas de ingeniería. La entrada de imágenes y el millón de tokens de contexto resultan especialmente útiles cuando un trabajo dura lo suficiente para que un chatbot normal olvide algo importante.

Por qué gana

Arena sitúa a Kimi K3 primero en WebDev con 1679 Elo, por delante de Claude Fable 5, GPT-5.6 Sol y Grok 4.5, aunque el resultado es preliminar. Artificial Analysis le da 57 en general y 1668 Elo en GDPval-AA v2. Moonshot informa 42% en SWE Marathon y 88.3% en Terminal-Bench 2.1. Entrada nativa de imágenes, contexto de 1M, Kimi Code y API convierten esas capacidades en un flujo real.

Ten en cuenta

Los primeros resultados entusiasman, pero las comparaciones no son del todo justas. Kimi K3 aún no tiene un resultado completo e independiente en el Coding Agent Index de Artificial Analysis, y la tabla de Moonshot prueba los modelos con herramientas distintas: KimiCode, Claude Code, Codex y Terminus. El liderazgo de Arena es preliminar, los pesos prometidos aún no existen públicamente y Artificial Analysis midió 51% de alucinaciones junto con un uso de tokens muy elevado.

01

Lo que realmente es

Ningún benchmark de programación muestra todo lo que puede hacer un modelo. Una prueba corta puede medir una respuesta correcta, mientras el trabajo real también exige leer un repositorio, usar herramientas, recuperarse de errores y recordar el objetivo durante muchos pasos. Kimi K3 interesa porque sus mejores señales cubren varias de esas condiciones difíciles: frontend visual, herramientas de terminal, repositorios grandes y sesiones largas de ingeniería.

El dato más ruidoso es la clasificación ciega WebDev de Arena. K3 entra con 1679 Elo, delante de Claude Fable 5 con 1631, GPT-5.6 Sol con 1618 y Grok 4.5 con 1558. Las personas comparan aplicaciones sin saber qué modelo las creó. Eso importa mucho si la interfaz debe verse y sentirse bien, no solo compilar. Pero el resultado lleva una advertencia amarilla: Arena lo llama preliminar, y puede moverse cuando lleguen más votos.

Los resultados de largo horizonte explican por qué la victoria de frontend puede no ser casualidad. En SWE Marathon, K3 obtiene 42% frente al 35% citado para Fable 5, usando ambos Claude Code. Un trabajo largo de ingeniería no es una respuesta genial; es una cadena de actos pequeños: leer el repositorio, formar una hipótesis, editar, probar, descubrir el error y volver a empezar sin olvidar la meta original.

La evidencia independiente también es fuerte. Artificial Analysis puntúa a K3 con 57 y 1668 Elo en GDPval-AA v2. Sigue detrás de Fable 5 y GPT-5.6 Sol, pero supera a Grok 4.5. Esa es la razón central para desplazar a Grok del #3. Grok continúa siendo el corredor económico; K3 parece tener un techo de capacidad mayor.

La arquitectura solo resulta útil al traducirla a lenguaje común. Un millón de tokens de contexto, entrada nativa de imágenes y un diseño disperso de 2.8 billones de parámetros significan que K3 puede mirar capturas y referencias mientras mantiene mucho código y documentación sobre la misma mesa. No es una invitación a llenar cada prompt con basura; es espacio adicional cuando el proyecto realmente tiene muchas piezas pertinentes.

Kimi Code convierte esa capacidad en producto de terminal, y la API compatible con OpenAI facilita probarlo. Con $3/$15 por millón de tokens, K3 queda entre agentes económicos y buques insignia. La caché a $0.30 ayuda si se reutiliza un prefijo estable del repositorio. Aun así, hay que medir el costo de un parche probado, no el de la primera respuesta.

La nota incómoda es que Moonshot compara sistemas con harnesses distintos. K3 puede usar KimiCode, GPT usa Codex y Claude usa Claude Code o Terminus. Ese envoltorio decide herramientas, reintentos y memoria. Es justo decir 88.3% en Terminal-Bench 2.1; no es justo convertirlo en una victoria pura del modelo contra todos.

Fable además lidera FrontierSWE y posee evidencia mucho más fuerte en SWE-Bench Pro. K3 aún carece de un Coding Agent Index independiente completo. Por eso el veredicto es estrecho: Kimi K3 es provisionalmente #3. Úsalo para trabajo visual, frontend, contexto masivo o sesiones largas. Fable y GPT-5.6 permanecen arriba hasta que la evidencia independiente de K3 sea tan profunda como su promesa inicial.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • El resultado de frontend es difícil de ignorar: La clasificación ciega WebDev de Arena coloca a Kimi K3 en 1679 Elo, delante de Fable 5 con 1631, GPT-5.6 Sol con 1618 y Grok 4.5 con 1558. Es preferencia humana sobre interfaces construidas, no un examen de opción múltiple—aunque Arena aún marca el resultado como preliminar.
  • La ingeniería de largo horizonte es su especialidad más clara: Moonshot informa 42% en SWE Marathon, por encima del 35% citado para Fable 5, con ambos modelos evaluados mediante Claude Code. Esa porción controlada respalda que K3 puede navegar, modificar, probar y persistir durante trabajos extensos.
  • La evidencia general independiente respalda la historia de programación: Artificial Analysis otorga a K3 57 en Intelligence Index y 1668 Elo en GDPval-AA v2. No son trofeos exclusivamente de código, pero muestran que planificación, uso de herramientas y resolución profesional no provienen solo de las pruebas de Moonshot.
  • Visión y un millón de tokens pertenecen a la misma caja de herramientas: K3 puede combinar capturas, diagramas, referencias de diseño y contexto de repositorios. Es especialmente útil para convertir pantallas en código, depurar visualmente, iterar interfaces e investigar bases de código grandes.
  • Kimi Code ofrece herramientas prácticas de desarrollo: El modelo está disponible en el terminal de Kimi Code y mediante la API compatible con OpenAI de Moonshot. Kimi Code permite que K3 inspeccione archivos, use herramientas de terminal, edite un proyecto y continúe hasta obtener un resultado probado.
  • Cuesta menos que los líderes premium sin fingir ser barato: La API vale $3 de entrada / $15 de salida por millón de tokens, con caché de entrada a $0.30. Es más caro que Grok 4.5, pero muy inferior a Fable 5 y ofrece un terreno similar de código visual y contexto largo.

Limitaciones honestas

  • Todavía falta la prueba independiente de código más importante: Artificial Analysis midió la capacidad general y agéntica de K3, pero no publicó una ejecución completa de su Coding Agent Index. Grok 4.5 conserva por ello la evidencia independiente más limpia de costo por tarea de programación.
  • Las distintas herramientas de agente dificultan comparar directamente las puntuaciones: K3 suele usar KimiCode mientras sus rivales usan Codex, Claude Code o Terminus. Estas herramientas cambian prompts, reintentos, comandos y gestión de contexto; el 88.3% prueba un sistema Kimi fuerte, no que el modelo por sí solo venza a todos.
  • Fable todavía gana terrenos importantes: La comparación de Moonshot pone a Fable 5 por delante en FrontierSWE, y la evidencia publicada de SWE-Bench Pro también favorece a Fable. K3 es un retador equilibrado de frontend y largo horizonte, no el campeón universal de reparar repositorios.
  • Los pesos abiertos ya están disponibles — pero ejecutarlos es otra historia: Moonshot publicó los pesos completos de 2,8 billones de parámetros el 27 de julio bajo una licencia Modified MIT. Sin embargo, con aproximadamente 1,4 terabytes en MXFP4, el despliegue en producción necesita decenas de GPU de clase H100. K3 se puede autoalojar de verdad, pero para la mayoría de los desarrolladores la API alojada sigue siendo el camino práctico.
  • Hay que vigilar fiabilidad y apetito de tokens: Artificial Analysis midió 51% de alucinaciones y unos 130 millones de tokens de salida en el índice. El código sigue necesitando pruebas, revisión de seguridad y presupuesto por tarea completada.
03

Resumen de Benchmarks

Arena WebDev — 1679 Elo (#1, preliminar)

Preferencia humana ciega en tareas frontend y web. K3 lidera a Fable 5, GPT-5.6 Sol y Grok 4.5, pero Arena etiqueta explícitamente el resultado nuevo como preliminar.

Artificial Analysis Intelligence Index — 57

Resultado compuesto independiente detrás de Fable 5 y GPT-5.6 Sol, pero delante de Grok 4.5. Respalda capacidad frontier sin inventar una victoria dedicada de agente de código.

GDPval-AA v2 — 1668 Elo

Señal independiente de trabajo profesional por encima de Opus 4.8 y Grok 4.5, aunque aún por debajo de Fable 5 y GPT-5.6 Sol.

SWE Marathon — 42%

La comparación de código más limpia de Moonshot: K3 y Fable 5 usan Claude Code, y K3 supera el 35% citado para Fable.

Terminal-Bench 2.1 — 88.3%

Excelente resultado del proveedor en trabajo agéntico de terminal, apenas detrás del 88.8% citado para GPT-5.6 Sol. Comparar con cautela por los distintos harnesses.

04

El Veredicto

Kimi K3 pertenece hoy provisionalmente al puesto #3, entre Fable 5 y Grok 4.5. Hay más que entusiasmo de lanzamiento: inteligencia frontier independiente, una ventaja preliminar grande en frontend, una victoria controlada sobre Fable en SWE Marathon y un entorno de desarrollo creíble. No sube más porque Fable y GPT-5.6 poseen evidencia agéntica más amplia y madura, mientras los harnesses mixtos y la ausencia del Coding Agent Index dejan incertidumbre. Elige K3 para trabajo largo, visual, centrado en frontend o repositorios enormes; Grok cuando mande el costo; Fable y Sol para los terrenos difíciles con pruebas más profundas.

05

Preguntas frecuentes