Puesto #5 Ecosistema Diario — Los Asistentes Líderes
Moonshot AI

Kimi K3

Kimi K3 es la primera versión de Kimi que merece estar junto a las plataformas cotidianas, no solo en una gráfica de modelos. Combina razonamiento cercano a la frontera con chat web y móvil, Agent autónomo, Docs, Sheets, Slides, Deep Research, Kimi Work y Kimi Code. El modelo ya hace cosas impresionantes, aunque algunos flujos Agent todavía tienen límites prácticos.

Actualizado 28 de julio de 2026 AgenticKnowledge WorkDocs & Sheets
Ideal para

Kimi K3 es la primera versión de Kimi que merece estar junto a las plataformas cotidianas, no solo en una gráfica de modelos. Combina razonamiento cercano a la frontera con chat web y móvil, Agent autónomo, Docs, Sheets, Slides, Deep Research, Kimi Work y Kimi Code. El modelo ya hace cosas impresionantes, aunque algunos flujos Agent todavía tienen límites prácticos.

Por qué gana

Artificial Analysis puntúa a K3 con 57 en general, 1668 Elo en GDPval-AA v2, 1547 Elo en AA-Briefcase y 53% en AutomationBench-AA. El producto acepta texto e imágenes, el modelo ofrece 1M de contexto y Kimi puede generar sitios, informes, Word, hojas de cálculo, presentaciones y código. Hay nivel gratuito y planes pagados desde $19 al mes.

Ten en cuenta

El cerebro de IA de Kimi ya es muy capaz. El problema está en algunos detalles del producto: el Agent normal puede olvidar instrucciones antiguas durante una conversación larga, suele entregar un solo archivo por tarea y usa en la práctica menos contexto que el máximo de 1M de tokens del modelo. Artificial Analysis también midió 51% de alucinaciones, alto consumo de tokens y una velocidad inferior a la media. Kimi no está tan conectado con Workspace, Android, Chrome y Search como Gemini.

01

Lo que realmente es

La mayoría de los asistentes de IA se construyen alrededor de una ventana de chat sencilla: haces una pregunta y recibes una respuesta. Kimi K3 va más allá al combinar el chat con herramientas especializadas para investigación, documentos, hojas de cálculo, presentaciones, sitios web, programación y automatización. Moonshot no solo entrenó un modelo más grande; también creó productos capaces de convertir su razonamiento en trabajo terminado.

Los resultados independientes justifican tomarlo en serio. Artificial Analysis da a K3 57, 1668 Elo en GDPval-AA v2 y 1547 Elo en AA-Briefcase. En esta prueba de trabajo profesional prolongado, solo Claude Fable 5 queda arriba. También logra 53% y primer lugar en AutomationBench-AA. Dicho sencillamente: K3 no solo sabe cosas; puede empujar una tarea de varios pasos hacia un entregable.

La gama de productos es amplia. Agent investiga, crea sitios, produce documentos, analiza hojas y prepara presentaciones. Kimi Work lleva los flujos de agentes al escritorio. Kimi Code sirve a desarrolladores, Agent Swarm reparte investigaciones grandes y tareas por lotes entre varios agentes, y Claw mantiene automatizaciones. En conjunto resuelven una necesidad práctica: la gente suele querer la hoja de cálculo, presentación o informe terminado, no solo instrucciones para hacerlo.

El millón de tokens y la entrada de imágenes forman una mesa enorme. Informes, capturas, gráficas y fuentes pueden estudiarse juntos. Más contexto no equivale a memoria perfecta, y más papeles también pueden causar confusión. Para comparaciones legales, colecciones de investigación o análisis financiero, el espacio adicional sí importa.

Kimi es fácil de probar. Funciona en web y móvil; el nivel gratuito incluye unas pocas tareas Agent, y los planes pagados comienzan en $19 mensuales. La API cuesta $3 de entrada y $15 de salida por millón. K3 no es una opción barata; su precio está pensado para trabajo profesional.

¿Por qué solo #4? Porque esta categoría evalúa todo el ecosistema, no solo el modelo. Gemini puede ser más débil en algunas pruebas independientes, pero Google ya lo conecta con correo, documentos, calendarios, navegadores, teléfonos, búsqueda y permisos organizativos. Kimi ofrece muchas herramientas, aunque todavía no está tan integrado con los servicios que la gente usa a diario. Para quien elige un solo asistente, esa comodidad es una ventaja real.

La fiabilidad es el otro freno. Artificial Analysis observó más precisión pero también 51% de alucinaciones. Es como una colega brillante que acierta más, pero se siente menos cómoda diciendo “no sé”. Puede ser muy productiva si alguien comprueba citas, fórmulas y afirmaciones.

Además, el millón de tokens debe comprobarse en el producto concreto: el modelo lo soporta, pero algunos flujos Agent documentan límites prácticos menores. Los pesos completos llegaron el 27 de julio bajo una licencia Modified MIT — pero con 2,8 billones de parámetros y aproximadamente 1,4 terabytes en MXFP4, requieren hardware de nivel datacenter para ejecutarse. Por ahora, Kimi K3 merece el #4 para investigación profunda, muchas fuentes y archivos terminados. Gemini encaja con más facilidad en un flujo de trabajo existente de Google. Kimi es una alternativa potente, pero conviene comprobar los límites de la herramienta Agent concreta antes de organizar una tarea grande a su alrededor.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • El trabajo de conocimiento independiente ya roza la cima: K3 alcanza 1668 Elo en GDPval-AA v2 y 1547 Elo en AA-Briefcase, donde Artificial Analysis lo ubica solo detrás de Fable 5. Es evidencia para informes, análisis y trabajo profesional multietapa, no solo preguntas académicas.
  • Kimi crea el archivo en lugar de limitarse a explicarlo: Kimi Agent crea y edita Word, analiza y genera Excel, construye presentaciones, produce PDF, publica sitios y entrega investigación profunda. Para una persona no técnica, un archivo descargable suele valer más que otro párrafo explicando cómo hacerlo.
  • Los flujos agénticos son una fortaleza real: Artificial Analysis informa 53% y primer lugar en AutomationBench-AA. Agent, Agent Swarm, Work, Code y Claw trasladan esa capacidad a tareas web, escritorio, programación y automatización persistente.
  • El contexto amplio y la entrada de imágenes ayudan con grandes colecciones de documentos: K3 acepta texto e imágenes con 1M de contexto. Puede trabajar con contratos, informes, capturas, gráficas y colecciones extensas sin perder continuamente información importante.
  • Los planes gratuitos y de pago cubren distintos niveles de uso: Kimi funciona en web, iOS, Android y HarmonyOS. El plan gratuito incluye pocas tareas Agent; las membresías desde $19 mensuales aumentan los cupos de Agent, Swarm, Code y bases profesionales.
  • La API sigue siendo competitiva para trabajo serio: A $3/$15 por millón de tokens de entrada/salida y $0.30 de caché, K3 no es barato. Artificial Analysis estima unos $0.94 por tarea del Intelligence Index, cerca de GPT-5.6 Sol y muy por debajo de Fable 5 en esa evaluación.

Limitaciones honestas

  • Gemini sigue más integrado con las herramientas cotidianas: Gemini está integrado con Workspace, Android, Chrome y Search. Kimi tiene muchas herramientas propias, pero muchas menos personas ya las usan a diario; por eso K3 queda #4 detrás de Gemini.
  • La fiabilidad de los hechos sigue siendo preocupante: Artificial Analysis midió 51% de alucinaciones, frente al 39% de K2.6 aunque aumentó la precisión. Fuentes, fórmulas, cláusulas y afirmaciones comerciales requieren comprobación.
  • El límite del modelo y el del producto no siempre coinciden: K3 soporta 1M de tokens, pero la documentación de Agent describe límites prácticos menores en algunos flujos. Comprueba la superficie real antes de prometer que cualquier trabajo gigantesco cabrá.
  • Razonamiento máximo no es conversación instantánea: K3 debutó con esfuerzo máximo por defecto; Artificial Analysis lo encontró verboso y más lento que la media. Es apropiado para un informe difícil, excesivo para preguntar la hora de una reunión.
  • Los pesos abiertos ya están disponibles, pero ejecutarlos es otra historia: Moonshot publicó los pesos completos de 2,8 billones de parámetros el 27 de julio bajo una licencia Modified MIT, confirmando que K3 se puede autoalojar de verdad. Pero con aproximadamente 1,4 terabytes en MXFP4, el despliegue en producción necesita decenas de GPU de clase H100 en varios nodos. Para la mayoría de usuarios, la API alojada sigue siendo el camino práctico; los pesos importan sobre todo a empresas y laboratorios que ya operan clústeres de GPU.
03

Resumen de Benchmarks

Artificial Analysis Intelligence Index — 57

Resultado independiente cercano a la frontera, detrás de Fable 5 y GPT-5.6 Sol y delante de Grok 4.5. Varias configuraciones de esfuerzo pueden cambiar el rango mostrado.

GDPval-AA v2 — 1668 Elo

Trabajo profesional agéntico realista. K3 queda tras Fable 5 y GPT-5.6 Sol, pero supera a Opus 4.8 y Grok 4.5 en la comparación citada.

AA-Briefcase — 1547 Elo (#2)

Evaluación privada de conocimiento de largo horizonte. K3 solo queda detrás de Fable 5 y destaca especialmente en calidad analítica.

AutomationBench-AA — 53% (#1)

Implementación independiente de tareas SaaS, que respalda que los agentes de Kimi hacen más que conversar.

Costo del Intelligence Index — cerca de $0.94 por tarea

Estimación con consumo medido y tarifas de API. El costo real depende mucho de la longitud del razonamiento y reutilización de caché.

04

El Veredicto

Kimi K3 entra al Everyday Ecosystem en el puesto #4. El modelo tiene potencia de sobra: las pruebas independientes lo sitúan cerca de la cima y Kimi ha creado uno de los conjuntos de agentes más amplios fuera de las tres plataformas dominantes. Permanece debajo de Gemini porque un ecosistema cotidiano también depende de dónde ya están tu correo, documentos, navegador, teléfono y colegas. Elige Kimi para investigación profunda, muchas fuentes, trabajo autónomo o archivos Office terminados en un solo servicio. Comprueba los datos importantes y ten en cuenta que, aunque los pesos abiertos ya se pueden descargar, ejecutarlos por tu cuenta requiere hardware de nivel datacenter.

05

Preguntas frecuentes