Puesto #2 IA Local / Privada — Tu Cerebro en tu Hardware
Moonshot AI

Kimi K3

El primer modelo de pesos abiertos que se parece a un cerebro cerrado de frontera. 2,8 billones de parámetros en una arquitectura mixture-of-experts, visión nativa, un contexto completo de un millón de tokens y una licencia que te permite usarlo comercialmente — todo descargable en una máquina bajo tu control. El problema es la máquina: necesita un centro de datos, no un escritorio.

Actualizado July 28, 2026 Open WeightsModified MIT2.8T MoE
Ideal para

El primer modelo de pesos abiertos que se parece a un cerebro cerrado de frontera. 2,8 billones de parámetros en una arquitectura mixture-of-experts, visión nativa, un contexto completo de un millón de tokens y una licencia que te permite usarlo comercialmente — todo descargable en una máquina bajo tu control. El problema es la máquina: necesita un centro de datos, no un escritorio.

Por qué gana

El modelo de pesos abiertos más grande jamás publicado. Artificial Analysis lo clasifica en el puesto 5 mundial (a tres puntos de Claude Fable 5). Visión y comprensión de vídeo multimodal nativa que ningún otro modelo abierto de esta categoría ofrece. Puntuaciones propias de programación sólidas — FrontierSWE 81.2, Terminal-Bench 88.3, DeepSWE 67.5. La licencia Modified MIT permite autoalojamiento comercial con atribución. Soporte de despliegue desde el día 0 por vLLM, SGLang, Docker, Together AI y HuggingChat.

Ten en cuenta

Los pesos MXFP4 ocupan aproximadamente 1,4 terabytes. El despliegue experimental necesita al menos ocho GPU H100 de 80 GB; la producción recomienda 64 o más aceleradores en varios nodos. No es un modelo para portátil, escritorio ni estación de trabajo individual. La mayoría de las cifras de rendimiento son del fabricante — las evaluaciones independientes aún se están completando tras el lanzamiento del 27 de julio. La licencia modificada no es un MIT ni Apache 2.0 limpio, y el modelo tiene problemas conocidos de estabilidad con el historial de razonamiento y un exceso de proactividad.

01

Lo que realmente es

Durante años, la comunidad de pesos abiertos vivió bajo una regla simple: podías tener privacidad o inteligencia de frontera, pero no ambas a la vez. Los mejores modelos que podías descargar y ejecutar tú mismo siempre estaban un escalón por detrás de los gigantes cerrados. Suficientemente buenos para muchas tareas, pero no para las difíciles.

Kimi K3 es el modelo que hace que esa regla parezca superada.

Moonshot AI publicó los pesos completos el 27 de julio de 2026, y las cifras son sobrecogedoras. 2,8 billones de parámetros organizados como arquitectura mixture-of-experts — 896 expertos, de los cuales 16 se activan en cada token (104 mil millones activos). Un codificador de visión integrado llamado MoonViT-V2 permite al modelo leer capturas de pantalla, diagramas, gráficos, documentos y fotogramas de vídeo de forma nativa. La ventana de contexto se extiende a un millón de tokens, aproximadamente diez novelas completas. Y todo bajo una licencia Modified MIT que permite uso comercial.

La evidencia independiente respalda la afirmación de capacidad. Artificial Analysis — lo más parecido a un árbitro neutral en el campo de la IA — clasifica a K3 en torno a 80 de 100 en su Intelligence Index, situándolo en el puesto 5 entre 215 modelos a nivel mundial. Eso lo coloca a tres puntos de Claude Fable 5, un modelo cerrado que cuesta dinero real. Ningún otro modelo de pesos abiertos ha alcanzado ese nivel.

La historia de la arquitectura

El recuento bruto de parámetros es el titular, pero la ingeniería subyacente merece atención. K3 se construye sobre dos ideas que Moonshot llama Kimi Delta Attention (KDA) y Attention Residuals. KDA es un mecanismo de atención eficiente que escala mejor que los enfoques estándar; Attention Residuals recuperan información selectivamente a lo largo de la profundidad del modelo en lugar de acumularla uniformemente. Juntos, según Moonshot, proporcionan aproximadamente una mejora de 2,5× en la eficiencia de escalado respecto a K2.

Lo que eso significa en la práctica: el modelo usa su enorme presupuesto de parámetros de forma más inteligente que un simple aumento de escala. Además se entrega con cuantización MXFP4 nativa — los pesos se almacenan con precisión de 4 bits y activaciones de 8 bits, y esta compresión se integró durante el entrenamiento en lugar de aplicarse como un añadido posterior. Por eso el modelo puede funcionar con «solo» ocho H100 en lugar de requerir un centro de datos completo a precisión total.

Por qué no es el número 1 de esta categoría

Aquí está la tensión honesta. Kimi K3 es el modelo de pesos abiertos más capaz del planeta. También es el menos práctico de esta categoría para la mayoría de lectores.

Los pesos MXFP4 totalizan aproximadamente 1,4 terabytes. La configuración experimental mínima que describe Moonshot requiere ocho GPU H100 de 80 GB — 640 gigabytes de VRAM, lo que equivale a unos 200.000 dólares en hardware a precios actuales. La producción quiere 64 o más aceleradores en varios nodos conectados por interconexiones de alto ancho de banda. Eso no es una estación de trabajo. Es una pequeña supercomputadora.

Contrástalo con GLM-5.2, el actual número 1 de esta categoría. GLM-5.2 es un modelo de 744 mil millones de parámetros (unos 40 mil millones activos) que cabe en aproximadamente 241 gigabytes con cuantización agresiva de 2 bits — al alcance de un Mac Studio con 256 GB de memoria unificada o una estación de trabajo con doble GPU. Lleva una licencia MIT limpia. Tiene meses de validación independiente de la comunidad, incluido un primer puesto en la clasificación de programación de Design Arena.

K3 gana en inteligencia bruta, capacidad multimodal y escala pura. GLM-5.2 gana en todo lo que determina si una persona normal o un equipo pequeño pueden usarlo realmente. Para una categoría llamada «Local / Private AI», esa diferencia práctica es decisiva — y por eso K3 entra en el puesto 2, no en el 1.

En qué es realmente bueno K3

Dejando a un lado la cuestión del hardware, el perfil de capacidad es impresionante. En las evaluaciones propias de Moonshot, K3 alcanza FrontierSWE 81.2 % (tareas reales de ingeniería de software en repositorios grandes), Terminal-Bench 88.3 (competencia como agente de línea de comandos) y GPQA Diamond 93.5 (razonamiento científico de nivel de posgrado). En una prueba de optimización de kernels, Moonshot informa de que K3 superó sustancialmente a GPT-5.6 Sol, GPT-5.5 y Opus 4.8 — aunque son cifras de la empresa que esperan confirmación independiente.

La capacidad multimodal nativa es la característica que más claramente separa a K3 de GLM-5.2 en esta categoría. GLM-5.2 es solo texto y código. K3 lee imágenes, capturas de pantalla, gráficos y vídeo. Para flujos de trabajo autoalojados que involucran entrada visual — analizar un PDF, depurar una interfaz desde una captura, examinar una visualización de datos — K3 lo gestiona de forma nativa sin añadir un modelo de visión separado. Esa es una ventaja arquitectónica real para equipos que construyen pipelines multimodales tras su propio cortafuegos.

La realidad del despliegue

Si tu organización ya opera un clúster de GPU — un laboratorio de investigación, una empresa en la nube, un equipo de IA corporativo — la historia de despliegue es sorprendentemente madura para un lanzamiento de un día de antigüedad. vLLM publicó una vista previa de soporte a escala de producción el 22 de julio, con optimizaciones de prefix-caching KDA que Moonshot devolvió a la comunidad de código abierto. SGLang, Docker, Together AI y HuggingChat ofrecen caminos inmediatos para servir el modelo. Las herramientas no son la barrera; el hardware sí.

Para todos los demás, la API de Moonshot ofrece el mismo modelo a 3 dólares por millón de tokens de entrada y 15 dólares por millón de tokens de salida (con entrada en caché a 0,30 dólares). Es un precio razonable para trabajo de clase frontera, pero frustra el propósito de una clasificación de «IA local»: los datos salen de tu máquina.

Aspereza conocida

Moonshot es admirablamente transparente sobre las limitaciones de K3 en su propia documentación. El modelo es sensible al modo de historial de razonamiento — cambiar de motor de inferencia a mitad de sesión puede desestabilizar la salida, algo que importa para equipos que operan varios frameworks de servicio. También puede ser excesivamente proactivo, tomando decisiones autónomas que el usuario no pidió. Moonshot recomienda restricciones explícitas en los system prompts o un archivo AGENTS.md para mantener al modelo en su carril.

También hay una brecha notable en la experiencia de usuario comparado con productos cerrados pulidos como Claude Fable 5 y GPT-5.6 Sol, como reconoce el propio Moonshot. La inteligencia bruta está ahí; la fluidez, todavía no.

Conclusión

Kimi K3 es el modelo que demuestra que la frontera de pesos abiertos ha llegado. Un cerebro descargable que compite con los mejores modelos cerrados, lee imágenes y vídeo, y trae una licencia comercial ya no es una hipótesis — es un archivo en Hugging Face. La física de ejecutarlo (1,4 terabytes, ocho H100 como mínimo) significa que la mayoría de lectores lo admirarán desde lejos o lo alcanzarán a través de una API en lugar de sus propios servidores. Pero para los equipos que tienen la infraestructura, y para todos los que siguen hacia dónde se dirige la IA abierta, K3 es el nuevo techo — y el techo acaba de subir drásticamente.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • El cerebro más grande que puedes descargar: Con 2,8 billones de parámetros totales (104 mil millones activos por token, seleccionando 16 de 896 expertos), Kimi K3 es el modelo de pesos abiertos más grande jamás publicado. Artificial Analysis lo sitúa en torno a 80 de 100 en su Intelligence Index — el puesto 5 entre 215 modelos clasificados y a solo tres puntos de Claude Fable 5. Ningún otro modelo autoalojable se acerca a esa posición independiente.
  • Visión nativa, no solo texto: A diferencia de GLM-5.2 y la mayoría de modelos abiertos de programación, K3 incluye un codificador de visión integrado (MoonViT-V2, 401 millones de parámetros). Lee capturas de pantalla, diagramas, gráficos, documentos e incluso fotogramas de vídeo. Para flujos de trabajo autoalojados con entrada visual — depuración de interfaces, análisis de documentos, lectura de gráficos — elimina la necesidad de encadenar un modelo de visión separado.
  • Puntuaciones de programación que igualan a los líderes cerrados: Las evaluaciones propias de Moonshot reportan FrontierSWE 81.2 %, Terminal-Bench 88.3 y DeepSWE 67.5. En una tarea de optimización de kernels, K3 superó sustancialmente a GPT-5.6 Sol, GPT-5.5 y Opus 4.8 según la comparación de Moonshot. Son cifras oficiales, pero la clasificación de Artificial Analysis confirma de forma independiente que K3 pertenece a la conversación de frontera.
  • Una licencia que permite uso comercial: La licencia Modified MIT permite a las empresas autoalojar, ajustar, destilar e integrar K3 en productos comerciales con atribución. No es un Apache 2.0 ni MIT estándar limpio — los datos y el proceso de entrenamiento no se publican — pero para equipos que necesitan una vía comercial defendible, las condiciones son viables donde muchas alternativas de frontera no ofrecen ninguna.
  • Infraestructura de despliegue disponible desde el día 0: vLLM publicó una vista previa de soporte a escala de producción el 22 de julio, con optimizaciones de prefix-caching KDA devueltas a la comunidad. SGLang, Docker, Together AI y HuggingChat ofrecen rutas inmediatas. Si tu equipo ya opera un clúster de GPU, la herramienta para servir K3 no está a meses de distancia — llegó con los pesos.

Limitaciones honestas

  • Es un modelo de centro de datos, no local: Los pesos MXFP4 totalizan aproximadamente 1,4 terabytes. La configuración experimental mínima son ocho GPU H100 de 80 GB (640 GB de VRAM), y Moonshot recomienda supernodos con 64 o más aceleradores para producción. Para comparar: GLM-5.2 — el número 1 de esta categoría — cabe en unos 241 GB y funciona en un Mac Studio de gama alta. La mayoría de quienes leen una guía de IA local no pueden alojar K3 en hardware que ya poseen.
  • La validación independiente aún es temprana: Los pesos se publicaron el 27 de julio de 2026. Artificial Analysis ha publicado su clasificación compuesta, pero el conjunto completo de pruebas independientes — SWE-Bench, LiveBench, Arena Elo en tareas diversas — aún se está completando. La mayoría de las puntuaciones detalladas en la ficha del modelo son del fabricante. Trátalas como señales fuertes, no como veredictos definitivos, hasta que los evaluadores independientes terminen sus análisis.
  • La licencia es modificada, no estándar: Las condiciones Modified MIT permiten uso comercial con atribución, pero no son el MIT o Apache 2.0 limpio y sin restricciones que llevan GLM-5.2 y Gemma 4. Los datos de entrenamiento no se publican y los términos modificados exactos merecen una lectura cuidadosa antes de construir un producto comercial sobre estos pesos.
  • Problemas de estabilidad conocidos: La propia documentación de Moonshot advierte que K3 es sensible al modo de historial de razonamiento — cambiar el motor de inferencia durante una sesión puede desestabilizar la salida. El modelo también puede ser excesivamente proactivo, tomando decisiones autónomas que el usuario no solicitó. Moonshot recomienda restricciones explícitas en los system prompts o un archivo AGENTS.md. Es manejable pero real, especialmente en pipelines automatizados.
  • Para la mayoría de compradores de IA local, GLM-5.2 sigue siendo mejor opción: K3 es más capaz sobre el papel, pero GLM-5.2 funciona en hardware que una persona seria o un equipo pequeño puede comprar realmente, lleva una licencia MIT limpia y tiene meses de validación independiente de la comunidad. K3 gana la corona de capacidad; GLM-5.2 conserva la práctica. Por eso K3 entra en el puesto 2, no en el 1.
03

Resumen de Benchmarks

Artificial Analysis Intelligence Index — ~80 (puesto 5 de 215)

La señal independiente más fuerte disponible. K3 ocupa el puesto 5 mundial y está a tres puntos de Claude Fable 5 — el primer modelo de pesos abiertos en alcanzar ese nivel. Puntuación compuesta; los desgloses por tarea aún se están publicando.

FrontierSWE — 81.2 % / Terminal-Bench 2.1 — 88.3

Pruebas propias de ingeniería de software y agente de terminal. FrontierSWE mide tareas reales en repositorios; Terminal-Bench mide competencia en línea de comandos. Cifras sólidas, pero pendientes de confirmación independiente tras el asentamiento de los pesos.

GPQA Diamond — 93.5

Preguntas científicas de nivel de posgrado. Cerca de la cima de cualquier clasificación pública — abierta o cerrada. Indica que la inteligencia de K3 se extiende más allá de la programación hacia el razonamiento general.

Arquitectura — 2.8T MoE / 104B activos

896 expertos con 16 seleccionados por token. Kimi Delta Attention más Attention Residuals ofrecen aproximadamente 2,5× la eficiencia de escalado frente a K2. Pesos MXFP4 nativos y activaciones MXFP8 con quantization-aware training integrado desde la fase SFT.

04

El Veredicto

Kimi K3 es el modelo de pesos abiertos más capaz que puedes descargar — y esa frase ahora es cierta en lugar de aspiracional. Un cerebro autoalojable que ocupa el puesto 5 mundial en Artificial Analysis, lee imágenes y vídeo, mantiene un millón de tokens de contexto y trae una licencia comercial es un hito genuino. Pero los hitos no borran la física. La huella de 1,4 terabytes y el mínimo de ocho H100 ponen este modelo fuera del alcance de todos excepto los equipos que ya operan clústeres de GPU. GLM-5.2 se mantiene como número 1 en esta categoría porque entrega inteligencia de programación casi de frontera en hardware que una persona puede comprar, bajo una licencia MIT limpia y con meses de validación independiente. K3 ocupa el puesto 2 como el modelo que empuja el techo: la prueba de que la frontera de pesos abiertos ha llegado, aunque la mayoría de lectores la alcance a través de una API en lugar de sus propios servidores. Si tienes la infraestructura — o si la capacidad bruta es la única variable — K3 es el nuevo rey de pesos abiertos. Si eliges un modelo para ejecutar realmente en local, empieza con GLM-5.2.

05

Preguntas frecuentes