Durante años, la comunidad de pesos abiertos vivió bajo una regla simple: podías tener privacidad o inteligencia de frontera, pero no ambas a la vez. Los mejores modelos que podías descargar y ejecutar tú mismo siempre estaban un escalón por detrás de los gigantes cerrados. Suficientemente buenos para muchas tareas, pero no para las difíciles.
Kimi K3 es el modelo que hace que esa regla parezca superada.
Moonshot AI publicó los pesos completos el 27 de julio de 2026, y las cifras son sobrecogedoras. 2,8 billones de parámetros organizados como arquitectura mixture-of-experts — 896 expertos, de los cuales 16 se activan en cada token (104 mil millones activos). Un codificador de visión integrado llamado MoonViT-V2 permite al modelo leer capturas de pantalla, diagramas, gráficos, documentos y fotogramas de vídeo de forma nativa. La ventana de contexto se extiende a un millón de tokens, aproximadamente diez novelas completas. Y todo bajo una licencia Modified MIT que permite uso comercial.
La evidencia independiente respalda la afirmación de capacidad. Artificial Analysis — lo más parecido a un árbitro neutral en el campo de la IA — clasifica a K3 en torno a 80 de 100 en su Intelligence Index, situándolo en el puesto 5 entre 215 modelos a nivel mundial. Eso lo coloca a tres puntos de Claude Fable 5, un modelo cerrado que cuesta dinero real. Ningún otro modelo de pesos abiertos ha alcanzado ese nivel.
La historia de la arquitectura
El recuento bruto de parámetros es el titular, pero la ingeniería subyacente merece atención. K3 se construye sobre dos ideas que Moonshot llama Kimi Delta Attention (KDA) y Attention Residuals. KDA es un mecanismo de atención eficiente que escala mejor que los enfoques estándar; Attention Residuals recuperan información selectivamente a lo largo de la profundidad del modelo en lugar de acumularla uniformemente. Juntos, según Moonshot, proporcionan aproximadamente una mejora de 2,5× en la eficiencia de escalado respecto a K2.
Lo que eso significa en la práctica: el modelo usa su enorme presupuesto de parámetros de forma más inteligente que un simple aumento de escala. Además se entrega con cuantización MXFP4 nativa — los pesos se almacenan con precisión de 4 bits y activaciones de 8 bits, y esta compresión se integró durante el entrenamiento en lugar de aplicarse como un añadido posterior. Por eso el modelo puede funcionar con «solo» ocho H100 en lugar de requerir un centro de datos completo a precisión total.
Por qué no es el número 1 de esta categoría
Aquí está la tensión honesta. Kimi K3 es el modelo de pesos abiertos más capaz del planeta. También es el menos práctico de esta categoría para la mayoría de lectores.
Los pesos MXFP4 totalizan aproximadamente 1,4 terabytes. La configuración experimental mínima que describe Moonshot requiere ocho GPU H100 de 80 GB — 640 gigabytes de VRAM, lo que equivale a unos 200.000 dólares en hardware a precios actuales. La producción quiere 64 o más aceleradores en varios nodos conectados por interconexiones de alto ancho de banda. Eso no es una estación de trabajo. Es una pequeña supercomputadora.
Contrástalo con GLM-5.2, el actual número 1 de esta categoría. GLM-5.2 es un modelo de 744 mil millones de parámetros (unos 40 mil millones activos) que cabe en aproximadamente 241 gigabytes con cuantización agresiva de 2 bits — al alcance de un Mac Studio con 256 GB de memoria unificada o una estación de trabajo con doble GPU. Lleva una licencia MIT limpia. Tiene meses de validación independiente de la comunidad, incluido un primer puesto en la clasificación de programación de Design Arena.
K3 gana en inteligencia bruta, capacidad multimodal y escala pura. GLM-5.2 gana en todo lo que determina si una persona normal o un equipo pequeño pueden usarlo realmente. Para una categoría llamada «Local / Private AI», esa diferencia práctica es decisiva — y por eso K3 entra en el puesto 2, no en el 1.
En qué es realmente bueno K3
Dejando a un lado la cuestión del hardware, el perfil de capacidad es impresionante. En las evaluaciones propias de Moonshot, K3 alcanza FrontierSWE 81.2 % (tareas reales de ingeniería de software en repositorios grandes), Terminal-Bench 88.3 (competencia como agente de línea de comandos) y GPQA Diamond 93.5 (razonamiento científico de nivel de posgrado). En una prueba de optimización de kernels, Moonshot informa de que K3 superó sustancialmente a GPT-5.6 Sol, GPT-5.5 y Opus 4.8 — aunque son cifras de la empresa que esperan confirmación independiente.
La capacidad multimodal nativa es la característica que más claramente separa a K3 de GLM-5.2 en esta categoría. GLM-5.2 es solo texto y código. K3 lee imágenes, capturas de pantalla, gráficos y vídeo. Para flujos de trabajo autoalojados que involucran entrada visual — analizar un PDF, depurar una interfaz desde una captura, examinar una visualización de datos — K3 lo gestiona de forma nativa sin añadir un modelo de visión separado. Esa es una ventaja arquitectónica real para equipos que construyen pipelines multimodales tras su propio cortafuegos.
La realidad del despliegue
Si tu organización ya opera un clúster de GPU — un laboratorio de investigación, una empresa en la nube, un equipo de IA corporativo — la historia de despliegue es sorprendentemente madura para un lanzamiento de un día de antigüedad. vLLM publicó una vista previa de soporte a escala de producción el 22 de julio, con optimizaciones de prefix-caching KDA que Moonshot devolvió a la comunidad de código abierto. SGLang, Docker, Together AI y HuggingChat ofrecen caminos inmediatos para servir el modelo. Las herramientas no son la barrera; el hardware sí.
Para todos los demás, la API de Moonshot ofrece el mismo modelo a 3 dólares por millón de tokens de entrada y 15 dólares por millón de tokens de salida (con entrada en caché a 0,30 dólares). Es un precio razonable para trabajo de clase frontera, pero frustra el propósito de una clasificación de «IA local»: los datos salen de tu máquina.
Aspereza conocida
Moonshot es admirablamente transparente sobre las limitaciones de K3 en su propia documentación. El modelo es sensible al modo de historial de razonamiento — cambiar de motor de inferencia a mitad de sesión puede desestabilizar la salida, algo que importa para equipos que operan varios frameworks de servicio. También puede ser excesivamente proactivo, tomando decisiones autónomas que el usuario no pidió. Moonshot recomienda restricciones explícitas en los system prompts o un archivo AGENTS.md para mantener al modelo en su carril.
También hay una brecha notable en la experiencia de usuario comparado con productos cerrados pulidos como Claude Fable 5 y GPT-5.6 Sol, como reconoce el propio Moonshot. La inteligencia bruta está ahí; la fluidez, todavía no.
Conclusión
Kimi K3 es el modelo que demuestra que la frontera de pesos abiertos ha llegado. Un cerebro descargable que compite con los mejores modelos cerrados, lee imágenes y vídeo, y trae una licencia comercial ya no es una hipótesis — es un archivo en Hugging Face. La física de ejecutarlo (1,4 terabytes, ocho H100 como mínimo) significa que la mayoría de lectores lo admirarán desde lejos o lo alcanzarán a través de una API en lugar de sus propios servidores. Pero para los equipos que tienen la infraestructura, y para todos los que siguen hacia dónde se dirige la IA abierta, K3 es el nuevo techo — y el techo acaba de subir drásticamente.