Classé #2 IA locale / privée — Votre cerveau, votre machine, vos règles
Moonshot AI

Kimi K3

Le premier modèle à poids ouverts qui ressemble à un cerveau fermé de pointe. 2,8 billions de paramètres en mixture-of-experts, vision native, un contexte complet d'un million de tokens et une licence qui autorise un usage commercial — le tout téléchargeable sur une machine que vous contrôlez. Le problème, c'est la machine : il faut un datacenter, pas un bureau.

Mis à jour July 28, 2026 Open WeightsModified MIT2.8T MoE
8.5sur 10
Site officiel
Idéal pour

Le premier modèle à poids ouverts qui ressemble à un cerveau fermé de pointe. 2,8 billions de paramètres en mixture-of-experts, vision native, un contexte complet d'un million de tokens et une licence qui autorise un usage commercial — le tout téléchargeable sur une machine que vous contrôlez. Le problème, c'est la machine : il faut un datacenter, pas un bureau.

Pourquoi ça Gagne

Le plus grand modèle à poids ouverts jamais publié. Artificial Analysis le classe au 5e rang mondial (à trois points de Claude Fable 5). Vision et compréhension vidéo multimodales natives qu'aucun autre modèle ouvert de cette catégorie ne propose. Scores de programmation internes solides — FrontierSWE 81.2, Terminal-Bench 88.3, DeepSWE 67.5. Licence Modified MIT autorisant l'auto-hébergement commercial avec attribution. Support de déploiement dès le jour 0 par vLLM, SGLang, Docker, Together AI et HuggingChat.

À surveiller

Les poids MXFP4 représentent environ 1,4 téraoctet. Un déploiement expérimental nécessite au minimum huit GPU H100 de 80 Go ; la production recommande 64 accélérateurs ou plus sur plusieurs nœuds. Ce n'est pas un modèle pour ordinateur portable, de bureau ou station de travail individuelle. La plupart des chiffres de performance proviennent du fabricant — les évaluations indépendantes s'étoffent encore après la sortie du 27 juillet. La licence modifiée n'est pas un MIT ou Apache 2.0 standard, et le modèle présente des problèmes de stabilité connus liés à l'historique de raisonnement et à un excès de proactivité.

01

Ce que c'est réellement

Pendant des années, la communauté des poids ouverts a vécu selon une règle simple : on pouvait avoir la confidentialité ou l’intelligence de pointe, mais pas les deux en même temps. Les meilleurs modèles téléchargeables et exécutables soi-même étaient toujours un cran en dessous des géants fermés. Suffisamment bons pour beaucoup de tâches, mais pas pour les difficiles.

Kimi K3 est le modèle qui donne l’impression que cette règle est dépassée.

Moonshot AI a publié les poids complets le 27 juillet 2026, et les chiffres sont saisissants. 2,8 billions de paramètres organisés en architecture mixture-of-experts — 896 experts, dont 16 s’activent à chaque token (104 milliards actifs). Un encodeur de vision intégré appelé MoonViT-V2 permet au modèle de lire captures d’écran, diagrammes, graphiques, documents et images vidéo de façon native. La fenêtre de contexte s’étend à un million de tokens, soit environ dix romans complets. Et le tout sous une licence Modified MIT qui autorise l’usage commercial.

La preuve indépendante corrobore la prétention de capacité. Artificial Analysis — l’entité la plus proche d’un arbitre neutre dans le domaine de l’IA — classe K3 à environ 80 sur 100 sur son Intelligence Index, le plaçant au 5e rang parmi 215 modèles dans le monde. Cela le met à trois points de Claude Fable 5, un modèle fermé qui coûte de l’argent réel. Aucun autre modèle à poids ouverts n’a atteint ce voisinage.

L’histoire de l’architecture

Le nombre brut de paramètres fait le titre, mais l’ingénierie en dessous mérite attention. K3 repose sur deux idées que Moonshot appelle Kimi Delta Attention (KDA) et Attention Residuals. KDA est un mécanisme d’attention efficace qui passe à l’échelle mieux que les approches standard ; les Attention Residuals récupèrent sélectivement l’information à travers la profondeur du modèle au lieu de l’accumuler uniformément. Ensemble, Moonshot annonce environ 2,5× d’amélioration de l’efficacité de passage à l’échelle par rapport à K2.

Ce que cela signifie en pratique : le modèle utilise son énorme budget de paramètres plus intelligemment qu’une simple montée en charge naïve. Il est aussi livré avec quantification MXFP4 native — les poids sont stockés en précision 4 bits avec activations 8 bits, et cette compression a été intégrée pendant l’entraînement plutôt qu’appliquée après coup. C’est pourquoi le modèle peut tourner sur « seulement » huit H100 au lieu de nécessiter tout un datacenter en pleine précision.

Pourquoi ce n’est pas le numéro 1 de cette catégorie

Voici la tension honnête. Kimi K3 est le modèle à poids ouverts le plus capable de la planète. C’est aussi le moins pratique de cette catégorie pour la plupart des lecteurs.

Les poids MXFP4 totalisent environ 1,4 téraoctet. La configuration expérimentale minimale décrite par Moonshot nécessite huit GPU H100 de 80 Go — 640 gigaoctets de VRAM, soit environ 200 000 dollars de matériel aux prix actuels. La production veut 64 accélérateurs ou plus répartis sur plusieurs nœuds reliés par des interconnexions à large bande passante. Ce n’est pas une station de travail. C’est un petit supercalculateur.

Contrastez cela avec GLM-5.2, l’actuel numéro 1 de cette catégorie. GLM-5.2 est un modèle de 744 milliards de paramètres (environ 40 milliards actifs) qui tient dans à peu près 241 gigaoctets avec une quantification agressive à 2 bits — à portée d’un Mac Studio avec 256 Go de mémoire unifiée ou d’une station de travail bi-GPU. Il porte une licence MIT irréprochable. Il bénéficie de mois de validation communautaire indépendante, y compris une première place au classement de programmation de Design Arena.

K3 gagne sur l’intelligence brute, la capacité multimodale et l’échelle pure. GLM-5.2 gagne sur tout ce qui détermine si une personne normale ou une petite équipe peut réellement l’utiliser. Pour une catégorie intitulée « Local / Private AI », cette différence pratique est décisive — c’est pourquoi K3 entre au rang 2, pas au rang 1.

Ce que K3 fait vraiment bien

En mettant de côté la question du matériel, le profil de capacité est impressionnant. Sur les évaluations internes de Moonshot, K3 atteint FrontierSWE 81.2 % (vraies tâches d’ingénierie logicielle sur de grands dépôts), Terminal-Bench 88.3 (compétence d’agent en ligne de commande) et GPQA Diamond 93.5 (raisonnement scientifique de niveau troisième cycle). Sur un benchmark d’optimisation de noyaux, Moonshot rapporte que K3 a largement surpassé GPT-5.6 Sol, GPT-5.5 et Opus 4.8 — bien que ce soient des chiffres d’entreprise qui attendent une confirmation indépendante.

La capacité multimodale native est la caractéristique qui sépare le plus clairement K3 de GLM-5.2 dans cette catégorie. GLM-5.2 ne gère que le texte et le code. K3 lit images, captures d’écran, graphiques et vidéo. Pour les flux auto-hébergés impliquant des entrées visuelles — analyser un PDF, déboguer une interface à partir d’une capture d’écran, examiner une visualisation de données — K3 le gère nativement sans ajouter un modèle de vision distinct. C’est un véritable avantage architectural pour les équipes qui construisent des pipelines multimodaux derrière leur propre pare-feu.

La réalité du déploiement

Si votre organisation exploite déjà un cluster de GPU — un laboratoire de recherche, une entreprise du cloud, une équipe IA d’entreprise — l’histoire du déploiement est étonnamment mature pour une sortie vieille d’un jour. vLLM a publié un aperçu de support à l’échelle de production le 22 juillet, avec des optimisations de prefix-caching KDA que Moonshot a reversées à la communauté open source. SGLang, Docker, Together AI et HuggingChat offrent tous des chemins immédiats pour servir le modèle. L’outillage n’est pas la barrière ; le matériel, oui.

Pour tous les autres, l’API Moonshot propose le même modèle à 3 dollars par million de tokens d’entrée et 15 dollars par million de tokens de sortie (avec entrée en cache à 0,30 dollar). C’est un prix raisonnable pour du travail de classe frontière, mais cela défait le but d’un classement d’« IA locale » : les données quittent votre machine.

Aspérités connues

Moonshot est admirablement transparent sur les limites de K3 dans sa propre documentation. Le modèle est sensible au mode d’historique de raisonnement — changer de moteur d’inférence en cours de session peut déstabiliser les sorties, ce qui compte pour les équipes qui font tourner plusieurs frameworks de service. Il peut aussi être excessivement proactif, prenant des décisions autonomes que l’utilisateur n’a pas sollicitées. Moonshot recommande des contraintes explicites dans les system prompts ou un fichier AGENTS.md pour garder le modèle dans son rail.

Il existe aussi une lacune notable d’expérience utilisateur comparé à des produits fermés aboutis comme Claude Fable 5 et GPT-5.6 Sol, comme le reconnaît Moonshot lui-même. L’intelligence brute est là ; la fluidité, pas encore.

En conclusion

Kimi K3 est le modèle qui prouve que la frontière des poids ouverts est arrivée. Un cerveau téléchargeable qui rivalise avec les meilleurs modèles fermés, lit images et vidéos, et porte une licence commerciale n’est plus une hypothèse — c’est un fichier sur Hugging Face. La physique de le faire tourner (1,4 téraoctet, huit H100 minimum) signifie que la plupart des lecteurs l’admireront de loin ou l’atteindront via une API plutôt que sur leurs propres serveurs. Mais pour les équipes qui ont l’infrastructure, et pour tous ceux qui suivent la trajectoire de l’IA ouverte, K3 est le nouveau plafond — et le plafond vient de monter de façon spectaculaire.

02

Forces et limites honnêtes

Points Forts

  • Le plus grand cerveau que vous pouvez télécharger : Avec 2,8 billions de paramètres au total (104 milliards actifs par token, 16 experts sur 896 sélectionnés), Kimi K3 est le plus grand modèle à poids ouverts jamais publié. Artificial Analysis le note à environ 80 sur 100 sur son Intelligence Index — le 5e rang parmi 215 modèles classés, à seulement trois points de Claude Fable 5. Aucun autre modèle auto-hébergeable n’approche cette position indépendante.
  • Une vision native, pas seulement du texte : Contrairement à GLM-5.2 et à la plupart des modèles ouverts de programmation, K3 est livré avec un encodeur de vision intégré (MoonViT-V2, 401 millions de paramètres). Il lit captures d’écran, diagrammes, graphiques, documents et même des images vidéo. Pour les flux auto-hébergés impliquant des entrées visuelles — débogage d’interface, analyse de documents, lecture de graphiques — cela supprime le besoin d’enchaîner un modèle de vision distinct.
  • Des scores de programmation qui rivalisent avec les leaders fermés : Les évaluations internes de Moonshot rapportent FrontierSWE 81.2 %, Terminal-Bench 88.3 et DeepSWE 67.5. Sur une tâche d’optimisation de noyaux, K3 a largement surpassé GPT-5.6 Sol, GPT-5.5 et Opus 4.8 selon la comparaison de Moonshot. Ce sont des chiffres officiels, mais le classement d’Artificial Analysis confirme indépendamment que K3 mérite sa place dans la conversation sur la frontière.
  • Une licence qui autorise l’usage commercial : La licence Modified MIT permet aux entreprises d’auto-héberger, de spécialiser, de distiller et d’intégrer K3 dans des produits commerciaux avec attribution. Ce n’est pas un Apache 2.0 ou un MIT standard irréprochable — les données et le pipeline d’entraînement ne sont pas publiés — mais pour les équipes nécessitant une voie commerciale défendable, les conditions, les conditions sont exploitables là où de nombreuses alternatives de pointe n’en offrent aucune.
  • Une infrastructure de déploiement dès le jour 0 : vLLM a publié un aperçu de support à l’échelle de production le 22 juillet, avec des optimisations de prefix-caching KDA reversées à la communauté. SGLang, Docker, Together AI et HuggingChat offrent tous des chemins immédiats. Si votre équipe exploite déjà un cluster de GPU, l’outil pour servir K3 n’est pas à des mois — il est arrivé avec les poids.

Limites Honnêtes

  • C’est un modèle de datacenter, pas local : Les poids MXFP4 totalisent environ 1,4 téraoctet. La configuration expérimentale minimale est de huit GPU H100 de 80 Go (640 Go de VRAM), et Moonshot recommande des supernodes avec 64 accélérateurs ou plus pour la production. À titre de comparaison, GLM-5.2 — le numéro 1 de cette catégorie — tient dans environ 241 Go et tourne sur un Mac Studio haut de gamme. La plupart des lecteurs d’un guide d’IA locale ne peuvent pas héberger K3 sur du matériel qu’ils possèdent déjà.
  • La validation indépendante est encore précoce : Les poids sont sortis le 27 juillet 2026. Artificial Analysis a publié son classement composite, mais la suite complète de benchmarks indépendants — SWE-Bench, LiveBench, Arena Elo sur des tâches variées — est encore en cours. La plupart des scores détaillés de la fiche modèle viennent du fabricant. Considérez-les comme des signaux forts, pas comme des verdicts définitifs, en attendant que les évaluateurs indépendants terminent leurs passes.
  • La licence est modifiée, pas standard : Les conditions Modified MIT autorisent l’usage commercial avec attribution, mais ne constituent pas le MIT ou Apache 2.0 irréprochable et sans restriction qu’apportent GLM-5.2 et Gemma 4. Les données d’entraînement ne sont pas publiées et les termes modifiés exacts méritent une lecture attentive avant de bâtir un produit commercial sur ces poids.
  • Des problèmes de stabilité connus : La documentation de Moonshot elle-même avertit que K3 est sensible au mode d’historique de raisonnement — changer de moteur d’inférence en plein session peut déstabiliser les sorties. Le modèle peut aussi faire preuve d’une proactivité excessive, prenant des décisions autonomes que l’utilisateur n’a pas demandées. Moonshot recommande des contraintes explicites dans les system prompts ou un fichier AGENTS.md. C’est gérable, mais réel, surtout dans des pipelines automatisés.
  • Pour la plupart des acheteurs d’IA locale, GLM-5.2 reste le meilleur choix : K3 est plus performant sur le papier, mais GLM-5.2 tourne sur du matériel qu’un particulier sérieux ou une petite équipe peut réellement acheter, porte une licence MIT irréprochable et bénéficie de mois de validation communautaire indépendante. K3 prend la couronne de la capacité ; GLM-5.2 conserve celle de la praticité. C’est pourquoi K3 entre au rang 2, pas au rang 1.
03

Aperçu des Benchmarks

Artificial Analysis Intelligence Index — ~80 (5e sur 215)

Le signal indépendant le plus fort disponible. K3 se classe au 5e rang mondial et se situe à trois points de Claude Fable 5 — le premier modèle à poids ouverts à atteindre ce voisinage. Score composite ; les ventilations par tâche sont encore en cours de publication.

FrontierSWE — 81.2 % / Terminal-Bench 2.1 — 88.3

Benchmarks internes d'ingénierie logicielle et d'agent terminal. FrontierSWE mesure des tâches réelles sur dépôts ; Terminal-Bench mesure la compétence en ligne de commande. Scores solides, mais en attente de confirmation indépendante après la stabilisation des poids.

GPQA Diamond — 93.5

Questions scientifiques de niveau troisième cycle. Proche du sommet de tout classement public — ouvert ou fermé. Indique que l'intelligence de K3 s'étend bien au-delà de la programmation, vers le raisonnement général.

Architecture — 2.8T MoE / 104B actifs

896 experts dont 16 sélectionnés par token. Kimi Delta Attention plus Attention Residuals offrent environ 2,5× l'efficacité de passage à l'échelle par rapport à K2. Poids MXFP4 natifs et activations MXFP8 avec quantization-aware training intégré dès la phase SFT.

04

Le Verdict

Kimi K3 est le modèle à poids ouverts le plus capable que vous puissiez télécharger — et cette phrase est désormais vraie au lieu d’aspirationnelle. Un cerveau auto-hébergeable qui se classe au 5e rang mondial sur Artificial Analysis, lit images et vidéos, retient un million de tokens de contexte et porte une licence commerciale est une véritable étape majeure. Mais les étapes majeures n’effacent pas la physique. L’empreinte de 1,4 téraoctet et le minimum de huit H100 mettent ce modèle hors de portée de tous, sauf des équipes qui exploitent déjà des clusters de GPU. GLM-5.2 reste numéro 1 dans cette catégorie parce qu’il délivre une intelligence de programmation quasi-frontière sur du matériel qu’une personne peut acheter, sous une licence MIT irréprochable et avec des mois de validation indépendante. K3 prend le rang 2 comme le modèle qui repousse le plafond : la preuve que la frontière des poids ouverts est arrivée, même si la plupart des lecteurs l’atteindront via une API plutôt que sur leurs propres serveurs. Si vous avez l’infrastructure — ou si la capacité brute est la seule variable — K3 est le nouveau roi des poids ouverts. Si vous choisissez un modèle pour réellement faire tourner en local, commencez par GLM-5.2.

05

Foire aux questions