Kimi K3 illustre ce qui se passe lorsque l’expression « l’exécuter soi-même » prend les dimensions d’un datacenter. Ses poids sont téléchargeables, le modèle peut rester dans le périmètre d’une organisation et son intelligence se situe près de la pointe. Pourtant, le checkpoint officiel compressé pèse environ 1,4 téraoctet. La confidentialité est possible ; la simplicité ne l’est pas.
Artificial Analysis place désormais Kimi K3 autour de 60 sur la version actuelle de son Intelligence Index, à égalité avec le modèle phare GLM-5.3 dans le groupe de tête des modèles à poids ouverts. L’ancien texte du site évoquait un score proche de 80 et une cinquième place sur une échelle antérieure. Cette photographie n’est plus d’actualité. Le nouveau score ne traduit pas une baisse d’intelligence : c’est la règle graduée qui a changé.
Les résultats de Moonshot sur des tâches précises restent impressionnants. L’entreprise annonce 88.3 sur Terminal-Bench 2.1, 67.5 sur DeepSWE et 81.2 sur FrontierSWE. La compréhension native des images et des vidéos, ainsi qu’un contexte d’un million de tokens, font de K3 bien plus qu’un moteur de texte. Un système privé peut examiner des contenus visuels, de vastes dépôts de code et de longs historiques sans les transmettre au fournisseur d’un modèle tiers.
Puis les lois de la physique présentent l’addition. Une architecture en mixture-of-experts active environ 104 milliards de paramètres par token, mais le système doit tout de même stocker et acheminer l’ensemble des 2 800 milliards de paramètres du pool. Les installations expérimentales commencent avec de nombreux accélérateurs dotés d’une grande mémoire ; une production sérieuse peut en exiger des dizaines. Ce n’est pas parce que seuls certains spécialistes traitent chaque dossier que l’hôpital peut démolir les bureaux des autres.
L’échelle de la concurrence a elle aussi changé. GLM-5.3-Flash propose un checkpoint FP8 officiel de 306 Gio, une licence MIT et des capacités indépendantes légèrement inférieures. Avec une quantification agressive, Qwen3.8-Flash-Next descend vers 75 Go et n’active que six milliards de paramètres, même si sa licence est plus restrictive. Qwen3.8-27B tient dans environ 18 Go en quatre bits. Aucun ne réunit tous les atouts de Kimi, mais chacun est bien plus facile à posséder.
Kimi K3 reste donc une étape majeure sans demeurer une recommandation pratique dans le duo de tête. Choisissez-le si votre organisation exploite déjà l’infrastructure requise et si son profil multimodal remporte une évaluation à conditions comparables. Pour tous les autres, la révolution des poids ouverts offre désormais des portes plus petites donnant accès au même édifice.