Classé #4 Programmation — L'IA qui écrit du code de production
Moonshot AI

Kimi K3

Kimi K3 prend provisoirement la troisième place en programmation, car trois indices racontent la même histoire : une première place préliminaire dans les tests frontend à l'aveugle d'Arena, de solides résultats indépendants et des scores Moonshot remarquables sur les longues tâches d'ingénierie. L'entrée d'images et le million de tokens deviennent particulièrement utiles quand une mission dure assez longtemps pour qu'un chatbot ordinaire oublie un élément important.

Mis à jour 18 juillet 2026 Agentic CodingFrontend LeaderLong-Horizon
9.8sur 10
Site officiel
Idéal pour

Kimi K3 prend provisoirement la troisième place en programmation, car trois indices racontent la même histoire : une première place préliminaire dans les tests frontend à l'aveugle d'Arena, de solides résultats indépendants et des scores Moonshot remarquables sur les longues tâches d'ingénierie. L'entrée d'images et le million de tokens deviennent particulièrement utiles quand une mission dure assez longtemps pour qu'un chatbot ordinaire oublie un élément important.

Pourquoi ça Gagne

Arena place Kimi K3 premier sur WebDev avec 1679 Elo, devant Claude Fable 5, GPT-5.6 Sol et Grok 4.5, mais le résultat reste préliminaire. Artificial Analysis lui attribue 57 au total et 1668 Elo sur GDPval-AA v2. Moonshot annonce 42 % sur SWE Marathon et 88,3 % sur Terminal-Bench 2.1. Images natives, contexte 1M, Kimi Code et API rendent ces capacités utilisables.

À surveiller

Les premiers résultats donnent envie d'y croire, mais les comparaisons ne sont pas tout à fait équitables. Kimi K3 n'a pas encore de résultat complet et indépendant au Coding Agent Index d'Artificial Analysis, et Moonshot teste les modèles avec des outils différents : KimiCode, Claude Code, Codex et Terminus. La première place Arena est préliminaire, les poids promis ne sont pas encore publics, et Artificial Analysis a mesuré 51 % d'hallucinations ainsi qu'une consommation élevée de tokens.

01

Ce que c'est réellement

Aucun benchmark de code ne montre à lui seul tout ce qu’un modèle sait faire. Un test court peut mesurer une bonne réponse, tandis que le vrai développement exige aussi de lire un dépôt, d’utiliser des outils, de corriger ses erreurs et de conserver l’objectif pendant de nombreuses étapes. Kimi K3 est intéressant parce que ses meilleurs résultats couvrent plusieurs de ces conditions difficiles : frontend visuel, terminal, grands dépôts et longues sessions d’ingénierie.

Le résultat le plus spectaculaire vient du classement WebDev à l’aveugle d’Arena. K3 arrive à 1679 Elo, devant Claude Fable 5 à 1631, GPT-5.6 Sol à 1618 et Grok 4.5 à 1558. Les humains comparent les applications sans connaître leur auteur. C’est très pertinent quand une interface doit être agréable et pas seulement compiler. Mais un avertissement demeure : Arena parle d’un résultat préliminaire, susceptible de bouger avec les votes.

Les résultats de longue durée expliquent pourquoi cette victoire peut être réelle. Sur SWE Marathon, K3 atteint 42 % contre 35 % cités pour Fable 5, tous deux avec Claude Code. Une longue mission d’ingénierie n’est pas une réponse brillante : c’est lire le dépôt, former une hypothèse, modifier, tester, découvrir l’erreur et recommencer sans perdre le but initial.

Les preuves indépendantes sont également solides. Artificial Analysis attribue à K3 57 et 1668 Elo sur GDPval-AA v2. Le modèle reste derrière Fable 5 et GPT-5.6 Sol, mais passe devant Grok 4.5. C’est la raison centrale de son arrivée au troisième rang. Grok reste le coureur économique ; K3 paraît avoir le plafond supérieur.

L’architecture devient utile une fois traduite en langage courant. Un million de tokens, l’entrée image native et une conception clairsemée de 2,8 billions de paramètres permettent de regarder captures et références tout en gardant énormément de code et de documentation sur la même table. Ce n’est pas une invitation à remplir chaque prompt de déchets, mais de l’espace supplémentaire quand le projet possède réellement beaucoup de pièces utiles.

Kimi Code transforme cette capacité en produit terminal, et l’API compatible OpenAI facilite l’essai. À 3/15 dollars par million de tokens, K3 se situe entre agents économiques et modèles premium. Le cache à 0,30 dollar aide si le contexte du dépôt est réutilisé. Mesurez toutefois le coût d’un correctif testé, pas celui de la première réponse.

La note inconfortable : Moonshot compare des systèmes aux harnesses différents. K3 emploie parfois KimiCode, GPT Codex et Claude Claude Code ou Terminus. Cette enveloppe décide des outils, reprises et de la mémoire. Dire 88,3 % sur Terminal-Bench 2.1 est juste ; en déduire une victoire pure du modèle ne l’est pas.

Fable mène aussi FrontierSWE et possède des preuves SWE-Bench Pro plus fortes. K3 n’a pas encore de Coding Agent Index indépendant complet. Le verdict reste donc précis : Kimi K3 est provisoirement #3. Utilisez-le pour le visuel, le frontend, les grands contextes et les longues sessions. Fable et GPT-5.6 restent devant jusqu’à ce que la profondeur des preuves rejoigne celle de la promesse.

02

Forces et limites honnêtes

Points Forts

  • Le résultat frontend est difficile à écarter : Le classement WebDev à l’aveugle d’Arena place Kimi K3 à 1679 Elo, devant Fable 5 à 1631, GPT-5.6 Sol à 1618 et Grok 4.5 à 1558. Il mesure la préférence humaine pour des interfaces construites, pas un QCM—même si Arena le qualifie encore de préliminaire.
  • L’ingénierie de longue durée est sa spécialité la plus nette : Moonshot annonce 42 % sur SWE Marathon, devant les 35 % cités pour Fable 5, les deux modèles utilisant Claude Code. Cette tranche contrôlée montre que K3 sait naviguer, modifier, tester et persister au fil d’une tâche prolongée.
  • Les mesures générales indépendantes soutiennent l’histoire du code : Artificial Analysis donne à K3 57 à l’Intelligence Index et 1668 Elo sur GDPval-AA v2. Ce ne sont pas des trophées purement logiciels, mais ils confirment que planification, outils et résolution professionnelle ne viennent pas seulement des tests de Moonshot.
  • La vision et un million de tokens appartiennent à la même boîte à outils : K3 combine captures d’écran, schémas, références de design et contexte de dépôt. Cela sert particulièrement la conversion visuel-vers-code, le débogage visuel, l’itération UI et l’exploration d’un grand codebase.
  • Kimi Code fournit des outils de développement concrets : Le modèle est accessible dans le terminal Kimi Code et via l’API compatible OpenAI. Kimi Code permet à K3 d’inspecter des fichiers, d’utiliser le terminal, de modifier un projet et de poursuivre jusqu’à un résultat testé.
  • Moins cher que les chefs premium sans être bon marché : L’API coûte 3 $ en entrée / 15 $ en sortie par million de tokens, et 0,30 $ pour le cache. C’est plus que Grok 4.5, mais nettement moins que Fable 5 pour un terrain similaire, visuel et à long contexte.

Limites Honnêtes

  • Le test indépendant de code le plus important manque encore : Artificial Analysis a mesuré K3 globalement et sur des tâches agentiques, mais n’a pas publié son Coding Agent Index complet. Grok 4.5 conserve donc les preuves les plus propres sur le coût indépendant par tâche de code.
  • Des outils d’agent différents compliquent la comparaison directe des scores : K3 emploie souvent KimiCode tandis que les rivaux utilisent Codex, Claude Code ou Terminus. Ces outils modifient prompts, reprises, commandes disponibles et gestion du contexte ; 88,3 % prouve un système Kimi puissant, pas la supériorité isolée du modèle.
  • Fable gagne encore des disciplines importantes : Le propre tableau de Moonshot place Fable 5 devant sur FrontierSWE, et SWE-Bench Pro favorise aussi Fable. K3 est un concurrent équilibré en frontend et en endurance, pas le champion universel de réparation de dépôts.
  • Les poids ouverts sont disponibles — mais les exécuter est une autre affaire : Moonshot a publié les poids complets de 2,8 billions de paramètres le 27 juillet sous une licence Modified MIT. Cependant, à environ 1,4 téraoctet en MXFP4, le service en production nécessite des dizaines de GPU de classe H100. K3 est réellement auto-hébergeable, mais pour la plupart des développeurs, l’API hébergée reste le chemin pratique.
  • Fiabilité et appétit en tokens restent à surveiller : Artificial Analysis a mesuré 51 % d’hallucinations et environ 130 millions de tokens de sortie. Le code exige toujours tests, audit de sécurité et budget par tâche terminée.
03

Aperçu des Benchmarks

Arena WebDev — 1679 Elo (#1, préliminaire)

Préférence humaine à l'aveugle sur les tâches frontend et web. K3 devance Fable 5, GPT-5.6 Sol et Grok 4.5, mais Arena marque explicitement le résultat comme préliminaire.

Artificial Analysis Intelligence Index — 57

Composite indépendant derrière Fable 5 et GPT-5.6 Sol, mais devant Grok 4.5. Il soutient une capacité frontier sans inventer une victoire dédiée de coding agent.

GDPval-AA v2 — 1668 Elo

Signal indépendant de travail professionnel au-dessus d'Opus 4.8 et Grok 4.5, encore derrière Fable 5 et GPT-5.6 Sol.

SWE Marathon — 42 %

Comparaison Moonshot la plus directe : K3 et Fable 5 utilisent Claude Code, et K3 dépasse les 35 % cités pour Fable.

Terminal-Bench 2.1 — 88,3 %

Excellent résultat fournisseur pour les agents de terminal, juste derrière les 88,8 % cités pour GPT-5.6 Sol. Prudence entre modèles, car les harnesses diffèrent.

04

Le Verdict

Kimi K3 mérite aujourd’hui la troisième place provisoire, entre Fable 5 et Grok 4.5. Les preuves dépassent l’enthousiasme du lancement : intelligence frontier indépendante, avance frontend préliminaire mais substantielle, victoire contrôlée sur Fable à SWE Marathon et véritable environnement de développement. Il ne monte pas davantage, car Fable et GPT-5.6 disposent de preuves agentiques plus larges et plus mûres, tandis que les harnesses mélangés et l’absence du Coding Agent Index entretiennent l’incertitude. Choisissez K3 pour le travail long, visuel, frontend ou les dépôts immenses ; Grok pour le coût ; Fable et Sol pour les domaines difficiles aux preuves les plus profondes.

05

Foire aux questions