Classé #5 Écosystème du quotidien — Les assistants IA leaders
Moonshot AI

Kimi K3

Kimi K3 est la première version de Kimi qui mérite une place parmi les plateformes IA du quotidien, pas seulement sur un graphique de modèles. Il associe raisonnement proche de la frontière, chat web et mobile, Agent autonome, Docs, Sheets, Slides, Deep Research, Kimi Work et Kimi Code. Le modèle sait déjà faire des choses impressionnantes, même si certains workflows Agent conservent des limites pratiques.

Mis à jour 28 juillet 2026 AgenticKnowledge WorkDocs & Sheets
9.6sur 10
Site officiel
Idéal pour

Kimi K3 est la première version de Kimi qui mérite une place parmi les plateformes IA du quotidien, pas seulement sur un graphique de modèles. Il associe raisonnement proche de la frontière, chat web et mobile, Agent autonome, Docs, Sheets, Slides, Deep Research, Kimi Work et Kimi Code. Le modèle sait déjà faire des choses impressionnantes, même si certains workflows Agent conservent des limites pratiques.

Pourquoi ça Gagne

Artificial Analysis donne à K3 un score global de 57, 1668 Elo sur GDPval-AA v2, 1547 Elo sur AA-Briefcase et 53 % sur AutomationBench-AA. Le produit accepte texte et images, le modèle offre 1M de contexte, et Kimi produit sites, rapports, Word, tableurs, présentations et code. Une offre gratuite existe, puis des abonnements à partir de 19 $ par mois.

À surveiller

Le cerveau IA de Kimi est déjà très capable. Le problème se cache dans certains détails du produit : l'Agent standard peut oublier d'anciennes consignes pendant une longue conversation, ne fournit généralement qu'un fichier par tâche et utilise en pratique moins de contexte que le maximum d'un million de tokens du modèle. Artificial Analysis a aussi mesuré 51 % d'hallucinations, une forte consommation de tokens et une vitesse inférieure à la moyenne. Kimi n'est pas aussi étroitement relié à Workspace, Android, Chrome et Search que Gemini.

01

Ce que c'est réellement

La plupart des assistants IA sont construits autour d’une simple fenêtre de chat : vous posez une question et vous recevez une réponse. Kimi K3 va plus loin en associant le chat à des outils spécialisés pour la recherche, les documents, les tableurs, les présentations, les sites web, le code et l’automatisation. Moonshot n’a pas seulement entraîné un modèle plus grand ; l’entreprise a aussi créé des produits capables de transformer son raisonnement en travail fini.

Les résultats indépendants justifient cette attention. Artificial Analysis donne à K3 57, 1668 Elo sur GDPval-AA v2 et 1547 Elo sur AA-Briefcase. Dans ce test prolongé du travail professionnel, seul Claude Fable 5 le dépasse. K3 obtient aussi 53 % et la première place sur AutomationBench-AA. Autrement dit, il ne sait pas seulement répondre ; il sait pousser une mission en plusieurs étapes vers un livrable.

La gamme de produits est vaste. Agent recherche, crée des sites, produit des documents, analyse des feuilles et prépare des présentations. Kimi Work apporte les workflows d’agents au bureau. Kimi Code sert les développeurs, Agent Swarm répartit les grandes recherches et les tâches par lots entre plusieurs agents, et Claw maintient des automatisations. Ensemble, ils répondent à un besoin concret : les utilisateurs veulent souvent le tableur, la présentation ou le rapport terminé, pas seulement des instructions pour le produire.

Le million de tokens et l’entrée image forment une immense table. Rapports, captures, graphiques et sources peuvent être étudiés ensemble. Davantage de contexte n’est pas une mémoire parfaite ; plus de papiers peut aussi créer plus de confusion. Pour des comparaisons juridiques, collections scientifiques ou analyses financières, cet espace reste précieux.

Kimi est facile à essayer sur le web et sur mobile. L’offre gratuite comprend quelques tâches Agent ; les abonnements commencent à 19 dollars par mois. L’API coûte 3 dollars en entrée et 15 en sortie par million. K3 n’est pas un modèle à prix cassé ; son tarif vise le travail professionnel.

Pourquoi seulement #4 ? Parce que cette catégorie évalue tout l’écosystème, pas seulement le modèle. Gemini peut être plus faible dans certains tests indépendants, mais Google le relie déjà au courrier, aux documents, aux calendriers, aux navigateurs, aux téléphones, à la recherche et aux autorisations d’organisation. Kimi propose beaucoup d’outils, sans être encore aussi profondément intégré aux services utilisés chaque jour. Pour une personne qui choisit un seul assistant, cette commodité constitue un avantage réel.

La fiabilité constitue l’autre frein. Artificial Analysis a observé plus de précision mais aussi 51 % d’hallucinations. C’est un collègue brillant qui répond mieux, mais dit moins volontiers « je ne sais pas ». Avec vérification des sources, formules et affirmations, il est productif ; sans contrôle, il devient risqué.

Le million de tokens doit enfin être vérifié dans le produit concret : le modèle le supporte, mais certains workflows Agent indiquent des limites pratiques inférieures. Les poids ouverts complets sont arrivés le 27 juillet sous une licence Modified MIT — mais à 2,8 billions de paramètres et environ 1,4 téraoctet en MXFP4, ils nécessitent du matériel de classe datacenter. Kimi K3 mérite donc la quatrième place pour la recherche profonde, les grandes collections et les fichiers finis. Gemini s’intègre plus facilement à un workflow Google existant. Kimi est une alternative puissante, mais mieux vaut vérifier les limites de l’outil Agent choisi avant de lui confier une très grande tâche.

02

Forces et limites honnêtes

Points Forts

  • Le travail intellectuel indépendant est déjà proche du sommet : K3 atteint 1668 Elo sur GDPval-AA v2 et 1547 Elo sur AA-Briefcase, où Artificial Analysis le place seulement derrière Fable 5. Ce sont des preuves pour rapports, analyse et travail professionnel en plusieurs étapes.
  • L’écosystème livre des fichiers au lieu de s’arrêter aux conseils : Kimi Agent crée et révise Word, analyse et génère Excel, construit des présentations, produit des PDF, déploie des sites et livre des recherches approfondies. Pour un non-technicien, un fichier téléchargeable vaut souvent mieux qu’une explication supplémentaire.
  • Les workflows agentiques constituent une vraie force : Artificial Analysis annonce 53 % et la première place sur AutomationBench-AA. Agent, Agent Swarm, Work, Code et Claw prolongent cette force vers le web, le bureau, la programmation et l’automatisation persistante.
  • Le grand contexte et l’entrée d’images facilitent les travaux riches en documents : K3 accepte texte et images avec 1M de contexte. Il peut relier contrats, rapports, captures, graphiques et grandes collections sans perdre continuellement les informations importantes.
  • L’échelle d’accès est utile : Kimi fonctionne sur le web, iOS, Android et HarmonyOS. Le forfait gratuit permet quelques tâches Agent ; les abonnements dès 19 $ par mois augmentent les quotas Agent, Swarm, Code et bases professionnelles.
  • L’API reste compétitive pour le travail sérieux : À 3/15 $ par million de tokens entrée/sortie et 0,30 $ en cache, K3 n’est pas bon marché. Artificial Analysis estime néanmoins environ 0,94 $ par tâche de l’Intelligence Index, proche de GPT-5.6 Sol et très inférieur à Fable 5 dans ce test.

Limites Honnêtes

  • Gemini reste mieux intégré aux outils du quotidien : Gemini est intégré à Workspace, Android, Chrome et Search. Kimi a de nombreux outils, mais beaucoup moins de personnes les utilisent déjà chaque jour ; K3 reste donc #4 derrière Gemini.
  • La fiabilité factuelle reste préoccupante : Artificial Analysis a mesuré 51 % d’hallucinations, contre 39 % pour K2.6 malgré une meilleure précision. Sources, formules, clauses et affirmations commerciales exigent une vérification.
  • La limite du modèle et celle du produit ne coïncident pas toujours : K3 supporte 1M de tokens, mais la documentation Agent décrit parfois des limites pratiques inférieures. Vérifiez l’interface réelle avant de promettre qu’un dossier gigantesque tiendra.
  • Le raisonnement maximal n’est pas une conversation instantanée : K3 a été lancé avec l’effort maximal par défaut ; Artificial Analysis l’a trouvé verbeux et plus lent que la moyenne. C’est adapté à un rapport difficile, excessif pour demander l’heure d’une réunion.
  • Les poids ouverts sont disponibles, mais les exécuter est une autre affaire : Moonshot a publié les poids complets de 2,8 billions de paramètres le 27 juillet sous une licence Modified MIT, confirmant que K3 est réellement auto-hébergeable. Mais à environ 1,4 téraoctet en MXFP4, le service en production nécessite des dizaines de GPU de classe H100 sur plusieurs nœuds. Pour la plupart des utilisateurs, l’API hébergée reste le chemin pratique ; les poids comptent surtout pour les entreprises et laboratoires qui exploitent déjà des clusters de GPU.
03

Aperçu des Benchmarks

Artificial Analysis Intelligence Index — 57

Résultat indépendant proche de la frontière, derrière Fable 5 et GPT-5.6 Sol, devant Grok 4.5. Plusieurs niveaux d'effort peuvent modifier le rang affiché.

GDPval-AA v2 — 1668 Elo

Travail professionnel agentique réaliste. K3 suit Fable 5 et GPT-5.6 Sol, mais dépasse Opus 4.8 et Grok 4.5 dans la comparaison citée.

AA-Briefcase — 1547 Elo (#2)

Évaluation privée de travail intellectuel prolongé. K3 suit seulement Fable 5 et excelle particulièrement en qualité analytique.

AutomationBench-AA — 53 % (#1)

Implémentation indépendante de tâches SaaS, confirmant que les agents Kimi dépassent le simple chat.

Coût Intelligence Index — environ 0,94 $ par tâche

Estimation fondée sur les tokens mesurés et les tarifs API. Le coût réel dépend fortement de la longueur du raisonnement et du cache.

04

Le Verdict

Kimi K3 entre au quatrième rang de l’Everyday Ecosystem. Le modèle est largement assez puissant : les tests indépendants le placent près du sommet et Kimi a bâti l’un des ensembles d’agents les plus complets hors des trois plateformes dominantes. Il reste derrière Gemini, car un écosystème dépend aussi de l’endroit où se trouvent déjà votre courrier, vos documents, votre navigateur, votre téléphone et vos collègues. Choisissez Kimi pour la recherche approfondie, de nombreux documents, le travail autonome ou des fichiers Office terminés dans un seul service. Vérifiez les faits importants et notez que, bien que les poids ouverts soient désormais téléchargeables, les exécuter soi-même nécessite du matériel de classe datacenter.

05

Foire aux questions