Classé #5 Écosystème du quotidien — Les assistants IA leaders
Alibaba / Qwen Team

Qwen3.8-Max

Qwen3.8-Max associe un modèle proche de la frontière à la famille Qwen : chat, recherche approfondie, création d'images et de vidéos, applications et API. Le nouveau fleuron MoE d'Alibaba comprend texte, images et vidéo, offre 1M de tokens de contexte et coûte nettement moins que les API de pointe les plus chères. Max est le moteur ; Qwen Studio est l'atelier autour de lui.

Mis à jour 14 août 2026 Multimodal1M ContextDeep Research
9.5sur 10
Site officiel
Idéal pour

Qwen3.8-Max associe un modèle proche de la frontière à la famille Qwen : chat, recherche approfondie, création d'images et de vidéos, applications et API. Le nouveau fleuron MoE d'Alibaba comprend texte, images et vidéo, offre 1M de tokens de contexte et coûte nettement moins que les API de pointe les plus chères. Max est le moteur ; Qwen Studio est l'atelier autour de lui.

Pourquoi ça Gagne

Qwen3.8-Max compte 2,4T paramètres au total, 95B actifs, 1M de contexte, et coûte $2 en entrée / $6 en sortie par million de tokens. Alibaba annonce 93,0 à PaperBench, 82,8 à IFBench et 86,6 à Terminal Bench 2.1. Une première photo de Frontend Code Arena le place #4 à 1668 Elo ; Qwen Studio ajoute recherche, image et vidéo.

À surveiller

La sortie est très récente. Le grand tableau vient d'Alibaba, les premiers tests indépendants de code sont contrastés et quotas ou facturation peuvent encore frotter. L'écosystème Qwen est vaste, mais son intégration aux services quotidiens reste moins naturelle que celle de Google, Microsoft ou OpenAI, surtout hors d'Asie.

01

Ce que c'est réellement

Qwen3.8-Max ressemble à un moteur neuf et puissant installé dans un atelier déjà bien fourni. Le moteur est le modèle phare d’Alibaba : 2,4 billions de paramètres au total, dont 95 milliards actifs par requête. L’atelier est Qwen Studio, avec chat, Deep Research, image, vidéo et artefacts web. Pour une tâche ordinaire, l’atelier compte presque autant que le moteur.

Son attrait immédiat est le prix. $2 en entrée et $6 en sortie par million de tokens, cache à $0,25, laissent de la place pour une analyse longue et une seconde vérification. Le raisonnement long reste facturé en sortie ; tout n’est donc pas bon marché. Mais un essai moins coûteux aide à vérifier une réponse au lieu de croire la première phrase convaincante.

Le modèle regarde texte, images et vidéo avec jusqu’à un million de tokens de contexte. Document de stratégie, tableur, maquette, capture de tableau de bord et vidéo d’un parcours défaillant peuvent rester sur la même table. Ce n’est ni une mémoire parfaite ni un jugement parfait, mais cela évite des passages imprécis entre recherche et travail visuel.

Les résultats sont prometteurs, pas définitifs. Alibaba annonce de très bons scores sur PaperBench, IFBench, OSWorld-Verified et Terminal Bench ; le premier aperçu Frontend Code Arena le place #4 à 1668 Elo. Les démonstrations concrètes d’autonomie sont particulièrement intéressantes : selon Alibaba, le modèle a travaillé 10 à 16 jours sans supervision depuis un dossier vide, construit un harness auto-évolutif et produit 265 commits, 127 pull requests et 151 issues. L’entreprise décrit aussi un défi de dialogue multimodal où la précision est passée de 0,60 à 0,853 en 45 soumissions, ainsi que de longues simulations de conception de puces et de commerce électronique. Ce sont des rapports Alibaba, non une validation indépendante, mais ils donnent une image parlante de l’objectif : une longue chaîne de travail professionnel, pas seulement une bonne réponse.

La prudence est maximale en code : 67,7 à SWE-bench Pro ne place pas le modèle parmi les leaders pour résoudre des problèmes dans de vrais dépôts, et les premiers tests de bugs sont mixtes. Construire une interface séduisante et réparer un ancien projet sont deux compétences différentes. Qwen3.8-Max mérite le #5 comme alternative polyvalente et économique : l’essayer sur une tâche réelle et bornée, contrôler les sources et laisser les résultats indépendants décider s’il devient l’outil par défaut.

Pour le choix quotidien, une autre question est plus utile que « est-ce le modèle le plus intelligent ? » : où le travail se perd-il aujourd’hui ? Une personne qui recopie sans cesse des éléments entre PDF, tableurs, captures et enregistrements d’écran peut gagner avec une même surface multimodale. Celle qui travaille déjà dans Gmail, Google Docs, Outlook ou un environnement d’entreprise aux permissions établies gagnera parfois davantage avec l’assistant déjà présent. Un écosystème n’est pas seulement une liste de fonctions : c’est aussi le nombre de passages de relais qu’il évite.

Les démonstrations d’autonomie doivent être lues comme des études de cas, pas comme une promesse. Deux cent soixante-cinq commits n’établissent pas que chacun est juste, sûr et maintenable. L’intérêt est la forme de travail qu’Alibaba cherche à montrer : découper un but, employer des outils, vérifier les résultats et poursuivre sans perdre le fil. Pour une équipe, le bon essai est un processus petit et réversible—recherche sourcée, prototype ou analyse avec une liste de contrôle—avant de confier une tâche critique.

Depuis le 14 août, les premiers poids Max sont réellement disponibles. Le checkpoint téléchargeable est textuel, utilise 262 144 tokens nativement et peut s’étendre à environ 1,01M ; Max hébergé ajoute vision, outils et 1M par défaut. Les 2,4T paramètres totaux exigent toujours un datacenter, et les seuils commerciaux de la licence doivent être vérifiés avant déploiement.

02

Forces et limites honnêtes

Points Forts

  • Beaucoup de capacité pour le prix API : $2 en entrée et $6 en sortie par million de tokens, cache à $0,25 ; environ la moitié du précédent prix de sortie de Kimi K3.
  • Il examine plus que du texte : texte, image et vidéo avec 1M de tokens permettent de réunir rapport, capture, graphique et enregistrement.
  • La famille Qwen dépasse la fenêtre de chat : Qwen Studio réunit Deep Research, artefacts web, génération d’images et de vidéos, applications web, mobile et bureau.
  • Les démonstrations de travail autonome sont remarquablement concrètes : Alibaba dit que Qwen3.8-Max a travaillé sans supervision pendant 10 à 16 jours depuis un dossier vide, en bâtissant un harness auto-évolutif avec 265 commits, 127 pull requests et 151 issues. L’entreprise rapporte aussi une précision passée de 0,60 à 0,853 en 45 soumissions dans un défi multimodal. Ce sont des démonstrations Alibaba, mais elles montrent l’échelle professionnelle visée.
  • Le premier signal frontend est compétitif : Frontend Code Arena affiche 1668 Elo (#4) dans un aperçu précoce.
  • L’intégration est praticable : Qwen Studio et le cloud proposent des API compatibles OpenAI et Anthropic, sans réécrire tout l’agent.

Limites Honnêtes

  • Les chiffres vedettes restent ceux du fournisseur : harness, réglages et relances modifient le résultat ; ils appellent un essai, pas une conclusion.
  • La résolution de problèmes dans de vrais dépôts n’est pas encore une victoire : 67,7 à SWE-bench Pro reste derrière les meilleurs Claude et les premiers tests de bugs sont inégaux.
  • Large ne veut pas dire intégré partout : Qwen Studio ne vit pas automatiquement dans Gmail, Office, calendrier, navigateur et permissions d’entreprise.
  • 1M de contexte n’est pas une mémoire parfaite : pages inutiles et but flou peuvent encore égarer le modèle ; fractionner le travail.
  • L’accès précoce peut être rugueux : quotas, facturation et débit ont été signalés ; mesurer une tâche bornée avant de généraliser.
  • Ouvert ne signifie ni petit ni sans conditions : Qwen3.8-2.4T-A95B est disponible sur Hugging Face et ModelScope, mais exige un datacenter. Sa licence ajoute affichage du nom et autorisation séparée au-delà de grands seuils commerciaux.
03

Aperçu des Benchmarks

Frontend Code Arena — 1668 Elo (#4, précoce)

Premier signal de préférence humaine pour un frontend fini, susceptible d'évoluer.

PaperBench — 93,0 (Alibaba)

Résultat fournisseur de travail de recherche complexe.

IFBench — 82,8 (Alibaba)

Forte exécution d'instructions selon le fournisseur.

Terminal Bench 2.1 — 86,6 (Alibaba)

Score élevé d'agent terminal ; les harnesses comptent.

SWE-bench Pro — 67,7 (Alibaba)

Réparation respectable, mais non dominante.

04

Le Verdict

Qwen3.8-Max remplace Kimi K3 au #5 d’Everyday Ecosystem : promesse de frontière comparable, coût plus bas et famille plus large pour recherche et création. Il convient à qui alterne documents, visuel, recherche, image, vidéo et code. Le rang reste provisoire : les affirmations les plus larges demandent une confirmation indépendante et l’intégration quotidienne ne rejoint pas encore les leaders. Vérifier faits, code et résultats importants.

05

Foire aux questions