Classé #8 Programmation — L'IA qui écrit du code de production
Alibaba / Qwen Team

Qwen3.8-Max

Un challenger de grande valeur, doué pour le contexte long et l'analyse visuelle en programmation, qui se classe désormais #6 après que des tests indépendants ont placé le modèle phare GLM-5.3 devant lui. Son point de contrôle de niveau Max téléchargeable reste remarquable, mais ses 2,4 billions de paramètres font de son auto-hébergement un projet digne d'un centre de données.

Mis à jour 30 août 2026 Agentic CodingVision + Video1M Context

Mise à jour du classement Le classement « Programmation » a été revu depuis la dernière mise à jour de cette critique (30 août 2026). Le rang affiché ci-dessus est toujours à jour. N° 1 actuel : GPT-6 Astra

9.2sur 10
Site officiel
Idéal pour

Un challenger de grande valeur, doué pour le contexte long et l'analyse visuelle en programmation, qui se classe désormais #6 après que des tests indépendants ont placé le modèle phare GLM-5.3 devant lui. Son point de contrôle de niveau Max téléchargeable reste remarquable, mais ses 2,4 billions de paramètres font de son auto-hébergement un projet digne d'un centre de données.

Pourquoi ça Gagne

Artificial Analysis enregistre 71,8 en Programmation et 58,4 en travail Agéntique ; Alibaba rapporte 86,6 sur Terminal Bench 2.1 et 93,0 sur PaperBench. Le modèle Max hébergé ajoute la vision, des outils, un contexte par défaut d'un million de tokens et un accès API à 2 $/6 $, tandis que les poids ouverts permettent un déploiement privé limité au texte.

À surveiller

GLM-5.3 devance désormais Qwen sur les indices indépendants d'Intelligence, de Programmation et Agéntique, ainsi que dans les comparaisons directes de Z.ai sur Terminal-Bench et DeepSWE. Les scores détaillés les plus solides de Qwen proviennent toujours de l'éditeur, et les tests de correction de bugs en conditions réelles sont mitigés.

01

Ce que c'est réellement

La partie intéressante de Qwen3.8-Max n’est pas qu’il affiche le plus grand chiffre dans chaque colonne. Ce n’est pas le cas. La partie intéressante est la combinaison : un modèle doté d’une très grande fenêtre de contexte, d’une entrée visuelle, de sérieuses ambitions en matière d’agents, et d’un prix qui rend les tentatives répétées abordables. La programmation est principalement un processus d’essais, de vérifications et de nouveaux essais ; une facture de tokens moins élevée rend ce processus moins théorique.

Alibaba propose le modèle à 2 $ par million de tokens en entrée et 6 $ par million de tokens en sortie. À titre de comparaison, le tarif précédent de Kimi K3 dans ce guide était de 3 $/15 $. Cette économie est particulièrement utile lorsqu’un agent de programmation doit relire le contexte du dépôt ou lorsque vous souhaitez qu’un deuxième modèle examine un correctif. Bon marché ne veut pas dire de bonne qualité, mais cela peut rendre les bonnes habitudes d’ingénierie — tests, nouvelles tentatives et révisions indépendantes — moins coûteuses à mettre en pratique.

Les premières preuves en matière de frontend méritent attention. Dans un premier aperçu de la Frontend Code Arena, Qwen3.8-Max est #4 avec 1668 Elo. Ces classements reposent sur le fait que des personnes préfèrent une interface terminée à une autre sans savoir quel modèle l’a créée. Cela rapproche le test de la véritable question derrière un prototype de produit : la page semble-t-elle cohérente et fonctionne-t-elle comme l’utilisateur s’y attend ? Le score peut évoluer, et une belle interface peut toujours cacher un code fragile, mais c’est un signal de départ significatif.

Les entrées du modèle Max hébergé sont bien adaptées au développement visuel : une capture d’écran, une référence de conception, un enregistrement de navigateur, un résumé et le texte du dépôt peuvent partager une seule conversation. Le point de contrôle ouvert diffère : il est uniquement textuel avec un contexte natif de 262K, extensible à environ 1,01M. Les équipes doivent choisir la forme hébergée ou ouverte en fonction de la modalité réelle et de l’infrastructure dont elles ont besoin.

La publication ouverte modifie le déploiement plutôt que de changer comme par magie la certitude des benchmarks. Les équipes peuvent conserver le code dans leur propre environnement et servir le modèle via les piles logicielles prises en charge. Cependant, 2,4 billions de paramètres restent à l’échelle d’un centre de données, et la licence personnalisée ajoute des conditions d’affichage du nom et de licence distincte pour des seuils de revenus ou d’utilisateurs élevés. Les poids ouverts déplacent simplement le verrou de la porte du fournisseur vers votre propre salle des serveurs ; ils ne réduisent pas la taille de la salle des serveurs.

Alibaba rapporte 86,6 sur Terminal Bench 2.1, un résultat solide pour un agent travaillant sur des tâches en ligne de commande. Z.ai rapporte 88,2 pour GLM-5.3 dans le même tableau de lancement et 66,9 contre 56,6 pour Qwen sur DeepSWE. Artificial Analysis place indépendamment GLM devant avec 74,8 contre 71,8 en Programmation et 59,1 contre 58,4 en travail Agéntique. GLM est également troisième à 41,8 % dans le tout dernier classement public Terminal-Bench 4.0, où Qwen n’a pas d’entrée. Les différents environnements de test restent importants, mais les preuves convergent désormais suffisamment pour modifier l’ordre.

La mise en garde la plus évidente concerne la réparation de dépôts. Le 67,7 sur SWE-bench Pro d’Alibaba est respectable mais reste en deçà des meilleurs résultats, et les premiers rapports indépendants sur la correction de bugs sont inégaux. C’est une différence familière dans le développement de l’IA : créer une nouvelle interface convaincante et réparer une base de code ancienne et étrange partagent des outils, mais pas nécessairement le même type de rigueur. Utilisez Qwen pour les deux s’il fait ses preuves lors de vos tests ; ne déduisez pas la deuxième victoire de la première.

Pour l’instant, Qwen3.8-Max est #6 avec un 9,2. Il reste convaincant pour le travail frontend grâce à Max hébergé et multimodal, ainsi que pour le codage privé à contexte long via le point de contrôle textuel ouvert, mais le modèle phare GLM-5.3 se place désormais au-dessus de lui sur la liste de programmation. Gardez les accès restreints et mesurez le résultat complet : réussite des tests, révision des différences (diff), comportement utile, coût de l’infrastructure et adéquation de la licence.

02

Forces et limites honnêtes

Points Forts

  • Le prix change ce qu’il vaut la peine d’essayer : À 2 $ en entrée / 6 $ en sortie par million de tokens, Qwen3.8-Max coûte beaucoup moins cher que les agents de programmation les plus onéreux et moins que l’ancien tarif de 3 $/15 $ de Kimi K3. Cela rend le débogage itératif, les contextes longs et les révisions indépendantes financièrement réalistes.
  • Il démarre avec un résultat encourageant en frontend : Frontend Code Arena classe Qwen3.8-Max à 1668 Elo (#4) dans un premier aperçu, ce qui inclut de solides classements pour des produits grand public. Une préférence aveugle pour l’interface générée est un signal utile pour le travail sur l’interface utilisateur (UI), même si cela ne prouve pas une compétence d’ingénierie à l’échelle d’un dépôt entier.
  • Les tâches longues et visuelles correspondent à sa conception d’entrée : Le modèle peut traiter du texte, des captures d’écran, des diagrammes et des vidéos avec une fenêtre de contexte d’un million de tokens. C’est extrêmement utile pour transformer un design en code, diagnostiquer une erreur d’interface enregistrée ou conserver un grand dépôt et ses exigences de produit dans une seule session de travail.
  • Le résultat de l’agent terminal du fournisseur est solide : Alibaba rapporte 86,6 sur Terminal Bench 2.1, très près du sommet de sa comparaison. C’est la preuve que le système Qwen peut naviguer dans des tâches en ligne de commande, écrire des fichiers et réagir aux retours des outils.
  • Il offre des contrôles délibérés sur le raisonnement : reasoning_effort prend en charge les paramètres haut, moyen et bas, tandis que preserve_thinking est activé par défaut. Les développeurs peuvent passer plus de temps sur une conception difficile ou réduire la latence pour une petite modification bien définie.
  • Les équipes peuvent héberger elles-mêmes le niveau Max : Le point de contrôle ouvert est sur Hugging Face et ModelScope, et sa fiche technique mentionne la compatibilité avec vLLM, SGLang et TokenSpeed. Cela permet des évaluations privées et des ajustements fins, à condition que l’équipe dispose d’un matériel à l’échelle d’un centre de données.

Limites Honnêtes

  • Les preuves indépendantes fixent désormais un plafond plus bas : Artificial Analysis attribue à Qwen3.8-Max 71,8 en Programmation et 58,4 en travail Agéntique, derrière GLM-5.3 avec 74,8 et 59,1. Les lignes détaillées d’Alibaba sur Terminal Bench et PaperBench restent utiles mais dépendent de la configuration.
  • La réparation de dépôts reste la lacune la plus évidente : Alibaba rapporte 67,7 sur SWE-bench Pro, derrière les meilleurs résultats de la pointe technologique. Les premiers rapports indépendants sur des suites de bugs sont également mitigés ; une bonne démonstration en frontend ne doit donc pas être confondue avec une maintenance fiable d’une grande base de code en production.
  • Un contexte immense peut prolonger la durée de vie d’un mauvais plan : Un million de tokens permet au modèle de voir énormément de choses, mais il peut toujours mal interpréter une hypothèse architecturale ou négliger un fait au milieu du texte. Privilégiez de petits commits, des tests et des points de contrôle au lieu de confier une tâche sans limite à une seule longue session.
  • La qualité du raisonnement, la vitesse et le coût forment un compromis tripartite : Un effort élevé peut aider sur un problème complexe, mais les tokens de réflexion sont facturés comme des sorties et les premiers utilisateurs signalent une consommation élevée de quotas ou de tokens. Utilisez un effort moyen ou faible pour les modifications de routine et mesurez le coût par changement fusionné et testé.
  • L’accès aux services et les intégrations peuvent varier selon l’emplacement : Les API sont accessibles, mais la disponibilité, le paiement, les quotas et la latence peuvent différer selon les régions. Confirmez que le modèle est disponible de manière fiable là où votre équipe et vos déploiements opèrent avant d’en faire un standard.
  • La licence et le matériel fixent toujours des limites : Servir 2,4 billions de paramètres est un projet de centre de données, et la licence personnalisée exige l’affichage du nom du modèle pour les très grands produits, ainsi qu’une autorisation distincte pour les grands services de modèles ou les entreprises d’assistance au codage/bureau dépassant son seuil de revenus.
03

Aperçu des Benchmarks

Frontend Code Arena — 1668 Elo (#4, tôt)

Un premier résultat de préférence humaine pour un travail terminé en frontend. C'est une preuve solide pour la création d'UI, pas un classement complet en ingénierie logicielle.

Terminal Bench 2.1 — 86,6 (rapporté par Alibaba)

Un résultat élevé d'agent de terminal rapporté par le fournisseur, derrière le score de 88,8 cité pour GPT-5.6 Sol. Les différents environnements d'agents rendent les comparaisons directes de modèles imparfaites.

SWE-bench Pro — 67,7 (rapporté par Alibaba)

Un score respectable en réparation de dépôts qui reste néanmoins à la traîne des meilleurs résultats de la famille Claude dans le tableau du fournisseur.

PaperBench — 93,0 (rapporté par Alibaba)

Un signal puissant pour le travail de recherche, un contexte utile pour la planification et le raisonnement étendu, mais pas un benchmark direct pour la programmation.

Artificial Analysis Programmation / Agéntique — 71,8 / 58,4

Les preuves composites indépendantes sont derrière GLM-5.3 (74,8 / 59,1) et justifient de placer le modèle phare GLM au-dessus de Qwen. Qwen reste légèrement devant GLM-5.3-Flash sur ces indices bruts.

04

Le Verdict

Qwen3.8-Max descend à la place #6 en Programmation avec un 9,2 ajusté par formule. Il reste un excellent challenger visuel, à contexte long et soucieux des coûts, mais les dernières preuves indépendantes ne permettent plus de le placer au-dessus du modèle phare GLM-5.3. Grok 4.6 est #4, GLM-5.3 est #5, Qwen est #6 et GLM-5.3-Flash est #7. Utilisez Qwen là où son produit multimodal hébergé et son prix sont adaptés au travail, puis laissez l’intégration continue (CI) et la révision de code décider s’il surpasse réellement ces modèles sur votre dépôt.

05

Foire aux questions