Classé #4 Programmation — L'IA qui écrit du code de production
Alibaba / Qwen Team

Qwen3.8-Max

Qwen3.8-Max prend le #4 en code comme challenger à forte valeur : 1M de contexte, entrées image et vidéo, premier signal frontend solide et tarifs bien inférieurs aux modèles premium. Le rang est provisoire : les chiffres principaux viennent du fournisseur et les essais indépendants de réparation sont encore rares et contrastés.

Mis à jour 14 août 2026 Agentic CodingVision + Video1M Context
9.7sur 10
Site officiel
Idéal pour

Qwen3.8-Max prend le #4 en code comme challenger à forte valeur : 1M de contexte, entrées image et vidéo, premier signal frontend solide et tarifs bien inférieurs aux modèles premium. Le rang est provisoire : les chiffres principaux viennent du fournisseur et les essais indépendants de réparation sont encore rares et contrastés.

Pourquoi ça Gagne

Alibaba annonce 86,6 à Terminal Bench 2.1 ; Frontend Code Arena place tôt Qwen3.8-Max #4 à 1668 Elo. Le modèle accepte texte, image et vidéo, utilise 2,4T paramètres dont 95B actifs, 1M de contexte et des API compatibles à $2/$6 par million de tokens entrée/sortie.

À surveiller

Un challenger rapide et bon marché n'est pas automatiquement le champion du code. Les scores dépendent du harness, 67,7 à SWE-bench Pro reste derrière les leaders et certains tests de bugs sont faibles. Le CI du projet doit trancher avant tout accès à la production.

01

Ce que c'est réellement

L’intérêt de Qwen3.8-Max n’est pas de gagner chaque ligne. C’est l’ensemble : grand contexte, entrée visuelle, ambition d’agent et prix qui rend les répétitions possibles. Programmer signifie essayer, vérifier puis recommencer ; une facture de tokens plus faible rend ce cycle plus réaliste.

À $2 en entrée et $6 en sortie par million de tokens, l’API coûte bien moins que les anciens $3/$15 de Kimi. C’est utile lorsqu’un agent relit le dépôt ou qu’un second modèle vérifie un correctif. Bon marché ne veut pas dire juste, mais tests, relances et revue indépendante deviennent moins coûteux.

Dans un premier aperçu de Frontend Code Arena, Qwen3.8-Max est #4 à 1668 Elo. Des personnes préfèrent une interface finie sans savoir quel modèle l’a créée. C’est pertinent pour un prototype, mais une page belle peut cacher un code fragile et le rang évoluera avec les votes.

Texte, capture, design, enregistrement et beaucoup de dépôt tiennent dans une session à 1M de contexte : un grand établi, pas une garantie. Alibaba annonce 86,6 à Terminal Bench 2.1, mais harness, outils et relances influencent ces chiffres. 67,7 à SWE-bench Pro et les tests de bugs mixtes demandent de la prudence sur le code ancien.

Le #4 reste provisoire : très fort pour frontend, débogage visuel et long contexte. Les poids ouverts permettent désormais un déploiement privé du modèle textuel ; CI, coût d’infrastructure, licence et revue du diff continuent toutefois de décider.

Pour le frontend, la place dans Arena est plus utile qu’elle n’en a l’air. Un utilisateur ne voit pas si le modèle a eu un raisonnement interne élégant ; il voit si la navigation, les espacements, les états d’erreur et l’étape suivante sont compréhensibles. La préférence aveugle pour une interface finie est donc un bon signal pour un prototype ou un produit. Elle ne remplace ni un contrôle d’accessibilité, ni le responsive, ni la vitesse de chargement, ni la revue du code sous l’écran. Ces quatre éléments doivent apparaître dans la demande comme dans la recette.

Le million de tokens ne doit pas non plus devenir une invitation à jeter tout le dépôt en vrac. Mieux vaut constituer un dossier de travail : but, fichiers pertinents, erreur reproductible, tests et choix d’architecture d’abord ; l’historique complémentaire ensuite si nécessaire. L’agent peut alors formuler et vérifier des hypothèses au lieu de parcourir des milliers de pages en silence. Pour une panne difficile, Qwen peut fournir une première enquête solide. Une personne doit encore choisir le changement assez petit pour être fusionné sans risque.

Pour comparer équitablement l’outil à l’agent existant, garder la même tâche, les mêmes outils, la même limite de temps et les mêmes tests. Mesurer non seulement si un correctif a fini par marcher, mais aussi le nombre d’essais, de tokens et de minutes humaines. L’avantage économique de Qwen n’a de valeur que s’il augmente le nombre d’essais bons et vérifiés, pas s’il augmente simplement la quantité de texte.

02

Forces et limites honnêtes

Points Forts

  • Le prix permet davantage de vrais essais : $2/$6 par million de tokens rend débogage itératif et seconde revue plus accessibles que les anciens $3/$15 de Kimi.
  • Le frontend démarre fort : 1668 Elo (#4) à Frontend Code Arena est un bon signal de préférence UI, pas une preuve complète d’ingénierie.
  • Les tâches visuelles et longues correspondent au modèle : texte, captures, schémas et vidéo avec 1M de contexte servent design-vers-code et débogage.
  • Le résultat terminal annoncé est élevé : 86,6 à Terminal Bench 2.1 suggère un système capable de travailler avec les outils.
  • Le raisonnement est réglable : reasoning_effort offre trois niveaux et preserve_thinking est actif par défaut.
  • L’adoption n’impose pas de réécriture : les API compatibles OpenAI et Anthropic permettent d’essayer le modèle dans l’agent existant.

Limites Honnêtes

  • L’évidence code clé n’est pas indépendante : harness, prompt, relances et outils influencent la table du fournisseur.
  • La réparation de dépôt est le trou clair : 67,7 SWE-bench Pro et des suites de bugs mixtes ne justifient pas une victoire.
  • Beaucoup de contexte peut prolonger un mauvais plan : commits courts, tests et jalons restent nécessaires.
  • Qualité, vitesse et coût forment un triangle : le raisonnement élevé consomme sortie et quota ; mesurer par correctif testé.
  • Accès et latence varient par région : confirmer paiement, quotas et disponibilité là où l’équipe déploie.
  • Les poids ouverts ne règlent ni matériel ni licence : le modèle textuel 2,4T/95B actifs est disponible, mais l’hébergement exige un datacenter et la licence ajoute des conditions pour les très grands produits et services.
03

Aperçu des Benchmarks

Frontend Code Arena — 1668 Elo (#4, précoce)

Signal humain fort pour UI, pas un classement complet d'ingénierie.

Terminal Bench 2.1 — 86,6 (Alibaba)

Score d'agent terminal élevé ; les harnesses limitent la comparaison.

SWE-bench Pro — 67,7 (Alibaba)

Respectable, mais derrière les meilleures réparations.

PaperBench — 93,0 (Alibaba)

Signal de planification, pas test direct de code.

IFBench — 82,8 (Alibaba)

Bon suivi de critères d'acceptation détaillés.

04

Le Verdict

Qwen3.8-Max remplace Kimi K3 au #4 Code : les signaux frontend et terminal précoces s’ajoutent à une économie API bien meilleure. C’est un très bon candidat à placer à côté de l’agent existant pour visuel, contexte long et itération sensible au coût. Il ne monte pas encore : résultats fournisseur, SWE-bench Pro non leader et rapports de bugs mixtes imposent un essai direct avec CI et revue.

05

Foire aux questions