Classé #3 IA locale / privée — Votre cerveau, votre machine, vos règles
Alibaba (Qwen Team)

Qwen3.8-Flash-Next

Un aperçu de l'architecture Qwen4 qui stocke environ 180B paramètres, mais n'en active que 6B par jeton. Il apporte des capacités multimodales proches de la frontière aux machines riches en RAM — si sa licence inhabituelle convient à votre produit.

Mis à jour 29 août 2026 Open WeightsQwen License125B MoE
9.0sur 10
Site officiel
Idéal pour

Un aperçu de l'architecture Qwen4 qui stocke environ 180B paramètres, mais n'en active que 6B par jeton. Il apporte des capacités multimodales proches de la frontière aux machines riches en RAM — si sa licence inhabituelle convient à votre produit.

Pourquoi ça Gagne

Artificial Analysis attribue à la version hébergée 56 en Intelligence et environ 77 jetons par seconde. Le contexte natif atteint 262K, les GGUF agressifs à un bit commencent autour de 72,5 à 75 Go, et la gigantesque table de n-grammes peut rester à l'écart de la précieuse mémoire des accélérateurs.

À surveiller

Le checkpoint ouvert est expérimental ; ce n'est pas le produit hébergé Qwen3.8-Flash. La Qwen Community License exige une licence distincte pour les activités commerciales MaaS et les assistants de travail IA, les petites quantifications peuvent perdre en qualité, et 75 Go dépassent encore largement les capacités d'un GPU grand public ordinaire.

01

Ce que c'est réellement

Les modèles de langage modernes gagnent généralement en capacité en construisant un entrepôt de paramètres plus vaste et en déplaçant davantage de cartons pour chaque réponse. Qwen3.8-Flash-Next tente un agencement plus étrange : un grand entrepôt, une petite équipe active et un gigantesque index de phrases qui peut résider dans une mémoire moins coûteuse.

Le modèle de langage principal compte 125 milliards de paramètres et en active environ six milliards par jeton. Une table d’embeddings de n-grammes de 51 milliards de paramètres conserve des motifs formés à partir de courtes séquences de jetons, tandis qu’un module de prédiction multi-jetons d’environ quatre milliards de paramètres aide à produire efficacement plus d’un jeton futur. En arrondissant l’ensemble, les fichiers représentent environ 180 milliards de paramètres. Les « 6B actifs » désignent le travail accompli à chaque étape, pas la taille de l’entrepôt.

L’attention est elle aussi hybride. La plupart des couches emploient Gated DeltaNet, un système d’attention linéaire conçu pour transporter efficacement l’information. À intervalles réguliers, Qwen Sparse Attention sélectionne de petits blocs pertinents du contexte antérieur au lieu d’examiner chaque jeton de façon égale. Imaginez la lecture d’immenses archives juridiques avec un index qui indique quelques rayonnages probables. L’index évite de marcher inutilement, mais les livres existent toujours.

Le résultat impressionne dans les évaluations indépendantes. Artificial Analysis attribue à la version hébergée 56 dans son Intelligence Index et mesure une génération d’environ 77 jetons par seconde. Qwen annonce de bons chiffres en programmation, bureautique et utilisation d’outils, notamment 62,5 sur SWE-bench Pro et 73,9 sur son CoWorkBench interne. Ces scores décrivent des systèmes soigneusement configurés. Ils ne garantissent pas qu’une version locale lourdement quantifiée se comportera de façon identique.

La taille locale dépend de la marche que vous choisissez. Le BF16 officiel pèse environ 360 Go en unités décimales, et le FP8 officiel près de 186 Go. Les GGUF les plus agressifs d’Unsloth commencent entre 72,5 et 75 Go, en partie parce que la table de n-grammes conserve une précision supérieure à ce que laisse entendre un simple slogan du type « un bit pour tout ». Cela peut tenir sur un Mac à grande mémoire, un serveur ou une station de travail inhabituelle. Cela ne tient pas sur une carte graphique ordinaire de 24 Go, et le cache KV a encore besoin d’espace.

Le contexte natif atteint 262 144 jetons. Static YaRN peut l’étendre vers un million, mais Qwen avertit qu’une mise à l’échelle toujours active peut réduire la qualité des prompts plus courts. Le produit hébergé appelé Qwen3.8-Flash active par défaut un contexte d’un million de jetons et ajoute des outils officiels. Ce produit est un proche parent, pas un synonyme. Il possède ses propres tarifs API, caches, garanties de disponibilité, limites et mises à jour.

La licence est la réserve décisive. La Qwen Community License 1.0 autorise largement l’utilisation et la modification, mais les activités commerciales MaaS et « AI Work Assistant » exigent une licence distincte. La définition inclut explicitement les assistants indépendants de programmation et de productivité bureautique. Les produits dépassant 100 millions d’utilisateurs mensuels ou 20 millions de dollars de chiffre d’affaires mensuel doivent également afficher clairement le nom du modèle. L’utilisation interne peut être exemptée lorsqu’aucun tiers ne reçoit le modèle, ses capacités ou ses sorties. Ce n’est pas Apache 2.0.

Les premiers retours de la communauté correspondent à la promesse de l’architecture comme à sa jeunesse. Les opérateurs apprécient la capacité obtenue par paramètre actif et démontrent une vitesse utile sur des systèmes spécialisés. Ils signalent aussi un raisonnement excessif, une forte consommation du contexte, des erreurs par manque de mémoire, une contamination du cache et des noyaux qui exigent l’environnement d’exécution le plus récent. Artificial Analysis a compté environ 200 millions de jetons de sortie dans l’ensemble de son indice, presque deux fois la médiane de comparaison.

Qwen3.8-Flash-Next ne devient donc pas le nouveau choix local facile par défaut. Cette place reste à Qwen3.8-27B, dont les fichiers à quatre bits tiennent autour de la classe des 18 Go sous Apache 2.0. Flash-Next constitue la marche supérieure : une fascinante expérience pour grande quantité de RAM, capable d’approcher le comportement de la frontière sans son calcul actif. Utilisez-le lorsque votre matériel, votre patience et votre licence conviennent tous les trois — pas simplement parce que six milliards paraît petit.

02

Forces et limites honnêtes

Points Forts

  • Six milliards actifs changent l’équation du calcul : Un MoE de 125B route seulement 10 experts plus un expert partagé par jeton, tandis qu’une table de n-grammes de 51B augmente la mémoire en demandant relativement peu de calcul. La conception vise une grande capacité sans activer un modèle géant à chaque étape.
  • Ses capacités indépendantes sont exceptionnellement élevées : Artificial Analysis donne à Flash-Next un score d’Intelligence de 56, à un point seulement de GLM-5.3-Flash, avec une génération mesurée plus rapide, autour de 77 jetons par seconde.
  • Des fondations multimodales et à long contexte sont incluses : Le checkpoint accepte le texte, les images et la vidéo, propose 262 144 jetons nativement et peut être configuré pour approcher un million avec static YaRN.
  • L’écosystème de déploiement s’est constitué rapidement : Les voies officielles ou documentées comprennent Transformers, vLLM, SGLang, TokenSpeed, llama.cpp, MLX, des paquets Ollama et les GGUF d’Unsloth.

Limites Honnêtes

  • La licence peut bloquer l’usage commercial le plus évident : Une activité commerciale MaaS ou un « AI Work Assistant » indépendant de programmation ou de bureautique nécessite une licence Qwen séparée. Les grands produits sont également soumis à des conditions d’affichage du nom du modèle.
  • Flash-Next n’est pas Flash hébergé : Qwen3.8-Flash est un produit de production géré, doté par défaut d’un contexte de 1M et d’outils intégrés. Son prix, ses limites, sa fiabilité et ses sorties ne peuvent pas être attribués en silence à chaque checkpoint local.
  • La plus petite quantification reste un projet pour grande quantité de RAM : Environ 72,5 à 75 Go couvrent un paquet agressif de type un bit, avant la mémoire d’exécution et de contexte. Le BF16 officiel pèse approximativement 360 Go en unités décimales, et le FP8 environ 186 Go.
  • Le raisonnement prolixe et les jeunes environnements d’exécution réclament une supervision : Artificial Analysis a observé près de 200M de jetons de sortie dans son indice, et les premiers opérateurs signalent des erreurs de mémoire, des problèmes de cache, des incompatibilités de noyau et une qualité sensible à la configuration.
03

Aperçu des Benchmarks

Artificial Analysis Intelligence Index — 56

Les tests indépendants de la version hébergée placent Flash-Next près de la frontière des modèles à poids ouverts. Ils n'établissent pas le même score pour une quantification locale de 75 Go.

Vitesse de sortie — environ 77 jetons/s

La génération est plus rapide que celle de GLM-5.3-Flash dans les tests d'Artificial Analysis, même si la première réponse arrive plus tard, car le raisonnement et le délai avant le premier jeton sont deux choses distinctes.

GDPval-AA v2 — environ 1743 Elo dans l'instantané consulté

Un signal solide sur les tâches professionnelles, avec un intervalle de confiance et une échelle en direct mouvante. Datez-le et ne prenez pas un faible écart pour une victoire décisive.

SWE-bench Pro — 62,5 (test Qwen)

Une réparation de dépôts convaincante dans l'ensemble de tâches affiné par Qwen et avec le banc d'essai Claude Code. Les corrections apportées aux tâches et le banc signifient qu'il faut attribuer ce score, pas le présenter comme un résultat local universel.

OSWorld 2.0 — 19,4 binaire / 52,3 partiel (test Qwen)

Un rappel que de bons scores en programmation et bureautique ne se transforment pas automatiquement en maîtrise complète de l'ordinateur ; le résultat binaire strict reste modeste.

04

Le Verdict

Qwen3.8-Flash-Next entre dans la catégorie IA locale / privée à la 3e place (#3) avec une note de 9,0. Qwen3.8-27B reste le meilleur choix par défaut pour machine personnelle au 1er rang (#1), tandis que GLM-5.3-Flash prend la 2e place (#2) pour des capacités indépendantes légèrement supérieures, un contexte natif de 1M et des droits MIT clairs. Flash-Next constitue le palier intermédiaire intrigant : plus rapide, calcul actif bien moindre et capacité à tourner dès environ 75 Go avec une quantification agressive. Choisissez-le pour des expérimentations internes et des tâches locales sur machines à forte mémoire vive après avoir lu la licence. Ne concevez pas d’assistant de code commercial hébergé autour de lui avant que Qwen ne confirme votre formule de licence, et n’utilisez pas les résultats du service en ligne Qwen3.8-Flash comme preuve pour une quantification locale non testée.

05

Foire aux questions