Les modèles de langage modernes gagnent généralement en capacité en construisant un entrepôt de paramètres plus vaste et en déplaçant davantage de cartons pour chaque réponse. Qwen3.8-Flash-Next tente un agencement plus étrange : un grand entrepôt, une petite équipe active et un gigantesque index de phrases qui peut résider dans une mémoire moins coûteuse.
Le modèle de langage principal compte 125 milliards de paramètres et en active environ six milliards par jeton. Une table d’embeddings de n-grammes de 51 milliards de paramètres conserve des motifs formés à partir de courtes séquences de jetons, tandis qu’un module de prédiction multi-jetons d’environ quatre milliards de paramètres aide à produire efficacement plus d’un jeton futur. En arrondissant l’ensemble, les fichiers représentent environ 180 milliards de paramètres. Les « 6B actifs » désignent le travail accompli à chaque étape, pas la taille de l’entrepôt.
L’attention est elle aussi hybride. La plupart des couches emploient Gated DeltaNet, un système d’attention linéaire conçu pour transporter efficacement l’information. À intervalles réguliers, Qwen Sparse Attention sélectionne de petits blocs pertinents du contexte antérieur au lieu d’examiner chaque jeton de façon égale. Imaginez la lecture d’immenses archives juridiques avec un index qui indique quelques rayonnages probables. L’index évite de marcher inutilement, mais les livres existent toujours.
Le résultat impressionne dans les évaluations indépendantes. Artificial Analysis attribue à la version hébergée 56 dans son Intelligence Index et mesure une génération d’environ 77 jetons par seconde. Qwen annonce de bons chiffres en programmation, bureautique et utilisation d’outils, notamment 62,5 sur SWE-bench Pro et 73,9 sur son CoWorkBench interne. Ces scores décrivent des systèmes soigneusement configurés. Ils ne garantissent pas qu’une version locale lourdement quantifiée se comportera de façon identique.
La taille locale dépend de la marche que vous choisissez. Le BF16 officiel pèse environ 360 Go en unités décimales, et le FP8 officiel près de 186 Go. Les GGUF les plus agressifs d’Unsloth commencent entre 72,5 et 75 Go, en partie parce que la table de n-grammes conserve une précision supérieure à ce que laisse entendre un simple slogan du type « un bit pour tout ». Cela peut tenir sur un Mac à grande mémoire, un serveur ou une station de travail inhabituelle. Cela ne tient pas sur une carte graphique ordinaire de 24 Go, et le cache KV a encore besoin d’espace.
Le contexte natif atteint 262 144 jetons. Static YaRN peut l’étendre vers un million, mais Qwen avertit qu’une mise à l’échelle toujours active peut réduire la qualité des prompts plus courts. Le produit hébergé appelé Qwen3.8-Flash active par défaut un contexte d’un million de jetons et ajoute des outils officiels. Ce produit est un proche parent, pas un synonyme. Il possède ses propres tarifs API, caches, garanties de disponibilité, limites et mises à jour.
La licence est la réserve décisive. La Qwen Community License 1.0 autorise largement l’utilisation et la modification, mais les activités commerciales MaaS et « AI Work Assistant » exigent une licence distincte. La définition inclut explicitement les assistants indépendants de programmation et de productivité bureautique. Les produits dépassant 100 millions d’utilisateurs mensuels ou 20 millions de dollars de chiffre d’affaires mensuel doivent également afficher clairement le nom du modèle. L’utilisation interne peut être exemptée lorsqu’aucun tiers ne reçoit le modèle, ses capacités ou ses sorties. Ce n’est pas Apache 2.0.
Les premiers retours de la communauté correspondent à la promesse de l’architecture comme à sa jeunesse. Les opérateurs apprécient la capacité obtenue par paramètre actif et démontrent une vitesse utile sur des systèmes spécialisés. Ils signalent aussi un raisonnement excessif, une forte consommation du contexte, des erreurs par manque de mémoire, une contamination du cache et des noyaux qui exigent l’environnement d’exécution le plus récent. Artificial Analysis a compté environ 200 millions de jetons de sortie dans l’ensemble de son indice, presque deux fois la médiane de comparaison.
Qwen3.8-Flash-Next ne devient donc pas le nouveau choix local facile par défaut. Cette place reste à Qwen3.8-27B, dont les fichiers à quatre bits tiennent autour de la classe des 18 Go sous Apache 2.0. Flash-Next constitue la marche supérieure : une fascinante expérience pour grande quantité de RAM, capable d’approcher le comportement de la frontière sans son calcul actif. Utilisez-le lorsque votre matériel, votre patience et votre licence conviennent tous les trois — pas simplement parce que six milliards paraît petit.