Imaginez que vous choisissez un atelier, pas un simple marteau. Un modèle local doit passer la porte, laisser de la place sur l’établi, comprendre le matériau et utiliser les outils sans expédier les données privées ailleurs. Qwen3.8-27B est convaincant parce que ces contraintes se rejoignent dans un checkpoint. Ce modèle dense vision-langage de 27 milliards de paramètres repose sur la fondation hybride de Qwen3.5 : trois couches Gated DeltaNet puis une couche d’attention complète se répètent. L’attention linéaire améliore l’efficacité ; l’attention complète périodique relie encore les détails éloignés.
« Multimodal » n’est pas ici un bouton image décoratif. Qwen entraîne et distribue le modèle pour texte, image et vidéo. Un agent de code local peut examiner une capture, lire une boîte d’erreur, la comparer aux sources et utiliser ses outils sans envoyer d’abord l’image à un service cloud distinct. La fiche décrit également documents, graphiques, navigateurs, mobiles et vidéos d’une heure. Qwen3.8 ressemble ainsi davantage à un établi privé polyvalent qu’à un moteur d’autocomplétion.
Les chiffres de lancement expliquent l’enthousiasme : 61,7 à SWE-bench Pro, 73,0 à Terminal Bench 2.1, 42,2 à DeepSWE 1.1 et 90,3 à LiveCodeBench v6. Côté agents multimodaux, Qwen annonce 84,3 à OSWorld-Verified, 64,8 à WebArena-Verified et 70,7 à CoWorkBench. Face à Qwen3.6-27B, le gain apparaît dans la réparation de dépôts, le terminal, le bureau et l’utilisation d’ordinateur, plutôt que dans un examen isolé. Cette largeur est plus intéressante qu’un record solitaire.
Mais un benchmark est un appareil de laboratoire, pas une loi naturelle. SWE-bench Pro et DeepSWE emploient chez Qwen Claude Code, un long contexte et des réglages déclarés. Des tâches problématiques de SWE-bench Pro ont été corrigées et les baselines réévaluées. CoWorkBench et QwenSWEBench sont internes. MathVision utilise un prompt fixe et des annotations corrigées ; certains tests visuels reposent sur un grader ou un scaffold particulier. Cela ne rend pas les scores inutiles. Cela précise la mesure : Qwen3.8 dans un système choisi avec soin. Ollama, LM Studio, llama.cpp ou votre agent peuvent produire autre chose.
Le récit matériel demande la même honnêteté. Les shards BF16 officiels totalisent environ 55,6 Go avant l’overhead. Le Q4_K_M d’Unsloth pèse 17,1 Go et son projecteur visuel 0,93 Go. Environ 18 Go tiennent donc sur un GPU 24 Go, mais les six gigaoctets restants doivent accueillir tampons et cache KV mémorisant les tokens. Plus le contexte grandit, plus ce cache consomme. Une carte 24 Go est un départ crédible pour travailler, pas la promesse de 262 144 tokens à pleine vitesse.
Qwen fournit des commandes inhabituellement complètes. La fenêtre native atteint 262 144 tokens et la fiche documente YaRN vers un million dans vLLM, SGLang et TokenSpeed. Le raisonnement est actif par défaut, propose low, medium et xhigh et peut conserver son contexte entre les tours. Une tête de prédiction multi-token peut accélérer le décodage dans les moteurs compatibles. Ces commandes restent des réglages : YaRN statique peut dégrader les textes courts, et un effort réduit peut provoquer des échecs puis des reprises qui annulent le gain.
Le bon premier essai doit être volontairement banal. Chargez le quant qui reste en mémoire, choisissez une fenêtre avec marge, puis confiez une tâche réelle à résultat visible : réparer un test, extraire des nombres d’un rapport privé ou reconstruire une interface depuis une capture. Notez réussite, reprises, vitesse et correction humaine. Relancez ensuite Qwen3.6 ou votre modèle actuel dans les mêmes conditions. Vous mesurez alors votre atelier, pas le laboratoire d’un autre.
Pour l’instant, Qwen3.8-27B est le meilleur choix par défaut au croisement de la confidentialité, des capacités, du multimodal et du matériel accessible. De plus grands modèles ouverts seront plus intelligents sur certains problèmes ; de plus petits seront plus rapides. Qwen occupe le milieu utile : assez fort pour le travail sérieux, assez petit pour vivre sous un bureau et assez ouvert pour que ce bureau reste entièrement le vôtre.