Classé #1 IA locale / privée — Votre cerveau, votre machine, vos règles
Alibaba (Qwen Team)

Qwen3.8 — 27B

Qwen3.8-27B est l'un des rares modèles locaux dont les compromis correspondent au matériel réellement possédé : un checkpoint dense de 27B pour texte, image, vidéo, code et agents à outils. Une version 4 bits tient sur un GPU de classe 24 Go, tandis qu'Apache 2.0 permet un travail privé et un usage commercial.

Mis à jour 15 août 2026 Open WeightsApache 2.027B Dense
9.2sur 10
Site officiel
Idéal pour

Qwen3.8-27B est l'un des rares modèles locaux dont les compromis correspondent au matériel réellement possédé : un checkpoint dense de 27B pour texte, image, vidéo, code et agents à outils. Une version 4 bits tient sur un GPU de classe 24 Go, tandis qu'Apache 2.0 permet un travail privé et un usage commercial.

Pourquoi ça Gagne

Qwen annonce 61,7 à SWE-bench Pro, 73,0 à Terminal Bench 2.1, 42,2 à DeepSWE 1.1, 84,3 à OSWorld-Verified et 70,7 à CoWorkBench. Le modèle offre 262 144 tokens natifs, YaRN optionnel vers 1M, effort de raisonnement réglable, conservation du raisonnement entre tours et compréhension native des images et vidéos.

À surveiller

Ce sont des preuves du jour de lancement, pas une vérité établie. Les scores principaux viennent surtout de la table de Qwen ; certains emploient le harness Claude Code, des tâches corrigées, des prompts particuliers ou des suites internes. Le paquet Q4_K_M courant approche 18 Go avec son projecteur visuel, mais overhead et cache KV limitent encore le contexte sur une carte 24 Go.

01

Ce que c'est réellement

Imaginez que vous choisissez un atelier, pas un simple marteau. Un modèle local doit passer la porte, laisser de la place sur l’établi, comprendre le matériau et utiliser les outils sans expédier les données privées ailleurs. Qwen3.8-27B est convaincant parce que ces contraintes se rejoignent dans un checkpoint. Ce modèle dense vision-langage de 27 milliards de paramètres repose sur la fondation hybride de Qwen3.5 : trois couches Gated DeltaNet puis une couche d’attention complète se répètent. L’attention linéaire améliore l’efficacité ; l’attention complète périodique relie encore les détails éloignés.

« Multimodal » n’est pas ici un bouton image décoratif. Qwen entraîne et distribue le modèle pour texte, image et vidéo. Un agent de code local peut examiner une capture, lire une boîte d’erreur, la comparer aux sources et utiliser ses outils sans envoyer d’abord l’image à un service cloud distinct. La fiche décrit également documents, graphiques, navigateurs, mobiles et vidéos d’une heure. Qwen3.8 ressemble ainsi davantage à un établi privé polyvalent qu’à un moteur d’autocomplétion.

Les chiffres de lancement expliquent l’enthousiasme : 61,7 à SWE-bench Pro, 73,0 à Terminal Bench 2.1, 42,2 à DeepSWE 1.1 et 90,3 à LiveCodeBench v6. Côté agents multimodaux, Qwen annonce 84,3 à OSWorld-Verified, 64,8 à WebArena-Verified et 70,7 à CoWorkBench. Face à Qwen3.6-27B, le gain apparaît dans la réparation de dépôts, le terminal, le bureau et l’utilisation d’ordinateur, plutôt que dans un examen isolé. Cette largeur est plus intéressante qu’un record solitaire.

Mais un benchmark est un appareil de laboratoire, pas une loi naturelle. SWE-bench Pro et DeepSWE emploient chez Qwen Claude Code, un long contexte et des réglages déclarés. Des tâches problématiques de SWE-bench Pro ont été corrigées et les baselines réévaluées. CoWorkBench et QwenSWEBench sont internes. MathVision utilise un prompt fixe et des annotations corrigées ; certains tests visuels reposent sur un grader ou un scaffold particulier. Cela ne rend pas les scores inutiles. Cela précise la mesure : Qwen3.8 dans un système choisi avec soin. Ollama, LM Studio, llama.cpp ou votre agent peuvent produire autre chose.

Le récit matériel demande la même honnêteté. Les shards BF16 officiels totalisent environ 55,6 Go avant l’overhead. Le Q4_K_M d’Unsloth pèse 17,1 Go et son projecteur visuel 0,93 Go. Environ 18 Go tiennent donc sur un GPU 24 Go, mais les six gigaoctets restants doivent accueillir tampons et cache KV mémorisant les tokens. Plus le contexte grandit, plus ce cache consomme. Une carte 24 Go est un départ crédible pour travailler, pas la promesse de 262 144 tokens à pleine vitesse.

Qwen fournit des commandes inhabituellement complètes. La fenêtre native atteint 262 144 tokens et la fiche documente YaRN vers un million dans vLLM, SGLang et TokenSpeed. Le raisonnement est actif par défaut, propose low, medium et xhigh et peut conserver son contexte entre les tours. Une tête de prédiction multi-token peut accélérer le décodage dans les moteurs compatibles. Ces commandes restent des réglages : YaRN statique peut dégrader les textes courts, et un effort réduit peut provoquer des échecs puis des reprises qui annulent le gain.

Le bon premier essai doit être volontairement banal. Chargez le quant qui reste en mémoire, choisissez une fenêtre avec marge, puis confiez une tâche réelle à résultat visible : réparer un test, extraire des nombres d’un rapport privé ou reconstruire une interface depuis une capture. Notez réussite, reprises, vitesse et correction humaine. Relancez ensuite Qwen3.6 ou votre modèle actuel dans les mêmes conditions. Vous mesurez alors votre atelier, pas le laboratoire d’un autre.

Pour l’instant, Qwen3.8-27B est le meilleur choix par défaut au croisement de la confidentialité, des capacités, du multimodal et du matériel accessible. De plus grands modèles ouverts seront plus intelligents sur certains problèmes ; de plus petits seront plus rapides. Qwen occupe le milieu utile : assez fort pour le travail sérieux, assez petit pour vivre sous un bureau et assez ouvert pour que ce bureau reste entièrement le vôtre.

02

Forces et limites honnêtes

Points Forts

  • Un véritable agent local multimodal : Le même checkpoint lit textes, captures, schémas, documents et vidéos, puis raisonne et appelle des outils. Un flux privé n’a pas à passer par deux modèles séparés pour examiner un bug d’interface ou extraire un tableau avant de modifier le code.
  • De grands gains générationnels dans les essais Qwen : Face à Qwen3.6-27B, Qwen3.8 passe de 53,5 à 61,7 sur SWE-bench Pro, de 63,4 à 73,0 sur Terminal Bench 2.1, et de 13,3 à 42,2 sur DeepSWE 1.1. Le harness compte, mais le progrès couvre plusieurs formes de travail logiciel.
  • Les 27B sont petits de façon utile : Les poids Q4_K_M d’Unsloth occupent environ 17,1 Go et le projecteur visuel 0,93 Go. Un GPU 24 Go ou une machine Apple Silicon adaptée devient réaliste, avec une marge qui dépend du moteur, de la précision du cache et de la longueur de contexte.
  • Contexte long et contrôle du raisonnement très complets : Le contexte natif est de 262 144 tokens ; Qwen documente YaRN jusqu’à 1M pour vLLM, SGLang et TokenSpeed. On peut couper le raisonnement, choisir low, medium ou xhigh, et le préserver entre les tours d’une longue boucle d’agent.
  • Licence ouverte et écosystème de déploiement rapide : Le checkpoint officiel est sous Apache 2.0. Qwen documente vLLM, SGLang et TokenSpeed ; Ollama liste déjà qwen3.8:27b à 18 Go et Unsloth des GGUF d’environ 9 à 31,5 Go.

Limites Honnêtes

  • Les chiffres sont principalement ceux du fournisseur : Qwen a mené la plupart des comparaisons et mélange tests publics avec QwenSWEBench, CoWorkBench et RecreationBench internes. SWE-bench Pro et DeepSWE utilisent Claude Code avec les réglages Qwen : ils mesurent un système modèle-plus-harness, pas les poids seuls dans toute application locale.
  • Vingt-quatre gigaoctets ne donnent pas tout le contexte 262K : Les poids ne sont que la première valise. Projecteur visuel, tampons du moteur et cache KV croissant prennent aussi de la mémoire. Une carte 24 Go exécute le 4 bits, mais les très longs prompts exigent cache réduit ou quantifié, offload CPU partiel ou davantage de mémoire.
  • La quantification change ce qui est mesuré : La table Qwen n’établit pas que chaque GGUF 4 bits garde exactement le même raisonnement, la même vision et le même usage d’outils. L’écart peut être faible ou propre à une tâche ; la production doit tester le quant et le contexte réellement prévus.
  • Les intégrations précoces demandent des soins propres à Qwen : Le raisonnement est actif par défaut, Qwen recommande des réglages de sampling différents selon le mode, et YaRN statique peut pénaliser les textes courts. Schémas d’outils, limites de sortie et template de chat font partie du produit.
03

Aperçu des Benchmarks

Réparation de dépôts — SWE-bench Pro : 61,7

Qwen annonce 61,7 contre 53,5 pour Qwen3.6-27B. Les modèles passent dans Claude Code à température 1,0, top-p 0,95, contexte 256K et sur un jeu affiné où des tâches problématiques ont été corrigées.

Agent terminal — Terminal Bench 2.1 : 73,0

Soit 9,6 points de plus que Qwen3.6-27B dans la table Qwen. C'est un bon signal pour le terminal en plusieurs étapes, mais vitesse et réussite locales dépendent toujours du harness et des outils disponibles.

Utilisation d'ordinateur — OSWorld-Verified : 84,3

La plus grande surprise pratique : ce checkpoint compact dépasse tous les comparateurs de la table Qwen, dont Opus4.6 Max à 72,7. Une reproduction indépendante est cruciale car le résultat dépend fortement du harness.

Empreinte locale — Q4_K_M plus projecteur visuel : environ 18 Go

Les métadonnées donnent 17,1 Go pour le GGUF Q4_K_M et environ 0,93 Go pour le projecteur BF16. Les fichiers tiennent donc sur 24 Go ; la mémoire restante fixe le contexte et la concurrence.

04

Le Verdict

Qwen3.8-27B devient notre #1 en IA locale / privée parce qu’il offre le meilleur ensemble à un particulier : code et agents sérieux, image et vidéo natives, contexte long, liberté Apache 2.0 et empreinte quantifiée tenant sur un GPU grand public haut de gamme. Il ne bat pas tout modèle plus gros—DeepSeek-V4-Flash-0731 mène Terminal Bench et DeepSWE dans la table Qwen—mais ses quants utiles réclament près de 100 Go plutôt qu’environ 18. Cette accessibilité compte ici. Le 9,2 reste provisoire : testez exactement quant, outils et prompts, gardez une revue humaine pour les actions conséquentes et réexaminez le rang lorsque les réplications indépendantes mûriront.

05

Foire aux questions