Guide classé

IA locale / privée — Votre cerveau, votre machine, vos règles

L'IA locale occupe désormais deux univers : d'un côté, un modèle comme Qwen3.8-27B sur une seule machine personnelle puissante ; de l'autre, un système de pointe comme GLM-5.3-Flash au sein d'un cluster privé. Dans les deux cas, vos données peuvent rester sous votre contrôle, mais le matériel requis, les licences, la vitesse et les coûts d'exploitation diffèrent radicalement.

La décision d'abord

Notre classement

Commencez par le gagnant, puis comparez les compromis qui pourraient changer votre choix.

#1 IA Locale / Privée

Qwen3.8 — 27B

Alibaba (Qwen Team)

Qwen3.8-27B est l'un des rares modèles locaux dont les compromis correspondent au matériel que les gens possèdent réellement : un checkpoint dense de 27B pour le texte, les images, la vidéo, le code et les agents utilisant des outils. Une version 4 bits tient sur un GPU de classe 24 Go, tandis que la licence Apache 2.0 permet de garder le travail privé et de l'utiliser commercialement.

Pourquoi ça Gagne

Les essais indépendants donnent désormais un véritable appui au récit du lancement : Qwen3.8-27B obtient 52 à l'Artificial Analysis Intelligence Index et 51 à son Agentic Index, tandis que le classement Image-to-WebDev d'Arena le place #7 parmi des systèmes de pointe bien plus grands. Les scores de Qwen en code et en utilisation d'ordinateur restent solides, et le modèle réunit un contexte de 262K, un raisonnement réglable, la vision et la vidéo natives, ainsi qu'une licence Apache 2.0.

L'Accroc

Les composites indépendants confortent les capacités générales et agentiques du modèle, mais la plupart des scores précis en code et en utilisation d'ordinateur proviennent encore des propres bancs d'essai de Qwen. Le réglage de raisonnement xhigh par défaut peut devenir péniblement lent et bavard sur du matériel local ; commencez par low ou medium, ou désactivez la réflexion pour le travail interactif ordinaire. La quantification Q4 et les limites du cache KV séparent toujours un téléchargement de 18 Go d'un usage pratique avec 262K de contexte.

9.2 Note éditoriale
Lire l'avis
Idéal pour

Qwen3.8-27B est l'un des rares modèles locaux dont les compromis correspondent au matériel que les gens possèdent réellement : un checkpoint dense de 27B pour le texte, les images, la vidéo, le code et les agents utilisant des outils. Une version 4 bits tient sur un GPU de classe 24 Go, tandis que la licence Apache 2.0 permet de garder le travail privé et de l'utiliser commercialement.

Pourquoi ça Gagne

Les essais indépendants donnent désormais un véritable appui au récit du lancement : Qwen3.8-27B obtient 52 à l'Artificial Analysis Intelligence Index et 51 à son Agentic Index, tandis que le classement Image-to-WebDev d'Arena le place #7 parmi des systèmes de pointe bien plus grands. Les scores de Qwen en code et en utilisation d'ordinateur restent solides, et le modèle réunit un contexte de 262K, un raisonnement réglable, la vision et la vidéo natives, ainsi qu'une licence Apache 2.0.

À surveiller

Les composites indépendants confortent les capacités générales et agentiques du modèle, mais la plupart des scores précis en code et en utilisation d'ordinateur proviennent encore des propres bancs d'essai de Qwen. Le réglage de raisonnement xhigh par défaut peut devenir péniblement lent et bavard sur du matériel local ; commencez par low ou medium, ou désactivez la réflexion pour le travail interactif ordinaire. La quantification Q4 et les limites du cache KV séparent toujours un téléchargement de 18 Go d'un usage pratique avec 262K de contexte.

#2

GLM-5.3-Flash

Z.ai (Zhipu AI)

Le meilleur compromis premium de la famille GLM pour les clusters privés : intelligence proche de la frontière, vision native, contexte de 1M et poids MIT — toujours des centaines de gigaoctets, mais bien plus pratique que le GLM-5.3 phare.

9.1 Note éditoriale
Lire l'avis
#3

Qwen3.8-Flash-Next

Alibaba (Qwen Team)

Un aperçu de l'architecture Qwen4 qui stocke environ 180B paramètres, mais n'en active que 6B par jeton. Il apporte des capacités multimodales proches de la frontière aux machines riches en RAM — si sa licence inhabituelle convient à votre produit.

9.0 Note éditoriale
Lire l'avis
#4

Un MoE efficace de 284 milliards de paramètres, dont 13 milliards actifs, spécialisé dans le texte et le code et toujours séduisant sur les machines de classe 128 Go. De nouveaux concurrents multimodaux ont mis fin à sa brève prétention au trône des agents locaux.

9.0 Note éditoriale
Lire l'avis
#5

GLM-5.3

Z.ai (Zhipu AI)

Un modèle proche de la frontière que vous pouvez enfin posséder — à condition que votre définition d'un ordinateur local inclue une baie d'accélérateurs. GLM-5.3 offre une excellente intelligence sur cluster privé, un contexte de 1M et des poids téléchargeables sous licence personnalisée.

8.7 Note éditoriale
Lire l'avis
#6

Kimi K3

Moonshot AI

Un modèle de pointe à poids ouverts comptant 2 800 milliards de paramètres, qui prouve qu'une IA privée peut être à la fois immense et excellente. Il prouve aussi que le téléchargement peut être gratuit sans que la machine nécessaire pour l'exécuter le soit.

8.5 Note éditoriale
Lire l'avis
#7

Gemma 4

Google DeepMind

Pas un modèle — cinq. Gemma 4 de Google DeepMind est une famille couvrant tout, d'un modèle de 2 milliards de paramètres qui tourne sur votre téléphone à un mastodonte dense de 31 milliards de paramètres pour serveurs. Chaque membre a une architecture différente, des forces différentes et des besoins matériels différents. Le E2B tient dans 1 Go de RAM. Le 12B Unified fait tourner une IA multimodale complète sur un GPU de laptop. Le 26B MoE n'active que 3,8B de paramètres par token. Tous Apache 2.0, tous open-weight, tous à vous. Ce guide passe en revue chacun pour que vous sachiez exactement quel Gemma correspond à votre matériel et votre utilisation.

8.1 Note éditoriale
Lire l'avis
Questions et réponses

Foire aux questions