Guide classé

IA locale / privée — Votre cerveau, votre machine, vos règles

Voici une idée radicale : et si vous pouviez faire tourner une IA véritablement intelligente sur votre propre matériel, sans qu'aucune de vos données ne quitte jamais votre machine ? Pas de serveurs cloud. Pas de collecte de données. Pas de frais d'abonnement. Juste vous, votre portable et une intelligence qui respecte votre vie privée par conception. Bienvenue dans la révolution des modèles open-weight.

La décision d'abord

Notre classement

Commencez par le gagnant, puis comparez les compromis qui pourraient changer votre choix.

#1 IA Locale / Privée

GLM-5.2

Zhipu AI

Le modèle open-weight qui réécrit les règles de l'IA locale. Design Arena #1, SWE-bench Pro 62,1%, Terminal-Bench 82,7, AkitaOnRails 87/100 — et chaque aspect disponible sous licence MIT pour le télécharger, le quantifier et l'exécuter sur votre propre matériel. Une fenêtre de contexte de 1M tokens correctement entraînée, deux niveaux d'intensité de raisonnement, et le premier modèle ouvert à rivaliser véritablement avec les leaders fermés sur les tâches d'ingénierie à long horizon.

Pourquoi ça Gagne

Le modèle ouvert le plus puissant jamais publié pour le coding et le travail agentique — Design Arena #1 (Elo 1360), AkitaOnRails 87/100 Tier A (+41 depuis GLM-5.1), SWE-bench Pro 62,1% (SOTA open-weight), FrontierSWE 74,4% (1% derrière Opus 4.8). Licence MIT sans aucune restriction. 744B MoE (~40B actifs) — plus compact que les 1,6T de DeepSeek V4 avec des benchmarks vérifiés plus solides. Fonctionne sur vLLM, SGLang, ktransformers. Tient sur des Macs avec 256Go de mémoire unifiée avec une quantification agressive (~241Go en 2-bit dynamique).

L'Accroc

Le MoE 744B nécessite toujours du matériel sérieux — 256Go+ de mémoire unifiée ou clusters multi-GPU. Pas un modèle pour laptop. Aucune capacité de vision native. Plus lent par token que les modèles compacts comme Qwen 3.6 27B ou Gemma 4. L'outillage de l'écosystème occidental mûrit encore.

9.0 Note éditoriale
Lire l'avis
Idéal pour

Le modèle open-weight qui réécrit les règles de l'IA locale. Design Arena #1, SWE-bench Pro 62,1%, Terminal-Bench 82,7, AkitaOnRails 87/100 — et chaque aspect disponible sous licence MIT pour le télécharger, le quantifier et l'exécuter sur votre propre matériel. Une fenêtre de contexte de 1M tokens correctement entraînée, deux niveaux d'intensité de raisonnement, et le premier modèle ouvert à rivaliser véritablement avec les leaders fermés sur les tâches d'ingénierie à long horizon.

Pourquoi ça Gagne

Le modèle ouvert le plus puissant jamais publié pour le coding et le travail agentique — Design Arena #1 (Elo 1360), AkitaOnRails 87/100 Tier A (+41 depuis GLM-5.1), SWE-bench Pro 62,1% (SOTA open-weight), FrontierSWE 74,4% (1% derrière Opus 4.8). Licence MIT sans aucune restriction. 744B MoE (~40B actifs) — plus compact que les 1,6T de DeepSeek V4 avec des benchmarks vérifiés plus solides. Fonctionne sur vLLM, SGLang, ktransformers. Tient sur des Macs avec 256Go de mémoire unifiée avec une quantification agressive (~241Go en 2-bit dynamique).

À surveiller

Le MoE 744B nécessite toujours du matériel sérieux — 256Go+ de mémoire unifiée ou clusters multi-GPU. Pas un modèle pour laptop. Aucune capacité de vision native. Plus lent par token que les modèles compacts comme Qwen 3.6 27B ou Gemma 4. L'outillage de l'écosystème occidental mûrit encore.

#2

Kimi K3

Moonshot AI

Le premier modèle à poids ouverts qui ressemble à un cerveau fermé de pointe. 2,8 billions de paramètres en mixture-of-experts, vision native, un contexte complet d'un million de tokens et une licence qui autorise un usage commercial — le tout téléchargeable sur une machine que vous contrôlez. Le problème, c'est la machine : il faut un datacenter, pas un bureau.

8.5 Note éditoriale
Lire l'avis
#3

Qwen3.6 — 27B

Alibaba (Qwen Team)

Le dernier modèle dense de 27B d'Alibaba ne se contente pas de succéder au précédent roi de l'IA locale — il surpasse son propre flagship de 397B sur chaque benchmark de codage agentique majeur tout en tournant sur un seul GPU grand public. SWE-bench Verified 77,2, Terminal-Bench 2.0 59,3, vision et vidéo natifs, Apache 2.0.

8.3 Note éditoriale
Lire l'avis
#4

Gemma 4

Google DeepMind

Pas un modèle — cinq. Gemma 4 de Google DeepMind est une famille couvrant tout, d'un modèle de 2 milliards de paramètres qui tourne sur votre téléphone à un mastodonte dense de 31 milliards de paramètres pour serveurs. Chaque membre a une architecture différente, des forces différentes et des besoins matériels différents. Le E2B tient dans 1 Go de RAM. Le 12B Unified fait tourner une IA multimodale complète sur un GPU de laptop. Le 26B MoE n'active que 3,8B de paramètres par token. Tous Apache 2.0, tous open-weight, tous à vous. Ce guide passe en revue chacun pour que vous sachiez exactement quel Gemma correspond à votre matériel et votre utilisation.

8.2 Note éditoriale
Lire l'avis
Questions et réponses

Foire aux questions