Classé #7 Programmation — L'IA qui écrit du code de production
Z.ai (Zhipu AI)

GLM-5.3-Flash

Des capacités de programmation et d'agent proches de la frontière à des prix exceptionnellement bas, avec vision native et contexte de 1M. Ici, « Flash » signifie efficace et bon marché — pas petit, ni particulièrement rapide.

Mis à jour 29 août 2026 Multimodal CodingOpen WeightsMIT
9.2sur 10
Site officiel
Idéal pour

Des capacités de programmation et d'agent proches de la frontière à des prix exceptionnellement bas, avec vision native et contexte de 1M. Ici, « Flash » signifie efficace et bon marché — pas petit, ni particulièrement rapide.

Pourquoi ça Gagne

Artificial Analysis attribue à GLM-5.3-Flash un Intelligence Index de 57 pour environ 0,09 $ par tâche de l'indice au tarif catalogue. Terminal-Bench 2.1 atteint autour de 84,3, tandis que les poids MIT et l'entrée multimodale permettent de programmer à partir de captures d'écran.

À surveiller

Le modèle reste derrière les meilleurs programmeurs fermés et le GLM-5.3 phare sur les travaux difficiles. L'API de Z.ai génère environ 50 jetons par seconde, le raisonnement est toujours actif, les sorties peuvent être prolixes, et la plupart des lignes détaillées du lancement proviennent de tests du fournisseur.

01

Ce que c'est réellement

Imaginez deux ingénieurs. Le premier résout un peu plus souvent les énigmes les plus difficiles. Le second est presque aussi compétent, peut regarder l’écran et coûte tellement moins cher que vous pouvez le laisser chercher, tester et vérifier tout l’après-midi. GLM-5.3-Flash est le second ingénieur. Son avantage n’est pas un trophée d’intelligence absolue, mais la quantité de travail utile qu’un budget permet de soutenir.

Son nom invite à une mauvaise déduction. Sur l’API propriétaire de Z.ai, Artificial Analysis mesure environ cinquante jetons de sortie par seconde, soit moins que le GLM-5.3 phare. « Flash » décrit un niveau d’efficacité et de prix repensé. Le modèle compte 320 milliards de paramètres au total, mais n’en active qu’environ 18 milliards pour chaque jeton ; il combine une attention creuse et une attention linéaire pour réduire le coût des longs contextes. Un restaurant peut servir chaque repas avec une petite équipe tout en ayant besoin du bâtiment entier.

Cette architecture autorise un contexte d’un million de jetons et une entrée multimodale native. Pour programmer, la vision n’est pas un ornement. Le modèle peut examiner une mise en page cassée, lire la boîte de dialogue d’erreur d’une capture d’écran, comparer un graphique au composant qui l’a produit ou utiliser des images vidéo pour comprendre une séquence d’interface. Le GLM-5.3 phare ne peut rien faire de tout cela sans une étape de vision externe.

Les preuves indépendantes sont encourageantes. Artificial Analysis donne à Flash 57 dans son Intelligence Index actuel et mesure environ 84,3 sur Terminal-Bench 2.1. Z.ai annonce 63,4 sur DeepSWE, 78,4 sur Toolathlon Verified et 48,8 sur AutomationBench. Ces dernières lignes représentent de véritables formes de travail, mais elles restent pour la plupart testées par le fournisseur ou seulement partiellement inspectables. Une bonne évaluation les emploie comme des indices étiquetés, pas comme les briques d’un monument à la victoire.

L’économie est d’une clarté inhabituelle. Les tarifs API standard sont de quinze centimes par million de jetons en entrée, trois centimes pour les entrées mises en cache et cinquante centimes par million de jetons en sortie. Jusqu’au 9 septembre 2026 à 24 h 00 UTC+8, Z.ai divise ces montants par deux. Artificial Analysis estime à environ neuf centimes le coût d’une tâche de l’Intelligence Index au prix catalogue, et Z.ai évoque près de 4,5 centimes pendant la promotion. Le prix promotionnel est temporaire ; les capacités ne le sont pas.

L’adoption sur OpenRouter a été gigantesque pendant l’aperçu gratuit Ox Alpha, mais un volume de jetons n’est pas une enquête de satisfaction. L’accès gratuit, les prompts d’un million de jetons et le raisonnement prolixe gonflent tous le compteur. La conclusion équitable est que les développeurs l’ont essayé à une échelle remarquable et que l’offre payante a bien démarré — pas que des milliers de milliards de jetons prouvent que chaque utilisateur l’a préféré.

Le raisonnement ne peut pas être désactivé. Les applications choisissent un effort low, high ou max, max servant à reproduire les benchmarks. Le modèle peut dépenser de nombreux jetons à réfléchir, et une mauvaise idée poursuivie avec obstination peut devenir une boucle coûteuse, même avec de faibles prix unitaires. Fixez des budgets, détectez les appels d’outils répétés, exigez des tests et réservez le niveau low aux transformations ordinaires.

GLM-5.3-Flash est donc un spécialiste de la valeur, doté d’une gamme de capacités proche de la frontière. Installez-le sur l’établi des tâches répétitives : fouiller le dépôt, examiner la capture d’écran, appliquer la correction courante, lancer le test et expliquer le résultat. Gardez un modèle plus puissant à portée de main pour le rare problème où un cas résolu de plus vaut davantage que le coût de cent tâches ordinaires. Cette division du travail est plus utile que de prétendre que chaque nouveau modèle doit détrôner un roi.

02

Forces et limites honnêtes

Points Forts

  • Le coût par tâche résolue est la vraie vedette : Le tarif catalogue est de 0,15 $/M de jetons en entrée et 0,50 $/M en sortie, avec une promotion temporaire de 50 % jusqu’au 9 septembre. Les longues boucles agentiques deviennent assez abordables pour employer le modèle comme un ouvrier quotidien plutôt que pour une occasion spéciale.
  • La vision fait partie de la boucle de programmation : Le modèle peut lire des captures d’écran, des schémas, des documents et des vidéos comme contexte. Les agents frontend et d’assistance peuvent relier ce que montre l’interface à ce que contient le dépôt.
  • Les tests indépendants confirment une capacité proche de la frontière : Artificial Analysis lui donne 57 en Intelligence et relève indépendamment environ 84,3 sur Terminal-Bench 2.1, un résultat proche de celui publié par Z.ai.
  • Les poids MIT réduisent les frictions du déploiement : Les équipes peuvent inspecter, modifier, héberger et commercialiser le modèle sous une licence permissive standard, avec vLLM, SGLang, TokenSpeed et d’autres solutions de service.

Limites Honnêtes

  • Flash désigne un niveau de prix, pas un chronomètre : Dans les tests d’Artificial Analysis, l’endpoint propriétaire de Z.ai produit environ 50 jetons par seconde. Des hébergeurs tiers plus rapides existent, mais le choix du fournisseur devient une composante du produit.
  • Il est moins cher que le modèle phare, pas meilleur que lui : GLM-5.3 obtient des scores supérieurs en intelligence générale et dans les suites difficiles de longue haleine. Flash gagne Toolathlon et certaines lignes d’automatisation du tableau Z.ai, pas l’ensemble de la comparaison.
  • Le raisonnement est obligatoire et prolixe : Les niveaux d’effort low, high et max sont disponibles, avec max par défaut. Même une modification banale peut déclencher une longue recherche interne ; les applications ont donc besoin de budgets et de limites de boucle.
  • Le niveau de confiance des benchmarks détaillés varie : DeepSWE, Toolathlon, AutomationBench, HLE avec outils et les lignes de vision sont principalement issus de tests Z.ai ou ne sont que partiellement vérifiables de manière indépendante. Attribuez chaque chiffre au lieu de qualifier le tableau de lancement de consensus.
03

Aperçu des Benchmarks

Artificial Analysis Intelligence Index — 57

Les tests agrégés indépendants placent Flash près du niveau d'intelligence de la classe GPT-5.6 Terra pour une fraction du coût en jetons, tout en restant derrière Opus 5 et le GLM-5.3 phare.

Terminal-Bench 2.1 — environ 84,3

L'un des signaux les plus solides parmi les tests spécialisés étayés indépendamment. Son léger avantage numérique sur une exécution du modèle phare configurée séparément ne constitue pas un classement de la qualité intrinsèque : le banc d'essai et l'échantillonnage diffèrent. La version 2.1 ne doit pas être confondue avec Terminal-Bench 3.0, bien plus difficile.

DeepSWE v1.1 — 63,4 (test Z.ai)

Un grand progrès sur GLM-5.2 et un signal convaincant pour le travail agentique dans les dépôts, mais inférieur à GPT-5.6 Sol dans le tableau cité et pas encore reproduit indépendamment.

Toolathlon Verified — 78,4 (service officiel / rapport Z.ai)

Flash domine la comparaison de Z.ai dans cette suite d'utilisation d'outils en conditions réelles. Le résultat annoncé est une moyenne de trois exécutions, mais aucun artefact indépendant distinct n'a été trouvé.

GDPval-AA v2 — groupe de tête, Elo en direct

Les instantanés de fin août placent Flash et le GLM phare dans des zones qui se recouvrent statistiquement, derrière les meilleurs réglages d'Opus. Cet Elo en direct doit toujours être daté.

04

Le Verdict

GLM-5.3-Flash entre en Programmation au n°7 avec 9,2, juste derrière le GLM-5.3 phare. Ce n’est pas le modèle à couronner sur la foi d’un tableau ; c’est celui à déployer lorsque des milliers d’étapes agentiques utiles comptent davantage que les derniers points d’un examen de frontière. Utilisez-le pour la recherche massive dans les dépôts, les corrections courantes, le frontend guidé par captures d’écran, l’appel d’outils et les boucles de vérification. Confiez les tâches texte les plus difficiles au GLM-5.3 phare ou à un grand modèle fermé, et mesurez la vitesse du fournisseur avant de promettre que « Flash » paraîtra rapide.

05

Foire aux questions