Guide classé

Programmation — L'IA qui écrit du code de production

Ce sont de véritables agents de code, pas des jouets d'autocomplétion. GPT-6 Astra s'adjuge la 1re place, porté par son triomphe sur la Code Arena d'Arena.ai (1 797 pts en WebDev), son efficacité en terminal et en contrôle d'ordinateur, ainsi que son faible coût par tâche achevée ; Opus 5 reste notre référence de vérification au 2e rang. GLM-5.3 et la variante multimodale plus accessible GLM-5.3-Flash enrichissent la sélection open-weight.

La décision d'abord

Notre classement

Commencez par le gagnant, puis comparez les compromis qui pourraient changer votre choix.

#1 Programmation

GPT-6 Astra

OpenAI

GPT-6 Astra s'empare de la couronne du code grâce au vote des développeurs et à l'épreuve du terrain : nouveau nº 1 sur la Code Arena d'Arena.ai (1 797 pts en WebDev), sessions de terminal, analyse d'incidents et configuration de poste en consommant environ un tiers des tokens de Sol.

Pourquoi ça Gagne

Nº 1 au classement général et en WebDev sur la Code Arena d'Arena.ai avec 1 797 pts (+35 pts d'avance sur Claude Fable 5.1 Max et +109 sur Opus 5 Max), nº 1 en Data & Analytics, Consumer Product et outils de création de contenu ; plus 57,7–57,9% sur Terminal-Bench 4.0, score record de 74,1% sur DeepSWE v1.1, 64,6% sur Terminal-Bench Science et 88% pass@1 / 99,2% pass@4 sur SRE-Bench.

L'Accroc

Sur le banc d'essai synthétique d'Artificial Analysis, Fable 5.1 devance encore légèrement Astra (70 contre 67), et SWE-Bench Pro demeure le bastion historique de Claude Fable. Le tarif API est de 10/50 $ (2,5× Sol), les lectures de cache coûtent quatre fois plus cher (1 $ contre 0,25 $ chez Fable 5.1), la concision néglige parfois la mise en forme des rapports et les garde-fous cyber ralentissent certains prompts d'analyse de vulnérabilités.

9.9 Note éditoriale
Lire l'avis
Idéal pour

GPT-6 Astra s'empare de la couronne du code grâce au vote des développeurs et à l'épreuve du terrain : nouveau nº 1 sur la Code Arena d'Arena.ai (1 797 pts en WebDev), sessions de terminal, analyse d'incidents et configuration de poste en consommant environ un tiers des tokens de Sol.

Pourquoi ça Gagne

Nº 1 au classement général et en WebDev sur la Code Arena d'Arena.ai avec 1 797 pts (+35 pts d'avance sur Claude Fable 5.1 Max et +109 sur Opus 5 Max), nº 1 en Data & Analytics, Consumer Product et outils de création de contenu ; plus 57,7–57,9% sur Terminal-Bench 4.0, score record de 74,1% sur DeepSWE v1.1, 64,6% sur Terminal-Bench Science et 88% pass@1 / 99,2% pass@4 sur SRE-Bench.

À surveiller

Sur le banc d'essai synthétique d'Artificial Analysis, Fable 5.1 devance encore légèrement Astra (70 contre 67), et SWE-Bench Pro demeure le bastion historique de Claude Fable. Le tarif API est de 10/50 $ (2,5× Sol), les lectures de cache coûtent quatre fois plus cher (1 $ contre 0,25 $ chez Fable 5.1), la concision néglige parfois la mise en forme des rapports et les garde-fous cyber ralentissent certains prompts d'analyse de vulnérabilités.

#2

Claude Opus 5

Anthropic

Le codeur de pointe le mieux étayé par les données, avec une patience inhabituelle pour la vérification. Opus 5 reste notre #2 uniquement parce que ce guide accorde explicitement à GPT-6 Astra le départage sur l'intégration Codex, l'efficacité dans le terminal et l'usage de l'ordinateur, et le coût par tâche terminée.

9.9 Note éditoriale
Lire l'avis
#3

Claude Fable 5.1

Anthropic

Le moteur de raisonnement de classe Mythos raffiné pour le codage par agents. Les mêmes poids que le Mythos 5.1 restreint, mais optimisé avec une réduction de cache de 75 % qui transforme l'économie de l'ingénierie à long terme. Déployé de manière optimale dans Claude Code, où son score AA Coding Agent de 70 domine le terrain.

9.8 Note éditoriale
Lire l'avis
#4

Grok 4.6

xAI

Grok 4.6 est une vraie mise à niveau pour les agents de code : meilleur pour explorer un dépôt, maintenir une longue implémentation et produire un premier jet visuel, toujours à $2/$6 et disponible immédiatement dans Cursor et Grok Build.

9.7 Note éditoriale
Lire l'avis
#5

GLM-5.3

Z.ai (Zhipu AI)

Un agent de programmation poids lourd à poids ouverts, entraîné pour tout ce qui vient après la première réponse : planifier, modifier, tester, se remettre d'un échec et garder le cap pendant de longues interventions dans un dépôt.

9.2 Note éditoriale
Lire l'avis
#6

Qwen3.8-Max

Alibaba / Qwen Team

Un challenger de grande valeur, doué pour le contexte long et l'analyse visuelle en programmation, qui se classe désormais #6 après que des tests indépendants ont placé le modèle phare GLM-5.3 devant lui. Son point de contrôle de niveau Max téléchargeable reste remarquable, mais ses 2,4 billions de paramètres font de son auto-hébergement un projet digne d'un centre de données.

9.2 Note éditoriale
Lire l'avis
#7

GLM-5.3-Flash

Z.ai (Zhipu AI)

Des capacités de programmation et d'agent proches de la frontière à des prix exceptionnellement bas, avec vision native et contexte de 1M. Ici, « Flash » signifie efficace et bon marché — pas petit, ni particulièrement rapide.

9.2 Note éditoriale
Lire l'avis
Questions et réponses

Foire aux questions