Il y a une différence entre quelqu’un qui écrit du code et quelqu’un qui comprend un système.
La première personne voit une erreur qui dit undefined is not a function, entoure la ligne d’une condition if et passe à autre chose. Le plantage disparaît. Trois jours plus tard, autre chose casse, à un endroit où personne ne s’y attendait.
La seconde se demande pourquoi la valeur était indéfinie. Elle la suit à rebours à travers les services, découvre qu’une écriture en base de données se terminait avant qu’un message ne soit confirmé, et corrige l’ordre des opérations pour que cet état incohérent ne puisse plus jamais se produire.
Claude Opus 5.5 appartient clairement à la seconde catégorie. Sorti le 22 septembre 2026, il occupe la deuxième place de notre classement Programmation, plus près de la première qu’aucun modèle avant lui.
Son point fort : les chantiers vastes et embrouillés
Les récits des premiers testeurs d’Anthropic se ressemblent tous : d’énormes chantiers qui prenaient auparavant des semaines à une équipe.
- Un testeur a bouclé une migration de code de 680 000 lignes en moins d’une journée.
- Un autre a audité et corrigé une base de code de 200 000 lignes en moins de trois heures. Opus 5 avait eu besoin de plus de 20 heures et de 2,5 fois plus de tokens pour le même travail.
- Lors d’un test interne, Opus 5.5 et Fable 5.1 ont tous deux réécrit de C en Rust HAProxy, le logiciel très répandu qui répartit le trafic web entre les serveurs, et tous deux ont passé presque tous les tests d’HAProxy lui-même. Opus 5.5 a terminé en 9 h 30 au lieu de 12 heures, pour un coût inférieur de 51 %.
Ce sont des anecdotes d’éditeur, pas des mesures indépendantes : voyez-y une indication de tendance plutôt qu’une garantie. Mais le schéma est constant : plus le chantier est vaste et désordonné, plus Opus 5.5 creuse l’écart.
Il sait aussi s’expliquer clairement. L’annonce d’Anthropic le montre en train de diagnostiquer un bug de facturation. Au lieu d’un mur de détails techniques, il commence par l’argent : 1,50 $ de la baisse de revenus d’un client venait d’un changement de tarif, et les 9,92 $ restants d’un bug dans un commit précis, qui cessait de comptabiliser l’utilisation du dernier jour de chaque mois. Quand un agent modifie votre code, ce sont des rapports de ce genre qui le gardent honnête.
Les benchmarks : une égalité, selon qui compte
C’est ici qu’il vaut la peine de ralentir, car tableaux d’éditeurs et tests indépendants ne racontent pas tout à fait la même histoire.
Les chiffres d’Anthropic (septembre 2026) :
- Terminal-Bench 4.0, qui évalue un travail en plusieurs étapes dans un terminal en ligne de commande : Opus 5.5 obtient 66,4 % (±2,6 points). GPT-6 Astra obtient 57,9 %, chiffre communiqué par OpenAI.
- FrontierCode v1.1, qui vérifie si les modifications de code sont assez bonnes pour être fusionnées : Opus 5.5 54,4 %, Astra 53,3 %.
- CursorBench 4.0, qui couvre des tâches de programmation plus longues dans l’éditeur Cursor : Opus 5.5 57,8 %, Fable 5.1 51,8 %.
Les chiffres indépendants : Artificial Analysis a lui-même fait tourner Terminal-Bench 4.0 et obtenu 59,6 % pour Opus 5.5 comme pour Astra. Égalité parfaite.
Notre règle : les mesures indépendantes pèsent plus lourd que les tableaux des éditeurs. Sur la capacité brute, c’est donc une égalité. Le classement se joue ailleurs.
Pourquoi GPT-6 Astra garde la première place
Quand deux modèles se valent, nous les départageons selon ce que vous coûte une tâche terminée.
Là, Astra a un net avantage. En effort maximal, Artificial Analysis a mesuré qu’Opus 5.5 produisait environ 119 000 tokens de sortie par tâche, contre environ 27 000 pour Astra. Les tokens d’Opus sont moins chers (20 $ par million en sortie, contre 50 $ pour Astra), mais il en consomme environ quatre fois plus. Faites le calcul : à plein régime, une tâche moyenne d’Astra coûte à peu près moitié moins.
Anthropic avance un contre-argument légitime. Au niveau d’effort par défaut, Opus 5.5 égalerait Astra sur Terminal-Bench pour environ 40 % du coût, et le battrait sur FrontierCode pour environ 20 % du coût. Si des tests indépendants le confirment, le classement changera. Pour l’instant, c’est une affirmation d’éditeur, et nous attendons des données indépendantes avant de promouvoir un modèle.
Les limites, en toute honnêteté
- Gardez l’effort maximal pour les problèmes difficiles. Laissé au maximum pour des corrections de routine, Opus 5.5 rédige de longs raisonnements que vous payez.
- Le travail de sécurité est redirigé. Opus 5.5 est si fort en cybersécurité qu’Anthropic confie la plupart des tâches de sécurité à Opus 4.8, sauf si vous faites partie de son Cyber Verification Program. La correction de bugs normale n’est pas concernée.
- Les longues sessions butent encore sur des plafonds. Anthropic a relevé les plafonds sur cinq heures des forfaits payants, mais un agent qui tourne des heures sur un gros dépôt peut toujours les atteindre.
Qui recruter ?
Faites appel à GPT-6 Astra si vous avez une file de tickets bien définis et que vous voulez les voir fermés au moindre coût.
Faites appel à Claude Opus 5.5 quand le travail est vaste, ambigu ou risqué : une migration de framework, un audit en profondeur ou un bug qui franchit les frontières entre services. Sur ces chantiers, un raisonnement soigneux vaut plus qu’une réponse laconique. C’est l’ingénieur à qui nous confierions le système auquel personne d’autre ne veut toucher.