Classé #3 Programmation — L'IA qui écrit du code de production
Anthropic

Claude Sonnet 5.5

Claude Sonnet 5.5 est le modèle de programmation qu'on peut laisser tourner toute la journée : rapide, deux fois moins cher par token qu'Opus 5.5, et assez bon pour que la plupart des corrections de bugs, des nouvelles fonctionnalités et des refactorisations n'aient jamais besoin du modèle phare. Évitez seulement de pousser le curseur d'effort à fond : à son réglage le plus haut, il écrit plus que tout autre modèle mesuré par Artificial Analysis, et certains résultats se dégradent.

Mis à jour 29 septembre 2026 Agentic CodingTerminal-Bench 4.0 64%Claude Code
9.8sur 10
Site officiel
Idéal pour

Claude Sonnet 5.5 est le modèle de programmation qu'on peut laisser tourner toute la journée : rapide, deux fois moins cher par token qu'Opus 5.5, et assez bon pour que la plupart des corrections de bugs, des nouvelles fonctionnalités et des refactorisations n'aient jamais besoin du modèle phare. Évitez seulement de pousser le curseur d'effort à fond : à son réglage le plus haut, il écrit plus que tout autre modèle mesuré par Artificial Analysis, et certains résultats se dégradent.

Pourquoi ça Gagne

Les tests indépendants d'Artificial Analysis lui donnent 64 % sur Terminal-Bench 4.0, un peu au-dessus d'Opus 5.5 et de GPT-6 Astra (environ 60 % chacun). Anthropic annonce 52,1 % sur FrontierCode en effort xhigh et 55,5 % sur CursorBench 4.0, à environ deux points d'Opus 5.5. Vals AI le classe deuxième sur 66 modèles dans son index et premier sur Vibe Code Bench et Code Migration. Les tokens coûtent 2/10 dollars, et la réponse arrive plus de 30 % plus vite qu'avec Sonnet 5.

À surveiller

En effort max, il a utilisé environ 193 000 tokens de sortie par tâche dans les tests d'Artificial Analysis, le chiffre le plus élevé jamais mesuré, et son score FrontierCode tombe de 52,1 % en xhigh à 46,2 % en max. Anthropic reconnaît elle-même qu'Opus 5.5 reste nettement plus fort pour le travail complexe et ouvert. Les tâches de sécurité les plus sensibles basculent vers Sonnet 5, et les utilisateurs de l'API doivent gérer cinq changements incompatibles lors de la migration.

01

Ce que c'est réellement

Imaginez deux menuisiers. Le premier est le maître qu’on appelle quand une maison a besoin d’un nouvel escalier et que personne n’en a encore dessiné les plans. Le second est l’artisan régulier capable de poser quarante portes en une semaine, toutes parfaitement d’aplomb.

L’essentiel de la semaine d’une équipe logicielle, ce sont des portes, pas des escaliers : un test qui échoue, un formulaire qui a besoin d’un nouveau champ, une API qui a changé de nom. Claude Sonnet 5.5 est fait pour les portes.

Anthropic l’a lancé le 28 septembre 2026, comme deuxième modèle de la famille Claude 5.5, une semaine après Opus 5.5. Il garde le prix de Sonnet 5 : 2 dollars par million de tokens en entrée et 10 dollars par million en sortie, soit la moitié d’Opus 5.5. Selon Anthropic, il est plus de 30 % plus rapide que Sonnet 5 et coûte jusqu’à 30 % de moins par tâche, parce qu’il termine en moins d’étapes.

Les chiffres indépendants

Pour les agents de programmation, le test auquel nous faisons le plus confiance est Terminal-Bench 4.0 : de longues tâches en plusieurs étapes dans une vraie ligne de commande, où le modèle doit installer des outils, les lancer, lire les erreurs et recommencer.

Artificial Analysis l’a fait tourner de façon indépendante en septembre 2026. Sonnet 5.5 a obtenu 64 %, un peu devant Opus 5.5 et GPT-6 Astra, autour de 60 % chacun. L’exécution d’Anthropic est plus haute, à 70,6 %, mais les environnements de test des éditeurs ont tendance à flatter leurs propres modèles : le chiffre indépendant de 64 % est celui à retenir. Quoi qu’il en soit, c’est un bond énorme par rapport à Sonnet 5, qui obtenait 10,3 % dans le tableau d’Anthropic.

Une seconde source indépendante confirme l’essentiel. Vals AI place Sonnet 5.5 deuxième sur 66 modèles dans son index, à 69,22 %, à moins d’un demi-point d’Opus 5.5, pour environ deux tiers du coût par test. Il prend la première place de deux classements de programmation : Vibe Code Bench (créer de petites applications à partir d’une description), à 92,39 %, et Code Migration, à 69,83 %.

Ce qu’ajoutent les tests d’Anthropic

Le tableau de lancement d’Anthropic complète le tableau :

  • FrontierCode v1.1, qui se demande si une modification de code pourrait être intégrée sans qu’un humain y touche : 52,1 % en effort xhigh. Opus 5.5 obtient 54,4 % et GPT-6 Sol 49,3 %.
  • CursorBench 4.0, construit à partir de vraies sessions dans l’éditeur Cursor : 55,5 %, environ deux points derrière Opus 5.5 et loin devant les 34,1 % de Sonnet 5.

Le plus instructif, ce sont les graphiques de coût, qui placent le score de chaque modèle face à son coût par tâche, pour chaque niveau d’effort. Deux constats ressortent. En effort High, le défaut de l’API, Sonnet 5.5 égale le meilleur score FrontierCode de GPT-6 Sol pour environ un cinquième du coût par tâche. Et en effort Medium, le défaut de Claude Code, il dépasse le meilleur score Terminal-Bench de Sonnet 5 pour moins d’un dixième du coût.

Les premiers testeurs disent la même chose avec des mots plus simples. Lovable a constaté environ deux fois moins de commandes shell par tâche. Slack a mesuré environ 14 % de tokens de sortie en moins qu’avec Sonnet 5. Unity, qui ne compte une tâche comme terminée que si la modification fonctionne réellement à l’exécution, indique que la majorité du travail de Sonnet 5.5 a passé ce contrôle.

Le curseur d’effort, et pourquoi le cran le plus haut se retourne contre vous

Comme Opus 5.5, Sonnet 5.5 dispose d’un curseur d’effort à cinq crans : low, medium, high, xhigh et max. Les crans élevés laissent le modèle réfléchir plus longtemps et vérifier davantage son travail. On s’attendrait à ce que max soit le meilleur. Avec Sonnet 5.5, ce n’est souvent pas le cas.

Artificial Analysis a mesuré toute la gamme sur son Intelligence Index :

Effort Intelligence Index Coût par tâche
Low 36 0,41 $
Medium 41 0,59 $
High 47 1,08 $
Xhigh 52 2,74 $
Max 56 7,60 $

Passer de xhigh à max rapporte quatre points de plus pour presque trois fois le coût. En max, Sonnet 5.5 a écrit environ 193 000 tokens de sortie par tâche. C’est le chiffre le plus élevé jamais mesuré par Artificial Analysis : environ 60 % de plus qu’Opus 5.5 en max, et environ sept fois GPT-6 Astra.

Pire encore, plus d’effort ne veut pas toujours dire meilleur code. Sur FrontierCode, Sonnet 5.5 obtient 52,1 % en xhigh mais 46,2 % en max. Anthropic en donne la raison dans une note de bas de page : en max, le modèle lançait plus souvent la routine de revue de code de Claude Code, qui répartit la relecture entre de nombreux agents auxiliaires. Dans certains cas, cela a provoqué un dépassement de délai ou des modifications en trop, et FrontierCode pénalise les changements que personne n’a demandés.

La leçon est simple : considérez xhigh comme le plafond. Si une tâche échoue encore en xhigh, la meilleure étape suivante est généralement Opus 5.5, pas max.

Le bémol honnête

Opus reste l’architecte. Anthropic le dit franchement : sur plusieurs tests, Sonnet 5.5 en max se rapproche d’Opus 5.5, mais dans les tests d’Anthropic comme dans ceux de testeurs externes, Opus 5.5 reste nettement plus fort pour le travail complexe et ouvert qui demande un jugement soutenu. Opus garde aussi la tête sur FrontierCode et CursorBench.

La facture Claude Code ne sera pas divisée par deux. Les agents de programmation relisent sans cesse votre projet, et ces relectures sont facturées comme des lectures de cache, à 0,20 dollar par million de tokens sur Sonnet 5.5 comme sur Opus 5.5. Vous économisez sur les nouvelles entrées et sorties, mais une longue session très dépendante du cache économise moins que le « moitié prix » du titre ne le laisse penser.

Le travail de sécurité est redirigé. Sonnet 5.5 est le premier Sonnet livré avec les protections de cybersécurité qu’Anthropic applique à ses modèles les plus puissants. La correction de bugs ordinaire n’est pas concernée, mais les tâches de sécurité les plus sensibles basculent visiblement vers Sonnet 5, sauf si votre équipe a été approuvée via le Cyber Verification Program d’Anthropic.

La migration demande un peu de travail. Anthropic liste cinq changements incompatibles par rapport à Sonnet 5. L’utilisation forcée d’outils renvoie désormais une erreur, les valeurs de température non standard sont refusées, et le texte entre deux appels d’outils revient dans un autre format. Rien de difficile à corriger, mais ce n’est pas un changement d’une ligne.

Où il trouve sa place

Si le travail est… Prenez Pourquoi
Un bug, une fonctionnalité ou une migration bien délimités Claude Sonnet 5.5 Rapide et économique en effort medium ou high
Une architecture ouverte ou un problème que personne n’a cerné Claude Opus 5.5 Jugement nettement plus solide, selon Anthropic et les testeurs
Du long travail en terminal sans surveillance, au plus bas coût par tâche GPT-6 Astra N’utilise qu’une fraction des tokens à son meilleur niveau
Finitions front-end, diapositives, petits projets visuels Claude Sonnet 5.5 Vrai sens du design et itérations rapides

Le verdict

Claude Sonnet 5.5 est le modèle que la plupart des développeurs devraient laisser allumé. Il s’occupe des portes, toutes les quarante, vite et pour la moitié du prix par token du modèle phare. Laissez-le en medium ou high, gardez xhigh pour les cas difficiles et, quand la commande se révèle être un escalier, appelez Opus.

02

Forces et limites honnêtes

Points Forts

  • Des résultats indépendants en terminal : Artificial Analysis a mesuré 64 % sur Terminal-Bench 4.0 en septembre 2026, un peu au-dessus d’Opus 5.5 et de GPT-6 Astra, autour de 60 %. C’est le test indépendant qui tranche la plupart des comparaisons entre agents de programmation, et Sonnet 5.5 s’y est bien comporté pour la moitié du prix par token d’Opus.
  • Économique avec des réglages raisonnables : Les graphiques d’Anthropic montrent qu’en effort High, le réglage par défaut de l’API, Sonnet 5.5 égale le meilleur score FrontierCode de GPT-6 Sol pour environ un cinquième du coût par tâche. Sur Terminal-Bench, l’effort Medium dépasse déjà le meilleur score de Sonnet 5 pour moins d’un dixième du coût.
  • Il termine en moins d’étapes : Les premiers testeurs décrivent la même tendance. Slack a mesuré environ 14 % de tokens de sortie en moins qu’avec Sonnet 5, Lovable a constaté environ deux fois moins de commandes shell par tâche, et lors d’un test de Balyasny il a utilisé environ 121 000 tokens par réponse, là où Sonnet 5 en consommait 497 000.
  • Solide sur les migrations et les prototypes rapides : Vals AI place Sonnet 5.5 premier sur Vibe Code Bench (92,39 %) et Code Migration (69,83 %), et deuxième au Vals Index global, pour environ deux tiers du coût par test d’Opus 5.5.
  • Un bon œil pour les interfaces : Selon Anthropic, Sonnet 5.5 a un vrai sens du design : il sait peaufiner des interfaces et suivre des modèles de diapositives d’assez près pour qu’il n’y ait presque rien à retoucher. Sa réponse arrive aussi plus de 30 % plus vite qu’avec Sonnet 5, ce qui rend les allers-retours de retouche agréables.

Limites Honnêtes

  • L’effort max est un piège : Artificial Analysis a mesuré environ 193 000 tokens de sortie par tâche en max, soit environ 60 % de plus qu’Opus 5.5 en max et environ sept fois GPT-6 Astra. À ce réglage, l’avantage de prix sur Opus disparaît presque entièrement.
  • Plus d’effort, moins bons merges : Sur FrontierCode, qui vérifie si des modifications pourraient être intégrées sans retouche humaine, Anthropic annonce 52,1 % en xhigh mais 46,2 % en max. En max, le modèle lançait plus souvent une routine de revue de code répartie entre de nombreux agents auxiliaires, ce qui provoquait parfois un dépassement de délai ou des modifications hors du périmètre demandé.
  • Ce n’est pas l’architecte : Anthropic affirme qu’Opus 5.5 reste nettement plus fort pour le travail complexe et ouvert qui demande un jugement soutenu. Opus mène aussi sur FrontierCode (54,4 %) et CursorBench (57,8 %).
  • Le travail de sécurité est redirigé : Les tâches de cybersécurité les plus sensibles basculent visiblement vers Sonnet 5. La correction de bugs ordinaire n’est pas concernée, et les équipes de sécurité vérifiées peuvent demander un accès élargi.
  • Pas un simple changement de nom dans l’API : Anthropic liste cinq changements incompatibles par rapport à Sonnet 5, dont des erreurs en cas d’utilisation forcée d’outils et de valeurs de température non standard. Lisez le guide de migration avant de basculer du code en production.
03

Aperçu des Benchmarks

Terminal-Bench 4.0 — 64 % indépendant (70,6 % selon l'éditeur)

Travail en plusieurs étapes dans un terminal en ligne de commande. Artificial Analysis a mesuré 64 %, contre environ 60 % pour Opus 5.5 et GPT-6 Astra (xhigh). La meilleure exécution d'Anthropic atteint 70,6 %, contre 66,4 % pour Opus 5.5 en xhigh et 10,3 % pour Sonnet 5.

FrontierCode v1.1 — 52,1 % en xhigh, 46,2 % en max

Si des modifications de code sont prêtes à être intégrées. Tableau d'Anthropic : Opus 5.5 54,4 %, GPT-6 Sol 49,3 %, Sonnet 5 42,4 %. Sonnet 5.5 obtient moins en max qu'en xhigh.

CursorBench 4.0 — 55,5 %

Tâches ambiguës sur plusieurs fichiers, tirées de vraies sessions Cursor. Anthropic annonce 57,8 % pour Opus 5.5 et 34,1 % pour Sonnet 5.

Vals Index — 69,22 % (2e sur 66)

Index indépendant de Vals AI, 0,47 point derrière Opus 5.5 et devant Fable 5.1, pour 20,80 dollars par test contre 32,77 dollars pour Opus 5.5. Premier sur Vibe Code Bench et Code Migration.

Tokens de sortie par tâche — ~193 000 en max

Mesure d'Artificial Analysis sur son Intelligence Index, la plus élevée jamais enregistrée : environ 60 % au-dessus d'Opus 5.5 (max) et environ sept fois GPT-6 Astra (max).

Prix — 2 / 10 dollars par million de tokens, 0,20 dollar en lecture de cache

Inchangé par rapport à Sonnet 5 et moitié moins que les 4/20 dollars d'Opus 5.5. Les lectures de cache coûtent les mêmes 0,20 dollar que chez Opus, si bien que les sessions de code très dépendantes du cache économisent moins que ne le suggère le prix affiché. Les requêtes par lots bénéficient de 50 % de réduction.

04

Le Verdict

Claude Sonnet 5.5 est le modèle à laisser tourner pour l’ingénierie du quotidien : bugs bien délimités, nouvelles fonctionnalités, migrations et travail front-end, en effort medium ou high, là où il est rapide et économique. Il se classe juste derrière GPT-6 Astra et Opus 5.5 parce que son meilleur score indépendant en terminal est obtenu en effort max, précisément là où il brûle le plus de tokens et où sa qualité d’intégration baisse. Restez sous max et confiez les questions d’architecture ouvertes à Opus 5.5.

05

Foire aux questions