Imaginez deux menuisiers. Le premier est le maître qu’on appelle quand une maison a besoin d’un nouvel escalier et que personne n’en a encore dessiné les plans. Le second est l’artisan régulier capable de poser quarante portes en une semaine, toutes parfaitement d’aplomb.
L’essentiel de la semaine d’une équipe logicielle, ce sont des portes, pas des escaliers : un test qui échoue, un formulaire qui a besoin d’un nouveau champ, une API qui a changé de nom. Claude Sonnet 5.5 est fait pour les portes.
Anthropic l’a lancé le 28 septembre 2026, comme deuxième modèle de la famille Claude 5.5, une semaine après Opus 5.5. Il garde le prix de Sonnet 5 : 2 dollars par million de tokens en entrée et 10 dollars par million en sortie, soit la moitié d’Opus 5.5. Selon Anthropic, il est plus de 30 % plus rapide que Sonnet 5 et coûte jusqu’à 30 % de moins par tâche, parce qu’il termine en moins d’étapes.
Les chiffres indépendants
Pour les agents de programmation, le test auquel nous faisons le plus confiance est Terminal-Bench 4.0 : de longues tâches en plusieurs étapes dans une vraie ligne de commande, où le modèle doit installer des outils, les lancer, lire les erreurs et recommencer.
Artificial Analysis l’a fait tourner de façon indépendante en septembre 2026. Sonnet 5.5 a obtenu 64 %, un peu devant Opus 5.5 et GPT-6 Astra, autour de 60 % chacun. L’exécution d’Anthropic est plus haute, à 70,6 %, mais les environnements de test des éditeurs ont tendance à flatter leurs propres modèles : le chiffre indépendant de 64 % est celui à retenir. Quoi qu’il en soit, c’est un bond énorme par rapport à Sonnet 5, qui obtenait 10,3 % dans le tableau d’Anthropic.
Une seconde source indépendante confirme l’essentiel. Vals AI place Sonnet 5.5 deuxième sur 66 modèles dans son index, à 69,22 %, à moins d’un demi-point d’Opus 5.5, pour environ deux tiers du coût par test. Il prend la première place de deux classements de programmation : Vibe Code Bench (créer de petites applications à partir d’une description), à 92,39 %, et Code Migration, à 69,83 %.
Ce qu’ajoutent les tests d’Anthropic
Le tableau de lancement d’Anthropic complète le tableau :
- FrontierCode v1.1, qui se demande si une modification de code pourrait être intégrée sans qu’un humain y touche : 52,1 % en effort xhigh. Opus 5.5 obtient 54,4 % et GPT-6 Sol 49,3 %.
- CursorBench 4.0, construit à partir de vraies sessions dans l’éditeur Cursor : 55,5 %, environ deux points derrière Opus 5.5 et loin devant les 34,1 % de Sonnet 5.
Le plus instructif, ce sont les graphiques de coût, qui placent le score de chaque modèle face à son coût par tâche, pour chaque niveau d’effort. Deux constats ressortent. En effort High, le défaut de l’API, Sonnet 5.5 égale le meilleur score FrontierCode de GPT-6 Sol pour environ un cinquième du coût par tâche. Et en effort Medium, le défaut de Claude Code, il dépasse le meilleur score Terminal-Bench de Sonnet 5 pour moins d’un dixième du coût.
Les premiers testeurs disent la même chose avec des mots plus simples. Lovable a constaté environ deux fois moins de commandes shell par tâche. Slack a mesuré environ 14 % de tokens de sortie en moins qu’avec Sonnet 5. Unity, qui ne compte une tâche comme terminée que si la modification fonctionne réellement à l’exécution, indique que la majorité du travail de Sonnet 5.5 a passé ce contrôle.
Le curseur d’effort, et pourquoi le cran le plus haut se retourne contre vous
Comme Opus 5.5, Sonnet 5.5 dispose d’un curseur d’effort à cinq crans : low, medium, high, xhigh et max. Les crans élevés laissent le modèle réfléchir plus longtemps et vérifier davantage son travail. On s’attendrait à ce que max soit le meilleur. Avec Sonnet 5.5, ce n’est souvent pas le cas.
Artificial Analysis a mesuré toute la gamme sur son Intelligence Index :
| Effort | Intelligence Index | Coût par tâche |
|---|---|---|
| Low | 36 | 0,41 $ |
| Medium | 41 | 0,59 $ |
| High | 47 | 1,08 $ |
| Xhigh | 52 | 2,74 $ |
| Max | 56 | 7,60 $ |
Passer de xhigh à max rapporte quatre points de plus pour presque trois fois le coût. En max, Sonnet 5.5 a écrit environ 193 000 tokens de sortie par tâche. C’est le chiffre le plus élevé jamais mesuré par Artificial Analysis : environ 60 % de plus qu’Opus 5.5 en max, et environ sept fois GPT-6 Astra.
Pire encore, plus d’effort ne veut pas toujours dire meilleur code. Sur FrontierCode, Sonnet 5.5 obtient 52,1 % en xhigh mais 46,2 % en max. Anthropic en donne la raison dans une note de bas de page : en max, le modèle lançait plus souvent la routine de revue de code de Claude Code, qui répartit la relecture entre de nombreux agents auxiliaires. Dans certains cas, cela a provoqué un dépassement de délai ou des modifications en trop, et FrontierCode pénalise les changements que personne n’a demandés.
La leçon est simple : considérez xhigh comme le plafond. Si une tâche échoue encore en xhigh, la meilleure étape suivante est généralement Opus 5.5, pas max.
Le bémol honnête
Opus reste l’architecte. Anthropic le dit franchement : sur plusieurs tests, Sonnet 5.5 en max se rapproche d’Opus 5.5, mais dans les tests d’Anthropic comme dans ceux de testeurs externes, Opus 5.5 reste nettement plus fort pour le travail complexe et ouvert qui demande un jugement soutenu. Opus garde aussi la tête sur FrontierCode et CursorBench.
La facture Claude Code ne sera pas divisée par deux. Les agents de programmation relisent sans cesse votre projet, et ces relectures sont facturées comme des lectures de cache, à 0,20 dollar par million de tokens sur Sonnet 5.5 comme sur Opus 5.5. Vous économisez sur les nouvelles entrées et sorties, mais une longue session très dépendante du cache économise moins que le « moitié prix » du titre ne le laisse penser.
Le travail de sécurité est redirigé. Sonnet 5.5 est le premier Sonnet livré avec les protections de cybersécurité qu’Anthropic applique à ses modèles les plus puissants. La correction de bugs ordinaire n’est pas concernée, mais les tâches de sécurité les plus sensibles basculent visiblement vers Sonnet 5, sauf si votre équipe a été approuvée via le Cyber Verification Program d’Anthropic.
La migration demande un peu de travail. Anthropic liste cinq changements incompatibles par rapport à Sonnet 5. L’utilisation forcée d’outils renvoie désormais une erreur, les valeurs de température non standard sont refusées, et le texte entre deux appels d’outils revient dans un autre format. Rien de difficile à corriger, mais ce n’est pas un changement d’une ligne.
Où il trouve sa place
| Si le travail est… | Prenez | Pourquoi |
|---|---|---|
| Un bug, une fonctionnalité ou une migration bien délimités | Claude Sonnet 5.5 | Rapide et économique en effort medium ou high |
| Une architecture ouverte ou un problème que personne n’a cerné | Claude Opus 5.5 | Jugement nettement plus solide, selon Anthropic et les testeurs |
| Du long travail en terminal sans surveillance, au plus bas coût par tâche | GPT-6 Astra | N’utilise qu’une fraction des tokens à son meilleur niveau |
| Finitions front-end, diapositives, petits projets visuels | Claude Sonnet 5.5 | Vrai sens du design et itérations rapides |
Le verdict
Claude Sonnet 5.5 est le modèle que la plupart des développeurs devraient laisser allumé. Il s’occupe des portes, toutes les quarante, vite et pour la moitié du prix par token du modèle phare. Laissez-le en medium ou high, gardez xhigh pour les cas difficiles et, quand la commande se révèle être un escalier, appelez Opus.