Classé #2 Programmation — L'IA qui écrit du code de production
Anthropic

Claude Opus 5

Le codeur frontière praticable : Opus 5 associe le jugement de Fable au prix d'Opus et à une vérification particulièrement patiente. Il prend notre #2 grâce à sa tête sur Frontier-Bench, sa quasi-parité avec Fable 5 sur CursorBench et un prix par token divisé par deux.

Mis à jour 25 juillet 2026 Agentic CodingFrontier-Bench SOTARoot-Cause Debugging
9.9sur 10
Site officiel
Idéal pour

Le codeur frontière praticable : Opus 5 associe le jugement de Fable au prix d'Opus et à une vérification particulièrement patiente. Il prend notre #2 grâce à sa tête sur Frontier-Bench, sa quasi-parité avec Fable 5 sur CursorBench et un prix par token divisé par deux.

Pourquoi ça Gagne

43,3 % sur Frontier-Bench v0.1, devant GPT-5.6 Sol à 34,4 % et Fable 5 à 33,7 %. À effort max, il reste à 0,5 point du sommet de Fable sur CursorBench 3.2 pour la moitié du coût par tâche. DeepSWE 68,8 %, FrontierCode 53,4 %, contexte 1M, sortie 128k, prix 5/25 $.

À surveiller

Pas de règne absolu : Sol mène DeepSWE et Terminal-Bench et termine les tâches plus vite et à moindre coût dans le comparatif actuel d'Artificial Analysis, même si les deux systèmes obtiennent 67 au Coding Agent Index. Fable garde de minuscules avances sur FrontierCode et CursorBench ; les données indépendantes restent jeunes et max peut être verbeux.

01

Ce que c'est réellement

Imaginez deux artisans devant une tache d’humidité. Le premier repeint par-dessus et clôt l’intervention. Le second remonte jusqu’au tuyau qui fuit, le répare, puis vérifie la pièce voisine. Claude Opus 5 est conçu pour programmer comme le second artisan.

Voilà pourquoi 43,3 % sur Frontier-Bench v0.1 est le chiffre central. L’évaluation demande de résoudre des problèmes d’ingénierie inconnus avec terminal et outils. Dans le tableau d’Anthropic, GPT-5.6 Sol obtient 34,4 %, Fable 5 33,7 % et Opus 4.8 21,1 %. Opus 5 ne remplace pas simplement 4.8 : il double presque son résultat.

Un exemple raconte bien son tempérament. Pour reconstruire une pièce mécanique depuis un dessin qu’il ne pouvait pas voir directement, il a écrit sa propre chaîne de vision, extrait la géométrie des pixels et créé la pièce dans FreeCAD. Ailleurs, il a trouvé la cause racine d’un bug et un cas limite oublié par le correctif communautaire. Ce sont des exemples fournisseur, pas des lois de la physique, mais l’objectif est net : enquêter jusqu’à ce que les preuves concordent.

Pourquoi il passe devant Fable 5

Fable gagne encore quelques photos-finish : 53,5 % contre 53,4 % sur FrontierCode et environ un demi-point de plus au maximum de CursorBench. Mais un classement est une décision d’achat, pas un musée de décimales. Opus 5 coûte 5/25 $ par million de tokens, exactement moitié moins que Fable, n’impose pas de rétention générale et utilise des classificateurs moins restrictifs.

Artificial Analysis apporte le premier signal indépendant : 61 et première place à max. High et xhigh obtiennent 59 et 60. L’avertissement est tout aussi utile : max a généré énormément de tokens. Un modèle à moitié prix peut encore produire une facture entière s’il écrit un roman pour réparer un bouton.

Pourquoi il manque de peu le #1

GPT-5.6 Sol mène DeepSWE v1.1 à 72,7 %, devant Fable à 69,7 % et Opus 5 à 68,8 %. Pourtant, dans le comparatif direct actuel d’Artificial Analysis, Claude Code avec Opus 5 et Codex avec GPT-5.6 Sol obtiennent tous deux 67 au Coding Agent Index général. Le détail est plus utile que l’égalité : GPT gagne DeepSWE et Terminal-Bench et termine les tâches plus vite et à moindre coût ; Opus gagne l’épreuve de compréhension du dépôt. GPT-5.6 prend donc la première place au départage sur l’efficacité et le terminal, non parce qu’il code nettement mieux qu’Opus 5 partout.

La bonne répartition : Opus 5 pour les bugs vagues, les causes racines, les gros changements multi-fichiers et la vérification visuelle ; Sol pour le marathon terminal le plus dur ; Fable seulement quand sa minuscule avance vaut un tarif double.

La migration conserve contexte 1M, sortie 128k, vision, PDF, cache, batch et outils Claude. La réflexion adaptative démarre par défaut. Seuls web fetch et Priority Tier manquent. Opus 5 remplace totalement Opus 4.8 et rend Fable difficile à justifier pour le volume quotidien.

02

Forces et limites honnêtes

Points Forts

  • Premier sur Frontier-Bench : 43,3 %, contre 34,4 % pour Sol, 33,7 % pour Fable et 21,1 % pour Opus 4.8. Le test récompense un agent capable d’habiter le terminal, d’utiliser des outils et de finir une tâche inconnue.
  • Vérifier avant de fêter : Opus 5 a trouvé des causes racines, créé son banc de test faute de flux réel et contrôlé des interfaces sur ordinateur et mobile avant de les déclarer terminées.
  • Presque Fable à moitié prix : À max, seulement 0,5 point de retard sur CursorBench, avec des tokens à 5/25 $ au lieu de 10/50 $.
  • Le dépôt tient sur le bureau : Contexte 1M par défaut, sortie 128k, et stabilité annoncée des instructions, outils et raisonnements sur de longs contextes.
  • Disponible là où les équipes travaillent : claude-opus-5 dans Claude Code, l’API, Bedrock, Vertex AI et Microsoft Foundry ; mode rapide environ 2,5× plus vite au double du tarif.

Limites Honnêtes

  • GPT-5.6 possède encore des couloirs majeurs : 68,8 % sur DeepSWE contre 72,7 % pour Sol. Dans le face-à-face d’Artificial Analysis, le score global est de 67 à 67, mais GPT-5.6 gagne DeepSWE et Terminal-Bench et finit les tâches plus vite et à moindre coût. Cette efficacité tranche de justesse notre #1.
  • Fable garde des pics étroits : 53,5 % contre 53,4 % sur FrontierCode et un maximum CursorBench légèrement supérieur.
  • Max peut avaler l’économie : Artificial Analysis a mesuré une forte verbosité. Un token moins cher ne sert à rien si l’agent en consomme deux fois plus.
  • Deux accrocs de migration : Pas de web fetch ni Priority Tier ; réflexion active par défaut, paramètres d’échantillonnage personnalisés refusés, budgets et prompts à retester.
  • Les frontières de sécurité restent visibles : Recherche de failles source autorisée, mais pentest, génération d’exploits et scan binaire bloqués hors programmes approuvés.
03

Aperçu des Benchmarks

Frontier-Bench v0.1 — 43,3 % (#1)

Exécution Anthropic avec mini-SWE-agent et cinq essais par tâche ; devant Sol (34,4 %) et Fable 5 (33,7 %).

CursorBench 3.2 — à 0,5 point de Fable 5

Quasi-parité à max pour la moitié du coût ; Cursor rappelle que de petits écarts peuvent ne pas être significatifs.

DeepSWE v1.1 — 68,8 %

Fort sur les dépôts longs, derrière Fable 5 (69,7 %) et Sol (72,7 %).

FrontierCode 1.1 Main — 53,4 %

Égalité pratique avec Fable 5 (53,5 %) et avance sur Sol (47,5 %).

Artificial Analysis Intelligence Index — 61 (#1)

Premier signal indépendant sur neuf évaluations ; il confirme la capacité et avertit aussi sur les tokens.

04

Le Verdict

Claude Opus 5 est notre #2 en code : devant Fable 5 et pratiquement à égalité avec GPT-5.6 en capacité générale. Opus gagne Frontier-Bench et le test de compréhension des dépôts, frôle les meilleurs résultats de Fable et coûte moitié moins que Fable. GPT-5.6 remporte notre départage serré grâce à DeepSWE, Terminal-Bench et une exécution plus rapide et moins chère. Commencez par Opus 5 pour un travail flou, multi-fichiers, où jugement et vérification comptent.

05

Foire aux questions