Classé #2 Programmation — L'IA qui écrit du code de production
Anthropic

Claude Opus 5

Le codeur de pointe le mieux étayé par les données, avec une patience inhabituelle pour la vérification. Opus 5 reste notre #2 uniquement parce que ce guide accorde explicitement à GPT-6 Astra le départage sur l'intégration Codex, l'efficacité dans le terminal et l'usage de l'ordinateur, et le coût par tâche terminée.

Mis à jour 29 août 2026 Agentic CodingFrontier-Bench SOTARoot-Cause Debugging
9.9sur 10
Site officiel
Idéal pour

Le codeur de pointe le mieux étayé par les données, avec une patience inhabituelle pour la vérification. Opus 5 reste notre #2 uniquement parce que ce guide accorde explicitement à GPT-6 Astra le départage sur l'intégration Codex, l'efficacité dans le terminal et l'usage de l'ordinateur, et le coût par tâche terminée.

Pourquoi ça Gagne

Les données de la période de lancement de l'indice des agents de code d'Artificial Analysis plaçaient Opus autour de 78,0, juste devant GPT-5.6 Sol à 77,4 ; le tableau a été recalibré au lancement de GPT-6 Astra en septembre (Fable 5.1 vers 70, Astra 67), ces générations de chiffres ne sont donc pas comparables. Le tableau public de Terminal-Bench 3.0 affiche environ 42,7%, tandis que l'Intelligence Index v4.1.1 est proche de 63. Il conserve un contexte de 1M, une sortie de 128k et un tarif de 5 $/25 $.

À surveiller

Son rang #2 est un jugement éditorial sur le produit, et non l'ordre du benchmark en direct. GPT-6 Astra mène toujours Terminal-Bench, DeepSWE et les couloirs scientifique et SRE, tandis que l'effort max d'Opus peut être verbeux et plus lent. Les scores de lancement d'Anthropic et les tableaux publics actuels sont des instantanés liés, mais pas des nombres interchangeables.

01

Ce que c'est réellement

Imaginez deux artisans devant une tache d’humidité. Le premier repeint par-dessus et clôt l’intervention. Le second remonte jusqu’au tuyau qui fuit, le répare, puis vérifie la pièce voisine. Claude Opus 5 est conçu pour programmer comme le second artisan.

Cette évaluation de lancement s’appelle désormais Terminal-Bench 3.0. Anthropic annonçait initialement 43,3%; le tableau public actuel affiche environ 42,7% pour Opus 5 et 34,6% pour la configuration citée de GPT-5.6 Sol. Les instantanés diffèrent légèrement, mais les deux racontent la même chose : Opus est exceptionnellement à l’aise dans un travail inconnu au terminal.

Un exemple raconte bien son tempérament. Pour reconstruire une pièce mécanique depuis un dessin qu’il ne pouvait pas voir directement, il a écrit sa propre chaîne de vision, extrait la géométrie des pixels et créé la pièce dans FreeCAD. Ailleurs, il a trouvé la cause racine d’un bug et un cas limite oublié par le correctif communautaire. Ce sont des exemples fournisseur, pas des lois de la physique, mais l’objectif est net : enquêter jusqu’à ce que les preuves concordent.

Pourquoi il passe devant Fable 5

Fable gagne encore quelques photos-finish : 53,5 % contre 53,4 % sur FrontierCode et environ un demi-point de plus au maximum de CursorBench. Mais un classement est une décision d’achat, pas un musée de décimales. Opus 5 coûte 5/25 $ par million de tokens, exactement moitié moins que Fable, n’impose pas de rétention générale et utilise des classificateurs moins restrictifs.

Le signal indépendant s’est renforcé. Artificial Analysis v4.1.1 donne à Opus 5 environ 63 et la première place sur son Intelligence Index, tandis que son Coding Agent Index est proche de 78,0. La même évaluation conserve son avertissement : l’effort max peut générer énormément de tokens.

Pourquoi il manque de peu le #1

GPT-6 Astra mène DeepSWE v1.1 à 74,1%, juste devant Opus 5 à 73,7% dans les tableaux de septembre, plus Terminal-Bench 4.0 à 57,9% et le meilleur usage d’ordinateur du marché. Artificial Analysis a recalibré son tableau d’agents de code au lancement d’Astra (Fable 5.1 vers 70, Astra 67) : les anciens chiffres de l’ère Opus ne sont pas des cellules comparables. Notre #1 va toujours à Astra au départage sur Codex, l’efficacité et la valeur d’exécution — pas parce qu’il surpasserait clairement Opus en code.

Voici donc comment répartir le travail :

Tâche Meilleur point de départ
Bug vague, recherche de cause racine, modification multifichier, vérification visuelle du frontend Opus 5
Travail lourd dans le terminal où vitesse, coût par tâche terminée et exécution comptent le plus GPT-6 Astra
Tâche de pointe sur CursorBench ou FrontierCode où le budget est secondaire Fable 5
Tickets ordinaires avec un plafond de coût ferme Commencer avec un effort inférieur, puis augmenter

Le chemin de migration est particulièrement clément. Opus 5 conserve 1M de tokens de contexte, une sortie maximale de 128k, la vision, les PDF, la mise en cache des prompts, le traitement par lots et les outils de Claude. La réflexion est adaptative et activée par défaut; l’effort va de low à max. Les prompts existants d’Opus 4.8 devraient généralement fonctionner, mais les développeurs doivent noter que le web fetch de l’API et Priority Tier ne sont pas disponibles au lancement.

La conclusion est simple : Opus 5 remplace entièrement Opus 4.8 et rend Fable 5 plus difficile à justifier pour le volume de production courant. Fable reste le spécialiste coûteux avec quelques avantages étroits. Opus 5 est le modèle que l’on peut confier à davantage d’ingénieurs, sur davantage de tâches et plus longtemps, tout en finançant encore la boucle de vérification qui donne de la valeur à son jugement.

02

Forces et limites honnêtes

Points Forts

  • À la tête de Terminal-Bench 3.0 : le benchmark d’abord présenté sous le nom de Frontier-Bench classe désormais Opus 5 autour de 42,7% sur son tableau public, devant la configuration citée de GPT-5.6 Sol à 34,6%. Il récompense un agent capable de vivre dans un terminal et d’achever un travail d’ingénierie inconnu.
  • Vérifier avant de fêter : dans les exemples d’Anthropic, Opus 5 a trouvé des causes racines qu’un autre modèle n’avait corrigées qu’en surface, créé son propre banc de test faute de flux de données réel et contrôlé des interfaces web sur ordinateur comme sur téléphone avant de les déclarer terminées.
  • Presque Fable pour la moitié du prix des tokens : à effort max, il reste à 0,5 point du meilleur résultat de Fable 5 sur CursorBench 3.2, selon Anthropic, tout en facturant 5 $/25 $ en entrée/sortie au lieu de 10 $/50 $.
  • Un dépôt entier tient sur le bureau : la fenêtre de contexte de 1M de tokens est activée par défaut, la sortie maximale atteint 128k, et Anthropic affirme que le suivi des instructions, l’usage des outils et le raisonnement restent stables sur les longs contextes. C’est important pour les migrations et les enquêtes multifichiers.
  • Disponible là où les équipes travaillent déjà : l’identifiant du modèle est claude-opus-5; il est proposé dans Claude Code et l’API Claude, ainsi que sur Amazon Bedrock, Google Cloud Vertex AI et Microsoft Foundry. Le mode Fast échange un tarif doublé contre une vitesse environ 2,5 fois supérieure.

Limites Honnêtes

  • GPT-6 Astra possède encore des couloirs majeurs : Opus 5 obtient 73,7% sur DeepSWE v1.1, juste derrière les 74,1% d’Astra dans les tableaux de septembre ; Astra mène aussi Terminal-Bench 4.0 à 57,9% en consommant environ un tiers des tokens de Sol. Artificial Analysis a recalibré son tableau de code au lancement d’Astra (Fable 5.1 vers 70, Astra 67), donc les comparaisons d’indice entre époques ne sont pas équivalentes — mais l’intégration Codex et l’efficacité en tokens d’Astra restent notre départage pour le #1.
  • Fable garde des pics étroits : Fable 5 obtient 53,5 % contre 53,4 % pour Opus 5 sur FrontierCode 1.1 Main, et Anthropic décrit Opus 5 comme étant juste en dessous du score maximum de Fable sur CursorBench. De petits écarts ne sont pas des vérités universelles, mais ils ne doivent pas non plus être effacés.
  • L’effort maximal peut avaler l’économie : Les tests indépendants d’Artificial Analysis ont trouvé Opus 5 max très capable mais verbeux. Un token moins cher ne sert à rien si un agent en consomme deux fois plus ; testez différents niveaux d’effort sur vos propres tâches.
  • La migration comporte deux accrocs de plateforme : Web fetch et Priority Tier ne sont pas pris en charge au lancement. La réflexion (Thinking) est activée par défaut, les paramètres d’échantillonnage non standards sont rejetés, et les équipes venant d’anciennes intégrations Claude devraient retester leurs budgets de tokens et leurs prompts.
  • Les frontières de sécurité restent visibles : Opus 5 peut trouver des vulnérabilités dans le code source, mais les classificateurs bloquent les tests d’intrusion (pentesting), la génération d’exploits et l’analyse binaire des vulnérabilités en dehors des programmes approuvés. Les spécialistes défensifs peuvent toujours rencontrer des faux positifs.
03

Aperçu des Benchmarks

Terminal-Bench 3.0 — environ 42,7%

Le résultat public actuel succède à l'exécution de lancement sur Frontier-Bench, donnée à 43,3%. Les détails de l'instantané et du dispositif diffèrent : employez le nom actuel et datez le score.

CursorBench 3.2 — à 0,5 point de Fable 5

Quasi-parité à max pour la moitié du coût ; Cursor rappelle que de petits écarts peuvent ne pas être significatifs.

DeepSWE v1.1 — 68,8 %

Fort sur les dépôts longs, derrière Fable 5 (69,7 %) et Sol (72,7 %).

FrontierCode 1.1 Main — 53,4 %

Égalité pratique avec Fable 5 (53,5 %) et avance sur Sol (47,5 %).

Artificial Analysis Intelligence Index — environ 63 (#1)

Les données indépendantes actuelles de la version 4.1.1 placent Opus 5 à la frontière de l'intelligence générale. Le score de lancement de 61 est désormais obsolète.

04

Le Verdict

Claude Opus 5 est notre #2 en code, même si les données indépendantes générales actuelles le placent de peu au premier rang. C’est volontaire : ce guide accorde à GPT-6 Astra un départage produit pour l’intégration Codex, l’efficacité dans le terminal et l’usage de l’ordinateur, le routage et le coût par tâche terminée. Commencez avec Opus sur les travaux vagues et multifichiers où l’architecture et la vérification comptent ; commencez avec Astra lorsque le débit dans le terminal et le travail de bureau priment. Le classement expose sa pondération au lieu de réécrire le tableau en direct.

05

Foire aux questions