Imaginez deux artisans devant une tache d’humidité. Le premier repeint par-dessus et clôt l’intervention. Le second remonte jusqu’au tuyau qui fuit, le répare, puis vérifie la pièce voisine. Claude Opus 5 est conçu pour programmer comme le second artisan.
Voilà pourquoi 43,3 % sur Frontier-Bench v0.1 est le chiffre central. L’évaluation demande de résoudre des problèmes d’ingénierie inconnus avec terminal et outils. Dans le tableau d’Anthropic, GPT-5.6 Sol obtient 34,4 %, Fable 5 33,7 % et Opus 4.8 21,1 %. Opus 5 ne remplace pas simplement 4.8 : il double presque son résultat.
Un exemple raconte bien son tempérament. Pour reconstruire une pièce mécanique depuis un dessin qu’il ne pouvait pas voir directement, il a écrit sa propre chaîne de vision, extrait la géométrie des pixels et créé la pièce dans FreeCAD. Ailleurs, il a trouvé la cause racine d’un bug et un cas limite oublié par le correctif communautaire. Ce sont des exemples fournisseur, pas des lois de la physique, mais l’objectif est net : enquêter jusqu’à ce que les preuves concordent.
Pourquoi il passe devant Fable 5
Fable gagne encore quelques photos-finish : 53,5 % contre 53,4 % sur FrontierCode et environ un demi-point de plus au maximum de CursorBench. Mais un classement est une décision d’achat, pas un musée de décimales. Opus 5 coûte 5/25 $ par million de tokens, exactement moitié moins que Fable, n’impose pas de rétention générale et utilise des classificateurs moins restrictifs.
Artificial Analysis apporte le premier signal indépendant : 61 et première place à max. High et xhigh obtiennent 59 et 60. L’avertissement est tout aussi utile : max a généré énormément de tokens. Un modèle à moitié prix peut encore produire une facture entière s’il écrit un roman pour réparer un bouton.
Pourquoi il manque de peu le #1
GPT-5.6 Sol mène DeepSWE v1.1 à 72,7 %, devant Fable à 69,7 % et Opus 5 à 68,8 %. Pourtant, dans le comparatif direct actuel d’Artificial Analysis, Claude Code avec Opus 5 et Codex avec GPT-5.6 Sol obtiennent tous deux 67 au Coding Agent Index général. Le détail est plus utile que l’égalité : GPT gagne DeepSWE et Terminal-Bench et termine les tâches plus vite et à moindre coût ; Opus gagne l’épreuve de compréhension du dépôt. GPT-5.6 prend donc la première place au départage sur l’efficacité et le terminal, non parce qu’il code nettement mieux qu’Opus 5 partout.
La bonne répartition : Opus 5 pour les bugs vagues, les causes racines, les gros changements multi-fichiers et la vérification visuelle ; Sol pour le marathon terminal le plus dur ; Fable seulement quand sa minuscule avance vaut un tarif double.
La migration conserve contexte 1M, sortie 128k, vision, PDF, cache, batch et outils Claude. La réflexion adaptative démarre par défaut. Seuls web fetch et Priority Tier manquent. Opus 5 remplace totalement Opus 4.8 et rend Fable difficile à justifier pour le volume quotidien.