Beaucoup de chatbots ressemblent à un stagiaire brillant un lundi sous pression : rapides, enthousiastes et parfaitement capables de livrer un tableur impeccable dont le total général est discrètement faux. Claude Opus 5 ressemble davantage au collègue qui revérifie les formules avant de cliquer sur « Envoyer ».
Ce jugement l’envoie directement au #1 quotidien. Le tableau d’Anthropic lui donne 1861 Elo sur GDPval-AA v2, une évaluation de tâches professionnelles utiles. Fable 5 obtient 1747, GPT-5.6 Sol 1736, Opus 4.8 1593. Box rapporte 8 % d’amélioration globale face à 4.8, davantage en analyse et due diligence. Un client financier a vu neuf points de précision en plus, moins d’étapes et 60 % de temps en moins. Ce sont des témoignages précoces, mais tous dessinent une même forme : davantage de soin, moins de tours de manège.
Plus qu’une machine à écrire cultivée
Opus 5 atteint 70,6 % sur OSWorld 2.0, où il faut réellement utiliser un ordinateur. Sur AutomationBench, il obtient 26,0 %, environ une fois et demie le résultat suivant. Zapier rapporte qu’Opus 5 a mené jusqu’au bout un processus complet de fidélisation : il a lu les indicateurs de santé des comptes, identifié les clients susceptibles de partir, alerté les responsables de ces comptes et préparé une synthèse. Les modèles précédents n’arrivaient pas au bout de toute cette chaîne.
Le nombre le plus étrange est 30,2 % sur ARC-AGI-3. Le test demande d’apprendre interactivement des problèmes inconnus, davantage comme découvrir les règles d’un jeu que réciter un fait. Sol atteint 7,8 %. Un benchmark n’est pas une âme, mais celui-ci suggère un vrai talent quand les consignes cessent de tenir la main.
Artificial Analysis confirme la direction : 61 et première place à max ; high 59, xhigh 60. On peut acheter davantage de réflexion pour un contrat ou un modèle financier, puis baisser le cadran pour un brouillon ordinaire.
Pourquoi devant Fable 5
Fable reste légèrement meilleur sur HLE sans outils, FrontierCode, CursorBench au maximum et un test juridique. Si votre évaluation privée ressemble à cela, utilisez-le. Mais Fable coûte 10/50 $ ; Opus 5 5/25 $, sans rétention générale et avec des classificateurs moins restrictifs. Fable est le prototype de course ; Opus 5, la voiture de route presque aussi rapide, deux fois moins gourmande et autorisée sur davantage de routes.
GPT-5.6 demeure un formidable système général. ChatGPT unit Work, Codex, images, Sites, applications, navigateur et bureau. Claude ne crée pas d’images et ses quotas peuvent être plus serrés. Le classement dit qu’Opus 5 offre aujourd’hui le meilleur mélange de jugement, d’agence professionnelle, de prix et de disponibilité—pas que tout le monde doit annuler ChatGPT.
L’établi comprend 1M de contexte, 128k de sortie, vision, PDF, fichiers, mémoire, recherche web et ordinateur. Mais les données indépendantes restent jeunes, max peut bavarder, web fetch et Priority Tier manquent. Opus 5 n’est pas Fable bon marché : c’est la meilleure décision quotidienne.