Beaucoup de chatbots ressemblent à un stagiaire brillant un lundi sous pression : rapides, enthousiastes et parfaitement capables de livrer un tableur impeccable dont le total général est discrètement faux. Claude Opus 5 ressemble davantage au collègue qui revérifie les formules avant de cliquer sur « Envoyer ».
Ce jugement l’envoie directement au #1 quotidien. Le tableau d’Anthropic lui donne 1861 Elo sur GDPval-AA v2, une évaluation de tâches professionnelles utiles. Fable 5 obtient 1747, GPT-5.6 Sol 1736, Opus 4.8 1593. Box rapporte 8 % d’amélioration globale face à 4.8, davantage en analyse et due diligence. Un client financier a vu neuf points de précision en plus, moins d’étapes et 60 % de temps en moins. Ce sont des témoignages précoces, mais tous dessinent une même forme : davantage de soin, moins de tours de manège.
Plus qu’une machine à écrire cultivée
Opus 5 atteint 70,6 % sur OSWorld 2.0, où il faut réellement utiliser un ordinateur. Sur AutomationBench, il obtient 26,0 %, environ une fois et demie le résultat suivant. Zapier rapporte qu’Opus 5 a mené jusqu’au bout un processus complet de fidélisation : il a lu les indicateurs de santé des comptes, identifié les clients susceptibles de partir, alerté les responsables de ces comptes et préparé une synthèse. Les modèles précédents n’arrivaient pas au bout de toute cette chaîne.
Le nombre le plus étrange est 30,2 % sur ARC-AGI-3. Le test demande d’apprendre interactivement des problèmes inconnus, davantage comme découvrir les règles d’un jeu que réciter un fait. Sol atteint 7,8 %. Un benchmark n’est pas une âme, mais celui-ci suggère un vrai talent quand les consignes cessent de tenir la main.
Les tests indépendants confirment désormais davantage que la seule direction du lancement. Artificial Analysis v4.1.1 attribue à Opus 5 à effort max environ 63, actuellement premier de son Intelligence Index. Le classement exact évolue avec l’évaluation : la version et la date de consultation doivent donc accompagner le score.
Pourquoi devant Fable 5
Fable reste légèrement meilleur à quelques endroits précis : Humanity’s Last Exam sans outils, FrontierCode, le réglage maximal de CursorBench et un test juridique tenu à l’écart. Si votre évaluation privée ressemble à l’un de ces couloirs, utilisez-le. Mais Fable coûte 10 $/50 $ par million de tokens en entrée/sortie. Opus 5 coûte 5 $/25 $, sans exigence générale de conservation des données, et ses classificateurs de sécurité devraient intervenir bien moins souvent.
Voyez Fable comme un prototype de course, et Opus 5 comme la voiture de route presque aussi rapide, deux fois moins chère à faire rouler et autorisée à voyager bien au-delà du circuit. Au quotidien, la voiture de route est la machine la plus utile.
Pourquoi ChatGPT reste dans la conversation
GPT-5.6 demeure un formidable système généraliste. ChatGPT réunit Work, Codex, la génération d’images, Sites, les applications connectées, un navigateur et l’usage de l’ordinateur de bureau dans un immense écosystème. Claude ne crée pas nativement d’images et ses quotas peuvent être plus serrés. Notre classement dit qu’Opus 5 offre aujourd’hui le meilleur mélange de qualité de raisonnement, d’autonomie professionnelle, de prix et de facilité de déploiement; il ne dit pas que tout le monde devrait résilier ChatGPT.
Le matériel de cet établi est conséquent : 1M de tokens de contexte par défaut, une sortie maximale de 128k, la vision pour les graphiques et documents, les PDF, fichiers, la mémoire, la recherche web, les outils et l’usage de l’ordinateur. Le modèle API est claude-opus-5, disponible sur la plateforme d’Anthropic et les principaux clouds. Le mode Fast fonctionne environ 2,5 fois plus vite pour deux fois le prix de base des tokens.
Il existe des réserves. Les données indépendantes restent jeunes. L’effort max peut être verbeux, et xhigh présente une latence notable avant le premier token. Le web fetch de l’API et Priority Tier sont absents au lancement. La bonne habitude consiste à commencer plus bas, vérifier le résultat et n’augmenter l’effort que lorsque le coût d’une erreur dépasse celui de la réflexion.
Opus 5 n’est pas simplement un Fable 5 moins cher. C’est la meilleure décision produit au quotidien. Il remplace Opus 4.8, remporte assez de tests importants pour défier la frontière absolue et rend le jugement soigneux de l’IA abordable pour le travail d’un mardi ordinaire — pas seulement pour le projet assez important pour recevoir un chèque en blanc.