Classé #1 Écosystème du quotidien — Les assistants IA leaders
Anthropic

Claude — Opus 5

Le nouveau leader de l'intelligence quotidienne : Opus 5 apporte un jugement proche de Fable dans un modèle que particuliers et entreprises peuvent réellement utiliser à grande échelle. Il mène les premiers tests indépendants d'intelligence, domine les comparaisons d'Anthropic sur le travail intellectuel et l'usage de l'ordinateur, coûte moitié moins que Fable 5 et reste largement disponible dans Claude, les plateformes cloud et l'API.

Mis à jour 29 août 2026 Knowledge Work SOTA1M ContextReasoning
9.9sur 10
Site officiel
Idéal pour

Le nouveau leader de l'intelligence quotidienne : Opus 5 apporte un jugement proche de Fable dans un modèle que particuliers et entreprises peuvent réellement utiliser à grande échelle. Il mène les premiers tests indépendants d'intelligence, domine les comparaisons d'Anthropic sur le travail intellectuel et l'usage de l'ordinateur, coûte moitié moins que Fable 5 et reste largement disponible dans Claude, les plateformes cloud et l'API.

Pourquoi ça Gagne

GDPval-AA v2 à 1861 Elo au lancement, ARC-AGI-3 à 30,2%, OSWorld 2.0 à 70,6% et Humanity's Last Exam avec outils à 64,7%. Artificial Analysis v4.1.1 attribue désormais à l'effort max environ 63 et la première place générale. Opus offre aussi 1M de contexte, 128k de sortie et un tarif de 5 $/25 $.

À surveiller

Fable 5 gagne toujours certaines évaluations spécialisées, GPT-5.6 conserve le plus vaste écosystème grand public et Opus 5 ne génère pas nativement d'images. L'effort max est lent et verbeux, les valeurs Elo en direct évoluent et les limites d'usage des offres gratuites et payantes de Claude restent importantes.

01

Ce que c'est réellement

Beaucoup de chatbots ressemblent à un stagiaire brillant un lundi sous pression : rapides, enthousiastes et parfaitement capables de livrer un tableur impeccable dont le total général est discrètement faux. Claude Opus 5 ressemble davantage au collègue qui revérifie les formules avant de cliquer sur « Envoyer ».

Ce jugement l’envoie directement au #1 quotidien. Le tableau d’Anthropic lui donne 1861 Elo sur GDPval-AA v2, une évaluation de tâches professionnelles utiles. Fable 5 obtient 1747, GPT-5.6 Sol 1736, Opus 4.8 1593. Box rapporte 8 % d’amélioration globale face à 4.8, davantage en analyse et due diligence. Un client financier a vu neuf points de précision en plus, moins d’étapes et 60 % de temps en moins. Ce sont des témoignages précoces, mais tous dessinent une même forme : davantage de soin, moins de tours de manège.

Plus qu’une machine à écrire cultivée

Opus 5 atteint 70,6 % sur OSWorld 2.0, où il faut réellement utiliser un ordinateur. Sur AutomationBench, il obtient 26,0 %, environ une fois et demie le résultat suivant. Zapier rapporte qu’Opus 5 a mené jusqu’au bout un processus complet de fidélisation : il a lu les indicateurs de santé des comptes, identifié les clients susceptibles de partir, alerté les responsables de ces comptes et préparé une synthèse. Les modèles précédents n’arrivaient pas au bout de toute cette chaîne.

Le nombre le plus étrange est 30,2 % sur ARC-AGI-3. Le test demande d’apprendre interactivement des problèmes inconnus, davantage comme découvrir les règles d’un jeu que réciter un fait. Sol atteint 7,8 %. Un benchmark n’est pas une âme, mais celui-ci suggère un vrai talent quand les consignes cessent de tenir la main.

Les tests indépendants confirment désormais davantage que la seule direction du lancement. Artificial Analysis v4.1.1 attribue à Opus 5 à effort max environ 63, actuellement premier de son Intelligence Index. Le classement exact évolue avec l’évaluation : la version et la date de consultation doivent donc accompagner le score.

Pourquoi devant Fable 5

Fable reste légèrement meilleur à quelques endroits précis : Humanity’s Last Exam sans outils, FrontierCode, le réglage maximal de CursorBench et un test juridique tenu à l’écart. Si votre évaluation privée ressemble à l’un de ces couloirs, utilisez-le. Mais Fable coûte 10 $/50 $ par million de tokens en entrée/sortie. Opus 5 coûte 5 $/25 $, sans exigence générale de conservation des données, et ses classificateurs de sécurité devraient intervenir bien moins souvent.

Voyez Fable comme un prototype de course, et Opus 5 comme la voiture de route presque aussi rapide, deux fois moins chère à faire rouler et autorisée à voyager bien au-delà du circuit. Au quotidien, la voiture de route est la machine la plus utile.

Pourquoi ChatGPT reste dans la conversation

GPT-5.6 demeure un formidable système généraliste. ChatGPT réunit Work, Codex, la génération d’images, Sites, les applications connectées, un navigateur et l’usage de l’ordinateur de bureau dans un immense écosystème. Claude ne crée pas nativement d’images et ses quotas peuvent être plus serrés. Notre classement dit qu’Opus 5 offre aujourd’hui le meilleur mélange de qualité de raisonnement, d’autonomie professionnelle, de prix et de facilité de déploiement; il ne dit pas que tout le monde devrait résilier ChatGPT.

Le matériel de cet établi est conséquent : 1M de tokens de contexte par défaut, une sortie maximale de 128k, la vision pour les graphiques et documents, les PDF, fichiers, la mémoire, la recherche web, les outils et l’usage de l’ordinateur. Le modèle API est claude-opus-5, disponible sur la plateforme d’Anthropic et les principaux clouds. Le mode Fast fonctionne environ 2,5 fois plus vite pour deux fois le prix de base des tokens.

Il existe des réserves. Les données indépendantes restent jeunes. L’effort max peut être verbeux, et xhigh présente une latence notable avant le premier token. Le web fetch de l’API et Priority Tier sont absents au lancement. La bonne habitude consiste à commencer plus bas, vérifier le résultat et n’augmenter l’effort que lorsque le coût d’une erreur dépasse celui de la réflexion.

Opus 5 n’est pas simplement un Fable 5 moins cher. C’est la meilleure décision produit au quotidien. Il remplace Opus 4.8, remporte assez de tests importants pour défier la frontière absolue et rend le jugement soigneux de l’IA abordable pour le travail d’un mardi ordinaire — pas seulement pour le projet assez important pour recevoir un chèque en blanc.

02

Forces et limites honnêtes

Points Forts

  • Le travail intellectuel fait la une : Opus 5 atteint 1861 Elo sur GDPval-AA v2 dans la comparaison de lancement d’Anthropic, devant Fable 5 à 1747 et GPT-5.6 Sol à 1736. Les premiers clients signalent aussi de meilleurs résultats en finance, droit, tableurs et audit préalable.
  • Il peut agir, pas seulement répondre : le modèle obtient 70,6% sur OSWorld 2.0 et 26,0% sur AutomationBench, en tête des modèles comparés. C’est un indice de sa capacité à naviguer dans des logiciels et à accomplir des processus métier, et pas seulement à rédiger un paragraphe brillant.
  • Les problèmes nouveaux sont une vraie force : ses 30,2% sur ARC-AGI-3 représentent presque quatre fois les 7,8% de GPT-5.6 Sol dans la table d’Anthropic. Artificial Analysis place désormais l’effort max en tête de son Intelligence Index général, autour de 63.
  • Une qualité proche de Fable sans la taxe Fable : le tarif API est de 5 $/25 $ par million de tokens en entrée/sortie, soit la moitié de Fable 5. Opus 5 n’impose pas non plus d’exigence générale de conservation des données, contrairement à certains déploiements de Fable.
  • Un véritable espace de travail professionnel : un million de tokens de contexte, 128k en sortie, une bonne vision des documents et graphiques, le travail sur des tableurs multifeuilles, la création de présentations, la recherche web, les fichiers, PDF, la mémoire et l’usage de l’ordinateur le rendent utile bien au-delà du chat.

Limites Honnêtes

  • Une couronne doit toujours être datée : Anthropic a fourni la plupart des comparaisons par tâche, tandis que les valeurs Elo en direct et les versions des composites continuent d’évoluer. La première place d’Artificial Analysis constitue une preuve indépendante solide, pas une constitution éternelle.
  • ChatGPT reste la plus grande plateforme grand public : Claude ne génère pas nativement d’images et n’égale pas l’ensemble formé par ChatGPT, Work, Codex, Sites, les plugins, le navigateur et le bureau. Opus 5 mène notre score qualité-prix; GPT-5.6 peut rester l’abonnement unique le plus simple.
  • Fable conserve des victoires spécialisées : Fable 5 devance de peu Opus sur Humanity’s Last Exam sans outils, FrontierCode, CursorBench et un Legal Agent Benchmark tenu à l’écart; Mythos reste meilleur en cyber offensif et en biologie autonome.
  • L’effort maximal est gourmand : Artificial Analysis a mesuré une forte verbosité à l’effort max, tandis que xhigh était plus lent que la moyenne. Commencez à high ou xhigh seulement lorsque la tâche le mérite, et comparez le coût total d’une tâche terminée plutôt que le simple tarif du token.
  • Certaines intégrations demandent des ajustements : le web fetch de l’API et Priority Tier manquent au lancement. La réflexion est active par défaut, les paramètres d’échantillonnage sont restreints et les quotas Claude peuvent toujours interrompre un long processus grand public.
03

Aperçu des Benchmarks

GDPval-AA v2 — 1861 Elo (#1)

Devant Fable 5 (1747), Sol (1736) et Opus 4.8 (1593) sur le travail professionnel.

ARC-AGI-3 — 30,2 % (#1)

Résolution interactive nouvelle : presque quatre fois Sol (7,8 %) et bien au-dessus de 4.8 (1,5 %).

OSWorld 2.0 — 70,6 % (#1)

Usage d'applications de bureau, devant Fable 5 (66,1 %) et Sol (62,6 %).

AutomationBench — 26,0 % (#1)

Workflows métier complets, environ 1,5 fois Fable 5 (17,4 %).

Artificial Analysis Intelligence Index — environ 63 (#1)

Composite indépendant actuel de la version 4.1.1 à effort max. Le score de lancement de 61 est obsolète; max consomme aussi beaucoup de tokens, donc le choix du niveau d'effort compte.

04

Le Verdict

Claude Opus 5 prend notre #1 en intelligence quotidienne, juste devant GPT-6 Astra et nettement devant Fable 5. Non parce qu’il gagne tous les examens, mais parce qu’il mène le mélange le plus pertinent de travail intellectuel, résolution de problèmes nouveaux, recherche dans le navigateur, usage de l’ordinateur et accomplissement de processus, puis facture moitié moins que Fable avec moins de contraintes de déploiement. Choisissez ChatGPT si un immense écosystème grand public compte avant tout; choisissez Fable seulement pour un sommet étroit où son petit avantage rembourse un prix doublé; choisissez Opus 5 lorsque le travail est ambigu, riche en documents et assez important pour mériter du jugement.

05

Foire aux questions