Classé #1 Écosystème du quotidien — Les assistants IA leaders
Anthropic

Claude — Opus 5

Le nouveau leader de l'intelligence quotidienne : Opus 5 apporte un jugement proche de Fable dans un modèle réellement exploitable à grande échelle. Il mène les premiers tests indépendants, coûte moitié moins que Fable 5 et reste largement disponible.

Mis à jour 25 juillet 2026 Knowledge Work SOTA1M ContextReasoning
9.9sur 10
Site officiel
Idéal pour

Le nouveau leader de l'intelligence quotidienne : Opus 5 apporte un jugement proche de Fable dans un modèle réellement exploitable à grande échelle. Il mène les premiers tests indépendants, coûte moitié moins que Fable 5 et reste largement disponible.

Pourquoi ça Gagne

GDPval-AA v2 Elo 1861, ARC-AGI-3 30,2 %, BrowseComp 90,8 %, OSWorld 2.0 70,6 %, AutomationBench 26,0 % et HLE avec outils 64,7 %. Artificial Analysis donne 61 et #1 à max. Contexte 1M, sortie 128k, 5/25 $, sans rétention générale.

À surveiller

Couronne provisoire : moins de 48 heures de données indépendantes. Fable gagne des tests spécialistes, GPT-5.6 garde le plus grand écosystème grand public, Claude ne génère pas d'images. Max est lent et verbeux ; les quotas des offres comptent.

01

Ce que c'est réellement

Beaucoup de chatbots ressemblent à un stagiaire brillant un lundi sous pression : rapides, enthousiastes et parfaitement capables de livrer un tableur impeccable dont le total général est discrètement faux. Claude Opus 5 ressemble davantage au collègue qui revérifie les formules avant de cliquer sur « Envoyer ».

Ce jugement l’envoie directement au #1 quotidien. Le tableau d’Anthropic lui donne 1861 Elo sur GDPval-AA v2, une évaluation de tâches professionnelles utiles. Fable 5 obtient 1747, GPT-5.6 Sol 1736, Opus 4.8 1593. Box rapporte 8 % d’amélioration globale face à 4.8, davantage en analyse et due diligence. Un client financier a vu neuf points de précision en plus, moins d’étapes et 60 % de temps en moins. Ce sont des témoignages précoces, mais tous dessinent une même forme : davantage de soin, moins de tours de manège.

Plus qu’une machine à écrire cultivée

Opus 5 atteint 70,6 % sur OSWorld 2.0, où il faut réellement utiliser un ordinateur. Sur AutomationBench, il obtient 26,0 %, environ une fois et demie le résultat suivant. Zapier rapporte qu’Opus 5 a mené jusqu’au bout un processus complet de fidélisation : il a lu les indicateurs de santé des comptes, identifié les clients susceptibles de partir, alerté les responsables de ces comptes et préparé une synthèse. Les modèles précédents n’arrivaient pas au bout de toute cette chaîne.

Le nombre le plus étrange est 30,2 % sur ARC-AGI-3. Le test demande d’apprendre interactivement des problèmes inconnus, davantage comme découvrir les règles d’un jeu que réciter un fait. Sol atteint 7,8 %. Un benchmark n’est pas une âme, mais celui-ci suggère un vrai talent quand les consignes cessent de tenir la main.

Artificial Analysis confirme la direction : 61 et première place à max ; high 59, xhigh 60. On peut acheter davantage de réflexion pour un contrat ou un modèle financier, puis baisser le cadran pour un brouillon ordinaire.

Pourquoi devant Fable 5

Fable reste légèrement meilleur sur HLE sans outils, FrontierCode, CursorBench au maximum et un test juridique. Si votre évaluation privée ressemble à cela, utilisez-le. Mais Fable coûte 10/50 $ ; Opus 5 5/25 $, sans rétention générale et avec des classificateurs moins restrictifs. Fable est le prototype de course ; Opus 5, la voiture de route presque aussi rapide, deux fois moins gourmande et autorisée sur davantage de routes.

GPT-5.6 demeure un formidable système général. ChatGPT unit Work, Codex, images, Sites, applications, navigateur et bureau. Claude ne crée pas d’images et ses quotas peuvent être plus serrés. Le classement dit qu’Opus 5 offre aujourd’hui le meilleur mélange de jugement, d’agence professionnelle, de prix et de disponibilité—pas que tout le monde doit annuler ChatGPT.

L’établi comprend 1M de contexte, 128k de sortie, vision, PDF, fichiers, mémoire, recherche web et ordinateur. Mais les données indépendantes restent jeunes, max peut bavarder, web fetch et Priority Tier manquent. Opus 5 n’est pas Fable bon marché : c’est la meilleure décision quotidienne.

02

Forces et limites honnêtes

Points Forts

  • Le travail intellectuel en tête : 1861 Elo sur GDPval-AA v2, devant Fable 5 (1747) et Sol (1736), avec des gains précoces en finance, droit, tableurs et due diligence.
  • Il agit, pas seulement répond : 70,6 % sur OSWorld 2.0 et 26,0 % sur AutomationBench mènent l’usage logiciel et les workflows métier.
  • Les problèmes nouveaux lui réussissent : 30,2 % sur ARC-AGI-3, presque quatre fois Sol (7,8 %) ; Artificial Analysis le place aussi premier à 61.
  • Qualité Fable sans taxe Fable : 5/25 $, moitié prix, sans exigence générale de conservation et avec des classificateurs moins fréquents.
  • Un vrai poste de travail : Contexte 1M, sortie 128k, vision documentaire, feuilles complexes, présentations, recherche web, fichiers, PDF, mémoire et ordinateur.

Limites Honnêtes

  • Une couronne de semaine de lancement : La plupart des comparaisons unitaires viennent d’Anthropic ; un indice indépendant n’est pas une constitution éternelle.
  • ChatGPT reste la plus grande plateforme : Claude n’a ni image native ni l’ensemble Work, Codex, Sites, plugins, navigateur et bureau.
  • Fable conserve des victoires spécialistes : HLE sans outils, FrontierCode, CursorBench et juridique ; Mythos reste meilleur en cyber offensif et biologie autonome.
  • Max a faim : Forte verbosité et latence xhigh. Comparez le coût de la tâche terminée, pas seulement le tarif du token.
  • Des intégrations demandent des retouches : Pas de web fetch ni Priority Tier, réflexion active, échantillonnage limité et quotas capables d’interrompre un long travail.
03

Aperçu des Benchmarks

GDPval-AA v2 — 1861 Elo (#1)

Devant Fable 5 (1747), Sol (1736) et Opus 4.8 (1593) sur le travail professionnel.

ARC-AGI-3 — 30,2 % (#1)

Résolution interactive nouvelle : presque quatre fois Sol (7,8 %) et bien au-dessus de 4.8 (1,5 %).

OSWorld 2.0 — 70,6 % (#1)

Usage d'applications de bureau, devant Fable 5 (66,1 %) et Sol (62,6 %).

AutomationBench — 26,0 % (#1)

Workflows métier complets, environ 1,5 fois Fable 5 (17,4 %).

Artificial Analysis Intelligence Index — 61 (#1)

Composite indépendant de neuf tests ; high 59, xhigh 60, avec beaucoup de tokens à max.

04

Le Verdict

Claude Opus 5 prend notre #1 quotidien, de peu devant GPT-5.6 et clairement devant Fable 5. Il mène le mélange le plus utile de travail professionnel, problèmes nouveaux, recherche, ordinateur et automatisation, à moitié prix de Fable et avec moins de contraintes.

05

Foire aux questions