Classé #3 Écosystème du quotidien — Les assistants IA leaders
Anthropic

Claude Fable 5.1

Les mêmes poids que l'exclusif Mythos 5.1, mais avec la couche de sécurité que la plupart des utilisateurs obtiennent réellement. C'est le modèle qu'Anthropic vous conseille d'utiliser lorsque Opus 5, avec un effort élevé, échoue à vos évaluations privées — codage à long terme, recherche de plusieurs heures et documents qui doivent rester cohérents.

ReasoningLong-ContextAgentic
9.8sur 10
Site officiel
Idéal pour

Les mêmes poids que l'exclusif Mythos 5.1, mais avec la couche de sécurité que la plupart des utilisateurs obtiennent réellement. C'est le modèle qu'Anthropic vous conseille d'utiliser lorsque Opus 5, avec un effort élevé, échoue à vos évaluations privées — codage à long terme, recherche de plusieurs heures et documents qui doivent rester cohérents.

Pourquoi ça Gagne

Artificial Analysis Intelligence Index de 66 à l'effort maximum (le plus élevé mesuré au lancement). GDPval-AA v2 1853. Le coût des lectures en cache est réduit de 75 % à 0,25 $/MTok — la véritable évolution des prix. Contexte de 1M, 128k en sortie, pensée adaptative toujours active.

À surveiller

Le prix catalogue reste de 10 $/50 $ — 2× Opus 5. L'effort maximum coûte 3,76 $/tâche contre 2,34 $ pour Opus car il écrit ~1,7× plus de jetons. L'effort maximum peut entraîner une sur-édition. Covered Model (conservation de 30 jours). Pas de génération d'images native.

01

Ce que c'est réellement

Si Opus 5 est le cheval de trait fiable sur lequel vous comptez pour 90 % de votre travail quotidien de connaissance, Fable 5.1 est le spécialiste que vous engagez pour les 10 % restants qui vous empêchent vraiment de dormir. Anthropic ne présente pas ici une toute nouvelle architecture ; Fable 5.1 est une version de mise au point qui resserre les classificateurs du Fable 5 original et, plus important encore, réduit considérablement le coût de la mise en cache du contexte. Il partage les mêmes poids que le Mythos 5.1, très restreint, mais est livré avec la couche de sécurité qui le rend généralement disponible pour le public.

Le saut de capacité est réel, mais il se mesure en endurance plutôt qu’en pics bruts. Fable 5.1 a pris la première place de l’Artificial Analysis Intelligence Index lors de son lancement avec un score de 66 à l’effort maximum, battant Opus 5 (63) et GPT-5.6 Sol (61). Il a également affiché un dominant 1853 au GDPval-AA v2. Mais le changement le plus significatif ne réside pas dans le réseau neuronal — il se trouve sur la page des prix. Alors que les coûts de base des jetons restent à 10 $/50 $, les prix de lecture du cache ont été réduits de 75 % à 0,25 $ par million de jetons. Pour les flux de travail qui dépendent d’une fenêtre de contexte chaude de 1M — comme l’interrogation de bases de code massives ou la synthèse de centaines de documents — cela change fondamentalement l’économie de l’utilisation d’un modèle de raisonnement frontière.

Cependant, utiliser Fable 5.1 n’est pas gratuit. Le modèle dispose d’une pensée adaptative toujours active, ce qui signifie qu’il mâchera un problème jusqu’à ce qu’il soit satisfait. Le résultat est une faim intense de jetons ; Fable 5.1 écrit environ 1,7 fois plus de jetons par tâche que son prédécesseur. Sur Artificial Analysis, l’effort maximum coûte 3,76 $ par tâche contre 2,34 $ pour Opus 5. Et ironiquement, plus d’efforts n’équivaut pas toujours à de meilleurs résultats. La carte du système révèle que l’effort maximum peut conduire à une “sur-édition” — l’ajout de documentation inutile, des modifications de fichiers au passage, ou des tâches CI complexes là où une simple correction aurait suffi.

Il y a aussi les réalités opérationnelles d’un Covered Model. Fable 5.1 conserve vos données pendant 30 jours, sauf si vous avez mis en place des accords Enterprise Frontier Safeguards (EFS) ou Zero Data Retention (ZDR). De plus, les classificateurs de sécurité restent agressifs. Bien qu’il puisse identifier les vulnérabilités dans votre code, il refusera d’écrire des exploits, et les requêtes de recherche biologique complexes déclencheront silencieusement un repli vers le modèle Opus. Et si vous frappez fréquemment l’API avec un contexte froid de 1M, ces lectures froides à 10 $/MTok puniront rapidement vos limites d’utilisation.

Les propres conseils de routage d’Anthropic résument le mieux la place de Fable 5.1 dans l’écosystème : commencez par Opus 5. Mais lorsque Opus échoue à vos évaluations privées — lorsque vous faites face à des recherches de plusieurs heures, des tâches de codage à long horizon ou des documents complexes qui doivent maintenir une cohérence stricte — Fable 5.1 est le modèle de repli le plus performant au monde. C’est le modèle pour lequel vous payez un supplément lorsque faire les choses correctement du premier coup est la seule chose qui compte.

02

Forces et limites honnêtes

Points Forts

  • AA Intelligence Index 66 : Lors de son lancement, Fable 5.1 a pris la première place de l’Artificial Analysis Intelligence Index avec un score de 66 à l’effort maximum, surpassant Opus 5 et GPT-5.6 Sol.
  • Réduction massive sur la lecture du cache : Bien que le prix catalogue reste élevé, les lectures en cache sont réduites de 75 % à 0,25 $/MTok. Pour les flux de travail reposant sur un contexte chaud de 1M, cette réduction de prix change la donne.
  • Pensée adaptative toujours active : Le modèle dispose d’une pensée adaptative toujours active, lui donnant le temps nécessaire pour raisonner sur des problèmes complexes à plusieurs étapes qui font trébucher les modèles à passage unique.
  • Maîtrise à long terme : Avec un contexte d’un million et des limites de sortie de 128k, il gère des tâches de recherche de plusieurs heures et un traitement massif de documents tout en maintenant la cohérence mieux que n’importe quel concurrent.
  • Leader en Intelligence Composite : Malgré l’avance d’Astra dans des catégories spécifiques comme l’utilisation de l’ordinateur et les mathématiques, Fable 5.1 conserve la couronne de l’intelligence composite et du HLE (Human Level Evaluation).

Limites Honnêtes

  • Faim de jetons et coûts plus élevés : Fable 5.1 écrit environ 1,7 fois plus de jetons que Fable 5. Sur Artificial Analysis, l’effort maximum coûte 3,76 $/tâche par rapport aux 2,34 $ d’Opus 5. La réduction sur le cache aide, mais ce n’est pas gratuit.
  • Sur-édition à l’effort maximum : Réfléchir plus n’est pas toujours meilleur. La carte du système révèle que l’effort ‘moyen’ bat souvent le ‘maximum’ en ingénierie logicielle car le maximum ajoute des modifications de fichiers au passage, des documents supplémentaires et des tâches CI inutiles.
  • Restrictions du Covered Model : Fable 5.1 fonctionne comme un Covered Model avec une conservation de 30 jours (sauf EFS/ZDR). Le Mythos 5.1 sans restriction est bloqué et réservé aux accès de confiance.
  • Les classificateurs de sécurité bloquent le double usage : Le modèle peut trouver des vulnérabilités mais n’écrira pas d’exploits. Si vous vous aventurez dans la recherche biologique, le système de sécurité vous redirigera automatiquement vers Opus.
  • Pénalité de cache froid : Les limites d’utilisation de Claude pénalisent les utilisateurs qui chargent fréquemment un contexte froid de 1M. Le prix total de 10 $/MTok s’applique aux lectures froides, épuisant rapidement les limites d’utilisation.
03

Aperçu des Benchmarks

Artificial Analysis Intelligence Index — 66 (Max)

Le plus élevé mesuré au lancement, devant Opus 5 (63) et GPT-5.6 Sol (61).

GDPval-AA v2 — 1853

Surpasse Fable 5 (1723) et Opus 5 (1824).

HLE tools — 65.0%

Prend la tête du peloton en Human Level Evaluation avec des outils, battant Opus 5 (63,6 %) et Astra (57,2 %).

Signal65 PINNACLE — 7 898

276/280 tâches d'agent accomplies ; 2,46 $ par tâche correcte.

04

Le Verdict

Claude Fable 5.1 n’est pas une nouvelle famille — c’est une mise à jour de précision de Fable 5 qui réduit considérablement les coûts de lecture du cache et resserre les classificateurs. Bien que la propre règle d’Anthropic soit de ‘commencer par Opus 5’, Fable 5.1 est le spécialiste poids lourd que vous appelez lorsque Opus échoue. Le score de 66 à l’Artificial Analysis Intelligence Index prouve ses capacités brutes, et la réduction de 75 % sur la lecture du cache rend les flux de travail à contexte long viables. Mais le prix catalogue élevé, la faim de jetons et le routage de sécurité agressif signifient qu’il n’est pas fait pour les discussions quotidiennes. Utilisez-le lorsque le travail exige des recherches de plusieurs heures, un codage complexe ou une génération cohérente sur un contexte d’un million de jetons, et que vous êtes prêt à payer la prime pour l’agent le plus intelligent de la pièce.