Classé #3 Programmation — L'IA qui écrit du code de production
Anthropic

Claude Fable 5.1

Le moteur de raisonnement de classe Mythos raffiné pour le codage par agents. Les mêmes poids que le Mythos 5.1 restreint, mais optimisé avec une réduction de cache de 75 % qui transforme l'économie de l'ingénierie à long terme. Déployé de manière optimale dans Claude Code, où son score AA Coding Agent de 70 domine le terrain.

ReasoningLong-ContextAgentic
9.8sur 10
Site officiel
Idéal pour

Le moteur de raisonnement de classe Mythos raffiné pour le codage par agents. Les mêmes poids que le Mythos 5.1 restreint, mais optimisé avec une réduction de cache de 75 % qui transforme l'économie de l'ingénierie à long terme. Déployé de manière optimale dans Claude Code, où son score AA Coding Agent de 70 domine le terrain.

Pourquoi ça Gagne

AA Coding Agent 70 (dans Claude Code). CursorBench 3.2 73.4%. FrontierSWE v2 0.57. Terminal-Bench 4.0 55.8%. Les lectures de cache sont réduites de 75 % à 0,25 $/MTok, débloquant des recherches approfondies dans les référentiels.

À surveiller

L'effort maximum peut dégrader les performances SWE en raison d'une sur-édition (l'effort moyen bat le maximum sur FrontierCode). Le score DeepSWE 1.1 a chuté à 67,4 % en raison de la sur-implémentation. Le coût de base élevé (10 $/50 $) épuise rapidement les limites sur les caches froids.

01

Ce que c'est réellement

Lorsque Fable 5 a été lancé, il a prouvé qu’une architecture de raisonnement de classe Mythos pouvait dominer les références d’ingénierie logicielle si on lui donnait suffisamment de temps pour réfléchir. Claude Fable 5.1 ne réinvente pas la roue ; il affine plutôt l’économie et l’intégration de ce processus de raisonnement. En combinant les mêmes poids que le Mythos 5.1 hautement restreint avec une remise massive de 75 % sur les lectures de cache, Anthropic a transformé un agent à long horizon d’un coût prohibitif en un outil pratique pour le travail en profondeur sur les référentiels.

Dans le bon harnais, Fable 5.1 est pratiquement inégalé. Au sein de Claude Code, il affiche un score Artificial Analysis Coding Agent de 70, s’établissant comme le premier assistant autonome. Il repousse l’état de l’art sur CursorBench 3.2 à 73,4 % et bondit à 55,8 % sur Terminal-Bench 4.0 — une amélioration massive par rapport aux 42,0 % de Fable 5. Sur FrontierSWE v2, qui mesure l’exécution de l’ingénierie sans contraintes, son score de 0,57 devance confortablement Opus 5 (0,52) et laisse les concurrents comme Astra Sol (0,32) loin derrière. Les utilisateurs expérimentés, en particulier ceux qui naviguent dans des bases de code complexes de style Jane Street, signalent que Fable 5.1 excelle à maintenir la cohérence à travers des traces d’exécution désordonnées de 40 fichiers sans perdre le fil.

Cependant, la pensée adaptative toujours active de Fable 5.1 est accompagnée d’une mise en garde importante : plus d’efforts peuvent en fait dégrader les performances d’ingénierie logicielle. Les données de la carte du système confirment que sur FrontierCode, l’effort “moyen” (50,9 %) surpasse l’effort “maximum” (50,3 %). En effet, à l’effort maximum, Fable 5.1 a tendance à surdimensionner les solutions — en effectuant des modifications de fichiers au passage, en ajoutant de la documentation inutile et en concevant des tâches CI complexes là où une simple correction de bogue était demandée. C’est en raison de cette sur-implémentation que son score DeepSWE 1.1 a légèrement baissé à 67,4 %. Pour tirer le meilleur parti de Fable 5.1, vous devez le contraindre ; fixez-le à un effort moyen pour les tâches standard, et ne déclenchez l’effort maximal que lorsque vous avez déjà des tests robustes en place pour guider son raisonnement.

Les coûts d’exploitation nécessitent également une gestion prudente. Bien que le prix de lecture en cache de 0,25 $/MTok soit une révélation, Fable 5.1 est notoirement verbeux, générant environ 1,7 fois plus de jetons que son prédécesseur. Les utilisateurs de MineBench ont signalé avoir constaté 3 fois le coût et le double de la latence par rapport à Fable 5. De plus, le prix de base reste de 10 $/50 $ par million de jetons ; l’insertion d’un énorme référentiel dans un cache froid épuisera rapidement vos limites d’utilisation de Claude. Et parce qu’il exécute les classificateurs de sécurité standard, les tâches touchant à la sécurité offensive ou au développement à double usage seront silencieusement acheminées vers Opus.

Claude Fable 5.1 n’est pas le modèle que vous souhaitez pour l’auto-complétion de chaque ligne de votre composant React. Astra est le leader de l’utilisation de l’ordinateur et de l’automatisation des navigateurs, et Opus 5 est nettement moins cher pour le codage quotidien à effort moyen. Mais lorsque vous faites face à un bogue architectural profondément enraciné, que vous avez besoin d’un planificateur de niveau senior ou que vous avez besoin d’un modèle capable de synthétiser un référentiel massif au cours d’une session de plusieurs heures, Fable 5.1 est l’outil qu’il vous faut pour le combat.

02

Forces et limites honnêtes

Points Forts

  • Le champion de Claude Code : Lorsqu’il est utilisé dans le propre Claude Code d’Anthropic, Fable 5.1 obtient un score Artificial Analysis Coding Agent de 70, surpassant à la fois son prédécesseur et les alternatives basées sur Codex.
  • Maîtrise de CursorBench et Terminal : Obtient 73,4 % sur CursorBench 3.2 et 55,8 % sur Terminal-Bench 4.0, consolidant sa position en tant qu’agent de premier plan pour les tâches d’IDE profondément intégrées.
  • Économie de cache pour le SWE : La réduction de 75 % du prix de lecture en cache (0,25 $/MTok) rend le débogage itératif et les recherches à long contexte à l’échelle du référentiel économiquement viables pour l’ingénierie quotidienne.
  • Leader sur FrontierSWE : Atteint un 0,57 sur FrontierSWE v2, démontrant une capacité supérieure dans la gestion de tâches complexes d’ingénierie logicielle sans contraintes par rapport à Opus 5 (0,52).
  • Endurance style Jane Street : Les utilisateurs expérimentés rapportent que Fable 5.1 résout des problèmes de codage plus complexes qu’Opus 5 et, de manière cruciale, reste lisible et cohérent sur de longues traces d’exécution multi-fichiers.

Limites Honnêtes

  • Le piège de la sur-édition : Plus d’efforts ne signifie pas un meilleur code. Les tests FrontierCode montrent que l’effort ‘moyen’ (50,9 %) bat le ‘maximum’ (50,3 %) car le modèle a tendance à faire des modifications de fichiers au passage et à surdimensionner les solutions.
  • Faim de jetons et latence : Le modèle est notoirement verbeux. Les utilisateurs de MineBench ont constaté environ 3 fois le coût et 2 fois la latence par rapport à Fable 5, car le modèle génère en moyenne environ 1,7 fois plus de jetons.
  • Astra gagne la guerre des OS/Navigateurs : Bien que Fable 5.1 excelle dans le codage brut, il est en deçà d’Astra dans les tâches d’OSWorld 2.0 et d’utilisation de l’ordinateur, ce qui le rend moins idéal pour l’automatisation du navigateur de bout en bout.
  • Plafonds de cache froid : Le prix de lecture à froid de 10 $/MTok signifie que l’insertion d’un énorme référentiel sans réchauffer le cache épuisera rapidement les limites d’utilisation de Claude et les budgets d’API.
  • Intervention des classificateurs de sécurité : Il peut trouver des vulnérabilités mais n’écrira pas d’exploits. La recherche légitime en matière de sécurité offensive ou les tâches de codage à double usage seront automatiquement acheminées vers Opus.
03

Aperçu des Benchmarks

AA Coding Agent — 70

Obtenu dans l'environnement Claude Code, ce qui l'établit comme le principal assistant de codage agentique.

CursorBench 3.2 — 73.4%

Une solide amélioration par rapport à Fable 5 (70,5 %), prouvant sa valeur dans les tâches d'IDE à long horizon.

FrontierSWE v2 — 0.57

Devance Opus 5 (0,52) et Astra Sol (0,32) dans les défis d'ingénierie logicielle sans contraintes.

Terminal-Bench 4.0 — 55.8%

Saut massif par rapport aux 42,0 % de Fable 5, bien qu'il soit à la traîne du Mythos 5.1 sans restriction (60,9 %).

04

Le Verdict

Claude Fable 5.1 est un scalpel qui essaie parfois d’être une tronçonneuse. Sur les références qui comptent pour le codage agentique — CursorBench, FrontierSWE et AA Coding Agent — c’est un poids lourd indéniable. La réduction de 75 % de la lecture en cache rend le travail sur les référentiels à long horizon viable pour la première fois. Mais sa tendance à sur-implémenter avec un effort élevé, combinée à une faim de jetons importante, signifie qu’il nécessite une invite disciplinée et un harnais (comme Claude Code) pour briller. Le conseil d’Anthropic tient toujours : utilisez Opus 5 pour votre travail quotidien à effort moyen, mais lorsque vous avez besoin d’un réviseur senior, d’un planificador, ou que vous avez un bogue complexe avec des tests déjà écrits, faites appel à Fable 5.1.