Место #3 Программирование — ИИ, который пишет код для продакшена
Anthropic

Claude Fable 5.1

Механизм рассуждений класса Mythos, усовершенствованный для агентного кодирования. Те же веса, что и у ограниченной Mythos 5.1, но оптимизированные со скидкой 75% на кэш, что меняет экономику долгосрочной инженерии. Лучше всего развертывать в Claude Code, где его оценка 70 в AA Coding Agent доминирует в этой области.

ReasoningLong-ContextAgentic
Лучше всего для

Механизм рассуждений класса Mythos, усовершенствованный для агентного кодирования. Те же веса, что и у ограниченной Mythos 5.1, но оптимизированные со скидкой 75% на кэш, что меняет экономику долгосрочной инженерии. Лучше всего развертывать в Claude Code, где его оценка 70 в AA Coding Agent доминирует в этой области.

Почему он побеждает

AA Coding Agent 70 (внутри Claude Code). CursorBench 3.2 73.4%. FrontierSWE v2 0.57. Terminal-Bench 4.0 55.8%. Чтение из кэша снижено на 75% до $0.25/МТ, разблокируя глубокий поиск по репозиториям.

Обратите внимание

Максимальное усилие может ухудшить производительность программной инженерии из-за чрезмерного редактирования (среднее усилие превосходит максимальное на FrontierCode). Оценка DeepSWE 1.1 упала до 67.4% из-за чрезмерной реализации. Высокая базовая стоимость ($10/$50) быстро исчерпывает лимиты на холодных кэшах.

01

Что это на самом деле

Когда был запущен Fable 5, он доказал, что архитектура рассуждений класса Mythos может доминировать в тестах программной инженерии, если дать ей достаточно времени на обдумывание. Claude Fable 5.1 не изобретает велосипед; он скорее совершенствует экономику и интеграцию этого процесса рассуждений. Объединив те же веса, что и строго ограниченная Mythos 5.1, с огромной скидкой в 75% на чтение из кэша, Anthropic превратил невероятно дорогого долгосрочного агента в практичный инструмент для глубокой работы с репозиториями.

В правильной обвязке Fable 5.1 практически не имеет равных. Внутри Claude Code он набирает 70 баллов в рейтинге Artificial Analysis Coding Agent, утверждая себя как главного автономного помощника. Он поднимает планку в CursorBench 3.2 до 73.4% и подскакивает до 55.8% в Terminal-Bench 4.0 — масштабное улучшение по сравнению с 42.0% у Fable 5. В FrontierSWE v2, который измеряет выполнение инженерных задач без ограничений, его результат 0.57 комфортно превосходит Opus 5 (0.52) и оставляет конкурентов, таких как Astra Sol (0.32), далеко позади. Опытные пользователи, особенно те, кто работает со сложными кодовыми базами в стиле Jane Street, отмечают, что Fable 5.1 отлично справляется с сохранением связности в запутанных трассах выполнения из 40 файлов, не теряя нити рассуждений.

Однако постоянно активное адаптивное мышление Fable 5.1 сопровождается важной оговоркой: больше усилий может фактически ухудшить производительность в программной инженерии. Данные системной карты подтверждают, что на FrontierCode «среднее» усилие (50.9%) превосходит «максимальное» (50.3%). Это происходит потому, что при максимальном усилии Fable 5.1 имеет тенденцию к чрезмерной инженерии решений — внося побочные изменения в файлы, добавляя ненужную документацию и проектируя сложные CI-задачи там, где требовалось простое исправление бага. Из-за этой чрезмерной реализации его оценка в DeepSWE 1.1 немного снизилась до 67.4%. Чтобы получить от Fable 5.1 максимум, вы должны ограничивать его; привяжите его к средним усилиям для стандартных задач и используйте максимальные усилия только тогда, когда у вас уже есть надежные тесты, направляющие его рассуждения.

Эксплуатационные расходы также требуют тщательного управления. Хотя цена чтения из кэша в $0.25/МТ является откровением, Fable 5.1 печально известен своей многословностью, генерируя примерно в 1.7 раза больше токенов, чем его предшественник. Пользователи MineBench сообщили, что затраты выросли в 3 раза, а задержка удвоилась по сравнению с Fable 5. Кроме того, базовая цена остается $10/$50 за миллион токенов; загрузка огромного репозитория в холодный кэш быстро истощит ваши лимиты использования Claude. А поскольку он использует стандартные классификаторы безопасности, задачи, затрагивающие наступательную безопасность или разработку двойного назначения, будут молча перенаправлены на Opus.

Claude Fable 5.1 — это не та модель, которую вы хотите использовать для автозаполнения каждой строки вашего React-компонента. Astra лидирует в использовании компьютера и автоматизации браузера, а Opus 5 значительно дешевле для повседневного кодирования со средними усилиями. Но когда вы сталкиваетесь с глубоко укоренившимся архитектурным багом, вам нужен планировщик уровня Senior, или вам требуется модель, способная синтезировать огромный репозиторий в течение многочасовой сессии — Fable 5.1 является идеальным инструментом для этой битвы.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Чемпион Claude Code: При использовании в собственном Claude Code от Anthropic Fable 5.1 достигает оценки 70 в Artificial Analysis Coding Agent, превосходя как своего предшественника, так и альтернативы на базе Codex.
  • Мастерство в CursorBench и Terminal: Набрал 73.4% в CursorBench 3.2 и 55.8% в Terminal-Bench 4.0, укрепляя свои позиции как первоклассный агент для задач глубоко интегрированных IDE.
  • Экономика кэша для SWE: Снижение цены на чтение из кэша на 75% ($0.25/МТ) делает итеративную отладку и поиск с длинным контекстом в масштабах всего репозитория экономически целесообразными для повседневной разработки.
  • Лидер FrontierSWE: Достигает 0.57 в FrontierSWE v2, демонстрируя превосходные способности в решении сложных, неограниченных задач программной инженерии по сравнению с Opus 5 (0.52).
  • Выносливость в стиле Jane Street: Опытные пользователи сообщают, что Fable 5.1 решает более сложные проблемы с кодированием, чем Opus 5, и, что критически важно, остается читаемым и связным на протяжении длинных трасс выполнения, затрагивающих несколько файлов.

Честные ограничения

  • Ловушка чрезмерного редактирования: Больше усилий не означает лучший код. Тесты FrontierCode показывают, что «среднее» усилие (50.9%) превосходит «максимальное» (50.3%), потому что модель имеет тенденцию вносить побочные изменения в файлы и переусложнять решения.
  • Жажда токенов и задержка: Модель печально известна своей многословностью. Пользователи MineBench отметили примерно в 3 раза большую стоимость и в 2 раза большую задержку по сравнению с Fable 5, потому что модель генерирует в среднем в ~1.7 раза больше токенов.
  • Astra выигрывает войны ОС/Браузеров: В то время как Fable 5.1 великолепен в чистом кодировании, он отстает от Astra в задачах OSWorld 2.0 и использовании компьютера, что делает его менее идеальным для сквозной автоматизации браузера.
  • Лимиты холодного кэша: Цена холодного чтения в $10/МТ означает, что загрузка огромного репозитория без предварительного прогрева кэша быстро исчерпает лимиты использования Claude и бюджеты API.
  • Вмешательство классификаторов безопасности: Он может находить уязвимости, но не будет писать эксплойты. Законные исследования в области наступательной безопасности или задачи двойного назначения будут автоматически направлены к Opus.
03

Результаты тестов

AA Coding Agent — 70

Достигнуто в среде Claude Code, что утверждает его как ведущего помощника по агентному кодированию.

CursorBench 3.2 — 73.4%

Значительное улучшение по сравнению с Fable 5 (70.5%), доказывающее его ценность в задачах IDE с длинным горизонтом планирования.

FrontierSWE v2 — 0.57

Опережает Opus 5 (0.52) и Astra Sol (0.32) в задачах программной инженерии без ограничений.

Terminal-Bench 4.0 — 55.8%

Огромный скачок с 42.0% у Fable 5, хотя и отстает от неограниченной Mythos 5.1 (60.9%).

04

Вердикт

Claude Fable 5.1 — это скальпель, который иногда пытается быть бензопилой. В тестах, которые имеют значение для агентного кодирования — CursorBench, FrontierSWE и AA Coding Agent — он является неоспоримым тяжеловесом. Скидка 75% на чтение из кэша впервые делает длительную работу с репозиториями экономически жизнеспособной. Но его тенденция к чрезмерной реализации при максимальных усилиях, в сочетании со значительной жаждой токенов, означает, что для блестящей работы ему требуется дисциплинированный промпт и обвязка (например, Claude Code). Совет Anthropic остается в силе: используйте Opus 5 для повседневной работы со средними усилиями, но когда вам нужен старший ревьюер, планировщик или у вас есть сложный баг с уже написанными тестами — вызывайте Fable 5.1.