Место #2 Кодинг — ИИ, который пишет код для продакшена
Anthropic

Claude Opus 5

Практичный фронтирный программист: Opus 5 сочетает рассудительность Fable с ценой Opus и необычно терпеливой проверкой результата. Он занимает наше #2 благодаря лидерству Frontier-Bench, почти равному Fable 5 CursorBench и вдвое меньшей цене токена.

Обновлено 25 июля 2026 Agentic CodingFrontier-Bench SOTARoot-Cause Debugging
Лучше всего для

Практичный фронтирный программист: Opus 5 сочетает рассудительность Fable с ценой Opus и необычно терпеливой проверкой результата. Он занимает наше #2 благодаря лидерству Frontier-Bench, почти равному Fable 5 CursorBench и вдвое меньшей цене токена.

Почему он побеждает

43,3% на Frontier-Bench v0.1 против 34,4% у GPT-5.6 Sol и 33,7% у Fable 5. На max он отстает от пика Fable в CursorBench 3.2 всего на 0,5 пункта при половине стоимости задачи. DeepSWE 68,8%, FrontierCode 53,4%, контекст 1M, вывод 128k, цена $5/$25.

Обратите внимание

Абсолютной короны нет: Sol ведёт в DeepSWE и Terminal-Bench и в текущем сравнении Artificial Analysis быстрее и дешевле на законченную задачу, хотя общий Coding Agent Index у систем одинаков — 67. Fable едва впереди в FrontierCode и CursorBench. Независимых данных пока мало, а max может быть многословным.

01

Что это на самом деле

Представьте двух мастеров, увидевших мокрое пятно на стене. Один быстро закрашивает пятно и закрывает заявку. Другой находит протекающую трубу, устраняет течь и проверяет, не дошла ли вода до соседней комнаты. Claude Opus 5 старается программировать как второй мастер.

Поэтому главное число релиза — 43,3% на Frontier-Bench v0.1. Тест просит агента решать незнакомые инженерные задачи через терминал и инструменты. В сравнении Anthropic GPT-5.6 Sol набрал 34,4%, Fable 5 — 33,7%, Opus 4.8 — 21,1%. Opus 5 не просто заменил 4.8, а почти удвоил его результат.

Один пример показывает характер модели. Ей поручили восстановить механическую деталь по чертежу, который она не могла просмотреть напрямую. Opus 5 написал собственный конвейер компьютерного зрения, извлек геометрию из пикселей и собрал деталь в FreeCAD. В другой задаче он нашел первопричину бага и крайний случай, пропущенный патчем сообщества. Это примеры поставщика, не законы природы, но цель настройки ясна: исследовать, пока доказательства не сойдутся.

Почему он выше Fable 5

Fable выигрывает несколько фотофинишей: 53,5% против 53,4% в FrontierCode и примерно полпункта в максимальном CursorBench. Но рейтинг — решение о покупке, а не музей десятых долей. Opus 5 стоит $5/$25 за миллион токенов, ровно половину Fable, не требует общего хранения данных и использует менее строгие классификаторы.

Artificial Analysis дает первое независимое подтверждение: 61 и первое место на max. High и xhigh набрали 59 и 60. Есть и предупреждение: max создал очень много токенов. Модель по полцены все равно выставит полный счет, если напишет роман ради починки кнопки.

Почему всё же не #1

GPT-5.6 Sol лидирует в DeepSWE v1.1 с 72,7%; у Fable — 69,7%, у Opus 5 — 68,8%. Но прямое сравнение Artificial Analysis даёт Claude Code с Opus 5 и Codex с GPT-5.6 Sol одинаковые 67 баллов в общем Coding Agent Index. Полезнее посмотреть, из чего сложилась ничья: GPT выигрывает DeepSWE и Terminal-Bench, а также завершает задачи быстрее и дешевле; Opus лучше справляется с тестом на понимание репозитория. Поэтому наше первое место у GPT-5.6 — это победа по скорости, стоимости и терминальным задачам, а не доказательство, что он программирует лучше Opus 5 во всём.

Практическое разделение простое: Opus 5 — для неясных ошибок, поиска первопричины, больших многофайловых изменений и визуальной проверки интерфейса; Sol — для терминальных задач, где особенно важны скорость и стоимость готового результата; Fable — лишь тогда, когда его небольшой выигрыш в узком тесте оправдывает двойную цену.

Переезд сохраняет контекст 1M, вывод 128k, зрение, PDF, кэш, batch и инструменты Claude. Адаптивное мышление включено по умолчанию. Не хватает лишь web fetch и Priority Tier. Opus 5 полностью заменяет Opus 4.8 и делает Fable трудным выбором для обычного производственного объема.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Лидер Frontier-Bench: 43,3% против 34,4% у Sol, 33,7% у Fable и 21,1% у Opus 4.8. Тест награждает агента, который работает в терминале, пользуется инструментами и завершает незнакомую задачу.
  • Проверка до фанфар: Opus 5 искал первопричины, строил собственный тестовый стенд без живых данных и проверял интерфейс на компьютере и телефоне до объявления готовности.
  • Почти Fable за полцены: На max разница CursorBench лишь 0,5 пункта, а токены стоят $5/$25 вместо $10/$50.
  • Репозиторий помещается на столе: Контекст 1M по умолчанию, вывод 128k, стабильные инструкции, инструменты и рассуждение в длинном контексте.
  • Доступен в рабочих средах: claude-opus-5 в Claude Code, API, Bedrock, Vertex AI и Microsoft Foundry; Fast mode примерно в 2,5 раза быстрее по двойной цене.

Честные ограничения

  • Важные дисциплины остаются за GPT-5.6: 68,8% в DeepSWE против 72,7% у Sol. В прямом сравнении Artificial Analysis общий индекс одинаков — 67, но GPT-5.6 лучше в DeepSWE и Terminal-Bench, а задачи завершает быстрее и дешевле. Это и стало нашим узким критерием для #1.
  • У Fable остаются узкие пики: 53,5% против 53,4% FrontierCode и чуть более высокий максимум CursorBench.
  • Max может съесть экономию: Artificial Analysis зафиксировал огромный объем вывода. Дешевый токен не спасает, если агент тратит их вдвое больше.
  • Два нюанса миграции: Нет web fetch и Priority Tier; мышление включено, нестандартный sampling запрещен, бюджеты и промпты нужно перепроверить.
  • Границы безопасности заметны: Поиск уязвимостей исходников разрешен, но пентест, создание эксплойтов и бинарное сканирование вне одобренных программ блокируются.
03

Результаты тестов

Frontier-Bench v0.1 — 43,3% (#1)

Прогон Anthropic с mini-SWE-agent и пятью попытками; впереди Sol (34,4%) и Fable 5 (33,7%).

CursorBench 3.2 — в 0,5 пункта от Fable 5

Почти равенство на max за половину стоимости; Cursor предупреждает, что малые различия могут быть статистически незначимы.

DeepSWE v1.1 — 68,8%

Сильная долгая работа с репозиториями, но ниже Fable 5 (69,7%) и Sol (72,7%).

FrontierCode 1.1 Main — 53,4%

Практическая ничья с Fable 5 (53,5%) и выше Sol (47,5%).

Artificial Analysis Intelligence Index — 61 (#1)

Ранний независимый итог девяти тестов: подтверждает способности и предупреждает о расходе токенов.

04

Вердикт

Claude Opus 5 — наше #2 для программирования: выше Fable 5 и практически на одном уровне с GPT-5.6 по общей способности писать код. Opus выигрывает Frontier-Bench и тест на понимание репозитория, почти повторяет пики Fable и стоит вдвое дешевле него. GPT-5.6 получает первое место по узкому дополнительному критерию: лучшие результаты DeepSWE и Terminal-Bench, более высокая скорость и меньшая стоимость законченной задачи. Opus 5 стоит первым пробовать на неясных многофайловых задачах, где важны рассудительность и проверка результата.

05

Часто задаваемые вопросы