Место #2 Программирование — ИИ, который пишет код для продакшена
Anthropic

Claude Opus 5

Фронтирный программист, лидирующий по текущим данным и необычно терпеливый при проверке. Opus 5 остаётся нашим #2 только потому, что это руководство явно отдаёт GPT-6 Astra тай-брейк за интеграцию с Codex, эффективность в терминале и владение компьютером, а также стоимость завершённой задачи.

Обновлено 29 августа 2026 Agentic CodingFrontier-Bench SOTARoot-Cause Debugging
Лучше всего для

Фронтирный программист, лидирующий по текущим данным и необычно терпеливый при проверке. Opus 5 остаётся нашим #2 только потому, что это руководство явно отдаёт GPT-6 Astra тай-брейк за интеграцию с Codex, эффективность в терминале и владение компьютером, а также стоимость завершённой задачи.

Почему он побеждает

Данные периода запуска Artificial Analysis по кодовым агентам давали Opus около 78,0 — чуть выше 77,4 у GPT-5.6 Sol; при сентябрьском запуске GPT-6 Astra таблица была пересчитана (Fable 5.1 около 70, Astra 67), так что эти поколения чисел несопоставимы. В публичной таблице Terminal-Bench 3.0 указано около 42,7%, а Intelligence Index v4.1.1 — примерно 63. Сохраняются контекст 1M, вывод 128k и цена $5/$25.

Обратите внимание

Второе место — редакционная оценка продукта, а не порядок в живом рейтинге. GPT-6 Astra всё ещё лидирует в Terminal-Bench, DeepSWE, а также в научной и SRE-дисциплинах, а Opus на max может быть многословным и медленным. Стартовые результаты Anthropic и текущие публичные таблицы — связанные, но не взаимозаменяемые снимки.

01

Что это на самом деле

Представьте двух мастеров, увидевших мокрое пятно на стене. Один быстро закрашивает пятно и закрывает заявку. Другой находит протекающую трубу, устраняет течь и проверяет, не дошла ли вода до соседней комнаты. Claude Opus 5 старается программировать как второй мастер.

Теперь эта запусковая оценка называется Terminal-Bench 3.0. Первоначально Anthropic сообщала 43,3%; в текущей публичной таблице у Opus 5 около 42,7%, а у приведённой конфигурации GPT-5.6 Sol — 34,6%. Снимки немного различаются, но вывод один: Opus необычно хорошо справляется с незнакомой работой в терминале.

Один пример показывает характер модели. Ей поручили восстановить механическую деталь по чертежу, который она не могла просмотреть напрямую. Opus 5 написал собственный конвейер компьютерного зрения, извлек геометрию из пикселей и собрал деталь в FreeCAD. В другой задаче он нашел первопричину бага и крайний случай, пропущенный патчем сообщества. Это примеры поставщика, не законы природы, но цель настройки ясна: исследовать, пока доказательства не сойдутся.

Почему он выше Fable 5

Fable выигрывает несколько фотофинишей: 53,5% против 53,4% в FrontierCode и примерно полпункта в максимальном CursorBench. Но рейтинг — решение о покупке, а не музей десятых долей. Opus 5 стоит $5/$25 за миллион токенов, ровно половину Fable, не требует общего хранения данных и использует менее строгие классификаторы.

Независимый сигнал стал сильнее. Artificial Analysis v4.1.1 даёт Opus 5 примерно 63 и первое место в Intelligence Index, а в Coding Agent Index — около 78,0. Предупреждение остаётся прежним: на max модель способна генерировать очень много токенов.

Почему всё же не #1

GPT-6 Astra лидирует в DeepSWE v1.1 с 74,1%, чуть опережая Opus 5 с 73,7% в сентябрьских таблицах, плюс Terminal-Bench 4.0 с 57,9% и лучшее на рынке владение компьютером. Artificial Analysis пересчитала таблицу кодовых агентов к запуску Astra (Fable 5.1 около 70, Astra 67), так что старые числа эпохи Opus — не сопоставимые ячейки. Наше #1 всё равно получает Astra — по тай-брейку интеграции с Codex, эффективности и ценности исполнения, а не потому, что он явно лучше программирует.

Практическое разделение простое: Opus 5 — для неясных ошибок, поиска первопричины, больших многофайловых изменений и визуальной проверки интерфейса; Sol — для терминальных задач, где особенно важны скорость и стоимость готового результата; Fable — лишь тогда, когда его небольшой выигрыш в узком тесте оправдывает двойную цену.

Переезд сохраняет контекст 1M, вывод 128k, зрение, PDF, кэш, batch и инструменты Claude. Адаптивное мышление включено по умолчанию, effort меняется от low до max. Большинство промптов Opus 4.8 должно перенестись без больших изменений, но на старте в API отсутствуют web fetch и Priority Tier. Opus 5 полностью заменяет Opus 4.8 и делает Fable трудным выбором для обычного производственного объёма.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Лидерство в Terminal-Bench 3.0: бенчмарк, первоначально представленный как Frontier-Bench, теперь показывает для Opus 5 около 42,7% в публичной таблице — выше 34,6% у приведённой конфигурации GPT-5.6 Sol. Он награждает агента, способного жить в терминале и завершать незнакомую инженерную работу.
  • Проверка до фанфар: в примерах Anthropic Opus 5 находил первопричины там, где другая модель исправляла лишь поверхностно, строил собственный тестовый стенд при отсутствии живых данных и проверял веб-интерфейсы на ширине экрана компьютера и телефона до объявления о готовности.
  • Кодинг почти как у Fable за половину цены токенов: при максимальных усилиях (max effort) он уступает всего 0,5 процентных пункта пиковому результату Fable 5 в CursorBench 3.2, согласно Anthropic, в то время как токены ввода и вывода стоят $5/$25 вместо $10/$50.
  • Целый репозиторий помещается на рабочем столе: контекстное окно на 1 млн токенов используется по умолчанию, максимальный вывод составляет 128k, и Anthropic утверждает, что следование инструкциям, использование инструментов и логика остаются стабильными на всём протяжении длинного контекста. Это важно для миграций и исследований множества файлов.
  • Доступен там, где команды уже ведут разработку: идентификатор модели — claude-opus-5; она поставляется в Claude Code и Claude API, с доступностью в Amazon Bedrock, Google Cloud Vertex AI и Microsoft Foundry. Быстрый режим (Fast mode) предлагает примерно в 2,5 раза большую скорость за двойную базовую цену.

Честные ограничения

  • Важные дисциплины остаются за GPT-6 Astra: Opus 5 получает 73,7% на DeepSWE v1.1, чуть уступая 74,1% Astra в сентябрьских таблицах; Astra также ведёт Terminal-Bench 4.0 с 57,9% и расходует примерно треть токенов Sol. Artificial Analysis пересчитала таблицу кода к запуску Astra (Fable 5.1 около 70, Astra 67), поэтому сравнения индекса между эпохами неравноценны — но интеграция Astra с Codex и токен-эффективность остаются нашим тай-брейком для #1.
  • У Fable остаются победы с узким отрывом на пике: Fable 5 набирает 53,5% против 53,4% у Opus 5 на FrontierCode 1.1 Main, и Anthropic описывает результат Opus 5 как чуть ниже максимального балла Fable в CursorBench. Небольшие отрывы — не абсолютная истина, но и стирать их не следует.
  • Максимальные усилия могут съесть экономию: независимые тесты Artificial Analysis показали, что Opus 5 на максимуме очень способен, но многословен. Дешевый токен не поможет, если агент тратит их вдвое больше; проверяйте уровни усилий (effort levels) на своих собственных задачах.
  • Миграция имеет два платформенных нюанса: извлечение веб-страниц (web fetch) и уровень приоритета (Priority Tier) не поддерживаются на старте. Функция размышления (Thinking) включена по умолчанию, нестандартные параметры сэмплинга отклоняются, и командам, переходящим с более старых интеграций Claude, следует заново протестировать бюджеты токенов и промпты.
  • Границы безопасности остаются заметными: Opus 5 может находить уязвимости в исходном коде, но классификаторы блокируют тестирование на проникновение, создание эксплойтов и сканирование уязвимостей на основе бинарных файлов вне одобренных программ. Специалисты по защите по-прежнему могут сталкиваться с ложными срабатываниями.
03

Результаты тестов

Terminal-Bench 3.0 — около 42,7%

Текущий публичный результат следует за ранним запусковым прогоном Frontier-Bench с 43,3%. Снимки и детали обвязки различаются, поэтому используйте современное название и указывайте дату результата.

CursorBench 3.2 — в 0,5 пункта от Fable 5

Почти равенство на max за половину стоимости; Cursor предупреждает, что малые различия могут быть статистически незначимы.

DeepSWE v1.1 — 68,8%

Сильная долгая работа с репозиториями, но ниже Fable 5 (69,7%) и Sol (72,7%).

FrontierCode 1.1 Main — 53,4%

Практическая ничья с Fable 5 (53,5%) и выше Sol (47,5%).

Artificial Analysis Intelligence Index — около 63 (#1)

Текущие независимые данные v4.1.1 ставят Opus 5 на границу широкого интеллекта. Ранний стартовый результат 61 уже устарел.

04

Вердикт

Claude Opus 5 — наша модель #2 для кодинга, хотя текущие широкие независимые данные ставят её чуть выше всех. Это сознательное решение: GPT-6 Astra получает продуктовый тай-брейк за интеграцию с Codex, эффективность в терминале и владение компьютером, маршрутизацию и стоимость завершённой задачи. Начинайте с Opus в неясной многофайловой работе, где важны архитектура и проверка; с Astra — в терминальных задачах на пропускную способность и работе за рабочим столом. Рейтинг показывает свои веса, а не переписывает живую таблицу.

05

Часто задаваемые вопросы