Место #2 Программирование — ИИ, который пишет код для продакшена
Anthropic

Claude Opus 5.5

Claude Opus 5.5 — модель для программирования, которую зовут, когда работа большая и запутанная: миграция на сотни тысяч строк, ошибка, проходящая через пять сервисов, старая система, которую уже никто толком не понимает. В собственных бенчмарках Anthropic она опережает GPT-6 Astra; в независимых тестах они идут вровень. Второе место вместо первого — только потому, что Astra выполняет ту же работу в терминале с гораздо меньшим числом токенов.

Обновлено 27 сентября 2026 Agentic CodingTerminal-Bench 4.0FrontierCode 54.4%
Лучше всего для

Claude Opus 5.5 — модель для программирования, которую зовут, когда работа большая и запутанная: миграция на сотни тысяч строк, ошибка, проходящая через пять сервисов, старая система, которую уже никто толком не понимает. В собственных бенчмарках Anthropic она опережает GPT-6 Astra; в независимых тестах они идут вровень. Второе место вместо первого — только потому, что Astra выполняет ту же работу в терминале с гораздо меньшим числом токенов.

Почему он побеждает

Anthropic сообщает о 66,4 % в Terminal-Bench 4.0, 54,4 % в FrontierCode v1.1 и 57,8 % в CursorBench 4.0 — в первых двух это больше, чем у GPT-6 Astra. Независимые тесты Artificial Analysis фиксируют ничью Opus 5.5 и Astra в Terminal-Bench 4.0 — по 59,6 %. Первые тестировщики рассказывают о миграции 680 000 строк меньше чем за день и аудите 200 000 строк меньше чем за три часа. Токены стоят $4/$20, чтение из кэша — $0,20.

Обратите внимание

На максимальном усилии Opus 5.5 многословна: Artificial Analysis насчитала примерно вчетверо больше выходных токенов на задачу, чем у GPT-6 Astra, поэтому по стоимости выполненной задачи первое место у нас остаётся за Astra. Защитные механизмы Anthropic передают большую часть задач по кибербезопасности Opus 4.8, а интенсивные сессии по-прежнему могут упираться в лимиты тарифа.

01

Что это на самом деле

Есть разница между тем, кто пишет код, и тем, кто понимает систему.

Первый видит ошибку undefined is not a function, оборачивает строку в проверку if и идёт дальше. Сбой исчезает. Через три дня ломается что-то другое, там, где никто не ждал.

Второй спрашивает, почему значение оказалось неопределённым. Он прослеживает его назад через сервисы, выясняет, что запись в базу данных завершалась раньше, чем подтверждалось сообщение, и меняет порядок так, чтобы ошибочное состояние вообще не могло возникнуть.

Claude Opus 5.5 — определённо из вторых. Модель вышла 22 сентября 2026 года и занимает второе место в нашем рейтинге программирования — ближе к первому, чем любая модель до неё.

В чём она сильна: большие и запутанные задачи

Истории первых тестировщиков Anthropic похожи друг на друга: огромные задачи, на которые раньше у целой команды уходили недели.

  • Один тестировщик завершил миграцию кода на 680 000 строк меньше чем за день.
  • Другой провёл аудит и исправил кодовую базу на 200 000 строк меньше чем за три часа. Opus 5 на ту же работу понадобилось больше 20 часов и в 2,5 раза больше токенов.
  • Во внутреннем тесте Opus 5.5 и Fable 5.1 переписали с C на Rust HAProxy — широко используемую программу, которая распределяет веб-трафик между серверами, — и обе версии прошли почти все собственные тесты HAProxy. Opus 5.5 справилась за 9,5 часа вместо 12 и на 51 % дешевле.

Это истории от производителя, а не независимые измерения, так что считайте их указанием на направление, а не гарантией. Но закономерность устойчива: чем больше и хаотичнее задача, тем сильнее отрывается Opus 5.5.

Кроме того, она понятно объясняет свои действия. В анонсе Anthropic показано, как модель диагностирует ошибку в биллинге. Вместо стены технических подробностей она начинает с денег: $1,50 из падения выручки у клиента пришлись на изменение тарифа, а остальные $9,92 — на ошибку в конкретном коммите, из-за которой перестало учитываться использование в последний день каждого месяца. Когда агент меняет ваш код, именно такие отчёты не дают ему лукавить.

Бенчмарки: ничья — смотря кто считает

Здесь стоит притормозить: таблицы производителей и независимые тесты рассказывают немного разные истории.

Данные Anthropic (сентябрь 2026 года):

  • Terminal-Bench 4.0 — многошаговая работа в терминале командной строки: у Opus 5.5 66,4 % (±2,6 пункта). У GPT-6 Astra — 57,9 %, эту цифру сообщила OpenAI.
  • FrontierCode v1.1 — проверка, достаточно ли хороши изменения кода для слияния: Opus 5.5 — 54,4 %, Astra — 53,3 %.
  • CursorBench 4.0 — более длинные задачи программирования в редакторе Cursor: Opus 5.5 — 57,8 %, Fable 5.1 — 51,8 %.

Независимые данные: Artificial Analysis сама прогнала Terminal-Bench 4.0 и получила 59,6 % и у Opus 5.5, и у Astra. Полная ничья.

Наше правило — доверять независимым измерениям больше, чем таблицам производителей. По чистым возможностям это ничья. Значит, рейтинг решает что-то другое.

Почему GPT-6 Astra сохраняет первое место

Когда две модели одинаково хороши, мы расставляем их по тому, сколько вам стоит выполненная задача.

Здесь у Astra явное преимущество. На максимальном усилии Artificial Analysis насчитала у Opus 5.5 около 119 000 выходных токенов на задачу против примерно 27 000 у Astra. Токены Opus дешевле ($20 за миллион выходных против $50 у Astra), но их уходит примерно вчетверо больше. Посчитайте — и на пике производительности средняя задача у Astra обходится примерно вдвое дешевле.

У Anthropic есть резонный контраргумент. По её словам, на стандартном уровне усилия Opus 5.5 догоняет Astra в Terminal-Bench примерно за 40 % стоимости, а во FrontierCode обходит её примерно за 20 %. Если независимые тесты это подтвердят, рейтинг изменится. Пока это заявление производителя, и прежде чем поднять модель, мы ждём независимых данных.

Честно об ограничениях

  • Приберегайте максимальное усилие для трудных задач. Если оставить Opus 5.5 на максимуме для рутинных правок, она будет писать длинные рассуждения, за которые платите вы.
  • Задачи по безопасности перенаправляются. Opus 5.5 настолько сильна в кибербезопасности, что Anthropic отправляет большинство таких задач Opus 4.8, если вы не участвуете в Cyber Verification Program. Обычное исправление ошибок не затронуто.
  • Долгие сессии всё ещё упираются в лимиты. Anthropic увеличила пятичасовые лимиты на платных тарифах, но многочасовая работа агента над большим репозиторием всё равно может в них упереться.

Кого нанять

Берите GPT-6 Astra, если у вас очередь чётко поставленных задач и вы хотите закрыть их как можно дешевле.

Берите Claude Opus 5.5, если работа большая, неоднозначная или рискованная: миграция фреймворка, глубокий аудит или ошибка на стыке сервисов. На таких задачах тщательное рассуждение ценнее лаконичного вывода. Это инженер, которому мы доверили бы систему, к которой больше никто не хочет прикасаться.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Создана для больших задач: тестировщики Anthropic выполнили с её помощью миграцию кода на 680 000 строк меньше чем за день и аудит 200 000 строк меньше чем за три часа — Opus 5 на то же потребовалось больше 20 часов и в 2,5 раза больше токенов. Чем крупнее и запутаннее работа, тем больше отрыв.
  • Находит настоящую ошибку: она прослеживает сбой до первопричины, а не заворачивает симптом в try/catch. В примере Anthropic модель объяснила ошибку в биллинге простым языком: что сломалось, какой коммит это сломал и сколько денег было потеряно.
  • Изменения, готовые к слиянию: FrontierCode v1.1 проверяет, достаточно ли хороши изменения кода, чтобы принять их в реальные проекты. В таблице Anthropic у Opus 5.5 — 54,4 %, чуть больше, чем у GPT-6 Astra с 53,3 %.
  • Отчёты, которые действительно читаются: Anthropic переобучила модель писать иначе. Объяснения начинаются с вывода и обходятся без жаргона, поэтому проверять работу агента гораздо быстрее.
  • Её труднее обмануть: по данным Anthropic, в тестах Gray Swan у Opus 5.5 вместе с Fable 5.1 самая низкая доля успешных атак через внедрение инструкций (prompt injection), и она заметно реже прежних моделей совершает трудно обратимые действия. Это важно, когда агент работает в вашем репозитории без присмотра.

Честные ограничения

  • Многословна на максимальном усилии: Artificial Analysis насчитала около 119 000 выходных токенов на задачу при максимальном усилии против примерно 27 000 у GPT-6 Astra. При одинаковом пиковом результате это делает Astra более дешёвой моделью в расчёте на выполненную задачу, несмотря на более высокую цену в прайсе.
  • Пока преобладают данные производителей: громкие 66,4 % в Terminal-Bench — это собственный прогон Anthropic (стандартная ошибка ±2,6 пункта), а 57,9 % у Astra для сравнения взяты у OpenAI. Независимый прогон Artificial Analysis показывает ничью, а не преимущество.
  • Задачи по безопасности перенаправляются: поскольку Opus 5.5 очень сильна в кибербезопасности, большинство таких задач передаётся Opus 4.8, если вы не участвуете в Cyber Verification Program от Anthropic. Обычное исправление ошибок это не затрагивает.
  • Лимиты в долгих сессиях: Anthropic увеличила пятичасовые лимиты на платных тарифах, но многочасовая работа агента над большой кодовой базой всё ещё может в них упереться.
03

Результаты тестов

Terminal-Bench 4.0 — 59,6 %, независимая ничья с Astra (66,4 % по данным производителя)

Сложные многошаговые задачи в терминале командной строки. Artificial Analysis измерила Opus 5.5 и GPT-6 Astra (xhigh) — по 59,6 %. В собственном прогоне Anthropic у Opus 5.5 — 66,4 % (±2,6), у Astra, по данным OpenAI, — 57,9 %.

FrontierCode v1.1 — 54,4 %

Готовы ли изменения кода к принятию в реальные кодовые базы. Таблица Anthropic к запуску: Opus 5.5 — 54,4 %, GPT-6 Astra — 53,3 %, Fable 5.1 — 50,3 %, Opus 5 — 48,0 %.

CursorBench 4.0 — 57,8 %

Более длинные задачи программирования в редакторе Cursor. Anthropic сообщает о 57,8 % против 51,8 % у Fable 5.1 и 41,7 % у GPT-5.6 Sol.

Выходные токены на задачу — ~119 тыс. при максимальном усилии

Измерение Artificial Analysis при максимальном усилии против ~27 тыс. у GPT-6 Astra. Именно поэтому Astra сохраняет у нас первое место: тот же пиковый результат примерно за половину стоимости задачи.

Цена — $4 / $20 за 1 млн токенов, $0,20 за чтение из кэша

Чтение из кэша, из которого в основном складывается счёт агентов для программирования, подешевело на 60 % по сравнению с Opus 5. Быстрый режим (до 2,5 раза быстрее) стоит $8/$40.

04

Вердикт

Claude Opus 5.5 — наша модель для программирования № 2, и отрыв от № 1 ещё никогда не был таким маленьким. В независимом Terminal-Bench она идёт вровень с GPT-6 Astra; в собственных прогонах Anthropic на FrontierCode и Terminal-Bench — впереди. Мы оставляем Astra на первом месте по открыто заявленной причине: на пике производительности Astra выполняет ту же работу примерно с четвертью выходных токенов, поэтому каждая завершённая задача обходится дешевле. Если же вам предстоит масштабная миграция, глубокий аудит или ошибка, которую больше никто не может найти, мы доверили бы эту работу Opus 5.5 — а на стандартном уровне усилия она дешевле, чем когда-либо.

05

Часто задаваемые вопросы