Место #3 Программирование — ИИ, который пишет код для продакшена
Anthropic

Claude Sonnet 5.5

Claude Sonnet 5.5 — модель для программирования, которую можно не выключать весь день: быстрая, вдвое дешевле Opus 5.5 за токен и достаточно сильная, чтобы большинство исправлений багов, новых функций и рефакторингов вообще не требовали флагмана. Только не выкручивайте регулятор усилий до упора: на самом высоком уровне она пишет больше любой модели, которую когда-либо измеряла Artificial Analysis, а некоторые результаты даже ухудшаются.

Обновлено 29 сентября 2026 Agentic CodingTerminal-Bench 4.0 64%Claude Code
Лучше всего для

Claude Sonnet 5.5 — модель для программирования, которую можно не выключать весь день: быстрая, вдвое дешевле Opus 5.5 за токен и достаточно сильная, чтобы большинство исправлений багов, новых функций и рефакторингов вообще не требовали флагмана. Только не выкручивайте регулятор усилий до упора: на самом высоком уровне она пишет больше любой модели, которую когда-либо измеряла Artificial Analysis, а некоторые результаты даже ухудшаются.

Почему он побеждает

Независимые тесты Artificial Analysis дают ей 64 % в Terminal-Bench 4.0 — чуть выше, чем у Opus 5.5 и GPT-6 Astra (около 60 % у каждой). Anthropic сообщает о 52,1 % в FrontierCode на уровне xhigh и 55,5 % в CursorBench 4.0 — примерно в двух пунктах от Opus 5.5. Vals AI ставит её на второе место из 66 моделей в своём индексе и на первое — в Vibe Code Bench и Code Migration. Токены стоят 2/10 доллара, а ответ приходит более чем на 30 % быстрее, чем у Sonnet 5.

Обратите внимание

На уровне max в тестах Artificial Analysis она тратила около 193 000 выходных токенов на задачу — больше, чем любая измеренная модель, — а её результат в FrontierCode падает с 52,1 % на xhigh до 46,2 % на max. Сама Anthropic признаёт, что Opus 5.5 остаётся заметно сильнее в сложной, открытой работе. Рискованные задачи по безопасности передаются Sonnet 5, а пользователям API при переходе придётся учесть пять несовместимых изменений.

01

Что это на самом деле

Представьте двух плотников. Первый — мастер, которого зовут, когда дому нужна новая лестница, а чертежей ещё никто не нарисовал. Второй — надёжный работник, который за неделю навесит сорок дверей, и каждая встанет ровно по уровню.

Большая часть недели команды разработчиков — это двери, а не лестницы: упавший тест, форма, которой нужно новое поле, API, сменивший название. Claude Sonnet 5.5 создана для дверей.

Anthropic выпустила её 28 сентября 2026 года — второй моделью семейства Claude 5.5, через неделю после Opus 5.5. Цена осталась как у Sonnet 5: 2 доллара за миллион входных токенов и 10 долларов за миллион выходных — вдвое меньше, чем у Opus 5.5. По словам Anthropic, она работает более чем на 30 % быстрее Sonnet 5 и обходится до 30 % дешевле в расчёте на задачу, потому что справляется за меньшее число шагов.

Независимые цифры

Для агентов-программистов мы больше всего доверяем Terminal-Bench 4.0: это длинные многошаговые задания в настоящей командной строке, где модели нужно что-то установить, запустить, прочитать ошибки и попробовать снова.

Artificial Analysis провела этот тест независимо в сентябре 2026 года. Sonnet 5.5 набрала 64 % — чуть больше, чем Opus 5.5 и GPT-6 Astra, у которых около 60 %. Собственный прогон Anthropic даёт больше, 70,6 %, но тестовые среды производителей обычно льстят своим моделям, так что запоминать стоит независимые 64 %. В любом случае это огромный скачок по сравнению с Sonnet 5, у которой в таблице Anthropic было 10,3 %.

Второй независимый источник подтверждает общую картину. Vals AI ставит Sonnet 5.5 на второе место из 66 моделей в своём индексе с результатом 69,22 % — меньше чем в половине пункта от Opus 5.5 — при стоимости теста примерно в две трети от него. На двух рейтингах по программированию она первая: Vibe Code Bench (создание небольших приложений по описанию) — 92,39 %, и Code Migration — 69,83 %.

Что добавляют собственные тесты Anthropic

Стартовая таблица Anthropic дополняет картину:

  • FrontierCode v1.1, который проверяет, можно ли принять изменение кода без участия человека: 52,1 % на уровне xhigh. У Opus 5.5 — 54,4 %, у GPT-6 Sol — 49,3 %.
  • CursorBench 4.0, собранный из реальных сессий в редакторе Cursor: 55,5 % — примерно на два пункта ниже Opus 5.5 и далеко впереди 34,1 % у Sonnet 5.

Полезнее всего графики стоимости: на них результат каждой модели сопоставлен со стоимостью задачи на каждом уровне усилий. Выделяются два вывода. На уровне High — по умолчанию в API — Sonnet 5.5 достигает лучшего результата GPT-6 Sol в FrontierCode примерно за пятую часть стоимости задачи. А на уровне Medium — по умолчанию в Claude Code — она превосходит лучший результат Sonnet 5 в Terminal-Bench менее чем за десятую часть стоимости.

Первые тестировщики говорят о том же, только проще. Lovable увидела примерно вдвое меньше shell-команд на задачу. Slack намерил около 14 % экономии выходных токенов по сравнению с Sonnet 5. Unity, где задача считается выполненной, только если изменение действительно работает при запуске, сообщает, что большая часть работы Sonnet 5.5 эту проверку прошла.

Регулятор усилий — и почему верхнее положение даёт обратный эффект

Как и у Opus 5.5, у Sonnet 5.5 есть регулятор усилий с пятью уровнями: low, medium, high, xhigh и max. Чем выше уровень, тем дольше модель думает и тщательнее проверяет свою работу. Логично ожидать, что max лучше всех. С Sonnet 5.5 это часто не так.

Artificial Analysis измерила весь диапазон в своём Intelligence Index:

Усилия Intelligence Index Стоимость задачи
Low 36 0,41 $
Medium 41 0,59 $
High 47 1,08 $
Xhigh 52 2,74 $
Max 56 7,60 $

Переход с xhigh на max даёт четыре пункта при почти трёхкратном росте стоимости. На max Sonnet 5.5 писала около 193 000 выходных токенов на задачу. Это рекорд за всю историю замеров Artificial Analysis: примерно на 60 % больше, чем у Opus 5.5 на max, и примерно в семь раз больше, чем у GPT-6 Astra.

Хуже того, больше усилий не всегда означает лучший код. В FrontierCode Sonnet 5.5 набирает 52,1 % на xhigh, но лишь 46,2 % на max. Anthropic объясняет причину в сноске: на max модель чаще запускала процедуру ревью кода в Claude Code, которая распределяет проверку между множеством вспомогательных агентов. В некоторых случаях это заканчивалось тайм-аутом или лишними правками за пределами задачи, а FrontierCode штрафует за изменения, о которых никто не просил.

Вывод простой: считайте xhigh потолком. Если задача не решается и на xhigh, лучшим следующим шагом обычно будет Opus 5.5, а не max.

Честная оговорка

Архитектор по-прежнему Opus. Anthropic говорит об этом прямо: в ряде тестов Sonnet 5.5 на max приближается к Opus 5.5, но и во внутренних тестах Anthropic, и у внешних тестировщиков Opus 5.5 остаётся заметно сильнее в сложной, открытой работе, требующей длительного взвешенного суждения. Opus также сохраняет лидерство в FrontierCode и CursorBench.

Счёт за Claude Code вдвое не уменьшится. Агенты-программисты постоянно перечитывают ваш проект, и это перечитывание оплачивается как чтение из кэша — 0,20 доллара за миллион токенов и у Sonnet 5.5, и у Opus 5.5. Вы экономите на новом вводе и выводе, но длинная сессия, активно использующая кэш, сэкономит меньше, чем обещает заголовок про «половину цены».

Задачи по безопасности перенаправляются. Sonnet 5.5 — первая модель Sonnet, которая выходит с теми же защитными механизмами в области кибербезопасности, что Anthropic применяет к своим самым сильным моделям. Обычное исправление багов это не затрагивает, но рискованные задачи по безопасности заметно для пользователя передаются Sonnet 5, если ваша команда не одобрена через Cyber Verification Program от Anthropic.

Переход потребует немного работы. Anthropic перечисляет пять несовместимых изменений по сравнению с Sonnet 5. Принудительный вызов инструмента теперь возвращает ошибку, нестандартные значения temperature отклоняются, а текст между вызовами инструментов приходит в другом формате. Исправить всё это несложно, но замена в одну строку не получится.

Где она уместна

Если задача — … Берите Почему
чётко очерченный баг, функция или миграция Claude Sonnet 5.5 Быстро и дёшево на medium или high
открытая архитектура или проблема, которую никто ещё не очертил Claude Opus 5.5 Заметно более сильное суждение, по словам Anthropic и тестировщиков
долгая работа в терминале без присмотра по минимальной цене за задачу GPT-6 Astra На пиковом уровне тратит лишь малую долю токенов
доводка фронтенда, слайды, небольшие визуальные проекты Claude Sonnet 5.5 Хорошее чувство дизайна и быстрые итерации

Вердикт

Claude Sonnet 5.5 — модель, которую большинству разработчиков стоит просто оставить включённой. Она навешивает двери — все сорок — быстро и по половине цены токена флагмана. Держите её на medium или high, включайте xhigh для трудных случаев, а когда заказ окажется лестницей, зовите Opus.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Независимые результаты в терминале: В сентябре 2026 года Artificial Analysis намерила 64 % в Terminal-Bench 4.0 — чуть выше, чем у Opus 5.5 и GPT-6 Astra, у которых около 60 %. Именно этот независимый тест решает большинство сравнений агентов для программирования, и Sonnet 5.5 показала в нём хороший результат при вдвое меньшей цене токена, чем у Opus.
  • Дёшево при разумных настройках: Графики Anthropic показывают, что на уровне High (по умолчанию в API) Sonnet 5.5 достигает лучшего результата GPT-6 Sol в FrontierCode примерно за пятую часть стоимости задачи. В Terminal-Bench уже уровень Medium превосходит лучший результат Sonnet 5 менее чем за десятую часть стоимости.
  • Справляется за меньшее число шагов: Первые тестировщики описывают одну и ту же картину. Slack намерил примерно на 14 % меньше выходных токенов, чем у Sonnet 5, Lovable — примерно вдвое меньше запусков shell на задачу, а в тесте Balyasny модель тратила около 121 000 токенов на ответ там, где Sonnet 5 тратила 497 000.
  • Сильна в миграциях и быстрых сборках: Vals AI ставит Sonnet 5.5 на первое место в Vibe Code Bench (92,39 %) и Code Migration (69,83 %) и на второе — в общем Vals Index, при стоимости одного теста примерно в две трети от Opus 5.5.
  • Хороший глаз на интерфейсы: По словам Anthropic, у Sonnet 5.5 развитое чувство дизайна: она умеет доводить интерфейсы до блеска и так точно следовать шаблонам слайдов, что править почти ничего не приходится. К тому же ответ приходит более чем на 30 % быстрее, чем у Sonnet 5, и быстрые правки туда-обратно становятся удобными.

Честные ограничения

  • Уровень max — ловушка: Artificial Analysis намерила около 193 000 выходных токенов на задачу на max — примерно на 60 % больше, чем у Opus 5.5 на max, и примерно в семь раз больше, чем у GPT-6 Astra. На этом уровне ценовое преимущество перед Opus почти полностью исчезает.
  • Больше усилий — хуже слияния: В FrontierCode, который проверяет, можно ли принять изменения без правок человеком, Anthropic сообщает о 52,1 % на xhigh, но лишь 46,2 % на max. На max модель чаще запускала процедуру ревью кода, распределённую между множеством вспомогательных агентов, и это иногда заканчивалось тайм-аутом или правками за пределами задачи.
  • Не архитектор: Anthropic говорит, что Opus 5.5 остаётся заметно сильнее в сложной, открытой работе, требующей длительного взвешенного суждения. Opus также лидирует в FrontierCode (54,4 %) и CursorBench (57,8 %).
  • Задачи по безопасности перенаправляются: Рискованные задачи по кибербезопасности заметно для пользователя передаются Sonnet 5. Обычное исправление багов это не затрагивает, а проверенные команды безопасности могут запросить расширенный доступ.
  • В API не получится просто поменять название модели: Anthropic перечисляет пять несовместимых изменений по сравнению с Sonnet 5, в том числе ошибки при принудительном вызове инструментов и при нестандартных значениях temperature. Прежде чем переводить рабочий код, прочитайте руководство по миграции.
03

Результаты тестов

Terminal-Bench 4.0 — 64 % независимо (70,6 % по данным производителя)

Многошаговая работа в терминале командной строки. Artificial Analysis намерила 64 % против примерно 60 % у Opus 5.5 и GPT-6 Astra (xhigh). Лучший собственный прогон Anthropic — 70,6 % против 66,4 % у Opus 5.5 на xhigh и 10,3 % у Sonnet 5.

FrontierCode v1.1 — 52,1 % на xhigh, 46,2 % на max

Готовы ли изменения кода к слиянию. Таблица Anthropic: Opus 5.5 — 54,4 %, GPT-6 Sol — 49,3 %, Sonnet 5 — 42,4 %. На max Sonnet 5.5 набирает меньше, чем на xhigh.

CursorBench 4.0 — 55,5 %

Неоднозначные задачи, затрагивающие несколько файлов, взятые из реальных сессий Cursor. Anthropic сообщает о 57,8 % у Opus 5.5 и 34,1 % у Sonnet 5.

Vals Index — 69,22 % (2-е место из 66)

Независимый индекс Vals AI: на 0,47 пункта позади Opus 5.5 и впереди Fable 5.1, при 20,80 доллара за тест против 32,77 доллара у Opus 5.5. Первое место в Vibe Code Bench и Code Migration.

Выходных токенов на задачу — ~193 000 на max

Замер Artificial Analysis по её Intelligence Index, самый высокий из когда-либо зафиксированных: примерно на 60 % больше, чем у Opus 5.5 (max), и примерно в семь раз больше, чем у GPT-6 Astra (max).

Цена — 2 / 10 долларов за 1 млн токенов, 0,20 доллара за чтение из кэша

Как у Sonnet 5 и вдвое меньше, чем 4/20 доллара у Opus 5.5. Чтение из кэша стоит те же 0,20 доллара, что и у Opus, поэтому сессии программирования, активно использующие кэш, экономят меньше, чем обещает прайс. Пакетные запросы — со скидкой 50 %.

04

Вердикт

Claude Sonnet 5.5 — модель, которую стоит держать включённой для повседневной разработки: чётко очерченные баги, новые функции, миграции и фронтенд на уровнях medium или high, где она быстра и дёшева. Она стоит сразу за GPT-6 Astra и Opus 5.5, потому что свой лучший независимый результат в терминале показывает на уровне max — именно там, где сжигает больше всего токенов и где падает качество её изменений. Держите её ниже max, а открытые архитектурные вопросы оставляйте Opus 5.5.

05

Часто задаваемые вопросы