Многие чат-боты напоминают талантливого стажёра в понедельник утром: работают быстро, берутся за всё с энтузиазмом и могут принести безупречно оформленную таблицу, в которой итоговая сумма незаметно посчитана неверно. Claude Opus 5 больше похож на коллегу, который перед отправкой письма ещё раз проверяет формулы.
Именно за эту рассудительность модель сразу получает первое место в нашей повседневной категории. В таблице Anthropic у неё 1861 Elo в GDPval-AA v2 — тесте полезных профессиональных задач. У Fable 5 — 1747, у GPT-5.6 Sol — 1736, у Opus 4.8 — 1593. Box сообщает об общем улучшении на 8% по сравнению с 4.8, причём прирост особенно заметен в анализе данных и комплексной проверке компаний. Один клиент из финансовой отрасли сообщил, что точность выросла на девять процентных пунктов, итераций стало меньше, а время работы сократилось на 60%. Это ранние отзывы клиентов, но они повторяют рисунок бенчмарков: работа аккуратнее, а возвращаться и переделывать приходится реже.
Не просто начитанная печатная машинка
Opus 5 набирает 70,6% в OSWorld 2.0, где модель должна не рассказывать о работе за компьютером, а действительно ею заниматься. В AutomationBench результат составляет 26,0% — примерно в полтора раза больше следующего показателя в сравнении Anthropic. Zapier сообщает, что Opus 5 самостоятельно прошёл весь процесс удержания клиентов: прочитал показатели состояния аккаунтов, определил клиентов с риском ухода, предупредил ответственных менеджеров и подготовил итоговую сводку. Предыдущие модели не могли довести всю эту цепочку до конца.
Самое необычное число — 30,2% в ARC-AGI-3. Это интерактивный тест на решение незнакомых задач: он скорее похож на попытку самостоятельно понять правила новой настольной игры, чем на просьбу вспомнить известный факт. В той же таблице Sol набрал 7,8%. Бенчмарк не измеряет разум целиком, но этот результат показывает, что Opus 5 особенно хорош там, где подробные инструкции заканчиваются и дальше нужно разбираться самому.
Независимые тесты подтверждают общее направление. Artificial Analysis даёт Opus 5 61 балл и первое место в режиме max; high набирает 59, xhigh — 60. Иными словами, для важного контракта или финансовой модели можно увеличить глубину рассуждения, а для обычного черновика — снизить её и не переплачивать.
Почему выше Fable 5
Fable всё ещё немного лучше в нескольких узких дисциплинах: HLE без инструментов, FrontierCode, максимальном режиме CursorBench и закрытом юридическом тесте. Если ваши собственные задачи похожи именно на них, Fable может быть правильным выбором. Но Fable стоит $10/$50 за миллион входных и выходных токенов, а Opus 5 — $5/$25, не требует общего согласия на хранение данных и использует менее строгие защитные классификаторы. Представьте Fable как гоночный прототип, а Opus 5 — как дорожный автомобиль, который почти так же быстр, обходится вдвое дешевле и может ездить далеко за пределами трассы. Для ежедневной работы дорожная машина полезнее.
GPT-5.6 при этом остаётся превосходной универсальной системой. ChatGPT объединяет Work, Codex, генерацию изображений, Sites, подключённые приложения, браузер и управление компьютером в одной большой экосистеме. Claude сам не создаёт изображения, а лимиты его тарифов могут быть жёстче. Наш рейтинг говорит лишь о том, что Opus 5 сейчас предлагает лучшее сочетание рассудительности, самостоятельной работы, цены и доступности, — а не о том, что всем пора отменять подписку на ChatGPT.
Набор рабочих возможностей внушителен: контекст 1M, вывод до 128k, распознавание диаграмм и документов, PDF, файлы, память, веб-поиск, инструменты и управление компьютером. Однако независимых данных пока мало, max бывает многословным, а API web fetch и Priority Tier на старте отсутствуют. Разумная тактика — начинать с меньшего усилия и повышать его только тогда, когда цена ошибки выше цены дополнительного обдумывания.
Opus 5 — не просто Fable подешевле, а более разумный выбор на каждый день. Он полностью заменяет Opus 4.8 и делает качественные рассуждения ИИ достаточно доступными для обычной рабочей недели, а не только для единственного проекта с почти неограниченным бюджетом.