Место #1 Повседневная экосистема — Ведущие ИИ-помощники
Anthropic

Claude — Opus 5

Новый лидер для повседневной интеллектуальной работы: Opus 5 предлагает рассудительность уровня Fable в модели, которую люди и компании действительно могут использовать в больших масштабах. Он лидирует в первых независимых тестах, стоит вдвое дешевле Fable 5 и широко доступен.

Обновлено 25 июля 2026 Knowledge Work SOTA1M ContextReasoning
Лучше всего для

Новый лидер для повседневной интеллектуальной работы: Opus 5 предлагает рассудительность уровня Fable в модели, которую люди и компании действительно могут использовать в больших масштабах. Он лидирует в первых независимых тестах, стоит вдвое дешевле Fable 5 и широко доступен.

Почему он побеждает

GDPval-AA v2 Elo 1861, ARC-AGI-3 30,2%, BrowseComp 90,8%, OSWorld 2.0 70,6%, AutomationBench 26,0%, HLE с инструментами 64,7%. Artificial Analysis дает max 61 и #1. Контекст 1M, вывод 128k, $5/$25, без общего требования хранения.

Обратите внимание

Корона предварительная: независимым данным меньше 48 часов. Fable выигрывает специальные тесты, у GPT-5.6 больше потребительская экосистема, Claude не создает изображения. Max медленный и многословный; лимиты планов важны.

01

Что это на самом деле

Многие чат-боты напоминают талантливого стажёра в понедельник утром: работают быстро, берутся за всё с энтузиазмом и могут принести безупречно оформленную таблицу, в которой итоговая сумма незаметно посчитана неверно. Claude Opus 5 больше похож на коллегу, который перед отправкой письма ещё раз проверяет формулы.

Именно за эту рассудительность модель сразу получает первое место в нашей повседневной категории. В таблице Anthropic у неё 1861 Elo в GDPval-AA v2 — тесте полезных профессиональных задач. У Fable 5 — 1747, у GPT-5.6 Sol — 1736, у Opus 4.8 — 1593. Box сообщает об общем улучшении на 8% по сравнению с 4.8, причём прирост особенно заметен в анализе данных и комплексной проверке компаний. Один клиент из финансовой отрасли сообщил, что точность выросла на девять процентных пунктов, итераций стало меньше, а время работы сократилось на 60%. Это ранние отзывы клиентов, но они повторяют рисунок бенчмарков: работа аккуратнее, а возвращаться и переделывать приходится реже.

Не просто начитанная печатная машинка

Opus 5 набирает 70,6% в OSWorld 2.0, где модель должна не рассказывать о работе за компьютером, а действительно ею заниматься. В AutomationBench результат составляет 26,0% — примерно в полтора раза больше следующего показателя в сравнении Anthropic. Zapier сообщает, что Opus 5 самостоятельно прошёл весь процесс удержания клиентов: прочитал показатели состояния аккаунтов, определил клиентов с риском ухода, предупредил ответственных менеджеров и подготовил итоговую сводку. Предыдущие модели не могли довести всю эту цепочку до конца.

Самое необычное число — 30,2% в ARC-AGI-3. Это интерактивный тест на решение незнакомых задач: он скорее похож на попытку самостоятельно понять правила новой настольной игры, чем на просьбу вспомнить известный факт. В той же таблице Sol набрал 7,8%. Бенчмарк не измеряет разум целиком, но этот результат показывает, что Opus 5 особенно хорош там, где подробные инструкции заканчиваются и дальше нужно разбираться самому.

Независимые тесты подтверждают общее направление. Artificial Analysis даёт Opus 5 61 балл и первое место в режиме max; high набирает 59, xhigh — 60. Иными словами, для важного контракта или финансовой модели можно увеличить глубину рассуждения, а для обычного черновика — снизить её и не переплачивать.

Почему выше Fable 5

Fable всё ещё немного лучше в нескольких узких дисциплинах: HLE без инструментов, FrontierCode, максимальном режиме CursorBench и закрытом юридическом тесте. Если ваши собственные задачи похожи именно на них, Fable может быть правильным выбором. Но Fable стоит $10/$50 за миллион входных и выходных токенов, а Opus 5 — $5/$25, не требует общего согласия на хранение данных и использует менее строгие защитные классификаторы. Представьте Fable как гоночный прототип, а Opus 5 — как дорожный автомобиль, который почти так же быстр, обходится вдвое дешевле и может ездить далеко за пределами трассы. Для ежедневной работы дорожная машина полезнее.

GPT-5.6 при этом остаётся превосходной универсальной системой. ChatGPT объединяет Work, Codex, генерацию изображений, Sites, подключённые приложения, браузер и управление компьютером в одной большой экосистеме. Claude сам не создаёт изображения, а лимиты его тарифов могут быть жёстче. Наш рейтинг говорит лишь о том, что Opus 5 сейчас предлагает лучшее сочетание рассудительности, самостоятельной работы, цены и доступности, — а не о том, что всем пора отменять подписку на ChatGPT.

Набор рабочих возможностей внушителен: контекст 1M, вывод до 128k, распознавание диаграмм и документов, PDF, файлы, память, веб-поиск, инструменты и управление компьютером. Однако независимых данных пока мало, max бывает многословным, а API web fetch и Priority Tier на старте отсутствуют. Разумная тактика — начинать с меньшего усилия и повышать его только тогда, когда цена ошибки выше цены дополнительного обдумывания.

Opus 5 — не просто Fable подешевле, а более разумный выбор на каждый день. Он полностью заменяет Opus 4.8 и делает качественные рассуждения ИИ достаточно доступными для обычной рабочей недели, а не только для единственного проекта с почти неограниченным бюджетом.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Главное — профессиональная работа: 1861 Elo в GDPval-AA v2, выше Fable 5 (1747) и Sol (1736). Первые клиенты также отмечают более качественную работу с финансами, юридическими документами, электронными таблицами и комплексной проверкой компаний.
  • Он действует, а не только отвечает: 70,6% OSWorld 2.0 и 26,0% AutomationBench ведут в работе с ПО и бизнес-процессами.
  • Силен в новых задачах: 30,2% ARC-AGI-3 — почти в четыре раза выше Sol (7,8%); Artificial Analysis ставит max первым с 61.
  • Качество Fable без переплаты за Fable: $5/$25 — половина цены, без общего требования хранить данные и с реже срабатывающими защитными классификаторами.
  • Полноценное профессиональное рабочее пространство: Контекст 1M, вывод 128k, понимание документов и диаграмм, сложные электронные таблицы, презентации, веб-поиск, файлы, PDF, память и управление компьютером.

Честные ограничения

  • Корона недели релиза: Большинство отдельных сравнений от Anthropic; один независимый индекс не вечный приговор.
  • ChatGPT остается большей платформой: У Claude нет встроенной генерации изображений и связки Work, Codex, Sites, плагинов, браузера и рабочего стола.
  • У Fable остаются победы в узких дисциплинах: HLE без инструментов, FrontierCode, CursorBench и юридический тест; Mythos сильнее в наступательной кибербезопасности и автономных биологических исследованиях.
  • Max прожорлив: Высокая многословность и задержка xhigh. Сравнивайте цену законченной задачи, не прайс токена.
  • Интеграции придется подправить: На старте нет API web fetch и Priority Tier, режим размышления включен по умолчанию, параметры сэмплирования ограничены, а лимит тарифа может оборвать долгую задачу.
03

Результаты тестов

GDPval-AA v2 — 1861 Elo (#1)

Выше Fable 5 (1747), Sol (1736) и Opus 4.8 (1593) в профессиональной работе.

ARC-AGI-3 — 30,2% (#1)

Новые интерактивные задачи: почти в четыре раза выше Sol (7,8%) и намного выше 4.8 (1,5%).

OSWorld 2.0 — 70,6% (#1)

Работа с настольными приложениями, впереди Fable 5 (66,1%) и Sol (62,6%).

AutomationBench — 26,0% (#1)

Полные бизнес-процессы, примерно в 1,5 раза выше Fable 5 (17,4%).

Artificial Analysis Intelligence Index — 61 (#1)

Независимый составной тест из девяти оценок; high 59, xhigh 60, max расходует много токенов.

04

Вердикт

Claude Opus 5 берет наше повседневное #1, немного выше GPT-5.6 и явно выше Fable 5. Он ведет в наиболее полезной смеси профессиональной работы, новых задач, поиска, компьютера и автоматизации, стоит половину Fable и имеет меньше ограничений.

05

Часто задаваемые вопросы