Место #1 Повседневная экосистема — Ведущие ИИ-помощники
Anthropic

Claude — Opus 5

Новый лидер для повседневной интеллектуальной работы: Opus 5 предлагает рассудительность уровня Fable в модели, которую люди и компании действительно могут использовать в больших масштабах. Он лидирует в первых независимых тестах, стоит вдвое дешевле Fable 5 и широко доступен.

Обновлено 29 августа 2026 Knowledge Work SOTA1M ContextReasoning
Лучше всего для

Новый лидер для повседневной интеллектуальной работы: Opus 5 предлагает рассудительность уровня Fable в модели, которую люди и компании действительно могут использовать в больших масштабах. Он лидирует в первых независимых тестах, стоит вдвое дешевле Fable 5 и широко доступен.

Почему он побеждает

GDPval-AA v2 Elo 1861 на старте, ARC-AGI-3 30,2%, OSWorld 2.0 70,6% и 64,7% на Humanity's Last Exam с инструментами. Artificial Analysis v4.1.1 теперь даёт max около 63 и #1 в целом. Также доступны контекст 1M, вывод 128k и цена $5/$25.

Обратите внимание

Fable 5 всё ещё выигрывает отдельные специализированные оценки, GPT-5.6 остаётся более широкой потребительской экосистемой, а Opus 5 не умеет нативно генерировать изображения. Max медленный и многословный, живые значения Elo меняются, а лимиты бесплатных и платных тарифов Claude по-прежнему важны.

01

Что это на самом деле

Многие чат-боты напоминают талантливого стажёра в понедельник утром: работают быстро, берутся за всё с энтузиазмом и могут принести безупречно оформленную таблицу, в которой итоговая сумма незаметно посчитана неверно. Claude Opus 5 больше похож на коллегу, который перед отправкой письма ещё раз проверяет формулы.

Именно за эту рассудительность модель сразу получает первое место в нашей повседневной категории. В таблице Anthropic у неё 1861 Elo в GDPval-AA v2 — тесте полезных профессиональных задач. У Fable 5 — 1747, у GPT-5.6 Sol — 1736, у Opus 4.8 — 1593. Box сообщает об общем улучшении на 8% по сравнению с 4.8, причём прирост особенно заметен в анализе данных и комплексной проверке компаний. Один клиент из финансовой отрасли сообщил, что точность выросла на девять процентных пунктов, итераций стало меньше, а время работы сократилось на 60%. Это ранние отзывы клиентов, но они повторяют рисунок бенчмарков: работа аккуратнее, а возвращаться и переделывать приходится реже.

Не просто начитанная печатная машинка

Opus 5 набирает 70,6% в OSWorld 2.0, где модель должна не рассказывать о работе за компьютером, а действительно ею заниматься. В AutomationBench результат составляет 26,0% — примерно в полтора раза больше следующего показателя в сравнении Anthropic. Zapier сообщает, что Opus 5 самостоятельно прошёл весь процесс удержания клиентов: прочитал показатели состояния аккаунтов, определил клиентов с риском ухода, предупредил ответственных менеджеров и подготовил итоговую сводку. Предыдущие модели не могли довести всю эту цепочку до конца.

Самое необычное число — 30,2% в ARC-AGI-3. Это интерактивный тест на решение незнакомых задач: он скорее похож на попытку самостоятельно понять правила новой настольной игры, чем на просьбу вспомнить известный факт. В той же таблице Sol набрал 7,8%. Бенчмарк не измеряет разум целиком, но этот результат показывает, что Opus 5 особенно хорош там, где подробные инструкции заканчиваются и дальше нужно разбираться самому.

Теперь независимые тесты подтверждают не только общее направление запуска. Artificial Analysis v4.1.1 даёт Opus 5 в режиме max около 63 баллов и текущее первое место в Intelligence Index. Точная лестница меняется вместе с методикой оценки, поэтому рядом с результатом всегда должны стоять версия и дата получения данных.

Почему выше Fable 5

Fable всё ещё немного лучше в нескольких узких дисциплинах: HLE без инструментов, FrontierCode, максимальном режиме CursorBench и закрытом юридическом тесте. Если ваши собственные задачи похожи именно на них, Fable может быть правильным выбором. Но Fable стоит $10/$50 за миллион входных и выходных токенов, а Opus 5 — $5/$25, не требует общего согласия на хранение данных и использует менее строгие защитные классификаторы. Представьте Fable как гоночный прототип, а Opus 5 — как дорожный автомобиль, который почти так же быстр, обходится вдвое дешевле и может ездить далеко за пределами трассы. Для ежедневной работы дорожная машина полезнее.

Почему ChatGPT по-прежнему актуален

GPT-5.6 при этом остаётся превосходной универсальной системой. ChatGPT объединяет Work, Codex, генерацию изображений, Sites, подключённые приложения, браузер и управление компьютером в одной большой экосистеме. Claude сам не создаёт изображения, а лимиты его тарифов могут быть жёстче. Наш рейтинг говорит лишь о том, что Opus 5 сейчас предлагает лучшее сочетание рассудительности, самостоятельной работы, цены и доступности, — а не о том, что всем пора отменять подписку на ChatGPT.

Набор рабочих возможностей внушителен: контекст 1M по умолчанию, вывод до 128k, распознавание диаграмм и документов, PDF, файлы, память, веб-поиск, инструменты и управление компьютером. API-модель называется claude-opus-5 и доступна через платформу Anthropic и крупные облака; Fast mode работает примерно в 2,5 раза быстрее за двойную базовую цену токена.

Оговорки остаются. Независимые данные всё ещё сравнительно молоды, max бывает многословным, а у xhigh заметна задержка до первого токена. API web fetch и Priority Tier на старте отсутствуют. Разумная тактика — начинать с меньшего усилия, проверять результат и повышать effort только тогда, когда цена ошибки выше цены дополнительного обдумывания.

Opus 5 — не просто Fable подешевле, а более разумный выбор на каждый день. Он полностью заменяет Opus 4.8 и делает качественные рассуждения ИИ достаточно доступными для обычной рабочей недели, а не только для единственного проекта с почти неограниченным бюджетом.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Главное — профессиональная работа: 1861 Elo в GDPval-AA v2, выше Fable 5 (1747) и Sol (1736). Первые клиенты также отмечают более качественную работу с финансами, юридическими документами, электронными таблицами и комплексной проверкой компаний.
  • Он действует, а не только отвечает: 70,6% OSWorld 2.0 и 26,0% AutomationBench ведут в работе с ПО и бизнес-процессами.
  • Силен в новых задачах: 30,2% ARC-AGI-3 — почти в четыре раза выше Sol (7,8%); Artificial Analysis теперь ставит max первым в более широком Intelligence Index с результатом около 63.
  • Качество Fable без переплаты за Fable: $5/$25 — половина цены, без общего требования хранить данные и с реже срабатывающими защитными классификаторами.
  • Полноценное профессиональное рабочее пространство: Контекст 1M, вывод 128k, понимание документов и диаграмм, сложные электронные таблицы, презентации, веб-поиск, файлы, PDF, память и управление компьютером.

Честные ограничения

  • Даже короне нужна дата: Большинство сравнений по отдельным задачам предоставила Anthropic, а живые Elo и версии составных индексов продолжают меняться. Первое место Artificial Analysis — сильное независимое подтверждение, но не вечная конституция.
  • ChatGPT остается большей платформой: У Claude нет встроенной генерации изображений и связки Work, Codex, Sites, плагинов, браузера и рабочего стола.
  • У Fable остаются победы в узких дисциплинах: HLE без инструментов, FrontierCode, CursorBench и юридический тест; Mythos сильнее в наступательной кибербезопасности и автономных биологических исследованиях.
  • Max прожорлив: Высокая многословность и задержка xhigh. Сравнивайте цену законченной задачи, не прайс токена.
  • Интеграции придется подправить: На старте нет API web fetch и Priority Tier, режим размышления включен по умолчанию, параметры сэмплирования ограничены, а лимит тарифа может оборвать долгую задачу.
03

Результаты тестов

GDPval-AA v2 — 1861 Elo (#1)

Выше Fable 5 (1747), Sol (1736) и Opus 4.8 (1593) в профессиональной работе.

ARC-AGI-3 — 30,2% (#1)

Новые интерактивные задачи: почти в четыре раза выше Sol (7,8%) и намного выше 4.8 (1,5%).

OSWorld 2.0 — 70,6% (#1)

Работа с настольными приложениями, впереди Fable 5 (66,1%) и Sol (62,6%).

AutomationBench — 26,0% (#1)

Полные бизнес-процессы, примерно в 1,5 раза выше Fable 5 (17,4%).

Artificial Analysis Intelligence Index — около 63 (#1)

Текущий независимый составной показатель v4.1.1 в режиме max. Стартовый результат 61 устарел; max также расходует много токенов, поэтому выбор effort имеет значение.

04

Вердикт

Claude Opus 5 получает наше #1 для повседневной интеллектуальной работы, немного опережая GPT-6 Astra и заметно превосходя Fable 5. Причина не в победе на каждом экзамене, а в лидерстве по наиболее полезному сочетанию профессиональной работы, новых задач, браузерного поиска, управления компьютером и завершения процессов — при вдвое меньшей цене, чем у Fable, и с меньшими ограничениями развёртывания. Выбирайте ChatGPT, если важнее одна огромная потребительская экосистема; Fable — только для узкого пика, оправдывающего двойную цену; Opus 5 — когда работа неоднозначна, насыщена документами и достаточно важна для вдумчивого суждения.

05

Часто задаваемые вопросы