Представьте двух мастеров, увидевших мокрое пятно на стене. Один быстро закрашивает пятно и закрывает заявку. Другой находит протекающую трубу, устраняет течь и проверяет, не дошла ли вода до соседней комнаты. Claude Opus 5 старается программировать как второй мастер.
Поэтому главное число релиза — 43,3% на Frontier-Bench v0.1. Тест просит агента решать незнакомые инженерные задачи через терминал и инструменты. В сравнении Anthropic GPT-5.6 Sol набрал 34,4%, Fable 5 — 33,7%, Opus 4.8 — 21,1%. Opus 5 не просто заменил 4.8, а почти удвоил его результат.
Один пример показывает характер модели. Ей поручили восстановить механическую деталь по чертежу, который она не могла просмотреть напрямую. Opus 5 написал собственный конвейер компьютерного зрения, извлек геометрию из пикселей и собрал деталь в FreeCAD. В другой задаче он нашел первопричину бага и крайний случай, пропущенный патчем сообщества. Это примеры поставщика, не законы природы, но цель настройки ясна: исследовать, пока доказательства не сойдутся.
Почему он выше Fable 5
Fable выигрывает несколько фотофинишей: 53,5% против 53,4% в FrontierCode и примерно полпункта в максимальном CursorBench. Но рейтинг — решение о покупке, а не музей десятых долей. Opus 5 стоит $5/$25 за миллион токенов, ровно половину Fable, не требует общего хранения данных и использует менее строгие классификаторы.
Artificial Analysis дает первое независимое подтверждение: 61 и первое место на max. High и xhigh набрали 59 и 60. Есть и предупреждение: max создал очень много токенов. Модель по полцены все равно выставит полный счет, если напишет роман ради починки кнопки.
Почему всё же не #1
GPT-5.6 Sol лидирует в DeepSWE v1.1 с 72,7%; у Fable — 69,7%, у Opus 5 — 68,8%. Но прямое сравнение Artificial Analysis даёт Claude Code с Opus 5 и Codex с GPT-5.6 Sol одинаковые 67 баллов в общем Coding Agent Index. Полезнее посмотреть, из чего сложилась ничья: GPT выигрывает DeepSWE и Terminal-Bench, а также завершает задачи быстрее и дешевле; Opus лучше справляется с тестом на понимание репозитория. Поэтому наше первое место у GPT-5.6 — это победа по скорости, стоимости и терминальным задачам, а не доказательство, что он программирует лучше Opus 5 во всём.
Практическое разделение простое: Opus 5 — для неясных ошибок, поиска первопричины, больших многофайловых изменений и визуальной проверки интерфейса; Sol — для терминальных задач, где особенно важны скорость и стоимость готового результата; Fable — лишь тогда, когда его небольшой выигрыш в узком тесте оправдывает двойную цену.
Переезд сохраняет контекст 1M, вывод 128k, зрение, PDF, кэш, batch и инструменты Claude. Адаптивное мышление включено по умолчанию. Не хватает лишь web fetch и Priority Tier. Opus 5 полностью заменяет Opus 4.8 и делает Fable трудным выбором для обычного производственного объема.