Представьте двух мастеров, увидевших мокрое пятно на стене. Один быстро закрашивает пятно и закрывает заявку. Другой находит протекающую трубу, устраняет течь и проверяет, не дошла ли вода до соседней комнаты. Claude Opus 5 старается программировать как второй мастер.
Теперь эта запусковая оценка называется Terminal-Bench 3.0. Первоначально Anthropic сообщала 43,3%; в текущей публичной таблице у Opus 5 около 42,7%, а у приведённой конфигурации GPT-5.6 Sol — 34,6%. Снимки немного различаются, но вывод один: Opus необычно хорошо справляется с незнакомой работой в терминале.
Один пример показывает характер модели. Ей поручили восстановить механическую деталь по чертежу, который она не могла просмотреть напрямую. Opus 5 написал собственный конвейер компьютерного зрения, извлек геометрию из пикселей и собрал деталь в FreeCAD. В другой задаче он нашел первопричину бага и крайний случай, пропущенный патчем сообщества. Это примеры поставщика, не законы природы, но цель настройки ясна: исследовать, пока доказательства не сойдутся.
Почему он выше Fable 5
Fable выигрывает несколько фотофинишей: 53,5% против 53,4% в FrontierCode и примерно полпункта в максимальном CursorBench. Но рейтинг — решение о покупке, а не музей десятых долей. Opus 5 стоит $5/$25 за миллион токенов, ровно половину Fable, не требует общего хранения данных и использует менее строгие классификаторы.
Независимый сигнал стал сильнее. Artificial Analysis v4.1.1 даёт Opus 5 примерно 63 и первое место в Intelligence Index, а в Coding Agent Index — около 78,0. Предупреждение остаётся прежним: на max модель способна генерировать очень много токенов.
Почему всё же не #1
GPT-6 Astra лидирует в DeepSWE v1.1 с 74,1%, чуть опережая Opus 5 с 73,7% в сентябрьских таблицах, плюс Terminal-Bench 4.0 с 57,9% и лучшее на рынке владение компьютером. Artificial Analysis пересчитала таблицу кодовых агентов к запуску Astra (Fable 5.1 около 70, Astra 67), так что старые числа эпохи Opus — не сопоставимые ячейки. Наше #1 всё равно получает Astra — по тай-брейку интеграции с Codex, эффективности и ценности исполнения, а не потому, что он явно лучше программирует.
Практическое разделение простое: Opus 5 — для неясных ошибок, поиска первопричины, больших многофайловых изменений и визуальной проверки интерфейса; Sol — для терминальных задач, где особенно важны скорость и стоимость готового результата; Fable — лишь тогда, когда его небольшой выигрыш в узком тесте оправдывает двойную цену.
Переезд сохраняет контекст 1M, вывод 128k, зрение, PDF, кэш, batch и инструменты Claude. Адаптивное мышление включено по умолчанию, effort меняется от low до max. Большинство промптов Opus 4.8 должно перенестись без больших изменений, но на старте в API отсутствуют web fetch и Priority Tier. Opus 5 полностью заменяет Opus 4.8 и делает Fable трудным выбором для обычного производственного объёма.