Полезный вопрос о кодовых моделях в июле 2026 года — не «какая умнее?», а «какая завершит такой тип работы?» GPT-5.6 занимает первое место, потому что Sol особенно силён, когда программирование становится агентной работой: команды терминала, вызовы инструментов, ошибки, повторы, тесты и репозиторий, который отказывается быть аккуратным бенчмарком.
В таблице релиза OpenAI Sol с максимальным рассуждением (max) получает 80 в Artificial Analysis Coding Agent Index, опережая Claude Fable 5 (77,2). Sol набирает 88,8% на Terminal-Bench 2.1, а конфигурация с параллельными агентами Ultra достигает 91,9%. На DeepSWE Sol показывает 72,7%. Три независимых сигнала указывают в одном направлении: для долгой инженерной работы с инструментами это сильнейшее семейство OpenAI на сегодня.
Однако это не означает, что Sol побеждает во всех дисциплинах. Та же таблица дает Sol 64,6% на SWE-Bench Pro против 80,3% у Claude Fable 5. Это слишком большой разрыв, чтобы списывать его со счетов. Честный вывод точен и практичен: GPT-5.6 лидирует в агентных рабочих процессах; Fable сохраняет лучшие опубликованные показатели на SWE-Bench Pro.
Маршрутизация задач
| Задача | Модель | Почему |
|---|---|---|
| Многошаговое расследование, сложные терминальные процессы, трудная миграция | Sol | Максимальные возможности одного агента в линейке |
| Крупный проект с независимыми параллельными задачами | Sol + ultra | Параллельные агенты исследуют и выполняют задачи сообща |
| Тикеты, ревью PR, тесты, рефакторинг, повседневная работа в Codex | Terra | Экономичный стандарт на уровне GPT-5.5 |
| Механические преобразования, шаблоны, докстринги, массовые проверки | Luna | Быстро, дешево и достаточно, если тест проверяет результат |
Новые элементы управления заслуживают изучения. max дает агенту больше времени на размышление, проверку альтернатив и доработку. ultra по умолчанию запускает четыре агента параллельно. Это инструмент для сложных задач с реальными параллельными направлениями, а не повод собирать консилиум из-за пропущенной точки с запятой.
Для API-команд Programmatic Tool Calling — важнейшее улучшение. GPT-5.6 может писать и запускать небольшие программы в памяти для координации инструментов и обработки промежуточных данных. Вместо того чтобы прогонять каждую строчку лога через дорогой запрос к модели, агент фильтрует важное и сам выбирает следующий шаг.
Ценовая лестница дает четкую политику распределения нагрузки: Sol $5/$30, Terra $2.50/$15, Luna $1/$6 за миллион токенов ввода/вывода. Начинайте обычные задачи на Terra. Переключайтесь на Sol, когда задача доказала, что требует максимального интеллекта. Массовую рутину отдавайте Luna. Считайте итоговую стоимость готового изменения, а не только цену первого ответа.
Codex теперь встроен в новое десктопное приложение ChatGPT, предлагая редактирование diff в реальном времени, ревью PR в боковой панели, быстрый Computer Use и поддержку нескольких репозиториев. Это делает модель гораздо более удобным инструментом в привычной среде разработчика, хотя доступ к Sol и ultra зависит от тарифа и интерфейса.
Итог: GPT-5.6 — это сбалансированная команда, а не одна модель-герой. Она занимает первое место, потому что лидирует в сфере современных автономных агентов с инструментами, а гибкая ценовая сетка делает маршрутизацию экономически оправданной. Просто помните о нюансе со SWE-Bench и проверяйте модель на собственном коде перед запуском в продакшн.