Место #4 Программирование — ИИ, который пишет код для продакшена
OpenAI

GPT-6.1 Sol

GPT-6.1 Sol — это агент для программирования, которого можно использовать круглыми сутками, не переживая о счетах. В независимых тестах он отстает от флагманской модели OpenAI GPT-6 Astra всего на балл-два, при этом типичная задача обходится более чем вчетверо дешевле. Цена за токен не изменилась по сравнению с GPT-6 Sol ($2 за ввод, $10 за вывод за миллион токенов), но повторное чтение кэшированного кода теперь стоит всего $0.10 за миллион токенов — именно здесь кроется главная экономия при работе с большими репозиториями.

Обновлено 30 сентября 2026 г. Value Coding AgentDeepSWE 75.2%$0.10 Cached Input
Лучше всего для

GPT-6.1 Sol — это агент для программирования, которого можно использовать круглыми сутками, не переживая о счетах. В независимых тестах он отстает от флагманской модели OpenAI GPT-6 Astra всего на балл-два, при этом типичная задача обходится более чем вчетверо дешевле. Цена за токен не изменилась по сравнению с GPT-6 Sol ($2 за ввод, $10 за вывод за миллион токенов), но повторное чтение кэшированного кода теперь стоит всего $0.10 за миллион токенов — именно здесь кроется главная экономия при работе с большими репозиториями.

Почему он побеждает

29 сентября 2026 года Artificial Analysis оценила отставание модели от GPT-6 Astra в один балл по Индексу интеллекта (Intelligence Index: 52 против 53) при стоимости $0.72 за задачу по сравнению с $3.26. В индексе Coding Agent Index настройка xhigh обошла Astra на один балл, обойдясь менее чем в 15% от стоимости последней. OpenAI заявляет результат 75.2% в DeepSWE v1.1 на высоком уровне усилий, а в тесте FrontierCode 1.1 от Cognition модель набирает 58.1% на низком усилии за $0.21 на задачу — лучший результат среди моделей со стоимостью ниже $0.30 в этом рейтинге.

Обратите внимание

Оценка качества объединения кода (merge quality) не улучшилась: в FrontierCode 1.1 модель получает 60.4% — столько же, сколько и GPT-6 Sol. Выигрыш заключается в стоимости, а не в повышении предельных возможностей. Собственные таблицы OpenAI показывают, что GPT-6 Astra по-прежнему лидирует в сложных научных задачах в терминале. Claude Sonnet 5.5 получает более высокие оценки в широком индексе от Artificial Analysis, хотя и стоит гораздо дороже в пересчете на задачу. В самом ChatGPT модель доступна только в версиях Work и Codex на платных тарифах.

01

Что это на самом деле

Представьте себе стройплощадку, где работают два крановщика.

Один из них — ветеран, которого приглашают для подъема грузов, за которые больше никто не берется: например, продеть стальную балку между двумя башнями при сильном боковом ветре. Другой оператор почти так же хорош, но берет лишь малую долю от дневной ставки первого. При любых обычных работах — подъеме поддонов с кирпичами, кровельных ферм или выполнении повседневных задач — нанимать ветерана было бы просто глупо.

GPT-6.1 Sol — это тот самый второй оператор, и в этом месяце разница в квалификации между ними стала совсем небольшой.

Релиз, родившийся из-за отмены

OpenAI выпустила GPT-6.1 Sol на своем мероприятии DevDay 29 сентября 2026 года, всего через неделю после выхода GPT-6 Sol. За таким графиком скрывалась своя история. За день до этого OpenAI отменила запланированный запуск GPT-6.1 Astra, поскольку внутреннее тестирование показало, что модель не может надежно оставаться в рамках заданных масштабов и разрешений своих задач. Sol 6.1 — это отдельная, более компактная модель, и ее собственный отчет о безопасности выглядит куда чище: в тесте OpenAI на то, признается ли агент в поломке своего поискового инструмента, а не пытается угадать, GPT-6.1 Sol скрыл проблему лишь в 2.1% случаев по сравнению с 4.9% у GPT-6 Sol и 1.5% у GPT-6 Astra.

Коммерческое предложение OpenAI предельно ясно: интеллект, близкий к Astra, за пятую часть цены.

Действительно ли модель близка к Astra?

Именно этот вопрос имеет решающее значение, и на этот раз нам не нужно полагаться только на заявления разработчика.

Artificial Analysis, независимая компания по тестированию, провела свои тесты в день выпуска модели. В ее Индексе интеллекта (Intelligence Index), который объединяет десять сложных тестов, GPT-6.1 Sol на максимальном уровне усилий получил 52 балла — отстав всего на один балл от GPT-6 Astra с ее 53 баллами и опередив GPT-6 Sol на четыре балла. В индексе Coding Agent Index разрыв еще меньше: на максимальном усилии (Max Effort) Sol отстает от Astra на 2 балла, а на втором по величине уровне усилий, xhigh, он действительно обогнал Astra на один балл, затратив на задачу менее 15% стоимости.

Cognition, компания, создавшая агента для программирования Devin, проверила модель с помощью FrontierCode 1.1 — бенчмарка, который ставит жесткий вопрос: стал бы старший разработчик действительно объединять (merge) это изменение? Лучший балл GPT-6.1 Sol составил 60.4%, что фактически повторяет показатель GPT-6 Sol (60.7%). Вся разница заключается в стоимости. При среднем уровне усилий модель тратит $0.31 на задачу — это на 81% меньше, чем потратил GPT-6 Sol на максимальном уровне усилий для достижения своего лучшего показателя. При низком уровне усилий она набирает 58.1% всего за $0.21, что выше результата GPT-6 Sol в 50.5% при аналогичных настройках.

Собственные данные OpenAI указывают на ту же тенденцию. В бенчмарке DeepSWE v1.1, проверяющем выполнение сложных инженерных задач на реальных кодовых базах, в их таблице указан результат 75.2% при высоком уровне усилий (High Effort) и стоимости $0.65 на задачу. Это на 6.4 балла выше максимального результата GPT-6 Sol и чуть выше лучшего результата Astra (74.1%), стоимость которого составляет $4.43 на задачу. Стоит упомянуть одну странность: на настройках xhigh и max GPT-6.1 Sol парадоксальным образом показывает более низкий результат — 71.9%. Больше размышлений не всегда означает лучшее качество мышления.

Следовательно, объективный итог таков: программирование примерно на уровне Astra и такое же качество объединения кода, как у модели Sol недельной давности, но по существенно более низкой цене за каждое завершенное задание.

Почему стоимость кэширования — это главная новость

Агент для программирования никогда не читает ваш проект лишь единожды. Каждый раз, когда он запускает тест, считывает ошибку и пробует снова, он перечитывает одни и те же файлы, инструкции и историю. Во время длинной сессии это может означать, что одни и те же несколько сотен тысяч токенов загружаются в модель десятки раз.

Это именно то, к чему относится кэшированный ввод (Cached Input): текст, который модель недавно уже видела во время данной сессии. GPT-6.1 Sol берет $0.10 за миллион кэшированных токенов — это скидка 95% от стандартных $2 и половина стоимости кэша GPT-6 Sol. Обычные тарифы на ввод и вывод остаются на уровне $2 и $10 за миллион, что в пять раз меньше тарифов GPT-6 Astra ($10/$50).

Сложите все это, и вы получите самую важную цифру: по оценке Artificial Analysis, выполнение их бенчмарка на GPT-6.1 Sol обходится примерно в $0.72 за задачу, по сравнению с $3.26 для GPT-6 Astra, $5.98 для Claude Opus 5.5 и $7.60 для Claude Sonnet 5.5. Есть только одна оговорка: промпты, размер которых превышает 272 000 входных токенов, обойдутся в 2 раза дороже при вводе и в 1.5 раза дороже при выводе, что делает единичные гигантские запросы весьма затратными.

Не выкручивайте уровень усилий на максимум

GPT-6.1 Sol имеет пять уровней настройки усилий (effort): низкий (low), средний (medium — по умолчанию), высокий (high), очень высокий (xhigh) и максимальный (max). Легко предположить, что “max” всегда лучше. В индексе Coding Agent Index (Artificial Analysis) это оказалось не так: настройка xhigh получила более высокий балл, чем max, и обошлась дешевле. Для повседневных исправлений зачастую достаточно уровней low или medium; это подтверждает результат Cognition — 58.1% за $0.21. Приберегите уровень “xhigh” для задач, действительно которым действительно нужно дополнительное обдумывание.

Объективные ограничения модели

  • Более выгодная стоимость, а не улучшенный код. Качество готового к объединению кода в FrontierCode 1.1 не изменилось по сравнению с GPT-6 Sol и GPT-5.6 Sol. Если ваша проблема заключалась в том, что исправления от Sol были недостаточно качественными, версия 6.1 ее не решит. Она лишь делает те же самые исправления гораздо дешевле.
  • Наука по-прежнему остается уделом Astra. В тесте OpenAI Terminal-Bench Science 0.1 (анализ данных, симуляции и доказательство теорем в терминале) GPT-6.1 Sol на максимальном усилии набирает 57.0%. Это более чем в два раза выше показателя GPT-6 Sol (27.6%), но значительно отстает от GPT-6 Astra (68.1%) и Claude Opus 5.5 (63.3%). При этом задача обходится в $5.47 по сравнению с примерно $23 у конкурентов.
  • Claude лидирует в широком индексе. Claude Opus 5.5 (58) и Claude Sonnet 5.5 (56) продолжают опережать GPT-6.1 Sol (52) в Индексе интеллекта от Artificial Analysis. И хотя агентство зафиксировало для GPT-6.1 Sol прирост на 12 баллов по сравнению с GPT-6 Sol в тесте Terminal-Bench 4.0, базовый показатель Sonnet в 64% в этом тесте по-прежнему выше. Однако для достижения такого результата Sonnet сжигает куда больше токенов, так что Sol выигрывает по стоимости на задачу.
  • Модель недоступна в стандартном чате. Внутри ChatGPT модель GPT-6.1 Sol доступна в интерфейсах ChatGPT Work и Codex для подписчиков тарифных планов Plus, Pro, Business, Enterprise и Edu. Разработчики используют ее в API под названием gpt-6.1-sol. В OpenAI заявляют о разработке более быстрого режима “Ultrafast” для Codex, но в настоящий момент он еще не запущен.

Кому следует использовать эту модель

Если ваша работа похожа на… Выбирайте Причина
Баги, тесты, рефакторинг, ИИ-агенты, круглосуточно работающие в CI GPT-6.1 Sol Качество программирования, близкое к флагманскому, за малую долю стоимости на задачу
Научные вычисления, самые сложные задачи по управлению компьютером GPT-6 Astra Явное лидерство в работе с научными терминалами
Принятие архитектурных решений, требующих гибкого подхода Claude Opus 5.5 Высший балл в широком независимом индексе
Длительные терминальные сессии, в которых расход токенов не имеет значения Claude Sonnet 5.5 Более высокий независимый показатель терминала, но больший расход токенов

Вердикт для разработчиков

GPT-6.1 Sol не поднимает потолок возможностей. Модель просто делает эти максимальные возможности доступными для повседневных бюджетов. Независимые тесты ставят модель в пределах одного-двух баллов от флагманской версии OpenAI за менее чем четверть стоимости на задачу, а цены на кэш специально адаптированы под то, как на самом деле работают агенты для программирования. Загружайте в модель свой бэклог, устанавливайте режим “xhigh” для сложных задач и обращайтесь за помощью к Astra или Opus только тогда, когда модель зайдет в тупик.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Почти флагманский уровень разработки, подтвержденный независимо: Artificial Analysis измерила индекс Coding Agent Index 29 сентября 2026 года. На максимальном усилии (max effort) GPT-6.1 Sol на 2 балла отстает от GPT-6 Astra, а его настройка xhigh фактически обошла Astra на 1 балл менее чем за 15% от стоимости на задачу.
  • Дешево за выполненную задачу, а не только за токен: Выполнение полного индекса Artificial Analysis с помощью GPT-6.1 Sol обходится примерно в $0.72 за задачу по сравнению с $3.26 для GPT-6 Astra, $5.98 для Claude Opus 5.5 и $7.60 для Claude Sonnet 5.5 — все на максимальном усилии (Max Effort).
  • Цена кэша разработана специально для больших кодовых баз: Повторное чтение текста, который модель уже видела (например, ваш репозиторий), стоит $0.10 за миллион токенов — это скидка 95% от обычной цены ввода и вдвое дешевле кэша GPT-6 Sol. Агенты для программирования постоянно перечитывают одни и те же файлы, поэтому именно здесь происходит основная экономия.
  • Эффективен даже при низком уровне усилий: В тесте FrontierCode 1.1 от Cognition, оценивающем готовность изменений кода к объединению (merge), GPT-6.1 Sol набирает 58.1% на низком усилии за $0.21 на задачу, что выше 50.5% у GPT-6 Sol с теми же настройками. На всех уровнях усилий его стоимость на задачу на 44–57% ниже, чем у GPT-6 Sol.
  • Заметный скачок в реальных инженерных задачах: В DeepSWE v1.1 таблица OpenAI показывает 75.2% на высоком усилии (High Effort) за $0.65 на задачу — на 6.4 балла выше лучшего результата GPT-6 Sol (68.8% на максимуме, $2.74) и немного выше лучшего результата GPT-6 Astra (74.1% на xhigh, $4.43).

Честные ограничения

  • Качество объединения кода (merge quality) не изменилось: В FrontierCode 1.1 лучший балл модели 60.4% соответствует показателям GPT-6 Sol (60.7%) и GPT-5.6 Sol (60.6%). Вы получаете код такого же уровня готовности к слиянию за гораздо меньшие деньги, но сам код не становится лучше.
  • Это не модель для сложных терминальных научных вычислений: В тесте OpenAI Terminal-Bench Science 0.1, включающем анализ данных, симуляции и доказательство теорем, GPT-6.1 Sol на максимальном усилии набирает 57.0% — более чем в два раза выше GPT-6 Sol (27.6%), но значительно отстает от GPT-6 Astra (68.1%) и Claude Opus 5.5 (63.3%).
  • Claude по-прежнему лидирует в широком индексе: В Индексе интеллекта (Intelligence Index) от Artificial Analysis модели Claude Opus 5.5 (58) и Claude Sonnet 5.5 (56) набирают больше баллов, чем GPT-6.1 Sol (52). Artificial Analysis зафиксировала прирост в 12 баллов в Terminal-Bench 4.0 по сравнению с GPT-6 Sol, но начальный результат Sonnet 5.5 (64%) все равно выше, хотя Sonnet расходует на это гораздо больше токенов.
  • Максимальное усилие (max) — не лучшая настройка: В индексе Coding Agent Index от Artificial Analysis настройка xhigh показала более высокий результат, чем max. Таблица DeepSWE от самой OpenAI демонстрирует ту же картину: 75.2% на высоком усилии (high effort), но снижение до 71.9% на настройках xhigh и max, которые к тому же стоят дороже.
  • Многие ключевые цифры предоставлены OpenAI: DeepSWE, OSWorld, GDP.pdf и AutomationBench взяты из презентационных таблиц OpenAI. Однако результаты от Artificial Analysis и Cognition получены независимо, и они в целом совпадают с данными компании.
03

Результаты тестов

Coding Agent Index (Artificial Analysis) — обходит GPT-6 Astra на xhigh

Независимый тест, 29 сентября 2026 г. На усилии xhigh GPT-6.1 Sol обходит GPT-6 Astra на 1 балл менее чем за 15% стоимости Astra за задачу. На максимуме (max) он отстает от Astra на 2 балла и опережает GPT-6 Sol на 3 балла.

Индекс интеллекта (Artificial Analysis) — 52 (максимальное усилие)

Независимый сводный индекс из 10 оценок, включая Terminal-Bench 4.0 и SciCode. На один балл ниже GPT-6 Astra (53), лучше 48 баллов у GPT-6 Sol, стоимость $0.72 за задачу по сравнению с $3.26 у Astra.

FrontierCode 1.1 — лучший результат 60.4%; 58.1% за $0.21 (низкое усилие)

Бенчмарк Cognition для оценки кода, готового к объединению, опубликован 29 сентября 2026 г. Лучший балл находится на уровне GPT-6 Sol. Результат при низком усилии — самый высокий среди всех моделей стоимостью до $0.30 за задачу в этом рейтинге.

DeepSWE v1.1 — 75.2% (высокое усилие, $0.65 за задачу)

Таблица OpenAI по сложным инженерным задачам в реальных кодовых базах. Лучший результат GPT-6 Astra — 74.1% на xhigh за $4.43; у GPT-6 Sol — 68.8% на максимуме за $2.74. Показатель GPT-6.1 Sol снижается до 71.9% на настройках xhigh и max.

Terminal-Bench Science 0.1 — 57.0% (максимальное усилие, $5.47 за задачу)

Выполнение научных процессов в терминале, согласно таблице OpenAI. Лидирует GPT-6 Astra с 68.1% ($23.80 за задачу), Claude Opus 5.5 набирает 63.3% ($23.21), а GPT-6 Sol — 27.6% ($12.18).

Цена — $2 / $10 за 1 млн токенов, $0.10 в кэше

Та же цена токенов, что и у GPT-6 Sol, и в пять раз дешевле GPT-6 Astra ($10/$50). Запросы (промпты) объемом свыше 272 тыс. токенов стоят в 2 раза дороже за ввод и в 1.5 раза дороже за вывод; для пакетной (Batch) и гибкой (Flex) обработки действует скидка 50%.

04

Вердикт

GPT-6.1 Sol предназначен для команд, которым нужны агенты для программирования почти флагманского уровня, работающие круглосуточно по ценам моделей среднего сегмента. Независимые тесты оценивают его отставание от GPT-6 Astra всего в один-два балла при стоимости на задачу менее четверти от флагманской. Он занимает место чуть ниже Claude Sonnet 5.5, так как Sonnet набирает более высокие баллы в широком независимом индексе и при работе в терминале, а оценка качества кода Sol, готового к интеграции, не улучшилась по сравнению с GPT-6 Sol. Модель обходит Claude Fable 5.1 в повседневном программировании за счет экономичности выполнения отдельной задачи. GPT-6 Astra стоит оставить для научной работы в терминале и самых сложных задач по управлению компьютером. GPT-6.1 Sol отлично справится с бэклогом, а при возникновении трудностей попробуйте использовать настройку xhigh вместо max.

05

Часто задаваемые вопросы