Место #1 Программирование — ИИ, который пишет код для продакшена
OpenAI

GPT-6 Astra

GPT-6 Astra берёт coding-корону реальным голосованием разработчиков и агентской практикой: новый №1 на Arena.ai Code Arena (1 797 баллов в WebDev), закрытие инцидентов, терминальные сессии и полная настройка рабочего места при расходе примерно трети токенов Sol.

Обновлено 5 сентября 2026 Arena #1Coding AgentAgentic
Лучше всего для

GPT-6 Astra берёт coding-корону реальным голосованием разработчиков и агентской практикой: новый №1 на Arena.ai Code Arena (1 797 баллов в WebDev), закрытие инцидентов, терминальные сессии и полная настройка рабочего места при расходе примерно трети токенов Sol.

Почему он побеждает

№1 на Arena.ai Code Arena в общем зачёте и в WebDev с 1 797 баллами (+35 баллов отрыва от Claude Fable 5.1 Max и +109 от Opus 5 Max), лидерство в Data & Analytics, Consumer Product и Content Creation Tools; плюс 57,7–57,9% на Terminal-Bench 4.0, рекордные 74,1% на DeepSWE v1.1, 64,6% на Terminal-Bench Science и 88% pass@1 / 99,2% pass@4 на SRE-Bench.

Обратите внимание

На синтетическом харнессе Artificial Analysis Fable 5.1 по-прежнему опережает Astra со счётом 70:67, а SWE-Bench Pro остаётся исторической силой Claude Fable. Ценник API — $10/$50 (в 2,5× выше Sol), чтение кэша стоит вчетверо дороже ($1 против $0,25 у Fable 5.1), лаконичные ответы иногда пропускают шаги оформления отчётов, а усиленные кибер-ограничители могут добавлять трения в анализе уязвимостей.

01

Что это на самом деле

Лучший вопрос про кодинг-модели в сентябре 2026-го всё ещё не «какая умнее?». Он звучит иначе: «Какая модель доведет начатую работу до конца?» GPT-6 Astra отвечает делом, беря управление клавиатурой на себя: он живет в терминале, управляет браузером и рабочим столом, если возможностей терминала не хватает, и не сдается после первой ошибки — расходуя при этом примерно треть тех токенов, что потратил бы GPT-5.6 Sol на том же объеме задач.

Цифры из реальной практики разработчиков и синтетических тестов, честно датированные: в Code Arena от Arena.ai Astra (Max) забирает абсолютное первое место с 1 797 баллами в WebDev, создавая солидный отрыв в +35 баллов от Claude Fable 5.1 Max (1 762 балла) и +109 баллов от Opus 5 Max (1 688 баллов), лидирует в Data & Analytics, Consumer Product и Content Creation Tools и переопределяет границу Парето при $40 за миллион токенов. На синтетических терминальных бенчмарках Astra показывает 57,7–57,9% на Terminal-Bench 4.0 (Fable 5.1 — 55,8%), рекордные 74,1% на DeepSWE v1.1, 64,6% на Terminal-Bench Science и 88% pass@1 / 99,2% pass@4 на SRE-Bench. Собственный харнесс Artificial Analysis по-прежнему видит Fable 5.1 на 70 против 67 у Astra — а AA пересчитал таблицу к запуску Astra. Сегодня выбор харнесса и платформы тестирования двигает кодинг-оценки сильнее, чем смена поколений моделей.

Противовес не сдвинулся, и отмахиваться мы не будем. Разрешение issue в SWE-Bench Pro остаётся историей Claude Fable, а среда Claude Code от Anthropic — идеальное место для кропотливого и глубокого рефакторинга всего репозитория. Если ваша работа выглядит как «закрой этот трекер как надо», начните с Fable. Если как «построй это веб-приложение, почини мой билд, разбери инцидент, наладь машину, прогони эксперимент» — начните с Astra.

Направьте задачу

Задача Берите Почему
Веб-разработка, фулстек-приложения, аналитика данных Astra №1 на Arena.ai Code Arena: WebDev (1 797 баллов, +35 перед Fable 5.1)
Тяжёлое терминальное расследование, упрямые миграции, разбор инцидентов Astra Лучшие терминал- и SRE-доказательства, меньше всего токенов на задачу
Работа, где нужны браузер или рабочий стол, а не только шелл Astra Лучшее в классе владение компьютером в кодинг-агенте
Глубокий рефакторинг репозитория, закрытие issue в Claude Code Fable 5 / Fable 5.1 SWE-Bench Pro и лидерство на харнессе AA
Повседневные тикеты, ревью PR, тесты, рефакторинг Terra / Sol Экономичный GPT-дефолт по прежним ценам
Механические преобразования, скаффолдинг, пакетные проверки Luna Быстро и дёшево, когда тест может проверить результат

Экономика заслуживает честного абзаца. Ценник гласит $10/$50 — 2,5× Sol, а чтение кэша за $1 вчетверо дороже тарифа Fable 5.1, что ощутимо на длинных агентских циклах. Но Astra думает меньшим числом токенов: примерно треть от Sol и пятая часть от Opus на сопоставимых прогонах — поэтому независимые тестировщики раз за разом фиксируют за ним оптимальную границу цены и качества, причем стоимость решенной задачи у него подчас оказывается ниже, чем у Fable 5. Прогоните собственный репозиторий через оба, прежде чем поверить любой из счетов.

Честная оговорка: лаконичность Astra пропускает шаги полировки, которые замечают ревьюеры и рубрики; его киберспособности (100% ExploitBench, неизвестные 0-day на оценке) идут с ограничителями, замедляющими легитимную работу рядом с эксплойтами; а запуск первого дня был шероховатым — Enterprise выключен по умолчанию. Корона настоящая, корона узкая, и корона датирована. Перепроверьте таблицы через две недели — мы перепроверим.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Новый абсолютный лидер на арене разработчиков и в терминале: Astra (Max) берёт первое место в Code Arena от Arena.ai со счётом 1 797 баллов в WebDev — солидный отрыв на +35 баллов от Claude Fable 5.1 Max (1 762) и на +109 от Opus 5 Max (1 688), побеждая в Data & Analytics, Consumer Product и инструментах создания контента, а также формируя границу Парето при $40 за миллион смешанных токенов. На синтетике он подтверждает статус: 57,7–57,9% на Terminal-Bench 4.0 и рекордные 74,1% на DeepSWE v1.1.
  • Он программирует как учёный: 64,6% на Terminal-Bench Science против 52,6% у Fable 5.1 и 22,4% у Sol плюс примерно 97,6% на FrontierMath Tier 4. Для вычислительной, насыщенной данными и околонаучной разработки разрыв не косметический.
  • Токен-эффективность меняет счёт: независимый трекинг агентов ставит Astra примерно на треть токенов Sol и пятую часть токенов Opus на сопоставимых прогонов. На кодинг-агентах Astra лежит на границе цена/качество и может завершать дешевле Fable 5 вопреки большему ценнику — меряйте на своём репозитории, а не на прайс-листе.
  • SRE и безопасность, которыми реально пользоваться: 88% pass@1 и 99,2% pass@4 на SRE-Bench, 100% на ExploitBench и ранее неизвестные 0-day, всплывшие на оценке. Защитные и reliability-команды получают здесь настоящую мощь — с бо́льшим числом отказов на dual-use-промпты как видимой пошлиной.
  • Апгрейд без переезда: тот же Codex, тот же ChatGPT Work, тот же Responses API (gpt-6-astra), плюс Azure, Bedrock, Zero Data Retention для подходящих API-сценариев, контекст около 1,05 млн токенов и интеграции первого дня вроде Devin. Ничему в вашем пайплайне переезжать не нужно.

Честные ограничения

  • Лидерство в индексе на собственном харнессе сегодня у Anthropic: собственный харнесс Artificial Analysis оценивает Fable 5.1 в 70 против 67 у Astra (конфигурация Codex), а история SWE-Bench Pro остаётся за Fable (80,3% против 64,6% у Sol в опубликованном сравнении GPT-5.6). Кропотливый глубокий рефакторинг репозитория внутри харнесса Claude Code по-прежнему говорит в пользу Fable.
  • Ценник премиальный: $10/$50 за миллион токенов — 2,5× Sol — с чтением кэша за $1 против $0,25 у Fable 5.1, что доминирует в счетах многоходовых агентов; промпты свыше 272 тыс. токенов стоят 2× вход / 1,5× выход, а быстрый режим удваивает цену. Эффективность обычно выигрывает арифметику — но не всегда.
  • Трение реально: лаконичные ответы пропускают рубричные и отчётные тонкости, которые замечают оценивающие системы и живые ревьюеры; запуск первого дня был беспорядочным, Enterprise приехал выключенным по умолчанию; кибер-ограничители замедляют часть легитимных промптов рядом с эксплойтами; нативной генерации изображений для ассетов нет.
03

Результаты тестов

Arena.ai Code Arena: WebDev — Astra (Max) 1 797 баллов (#1)

Голосование разработчиков на реальных задачах, начало сентября 2026 года. Astra обходит Claude Fable 5.1 Max (1 762 балла) на +35 пунктов и Claude Opus 5 Max (1 688 баллов) на +109 пунктов; #1 в Data & Analytics, Consumer Product и инструментах создания контента.

Artificial Analysis Coding Agent Index — Astra 67 · Fable 5.1 70

Собственный харнесс AA, дата — 4 сентября 2026 года. Таблицу пересчитали после цифр запуска GPT-5.6 (эра Sol 77,4), так что сравнения между эпохами не равноценны; выбор харнесса двигает эти оценки сильнее, чем обновления моделей.

Terminal-Bench 4.0 — Astra 57,7–57,9%

Таблица OpenAI сдвинулась после публикации, отсюда вилка. Fable 5.1 — 55,8%. Ближайший публичный тест к настоящей шелл-разработке.

DeepSWE v1.1 — Astra 74,1%

Лучший результат текущей таблицы, но в плотной куче: Opus 5 — 73,7%, Gemini 3.8 Flash — 73,8%, Fable 5.1 — 67,4%. Отрыв, а не обвал.

Terminal-Bench Science — Astra 64,6%

Против 52,6% у Fable 5.1 и 22,4% у Sol. Самый чистый разрыв в launch-наборе — вендорский замер, поэтому датируйте и перепроверяйте на своих нагрузках.

SRE-Bench — 88% pass@1 · 99,2% pass@4

Инженерия надёжности в реальных инцидентных условиях. Вместе со 100% на ExploitBench трек безопасности — настоящий скачок этого релиза.

04

Вердикт

GPT-6 Astra — наш выбор номер один по программированию: статус №1 на независимой Code Arena от Arena.ai (1 797 баллов), терминальная эффективность, глубина интеграции и низкая стоимость решенной задачи перевешивают лидерство Fable в синтетическом харнессе AA. Веб-разработку, агентские задачи, автоматизацию рабочего стола и научные вычисления отдавайте Astra; глубокий и кропотливый рефакторинг репозитория в среде Claude Code оставьте Fable 5; Sol, Terra и Luna пусть остаются экономичным вариантом по умолчанию. Тестовые окружения расходятся между собой сильнее, чем сами модели, — замеряйте результаты на собственном репозитории, прежде чем перестраивать процессы команды.

05

Часто задаваемые вопросы