Лучший вопрос про кодинг-модели в сентябре 2026-го всё ещё не «какая умнее?». Он звучит иначе: «Какая модель доведет начатую работу до конца?» GPT-6 Astra отвечает делом, беря управление клавиатурой на себя: он живет в терминале, управляет браузером и рабочим столом, если возможностей терминала не хватает, и не сдается после первой ошибки — расходуя при этом примерно треть тех токенов, что потратил бы GPT-5.6 Sol на том же объеме задач.
Цифры из реальной практики разработчиков и синтетических тестов, честно датированные: в Code Arena от Arena.ai Astra (Max) забирает абсолютное первое место с 1 797 баллами в WebDev, создавая солидный отрыв в +35 баллов от Claude Fable 5.1 Max (1 762 балла) и +109 баллов от Opus 5 Max (1 688 баллов), лидирует в Data & Analytics, Consumer Product и Content Creation Tools и переопределяет границу Парето при $40 за миллион токенов. На синтетических терминальных бенчмарках Astra показывает 57,7–57,9% на Terminal-Bench 4.0 (Fable 5.1 — 55,8%), рекордные 74,1% на DeepSWE v1.1, 64,6% на Terminal-Bench Science и 88% pass@1 / 99,2% pass@4 на SRE-Bench. Собственный харнесс Artificial Analysis по-прежнему видит Fable 5.1 на 70 против 67 у Astra — а AA пересчитал таблицу к запуску Astra. Сегодня выбор харнесса и платформы тестирования двигает кодинг-оценки сильнее, чем смена поколений моделей.
Противовес не сдвинулся, и отмахиваться мы не будем. Разрешение issue в SWE-Bench Pro остаётся историей Claude Fable, а среда Claude Code от Anthropic — идеальное место для кропотливого и глубокого рефакторинга всего репозитория. Если ваша работа выглядит как «закрой этот трекер как надо», начните с Fable. Если как «построй это веб-приложение, почини мой билд, разбери инцидент, наладь машину, прогони эксперимент» — начните с Astra.
Направьте задачу
| Задача | Берите | Почему |
|---|---|---|
| Веб-разработка, фулстек-приложения, аналитика данных | Astra | №1 на Arena.ai Code Arena: WebDev (1 797 баллов, +35 перед Fable 5.1) |
| Тяжёлое терминальное расследование, упрямые миграции, разбор инцидентов | Astra | Лучшие терминал- и SRE-доказательства, меньше всего токенов на задачу |
| Работа, где нужны браузер или рабочий стол, а не только шелл | Astra | Лучшее в классе владение компьютером в кодинг-агенте |
| Глубокий рефакторинг репозитория, закрытие issue в Claude Code | Fable 5 / Fable 5.1 | SWE-Bench Pro и лидерство на харнессе AA |
| Повседневные тикеты, ревью PR, тесты, рефакторинг | Terra / Sol | Экономичный GPT-дефолт по прежним ценам |
| Механические преобразования, скаффолдинг, пакетные проверки | Luna | Быстро и дёшево, когда тест может проверить результат |
Экономика заслуживает честного абзаца. Ценник гласит $10/$50 — 2,5× Sol, а чтение кэша за $1 вчетверо дороже тарифа Fable 5.1, что ощутимо на длинных агентских циклах. Но Astra думает меньшим числом токенов: примерно треть от Sol и пятая часть от Opus на сопоставимых прогонах — поэтому независимые тестировщики раз за разом фиксируют за ним оптимальную границу цены и качества, причем стоимость решенной задачи у него подчас оказывается ниже, чем у Fable 5. Прогоните собственный репозиторий через оба, прежде чем поверить любой из счетов.
Честная оговорка: лаконичность Astra пропускает шаги полировки, которые замечают ревьюеры и рубрики; его киберспособности (100% ExploitBench, неизвестные 0-day на оценке) идут с ограничителями, замедляющими легитимную работу рядом с эксплойтами; а запуск первого дня был шероховатым — Enterprise выключен по умолчанию. Корона настоящая, корона узкая, и корона датирована. Перепроверьте таблицы через две недели — мы перепроверим.