Каждый запуск флагмана приходит с одним и тем же плакатом: самая умная модель из когда-либо созданных. Плакат GPT-6 Astra другой — и куда более полезный. Он гласит: эта модель сама садится за клавиатуру. Astra — новый флагман OpenAI для работы вне чата: управлять браузером, щёлкать по настольным приложениям, доводить многошаговый профессиональный процесс до конца — и при этом заметно лучше проверять собственные факты.
Измеренная история соответствует анонсу. На OSWorld 2.0, тесте настольных операций, Astra набирает 72,6% и заканчивает примерно за 40 минут, где GPT-5.6 Sol требовалось около 75; Opus 5 — 70,2%. На Agents’ Last Exam, оценке долгих профессиональных процессов в 55 областях, он достигает 59,3%. А мониторинг фактологичности Artificial Analysis показывает уровень галлюцинаций примерно вдвое ниже, чем у Sol, при более высокой точности. Меньше самоуверенных ошибок, быстрее законченная работа — апгрейд, который чувствуешь уже в первую неделю.
Вот честная звёздочка. В Intelligence Index Artificial Analysis Astra набирает 61,2 — статистическая ничья с 60,9 у Sol, — а Claude Fable 5.1 лидирует с 65,7. В интеллектуальной работе GDPval-AA v2 примерно 1629 у Astra отстают от Opus 5 (1824) и Fable 5.1 (1853) — и от Sol. Если ваш день — due diligence, записки и суждения, новый флагман не автоматически лучший инструмент; это другой инструмент. А цена API — $10/$50 за миллион токенов, 2,5× Sol, чтение кэша $1 — прямо называет цену этой разницы.
Направьте работу по адресу
| Задача | Кому отдать | Почему |
|---|---|---|
| «Сделай на моём компьютере»: браузер, файлы, настольные приложения, до конца | Astra | Лучшая измеренная работа за компьютером, примерно вдвое быстрее на задачу |
| Интеллектуальная работа с упором на суждение, due diligence, длинные документы | Opus 5 | Выше GDPval при четверти цены API |
| Самое сложное чистое рассуждение и длинный запутанный контекст | Fable 5 / Fable 5.1 | Лидирует в независимых сводных индексах |
| Поток, черновики, ежедневный конвейер | Sol / Terra / Luna | Всё ещё доступны, всё ещё самые дешёвые места |
Честная оговорка
Astra лаконичен по характеру. Этот скоростной стиль выигрывает оценки по программированию и проигрывает рубрики права, финансов и налогов, где ценится перечисление каждого шага; качество презентаций просело относительно Sol даже при скачке качества анализа. Запуск первого дня был беспорядочным: платные пользователи играли в лотерею доступа, а корпоративные аккаунты получили Astra выключенным по умолчанию. Нативной генерации изображений нет, вывода звука и видео — тоже. А заметно более сильные киберспособности (100% на ExploitBench, с найденными на оценке ранее неизвестными 0-day) идут с более строгими ограничителями, которые могут замедлить легитимную околобезопасную работу.
Так что выигрышная привычка: Astra — за руль, Opus — за суждение, Fable — за трудное мышление, Sol — за конвейер. OpenAI построила не больший мозг; она построила лучшие руки. Для массы реальной работы именно это и есть важный апгрейд.