Место #5 Кодинг — ИИ, который пишет код для продакшена
xAI

Grok 4.5

Grok 4.5 занимает 4-е место, делая агентские циклы передового уровня экономически нормой. Kimi K3 теперь выше по сырой способности и frontend-предпочтению, но Grok Build остается третьим в индексе кодинг-агентов Artificial Analysis и выполняет задачу за долю стоимости.

Обновлено 10 июля 2026 Agentic CodingCursorGrok Build
Лучше всего для

Grok 4.5 занимает 4-е место, делая агентские циклы передового уровня экономически нормой. Kimi K3 теперь выше по сырой способности и frontend-предпочтению, но Grok Build остается третьим в индексе кодинг-агентов Artificial Analysis и выполняет задачу за долю стоимости.

Почему он побеждает

Artificial Analysis оценивает Grok Build в 76 баллов в индексе кодинг-агентов — 3-е место, наравне с GPT-5.5 в Codex — и фиксирует стоимость $2,49 за задачу против $5,07 у GPT-5.5 и $11,80 у Fable 5. xAI сообщает о 83,3% в Terminal-Bench 2.1, 29,0% в SWE Marathon, скорости 80 TPS, тарифах $2/$6 и в 4,2 раза меньшем расходе выходных токенов на задачу в SWE-Bench Pro, чем у Opus 4.8 max. Доступен в Cursor на всех тарифах, Grok Build и по API.

Обратите внимание

4-е место награждает выгоду и эффективность, а не победу над всеми. SWE-Bench Pro и DeepSWE отстают от лидеров, а у Kimi K3 теперь сильнее аргумент сырой способности. Дешёвый код всё равно требует тестов и проверки безопасности.

01

Что это на самом деле

Есть два способа нанять кодинг-агента. Можно привлекать самого звёздного консультанта в городе на каждый тикет или взять отличного инженера, который работает достаточно быстро и недорого, чтобы сделать ещё одну попытку, если первая не удалась. Grok 4.5 — это второй вариант, и это весомый комплимент.

Artificial Analysis ставит Grok Build на третье место в индексе кодинг-агентов с оценкой 76: наравне с GPT-5.5 в Codex и позади Fable 5 в Claude Code. Главный аргумент в пользу покупки — цена. Тот же анализ оценивает стоимость в $2,49 за агентскую задачу для Grok Build против $5,07 у GPT-5.5 в Codex и $11,80 у Fable 5 в Claude Code. При этом Grok тратит значительно меньше токенов.

Именно поэтому Grok 4.5 остается сильным четвертым после прихода Kimi K3. График xAI показывает его почти наравне с лидерами в Terminal-Bench 2.1 с результатом 83,3% и впереди в SWE Marathon с 29,0% pass@1. Модель доступна в Cursor на всех тарифах и является стандартом в Grok Build. Длинные агентские циклы, работа в терминале, многошаговая отладка и изучение репозиториев становятся доступными для повторения.

О чём не стоит заявлять

Grok 4.5 не является новым королём чистых баллов. Его 64,7% в SWE-Bench Pro уступают 80,4% у Fable 5 и 69,2% у Opus 4.8. Результаты в DeepSWE также следуют за Fable и GPT-5.5. Если ваш рабочий процесс состоит исключительно из бенчмарков по решению сложных issue, лидеры по-прежнему удерживают преимущество.

Что делать вместо этого

Запускайте Grok 4.5 на задачах, где способный агент улучшает результат за счёт дополнительного цикла: исследование, работа в терминале, рефакторинг, тесты и итеративная разработка приложений. Инвестируйте сэкономленный бюджет в проверку кода. Переходите к GPT-5.6 или Fable 5, когда задача докажет, что ей необходим их технический потолок.

Главный вывод для программирования простой: Grok 4.5 — не самый дорогой молоток. Это отличный электроинструмент, который можно позволить себе держать включённым постоянно.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Честное третье место, а не маркетинг разработчика: Artificial Analysis ставит Grok Build на третье место в индексе кодинг-агентов с оценкой 76, наравне с GPT-5.5 в Codex и позади Fable 5 в Claude Code. Это правильная формулировка: сильный практический агент, а не вымышленная победа над всеми.
  • Колоссальный разрыв в стоимости агентских задач: Artificial Analysis отмечает $2,49 за задачу индекса кодинг-агентов для Grok Build против $5,07 у GPT-5.5 в Codex и $11,80 у Fable 5 в Claude Code. При этом расходуется 1,9 млн токенов на задачу против 6,2 млн и 7,2 млн соответственно.
  • Высокая конкурентоспособность в терминале: xAI фиксирует 83,3% в Terminal-Bench 2.1 — совсем рядом с 84,3% у Fable 5 и 83,4% у GPT-5.5 в официальном сравнении. Для работы с инструментами, шелл-командами и повторными попытками это отличный уровень.
  • Скорость и доступность стимулируют качественную инженерию: xAI предлагает Grok 4.5 со скоростью 80 TPS и тарифом $2/$6 за 1 млн токенов. Это позволяет легко запустить дополнительный тест, попросить вторую реализацию или дать агенту разобраться до вмешательства человека.
  • Удобная интеграция через Cursor и Grok Build: Grok 4.5 включён по умолчанию в Grok Build и доступен в Cursor на всех тарифах, а также через API. У модели есть готовая среда разработки вместо необходимости собирать собственную обвязку.

Честные ограничения

  • Лидерство по чистым баллам принадлежит другим: xAI сообщает о 64,7% в SWE-Bench Pro, что ниже 80,4% у Fable 5 и 69,2% у Opus 4.8 в той же таблице. Если ваша единственная задача — автоматическое решение сложных issue в репозиториях, лидеры остаются сильнее.
  • Достойно в DeepSWE, но без доминирования: В сравнении xAI модель Grok 4.5 набирает 62,0% в DeepSWE 1.0 и 53% в DeepSWE 1.1, уступая Fable 5 и GPT-5.5 в обоих случаях. Выгода в цене не отменяет разрыв в чистых баллах.
  • Команды из ЕС пока не могут использовать запуск: По данным xAI, Grok 4.5 ещё недоступен в ЕС в продуктах и консоли API. Ожидание в середине июля — это план, а не текущий доступ.
  • Экономия токенов не гарантирует корректный код: Меньшее число шагов и низкая цена становятся плюсом только после того, как изменения пройдут тесты, ревью, проверки безопасности и реальный контекст вашего проекта.
  • Свежий релиз требует осторожности: Используйте внутренние тестовые задачи перед стандартизацией на модели. Новое поведение обвязки имеет значение, а выгодная стоимость не заменяет CI.
03

Результаты тестов

Индекс кодинг-агентов Artificial Analysis — 76 (#3)

Независимый результат для Grok Build: наравне с GPT-5.5 в Codex и позади Fable 5 в Claude Code.

Стоимость в индексе кодинг-агентов — $2,49 за задачу

Artificial Analysis фиксирует $2,49 для Grok Build против $5,07 у GPT-5.5 в Codex и $11,80 у Fable 5 в Claude Code.

Terminal-Bench 2.1 — 83,3%

Официальное сравнение xAI ставит Grok совсем близко к Fable 5 (84,3%) и GPT-5.5 (83,4%) в задачах терминала.

SWE Marathon — 29,0% pass@1

xAI указывает результат Grok выше приведённых цифр Opus 4.8 и Fable 5 в этом длительном инженерном тесте.

SWE-Bench Pro — 64,7%

Важный противовес: график xAI помещает Grok ниже Fable 5 и Opus 4.8 в решении issue репозиториев.

04

Вердикт

Grok 4.5 занимает 4-е место, потому что рейтинг должен учитывать и способность, и доступность повторных агентных запусков. Kimi K3 теперь сильнее по сырым и frontend-данным; Grok остается выгодной альтернативой с сильным терминалом, третьим местом независимого агентного индекса, Cursor и низкой ценой. Используйте K3, Fable 5 или GPT-5.6 для большего потолка; Grok — для итераций без сжигания бюджета.

05

Часто задаваемые вопросы