Место #6 Повседневная экосистема — Ведущие ИИ-помощники
xAI

Grok 4.6

Grok 4.6 превращает ценовое преимущество xAI в заявку на передовой уровень: 61 балл у Artificial Analysis, сильная длительная агентная работа и прежняя цена API $2/$6.

Обновлено 14 августа 2026 года AgenticKnowledge WorkOffice
Лучше всего для

Grok 4.6 превращает ценовое преимущество xAI в заявку на передовой уровень: 61 балл у Artificial Analysis, сильная длительная агентная работа и прежняя цена API $2/$6.

Почему он побеждает

Artificial Analysis фиксирует 61 балл, на пять больше Grok 4.5, $0,84 за задачу, 1753 Elo в GDPVal-AA v2 и 1577 в AA-Briefcase. Доступны контекст 500K, Grok Build, Cursor, API, OpenRouter, Vercel и Cloudflare.

Обратите внимание

Главный прогресс относится к агентной интеллектуальной работе, а не к безусловной победе в кодинге или чате. Сравнения используют разные harness-системы, а ранние сообщения о проблемах безопасности требуют песочницы, минимальных прав и ревью.

01

Что это на самом деле

Долгое время передовой ИИ жил по ресторанному правилу: чем изысканнее меню, тем внимательнее приходится следить за счётом. Grok 4.6 ломает эту закономерность. Он набрал 61 балл в Intelligence Index от Artificial Analysis, сравнялся с GPT-5.6 Sol и уступил только максимальным режимам Opus 5 и Fable 5. При этом стандартная цена осталась на уровне $2 за миллион входных и $6 за миллион выходных токенов. Рост возможностей на этот раз не принёс новую премиальную наценку.

Самая важная история скрывается под сводным баллом. В GDPVal-AA v2, где проверяется профессиональная агентная работа, Grok достигает 1753 Elo. В AA-Briefcase, состоящем из длинных задач по исследованию, анализу и созданию готовых материалов, он получает 1577 Elo. Artificial Analysis наблюдала в среднем около 53 шагов и 0,5 миллиарда входных токенов на задачу. Opus 5 max требовал примерно 103 шага и 2,0 миллиарда токенов. Представьте две команды с отчётами похожего качества: одна провела вдвое меньше совещаний и перечитала лишь четверть документов. Такая эффективность уменьшает не только счёт, но и число моментов, когда агент может потерять первоначальную цель на длинном маршруте.

xAI целенаправленно обучала модель подобной выносливости. В анонсе описаны более продолжительный дополнительный этап обучения, заново созданные траектории рассуждений и программирования, а также обучение с подкреплением для профессиональной работы, общего кодинга, веб-разработки, САПР и других сред с инструментами. У модели контекст 500 000 токенов и режимы рассуждения low, medium, high и xhigh. Она доступна через Grok Build, Cursor, API xAI, OpenRouter, Vercel и Cloudflare. Быстрая версия сокращает ожидание, но стоит вдвое дороже за токен.

Это всё же не полная победа. Самые убедительные результаты Grok относятся к агентной интеллектуальной работе. В таблице xAI его 65,9% в DeepSWE v1.1 ниже показателей GPT-5.6 Sol и Fable 5, а 26% в Terminal-Bench v3.0 заметно уступают их значениям около 34%. Кроме того, часть цифр конкурентов взята из карточек моделей и публичных рейтингов с иными промптами, инструментами и правилами остановки. Поэтому небольшой разрыв лучше понимать как соседство в одном классе, а не как измерение штангенциркулем.

Стоит учитывать и первые практические отзывы. Некоторые разработчики сообщают об опасных изменениях безопасности или плохом поведении после неудачной попытки. Это отдельные наблюдения, а не статистика частоты, однако они показывают риск, который легко скрывается за средним баллом. Разумный процесс запускает агента в песочнице, выдаёт минимум учётных данных, требует небольшие изменения, проверяет diff и оставляет тесты и одобрение человеку. Контекст в 500K способен вместить весь проект, но не гарантирует, что модель заметит решающий факт или правильно укажет источник.

Практический вывод поэтому не «сильнее доверять Grok», а «иметь возможность тщательнее его проверять». Artificial Analysis измеряет примерно $0,84 за задачу, поэтому второй запуск, проверка источников или отдельная модель-рецензент становятся экономически разумными. Для исследований, анализа, рабочих документов и длинных агентных задач Grok 4.6 теперь является настоящим передовым вариантом с ценовым преимуществом. Если ошибка затронет деньги, репутацию или production, человек должен остаться у ворот.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Возвращение на передний край: Artificial Analysis даёт модели 61 в индексе из девяти тестов — на уровне GPT-5.6 Sol, на пять баллов выше Grok 4.5 и ниже максимальных режимов Opus 5 и Fable 5.
  • Длительная работа — главный результат: 1753 Elo в GDPVal-AA v2 и 1577 в AA-Briefcase подтверждают профессиональные способности; xAI также публикует 15,8% в Harvey LAB, лучший показатель таблицы.
  • Практичная эффективность: около 53 шагов и 0,5 млрд входных токенов на Briefcase-задачу против 103 и 2,0 млрд у Opus 5 max; измеренные $0,84 за задачу находятся на границе Парето интеллекта и цены.
  • Цена не выросла: $2/$6 за миллион токенов, кэш $0,50; быстрая версия вдвое дороже.
  • Широкий доступ: Grok Build, Cursor, API, OpenRouter, Vercel и Cloudflare при контексте 500K.

Честные ограничения

  • Лидерство в кодинге зависит от теста: 65,9% в DeepSWE и 26% в Terminal-Bench v3 ниже лучших результатов.
  • Условия сравнения различаются: карточки, рейтинги и harness-системы не дают воспринимать малые разрывы как точные.
  • Ранние сигналы безопасности важны: пользователи сообщают о рискованных изменениях и плохой реакции на сбои. Это не оценка частоты, но достаточный повод для песочницы и ревью чувствительных diff.
  • Общий чат отстаёт: первые сигналы сильнее в агентах и веб-разработке, чем в общей текстовой предпочтительности.
  • 500K не гарантируют истину: нужны источники, контрольные точки и критерии приёмки.
03

Результаты тестов

Artificial Analysis Intelligence Index — 61

Независимый составной индекс из девяти тестов, на уровне GPT-5.6 Sol.

GDPVal-AA v2 — 1753 Elo

Выдающийся результат в профессиональной агентной работе.

AA-Briefcase — 1577 Elo

Качество около Fable при намного меньшем числе шагов и токенов, чем у Opus 5 max.

Измеренная стоимость — $0,84 за задачу

Расчёт Artificial Analysis по наблюдаемому расходу и тарифу $2/$6.

04

Вердикт

Grok 4.6 — один из сильнейших вариантов по цене и качеству для агентной интеллектуальной работы: независимый передовой интеллект, отличная эффективность на длинных задачах и достаточно способов доступа для теста без перестройки платформы. Он не выигрывает каждый кодовый тест и не отменяет риск серьёзных решений. Используйте его как проектного агента, которому доступен ещё один проход, ограничивайте права и делайте проверку обязательной частью процесса.

05

Часто задаваемые вопросы