Долгое время передовой ИИ жил по ресторанному правилу: чем изысканнее меню, тем внимательнее приходится следить за счётом. Grok 4.6 ломает эту закономерность. Он набрал 61 балл в Intelligence Index от Artificial Analysis, сравнялся с GPT-5.6 Sol и уступил только максимальным режимам Opus 5 и Fable 5. При этом стандартная цена осталась на уровне $2 за миллион входных и $6 за миллион выходных токенов. Рост возможностей на этот раз не принёс новую премиальную наценку.
Самая важная история скрывается под сводным баллом. В GDPVal-AA v2, где проверяется профессиональная агентная работа, Grok достигает 1753 Elo. В AA-Briefcase, состоящем из длинных задач по исследованию, анализу и созданию готовых материалов, он получает 1577 Elo. Artificial Analysis наблюдала в среднем около 53 шагов и 0,5 миллиарда входных токенов на задачу. Opus 5 max требовал примерно 103 шага и 2,0 миллиарда токенов. Представьте две команды с отчётами похожего качества: одна провела вдвое меньше совещаний и перечитала лишь четверть документов. Такая эффективность уменьшает не только счёт, но и число моментов, когда агент может потерять первоначальную цель на длинном маршруте.
xAI целенаправленно обучала модель подобной выносливости. В анонсе описаны более продолжительный дополнительный этап обучения, заново созданные траектории рассуждений и программирования, а также обучение с подкреплением для профессиональной работы, общего кодинга, веб-разработки, САПР и других сред с инструментами. У модели контекст 500 000 токенов и режимы рассуждения low, medium, high и xhigh. Она доступна через Grok Build, Cursor, API xAI, OpenRouter, Vercel и Cloudflare. Быстрая версия сокращает ожидание, но стоит вдвое дороже за токен.
Это всё же не полная победа. Самые убедительные результаты Grok относятся к агентной интеллектуальной работе. В таблице xAI его 65,9% в DeepSWE v1.1 ниже показателей GPT-5.6 Sol и Fable 5, а 26% в Terminal-Bench v3.0 заметно уступают их значениям около 34%. Кроме того, часть цифр конкурентов взята из карточек моделей и публичных рейтингов с иными промптами, инструментами и правилами остановки. Поэтому небольшой разрыв лучше понимать как соседство в одном классе, а не как измерение штангенциркулем.
Стоит учитывать и первые практические отзывы. Некоторые разработчики сообщают об опасных изменениях безопасности или плохом поведении после неудачной попытки. Это отдельные наблюдения, а не статистика частоты, однако они показывают риск, который легко скрывается за средним баллом. Разумный процесс запускает агента в песочнице, выдаёт минимум учётных данных, требует небольшие изменения, проверяет diff и оставляет тесты и одобрение человеку. Контекст в 500K способен вместить весь проект, но не гарантирует, что модель заметит решающий факт или правильно укажет источник.
Практический вывод поэтому не «сильнее доверять Grok», а «иметь возможность тщательнее его проверять». Artificial Analysis измеряет примерно $0,84 за задачу, поэтому второй запуск, проверка источников или отдельная модель-рецензент становятся экономически разумными. Для исследований, анализа, рабочих документов и длинных агентных задач Grok 4.6 теперь является настоящим передовым вариантом с ценовым преимуществом. Если ошибка затронет деньги, репутацию или production, человек должен остаться у ворот.