Большинство ИИ-помощников построены вокруг простого окна чата: вы задаете вопрос и получаете ответ. Kimi K3 идет дальше и объединяет чат с отдельными инструментами для исследований, документов, таблиц, презентаций, сайтов, программирования и автоматизации. Moonshot не просто обучила более крупную модель, а создала набор продуктов, которые превращают рассуждения модели в готовую работу.
Независимые результаты оправдывают серьезное отношение. Artificial Analysis дает K3 57, 1668 Elo на GDPval-AA v2 и 1547 Elo на AA-Briefcase. В этом тесте длительной профессиональной работы выше только Claude Fable 5. На AutomationBench-AA K3 получает 53% и первое место. Проще говоря, модель не только знает ответы, но умеет доводить многошаговое задание до результата.
Набор продуктов Kimi необычно широк. Agent проводит исследования, создает сайты и документы, анализирует таблицы и готовит презентации. Kimi Work переносит агентные сценарии в настольное приложение. Kimi Code предназначен для разработчиков, Agent Swarm распределяет большие исследования и пакетные задачи между несколькими агентами, а Claw отвечает за постоянную автоматизацию. Все это решает практическую задачу: людям часто нужны готовые таблица, презентация или отчет, а не инструкция по их самостоятельному созданию.
Контекст в один миллион токенов и поддержка изображений позволяют модели работать с очень большим объемом исходных материалов. Она может связывать информацию из отчетов, скриншотов, графиков и других документов. Большой контекст не гарантирует идеальную память, а лишние материалы все равно могут запутать модель. И все же эта емкость действительно полезна для юридических сравнений, научных подборок, финансового анализа и других проектов со множеством документов.
Kimi легко попробовать в web и на телефонах. Бесплатный уровень дает немного Agent-задач, платные планы начинаются с $19 в месяц. API стоит $3 за ввод и $15 за вывод на миллион. K3 — не бюджетная модель: ее цена рассчитана на профессиональную работу.
Почему же только №4? Потому что здесь оценивается вся экосистема, а не только модель. На некоторых независимых тестах Gemini может быть слабее, но Google уже напрямую связывает его с почтой, документами, календарями, браузерами, телефонами, поиском и корпоративными правами доступа. Инструментов у Kimi много, но они пока не так глубоко встроены в сервисы, которыми люди уже пользуются каждый день. Для человека, выбирающего одного ИИ-помощника, это удобство — самостоятельное преимущество.
Вторая причина для осторожности — надежность. Artificial Analysis обнаружил, что K3 стал точнее K2.6, но при этом чаще галлюцировал: измеренный уровень составил 51%. Иначе говоря, модель может верно отвечать на большее число вопросов, но все еще уверенно подавать часть ошибочных ответов. K3 может быть очень продуктивным, но важные ссылки, формулы и деловые утверждения необходимо проверять.
Заявление о миллионе токенов нужно уточнять на уровне конкретного продукта. Сама модель K3 поддерживает такой контекст, но в документации Kimi для некоторых Agent-сценариев указаны меньшие практические лимиты. Максимум модели и доступный объем в отдельном приложении не обязательно совпадают. Перед планированием очень большой задачи с документами проверьте лимит именно в том инструменте, который собираетесь использовать.
Наконец, K3 пока очень нов. Модель запустили с максимальным уровнем усилий на рассуждение: это помогает в сложных задачах, но делает ответы более многословными и медленными. Полные открытые веса вышли 27 июля под лицензией Modified MIT — но при 2,8 трлн параметров и объёме около 1,4 ТБ в MXFP4 они требуют оборудования дата-центр класса для запуска. Для большинства пользователей размещённый API и набор продуктов остаются практичным способом использовать K3.
На данный момент Kimi K3 заслуживает №4. Выбирайте его для задач, которые выходят за рамки обычного чата: глубокое исследование, множество документов, редактируемый отчет, таблица, презентация, сайт или длительная Agent-задача. Gemini пока проще вписывается в уже существующий рабочий процесс Google. Kimi — мощная альтернатива, но перед большой задачей стоит проверить ограничения именно того Agent-инструмента, который вы собираетесь использовать.