Место #4 Кодинг — ИИ, который пишет код для продакшена
Moonshot AI

Kimi K3

Kimi K3 предварительно занимает третье место в программировании, потому что три подсказки складываются в одну картину: первое предварительное место в слепом frontend-тесте Arena, сильные независимые результаты и необычно высокие оценки Moonshot в долгих инженерных задачах. Изображения и контекст в миллион токенов особенно полезны, когда задача длится так долго, что обычная чат-модель может забыть что-то важное.

Обновлено 18 июля 2026 года Agentic CodingFrontend LeaderLong-Horizon
Лучше всего для

Kimi K3 предварительно занимает третье место в программировании, потому что три подсказки складываются в одну картину: первое предварительное место в слепом frontend-тесте Arena, сильные независимые результаты и необычно высокие оценки Moonshot в долгих инженерных задачах. Изображения и контекст в миллион токенов особенно полезны, когда задача длится так долго, что обычная чат-модель может забыть что-то важное.

Почему он побеждает

Arena ставит Kimi K3 на первое место WebDev с 1679 Elo, выше Claude Fable 5, GPT-5.6 Sol и Grok 4.5, хотя результат пока предварительный. Artificial Analysis дает K3 общий балл 57 и 1668 Elo на GDPval-AA v2. Moonshot сообщает 42% на SWE Marathon и 88,3% на Terminal-Bench 2.1. Нативные изображения, контекст 1M, Kimi Code и API превращают способности в рабочий инструмент.

Обратите внимание

Первые результаты впечатляют, но сравнение не вполне честное. Kimi K3 еще не получил полный независимый результат Artificial Analysis Coding Agent Index, а в таблице Moonshot модели тестируются с разными инструментами: KimiCode, Claude Code, Codex и Terminus. Лидерство Arena предварительное, обещанные веса пока не опубликованы, а Artificial Analysis измерил 51% галлюцинаций и необычно большой расход токенов.

01

Что это на самом деле

Ни один программистский тест не показывает всего, что умеет модель. Короткий тест может измерить способность дать один верный ответ, но реальная разработка также требует прочитать репозиторий, применять инструменты, восстанавливаться после ошибок и помнить исходную цель на протяжении многих шагов. Kimi K3 интересен потому, что его сильнейшие результаты охватывают сразу несколько таких сложных условий: визуальную frontend-разработку, терминальные инструменты, большие репозитории и длительные инженерные сессии.

Самый заметный результат — слепой WebDev-рейтинг Arena. K3 стартовал с 1679 Elo, выше Claude Fable 5 с 1631, GPT-5.6 Sol с 1618 и Grok 4.5 с 1558. Люди сравнивают созданные приложения, не зная, какая модель их сделала. Поэтому результат особенно важен для тех, кому важны внешний вид и удобство web-интерфейса. Однако Arena называет результат предварительным, поэтому с появлением новых голосов место может измениться.

Данные длительных задач объясняют, почему frontend-победа может быть закономерной. На SWE Marathon K3 набирает 42% против приведенных 35% Fable 5, причем оба используют Claude Code. Долгая инженерная работа — не один гениальный ответ. Нужно прочитать репозиторий, построить гипотезу, изменить файл, запустить тест, обнаружить ошибку и начать снова, не забыв исходную цель.

Независимые общие результаты тоже сильны. Artificial Analysis дает K3 57 баллов в Intelligence Index и 1668 Elo на GDPval-AA v2. Модель остается ниже Fable 5 и GPT-5.6 Sol, но выше Grok 4.5 по этим общим показателям. Именно поэтому она вытесняет Grok с третьего места. Grok остается дешевле, а K3, по-видимому, лучше справляется с более требовательной работой.

K3 имеет контекст в один миллион токенов, поддержку изображений и разреженную архитектуру на 2,8 трлн параметров. На практике это позволяет ему анализировать скриншоты и дизайн-референсы одновременно с большим объемом кода и документации в рамках одной задачи. Это не значит, что в каждый промпт нужно помещать миллион токенов: нерелевантные материалы все равно могут снизить точность. Дополнительная емкость полезна, когда в проекте действительно много важных файлов и документов.

Kimi Code превращает способность в терминальный продукт, а OpenAI-совместимый API облегчает пробу. Цена $3/$15 за миллион токенов ставит K3 между бюджетными агентами и премиум-моделями. Кэш по $0,30 полезен при повторном использовании контекста. Но считать стоит стоимость проверенного патча, а не первого ответа.

Важно учесть, что в таблице Moonshot сравниваются системы с разными агентными инструментами. K3 может работать в KimiCode, GPT — в Codex, Claude — в Claude Code или Terminus. Эти окружающие инструменты определяют доступные команды, повторы и сохранение контекста. Корректно сообщить, что K3 набрал 88,3% на Terminal-Bench 2.1. Однако только этого числа недостаточно, чтобы доказать превосходство самой модели над всеми соперниками.

Есть еще два ограничения, не позволяющие K3 подняться выше. Fable 5 по-прежнему опережает K3 на FrontierSWE в собственном сравнении Moonshot и имеет гораздо более сильные опубликованные данные SWE-Bench Pro. Кроме того, у K3 пока нет полного независимого результа Artificial Analysis Coding Agent Index, который сейчас дает Grok более ясную доказательную базу по эффективности программирования.

Поэтому рейтинг сознательно осторожен: Kimi K3 предварительно занимает №3. Выбирайте его для визуальной и frontend-разработки, проектов с большим объемом контекста или задач, в которых агент будет работать долго. Fable 5 и GPT-5.6 остаются выше, пока независимые данные о программистских агентах K3 не станут столь же глубокими. Независимо от выбора модели, оставьте тесты и проверку кода в рабочем процессе: большой контекст не мешает агенту долго следовать ошибочному предположению.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Frontend-результат трудно игнорировать: Слепой рейтинг Arena WebDev дает Kimi K3 1679 Elo, выше Fable 5 с 1631, GPT-5.6 Sol с 1618 и Grok 4.5 с 1558. Это человеческое предпочтение готовых интерфейсов, а не тест с вариантами ответа—хотя Arena пока помечает результат как предварительный.
  • Длительная инженерная работа — его самая ясная специализация: Moonshot сообщает 42% на SWE Marathon, выше приведенных 35% Fable 5; оба работают через Claude Code. Этот контролируемый срез подтверждает способность K3 исследовать, изменять, тестировать и сохранять цель в продолжительной задаче.
  • Независимые тесты поддерживают заявления о программировании: Artificial Analysis дает K3 57 в Intelligence Index и 1668 Elo на GDPval-AA v2. Это не программистские тесты, но они показывают, что K3 умеет планировать, пользоваться инструментами и решать рабочие задачи не только в тестах Moonshot.
  • Поддержка изображений и миллион токенов контекста хорошо дополняют друг друга: K3 совмещает скриншоты, схемы, дизайн-референсы и контекст репозитория в одном процессе. Это особенно полезно для screenshot-to-code, визуальной отладки, итерацй интерфейса и изучения большой кодовой базы без постоянной пересборки промпта.
  • Kimi Code дает практические инструменты разработчика: Модель доступна в терминальном процессе Kimi Code и через OpenAI-совместимый API Moonshot. Kimi Code позволяет K3 просматривать файлы, пользоваться терминальными инструментами, редактировать проект и продолжать работу до проверенного результа.
  • Он дешевле премиальных лидеров, хотя и не является самым дешевым вариантом: API стоит $3 за ввод / $15 за вывод на миллион токенов, кэшированный ввод — $0,30. Это дороже Grok 4.5, но заметно дешевле Fable 5 при схожих возможностях длинного контекста и обработки изображений.

Честные ограничения

  • Главного независимого теста кода еще нет: Artificial Analysis измерил общие и агентные способности K3, но не опубликовал полный Coding Agent Index. Поэтому у Grok 4.5 пока чище независимые данные о стоимости одной программистской задачи.
  • Разные агентные инструменты затрудняют прямое сравнение оценок производителей: K3 часто использует KimiCode, а соперники — Codex, Claude Code или Terminus. Эти инструменты меняют промпты, повторы, доступные команды и управление контекстом; поэтому 88,3% подтверждают силу системы Kimi, а не доказывают, что сама модель превосходит всех соперников.
  • Fable все еще выигрывает важные дисциплины: Собственное сравнение Moonshot ставит Fable 5 выше на FrontierSWE, а опубликованные данные SWE-Bench Pro тоже в пользу Fable. K3 — сильный универсальный соперник в frontend и долгих задачах, не безусловный чемпион ремонта репозиториев.
  • Открытые веса опубликованы, но их запуск — отдельная задача: Moonshot выпустила полные веса модели на 2,8 трлн параметров 27 июля под лицензией Modified MIT. Однако при объеме около 1,4 терабайта в формате MXFP4 для работы в продакшене требуются десятки GPU уровня H100. K3 действительно поддерживает селф-хостинг, но для большинства разработчиков облачный API остается самым реалистичным путем.
  • Галлюцинации и высокий расход токенов требуют осторожности: Artificial Analysis измерил 51% галлюцинаций и около 130 миллионов выходных токенов в прогоне Intelligence Index. Созданный код по-прежнему требует тестов, проверки безопасности и бюджета, рассчитанного по стоимости завершенных задач, а не по привлекательной цене кэшированного ввода.
03

Результаты тестов

Arena WebDev — 1679 Elo (#1, предварительно)

Слепое человеческое предпочтение в frontend- и web-задачах. K3 опережает Fable 5, GPT-5.6 Sol и Grok 4.5, но Arena явно помечает новый результат как предварительный.

Artificial Analysis Intelligence Index — 57

Независимый комплексный результат ниже Fable 5 и GPT-5.6 Sol, но выше Grok 4.5. Он подтверждает пограничную способность, не изображая отдельную победу coding agent.

GDPval-AA v2 — 1668 Elo

Независимый сигнал профессиональной работы выше Opus 4.8 и Grok 4.5, но пока ниже Fable 5 и GPT-5.6 Sol.

SWE Marathon — 42%

Самое чистое сравнение Moonshot: K3 и Fable 5 используют Claude Code, а K3 выше приведенного результата Fable в 35%.

Terminal-Bench 2.1 — 88,3%

Отличный заявленный результат терминального агента, сразу за 88,8% GPT-5.6 Sol. Сравнивать осторожно: модели используют разные тестовые среды.

04

Вердикт

Сегодня Kimi K3 заслуживает предварительное третье место между Fable 5 и Grok 4.5. Здесь больше, чем шум запуска: независимый интеллект пограничного уровня, большой предварительный frontend-отрыв, контролируемая победа над Fable на SWE Marathon и настоящая среда разработчика. Выше он пока не идет, потому что Fable и GPT-5.6 имеют более широкий и зрелый набор агентных доказательств, а смешанные тестовые среды и отсутствие Coding Agent Index оставляют неопределенность. Выбирайте K3 для долгой, визуальной, frontend-ориентированной работы или огромных репозиториев; Grok — когда важна цена; Fable и Sol — для самых сложных областей с более глубокими данными.

05

Часто задаваемые вопросы