Ни один программистский тест не показывает всего, что умеет модель. Короткий тест может измерить способность дать один верный ответ, но реальная разработка также требует прочитать репозиторий, применять инструменты, восстанавливаться после ошибок и помнить исходную цель на протяжении многих шагов. Kimi K3 интересен потому, что его сильнейшие результаты охватывают сразу несколько таких сложных условий: визуальную frontend-разработку, терминальные инструменты, большие репозитории и длительные инженерные сессии.
Самый заметный результат — слепой WebDev-рейтинг Arena. K3 стартовал с 1679 Elo, выше Claude Fable 5 с 1631, GPT-5.6 Sol с 1618 и Grok 4.5 с 1558. Люди сравнивают созданные приложения, не зная, какая модель их сделала. Поэтому результат особенно важен для тех, кому важны внешний вид и удобство web-интерфейса. Однако Arena называет результат предварительным, поэтому с появлением новых голосов место может измениться.
Данные длительных задач объясняют, почему frontend-победа может быть закономерной. На SWE Marathon K3 набирает 42% против приведенных 35% Fable 5, причем оба используют Claude Code. Долгая инженерная работа — не один гениальный ответ. Нужно прочитать репозиторий, построить гипотезу, изменить файл, запустить тест, обнаружить ошибку и начать снова, не забыв исходную цель.
Независимые общие результаты тоже сильны. Artificial Analysis дает K3 57 баллов в Intelligence Index и 1668 Elo на GDPval-AA v2. Модель остается ниже Fable 5 и GPT-5.6 Sol, но выше Grok 4.5 по этим общим показателям. Именно поэтому она вытесняет Grok с третьего места. Grok остается дешевле, а K3, по-видимому, лучше справляется с более требовательной работой.
K3 имеет контекст в один миллион токенов, поддержку изображений и разреженную архитектуру на 2,8 трлн параметров. На практике это позволяет ему анализировать скриншоты и дизайн-референсы одновременно с большим объемом кода и документации в рамках одной задачи. Это не значит, что в каждый промпт нужно помещать миллион токенов: нерелевантные материалы все равно могут снизить точность. Дополнительная емкость полезна, когда в проекте действительно много важных файлов и документов.
Kimi Code превращает способность в терминальный продукт, а OpenAI-совместимый API облегчает пробу. Цена $3/$15 за миллион токенов ставит K3 между бюджетными агентами и премиум-моделями. Кэш по $0,30 полезен при повторном использовании контекста. Но считать стоит стоимость проверенного патча, а не первого ответа.
Важно учесть, что в таблице Moonshot сравниваются системы с разными агентными инструментами. K3 может работать в KimiCode, GPT — в Codex, Claude — в Claude Code или Terminus. Эти окружающие инструменты определяют доступные команды, повторы и сохранение контекста. Корректно сообщить, что K3 набрал 88,3% на Terminal-Bench 2.1. Однако только этого числа недостаточно, чтобы доказать превосходство самой модели над всеми соперниками.
Есть еще два ограничения, не позволяющие K3 подняться выше. Fable 5 по-прежнему опережает K3 на FrontierSWE в собственном сравнении Moonshot и имеет гораздо более сильные опубликованные данные SWE-Bench Pro. Кроме того, у K3 пока нет полного независимого результа Artificial Analysis Coding Agent Index, который сейчас дает Grok более ясную доказательную базу по эффективности программирования.
Поэтому рейтинг сознательно осторожен: Kimi K3 предварительно занимает №3. Выбирайте его для визуальной и frontend-разработки, проектов с большим объемом контекста или задач, в которых агент будет работать долго. Fable 5 и GPT-5.6 остаются выше, пока независимые данные о программистских агентах K3 не станут столь же глубокими. Независимо от выбора модели, оставьте тесты и проверку кода в рабочем процессе: большой контекст не мешает агенту долго следовать ошибочному предположению.