Место #2 Локальный / Приватный ИИ — Ваш мозг, Ваша машина, Ваши правила
Moonshot AI

Kimi K3

Первая модель с открытыми весами, которая выглядит как передовая закрытая разработка. 2,8 триллиона параметров в архитектуре Mixture-of-Experts, нативное зрение, контекстное окно на целый миллион токенов и лицензия, разрешающая коммерческое использование — всё это скачивается на машину под вашим контролем. Загвоздка в самой машине: нужен дата-центр, а не рабочий стол.

Обновлено July 28, 2026 Open WeightsModified MIT2.8T MoE
Лучше всего для

Первая модель с открытыми весами, которая выглядит как передовая закрытая разработка. 2,8 триллиона параметров в архитектуре Mixture-of-Experts, нативное зрение, контекстное окно на целый миллион токенов и лицензия, разрешающая коммерческое использование — всё это скачивается на машину под вашим контролем. Загвоздка в самой машине: нужен дата-центр, а не рабочий стол.

Почему он побеждает

Крупнейшая модель с открытыми весами за всю историю. Artificial Analysis ставит её на 5-е место в мире (в трёх пунктах от Claude Fable 5). Нативное мультимодальное зрение и понимание видео, которых нет ни у одной другой открытой модели в этой категории. Сильные собственные показатели в кодинге — FrontierSWE 81.2, Terminal-Bench 88.3, DeepSWE 67.5. Лицензия Modified MIT допускает коммерческий селф-хостинг с атрибуцией. Поддержка развёртывания с первого дня через vLLM, SGLang, Docker, Together AI и HuggingChat.

Обратите внимание

Веса в формате MXFP4 занимают примерно 1,4 терабайта. Экспериментальный запуск требует как минимум восемь GPU H100 по 80 ГБ; для продакшена рекомендуется 64 и более ускорителей на нескольких узлах. Это не модель для ноутбука, десктопа или одиночной рабочей станции. Большинство бенчмарков предоставлены производителем — независимые тесты ещё дополняются после релиза 27 июля. Модифицированная лицензия — это не чистый MIT или Apache 2.0, а у модели известны проблемы со стабильностью, связанные с историей рассуждений и избыточной самостоятельностью.

01

Что это на самом деле

Годами сообщество открытых весов жило по простому правилу: можно было получить приватность или передовой интеллект, но не то и другое одновременно. Лучшие модели, которые можно было скачать и запустить самостоятельно, всегда были на ступень ниже закрытых гигантов. Достаточно хорошие для многих задач, но не для трудных.

Kimi K3 — модель, из-за которой это правило кажется устаревшим.

Moonshot AI выпустила полные веса 27 июля 2026 года, и цифры поразительны. 2,8 триллиона параметров, организованных как архитектура Mixture-of-Experts — 896 экспертов, из которых 16 активируются на каждом токене (104 миллиарда активных). Встроенный vision-энкодер под названием MoonViT-V2 позволяет модели нативно читать скриншоты, диаграммы, графики, документы и даже кадры видео. Контекстное окно тянется на один миллион токенов — примерно десять полных романов. И всё это под лицензией Modified MIT, разрешающей коммерческое использование.

Независимые данные подтверждают заявку на мощность. Artificial Analysis — ближайший аналог нейтрального арбитра в сфере ИИ — оценивает K3 примерно в 80 из 100 на Intelligence Index, помещая его на 5-е место среди 215 моделей в мире. Это ставит его в трёх пунктах от Claude Fable 5 — закрытой модели, за которую нужно платить реальные деньги. Ни одна другая модель с открытыми весами не достигла этого уровня.

История архитектуры

Грубое число параметров — это заголовок, но инженерия под ним заслуживает внимания. K3 построен на двух идеях, которые Moonshot называет Kimi Delta Attention (KDA) и Attention Residuals. KDA — эффективный механизм внимания, масштабирующийся лучше стандартных подходов; Attention Residuals избирательно извлекают информацию по глубине модели, а не накапливают её равномерно. Вместе, по данным Moonshot, это даёт примерно 2,5-кратное улучшение эффективности масштабирования по сравнению с K2.

Что это значит на практике: модель использует свой гигантский бюджет параметров умнее, чем наивное масштабирование. Она также поставляется с нативным квантованием MXFP4 — веса хранятся в 4-битной точности с 8-битными активациями, и это сжатие было встроено во время обучения, а не применено задним числом. Именно поэтому модель вообще может работать на «всего» восьми H100, а не требовать целый дата-центр в полной точности.

Почему она не номер 1 в этой категории

Вот честное напряжение. Kimi K3 — самая мощная модель с открытыми весами на планете. Она же — наименее практичная модель в этой категории для большинства читателей.

Веса MXFP4 занимают примерно 1,4 терабайта. Минимальная экспериментальная конфигурация, описанная Moonshot, требует восемь GPU H100 по 80 ГБ — 640 гигабайт VRAM, что соответствует примерно 200 000 долларов оборудования по текущим ценам. Продакшен хочет 64 и более ускорителей на нескольких узлах, соединённых высокоскоростными интерконнектами. Это не рабочая станция. Это маленький суперкомпьютер.

Сравните с GLM-5.2 — текущим номером 1 в этой категории. GLM-5.2 — модель на 744 миллиарда параметров (примерно 40 миллиардов активных), помещающаяся примерно в 241 гигабайт при агрессивном 2-битном квантовании — в досягаемости Mac Studio с 256 ГБ объединённой памяти или рабочей станции с двумя GPU. Она несёт чистую лицензию MIT. За ней — месяцы независимого подтверждения сообщества, включая первое место в кодинговом рейтинге Design Arena.

K3 выигрывает по чистому интеллекту, мультимодальным возможностям и абсолютному масштабу. GLM-5.2 выигрывает по всему, что определяет, может ли обычный человек или небольшая команда реально ею воспользоваться. Для категории под названием «Локальный / Приватный ИИ» эта практическая разница решающая — поэтому K3 входит на 2-е место, а не на 1-е.

Что K3 действительно хорошо делает

Отложив вопрос оборудования, профиль возможностей впечатляет. В собственных тестах Moonshot K3 достигает FrontierSWE 81,2 % (реальные задачи программной инженерии на крупных репозиториях), Terminal-Bench 88.3 (компетентность как агента командной строки) и GPQA Diamond 93.5 (научное рассуждение аспирантского уровня). На бенчмарке оптимизации ядер Moonshot сообщает, что K3 существенно превзошёл GPT-5.6 Sol, GPT-5.5 и Opus 4.8 — хотя это цифры от компании, ожидающие независимого подтверждения.

Нативная мультимодальность — особенность, которая наиболее чётко отделяет K3 от GLM-5.2 в этой категории. GLM-5.2 работает только с текстом и кодом. K3 читает изображения, скриншоты, графики и видео. Для селф-хостинг-процессов с визуальным вводом — разбор PDF, отладка интерфейса по скриншоту, анализ визуализации данных — K3 обрабатывает это нативно без добавления отдельной vision-модели. Это реальное архитектурное преимущество для команд, строящих мультимодальные пайплайны за собственным файрволом.

Реальность развёртывания

Если ваша организация уже эксплуатирует GPU-кластер — исследовательская лаборатория, облачная компания, корпоративная ИИ-команда — история развёртывания удивительно зрелая для релиза возрастом в один день. vLLM опубликовал превью поддержки в продакшен-масштабе 22 июля с оптимизациями prefix-caching для KDA, которые Moonshot вернула в open-source сообщество. SGLang, Docker, Together AI и HuggingChat предлагают немедленные пути развёртывания модели. Инструменты — не барьер; оборудование — да.

Для всех остальных API Moonshot предлагает ту же модель по 3 доллара за миллион входных токенов и 15 долларов за миллион выходных (с кэшированным входом по 0,30 доллара). Это разумная цена для работы передового уровня, но она сводит на нет смысл рейтинга «локального ИИ»: данные покидают вашу машину.

Известные шероховатости

Moonshot достойно прозрачна в отношении ограничений K3 в собственной документации. Модель чувствительна к режиму истории рассуждений — переключение inference-движка посреди сессии может дестабилизировать вывод, что важно для команд, эксплуатирующих несколько фреймворков обслуживания. Она также может быть избыточно проактивной, принимая самостоятельные решения, не запрошенные пользователем. Moonshot рекомендует явные ограничения в system prompt или файле AGENTS.md, чтобы удерживать модель в русле.

Существует также заметный разрыв в пользовательском опыте по сравнению с отполированными закрытыми продуктами вроде Claude Fable 5 и GPT-5.6 Sol, как признаёт сам Moonshot. Чистый интеллект на месте; плавность — ещё нет.

Итог

Kimi K3 — модель, доказывающая, что эра передовых открытых весов наступила. Загружаемый мозг, конкурирующий с лучшими закрытыми моделями, читающий изображения и видео и несущий коммерческую лицензию, больше не гипотеза — это файл на Hugging Face. Физика его запуска (1,4 терабайта, минимум восемь H100) означает, что большинство читателей будут восхищаться им издалека или добираться до него через API, а не через собственные серверы. Но для команд с инфраструктурой и для всех, кто отслеживает, куда движется открытый ИИ, K3 — новый потолок, и потолок только что резко поднялся.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Самый большой мозг, который можно скачать: 2,8 триллиона параметров всего (104 миллиарда активных на токен, выбираются 16 из 896 экспертов) — Kimi K3 крупнейшая модель с открытыми весами из когда-либо опубликованных. Artificial Analysis оценивает её примерно в 80 из 100 на своём Intelligence Index — 5-е место среди 215 ранжированных моделей и всего в трёх пунктах от Claude Fable 5. Ни одна другая модель, которую можно хостить самостоятельно, не приблизилась к такому независимому положению.
  • Нативное зрение, а не только текст: В отличие от GLM-5.2 и большинства открытых кодинговых моделей, K3 поставляется со встроенным vision-энкодером (MoonViT-V2, 401 миллион параметров). Он читает скриншоты, диаграммы, графики, документы и даже кадры видео. Для селф-хостинг-процессов с визуальным вводом — отладка интерфейсов, анализ документов, чтение графиков — это устраняет необходимость подключения отдельной vision-модели.
  • Кодинговые результаты на уровне закрытых лидеров: Собственные тесты Moonshot показывают FrontierSWE 81,2 %, Terminal-Bench 88.3 и DeepSWE 67.5. На задаче по оптимизации ядер K3 существенно превзошёл GPT-5.6 Sol, GPT-5.5 и Opus 4.8 по данным Moonshot. Это официальные цифры, но рейтинг Artificial Analysis независимо подтверждает, что K3 заслуживает места в frontier-дискуссии.
  • Лицензия, разрешающая коммерческое использование: Modified MIT позволяет компаниям селф-хостить, файн-тюнить, дистиллировать и встраивать K3 в коммерческие продукты с атрибуцией. Это не безупречный Apache 2.0 или стандартный MIT — данные и пайплайн обучения не опубликованы, — но для команд, которым нужен защищаемый коммерческий путь, условия применимы там, где многие frontier-альтернативы не дают ничего.
  • Инфраструктура развёртывания с первого дня: vLLM опубликовал превью поддержки в продакшен-масштабе 22 июля, с оптимизациями prefix-caching для KDA, возвращёнными в комьюнити. SGLang, Docker, Together AI и HuggingChat предлагают немедленные пути развёртывания. Если ваша команда уже эксплуатирует GPU-кластер, инструмент для обслуживания K3 — это не вопрос месяцев; он вышел вместе с весами.

Честные ограничения

  • Это модель для дата-центра, а не локальная: Веса MXFP4 занимают примерно 1,4 терабайта. Минимальная экспериментальная конфигурация — восемь GPU H100 по 80 ГБ (640 ГБ VRAM), а Moonshot рекомендует супернатоды с 64 и более ускорителями для продакшена. Для сравнения: GLM-5.2 — номер 1 в этой категории — помещается примерно в 241 ГБ и работает на высококлассном Mac Studio. Большинство читателей руководства по локальному ИИ не могут хостить K3 на оборудовании, которым уже владеют.
  • Независимая валидация ещё ранняя: Веса вышли 27 июля 2026 года. Artificial Analysis опубликовал составной рейтинг, но полный набор независимых бенчмарков — SWE-Bench, LiveBench, Arena Elo по разным задачам — ещё дополняется. Большинство детальных результатов в карточке модели предоставлены производителем. Относитесь к ним как к сильным сигналам, а не к окончательным вердиктам, пока независимые оценщики не завершат свои проверки.
  • Лицензия модифицированная, а не стандартная: Условия Modified MIT допускают коммерческое использование с атрибуцией, но это не безупречный, свободный от ограничений MIT или Apache 2.0, который несут GLM-5.2 и Gemma 4. Данные обучения не публикуются, а точные модифицированные условия заслуживают внимательного прочтения перед созданием коммерческого продукта на этих весах.
  • Известные проблемы стабильности: Собственная документация Moonshot предупреждает, что K3 чувствителен к режиму истории рассуждений — переключение inference-движка в середине сессии может дестабилизировать вывод. Модель также может быть избыточно проактивной, принимая самостоятельные решения, которые пользователь не запрашивал. Moonshot рекомендует явные ограничения в system prompt или файле AGENTS.md. Это управляемо, но реально, особенно в автоматизированных пайплайнах.
  • Для большинства покупателей локального ИИ GLM-5.2 остаётся лучшим выбором: K3 мощнее на бумаге, но GLM-5.2 работает на оборудовании, которое серьёзный частный пользователь или небольшая команда может реально купить, несёт чистую лицензию MIT и опирается на месяцы независимого сообщества. K3 забирает корону возможностей; GLM-5.2 сохраняет практическую. Поэтому K3 входит на 2-е место, а не на 1-е.
03

Результаты тестов

Artificial Analysis Intelligence Index — ~80 (5-е из 215)

Самый сильный доступный независимый сигнал. K3 занимает 5-е место в мире и находится в трёх пунктах от Claude Fable 5 — первая модель с открытыми весами, достигшая этого уровня. Составной балл; разбивка по отдельным задачам ещё публикуется.

FrontierSWE — 81.2 % / Terminal-Bench 2.1 — 88.3

Собственные бенчмарки Moonshot по программной инженерии и терминальному агенту. FrontierSWE измеряет реальные задачи на репозиториях; Terminal-Bench — компетентность в командной строке. Сильные цифры, но ожидают независимого подтверждения после стабилизации весов.

GPQA Diamond — 93.5

Научные вопросы аспирантского уровня. Около вершины любого публичного рейтинга — открытого или закрытого. Свидетельствует, что интеллект K3 простирается далеко за пределы кодинга в область общего рассуждения.

Архитектура — 2.8T MoE / 104B активных

896 экспертов, из которых 16 выбираются на токен. Kimi Delta Attention и Attention Residuals дают примерно 2,5× эффективности масштабирования по сравнению с K2. Нативные веса MXFP4 и активации MXFP8 с квантованием, встроенным в обучение начиная с этапа SFT.

04

Вердикт

Kimi K3 — самая мощная модель с открытыми весами, которую можно скачать, и это утверждение теперь факт, а не пожелание. Самохостящийся мозг, занимающий 5-е место в мире на Artificial Analysis, читающий изображения и видео, удерживающий миллион токенов контекста и несущий коммерческую лицензию — это подлинная веха. Но вехи не отменяют физику. Футпринт в 1,4 терабайта и минимум в восемь H100 ставят эту модель вне досягаемости для всех, кроме команд, уже эксплуатирующих GPU-кластеры. GLM-5.2 остаётся номером 1 в этой категории, потому что она обеспечивает интеллект почти передового уровня в кодинге на оборудовании, которое человек может купить, под чистой лицензией MIT и с месяцами независимой валидации. K3 берёт 2-е место как потолок: доказательство того, что эра передовых моделей с открытыми весами наступила, даже если большинство читателей доберётся до неё через API, а не через собственные серверы. Если у вас есть инфраструктура — или если чистая мощность единственная переменная — K3 новый король открытых весов. Если вы выбираете одну модель для реального локального запуска, начните с GLM-5.2.

05

Часто задаваемые вопросы