Годами сообщество открытых весов жило по простому правилу: можно было получить приватность или передовой интеллект, но не то и другое одновременно. Лучшие модели, которые можно было скачать и запустить самостоятельно, всегда были на ступень ниже закрытых гигантов. Достаточно хорошие для многих задач, но не для трудных.
Kimi K3 — модель, из-за которой это правило кажется устаревшим.
Moonshot AI выпустила полные веса 27 июля 2026 года, и цифры поразительны. 2,8 триллиона параметров, организованных как архитектура Mixture-of-Experts — 896 экспертов, из которых 16 активируются на каждом токене (104 миллиарда активных). Встроенный vision-энкодер под названием MoonViT-V2 позволяет модели нативно читать скриншоты, диаграммы, графики, документы и даже кадры видео. Контекстное окно тянется на один миллион токенов — примерно десять полных романов. И всё это под лицензией Modified MIT, разрешающей коммерческое использование.
Независимые данные подтверждают заявку на мощность. Artificial Analysis — ближайший аналог нейтрального арбитра в сфере ИИ — оценивает K3 примерно в 80 из 100 на Intelligence Index, помещая его на 5-е место среди 215 моделей в мире. Это ставит его в трёх пунктах от Claude Fable 5 — закрытой модели, за которую нужно платить реальные деньги. Ни одна другая модель с открытыми весами не достигла этого уровня.
История архитектуры
Грубое число параметров — это заголовок, но инженерия под ним заслуживает внимания. K3 построен на двух идеях, которые Moonshot называет Kimi Delta Attention (KDA) и Attention Residuals. KDA — эффективный механизм внимания, масштабирующийся лучше стандартных подходов; Attention Residuals избирательно извлекают информацию по глубине модели, а не накапливают её равномерно. Вместе, по данным Moonshot, это даёт примерно 2,5-кратное улучшение эффективности масштабирования по сравнению с K2.
Что это значит на практике: модель использует свой гигантский бюджет параметров умнее, чем наивное масштабирование. Она также поставляется с нативным квантованием MXFP4 — веса хранятся в 4-битной точности с 8-битными активациями, и это сжатие было встроено во время обучения, а не применено задним числом. Именно поэтому модель вообще может работать на «всего» восьми H100, а не требовать целый дата-центр в полной точности.
Почему она не номер 1 в этой категории
Вот честное напряжение. Kimi K3 — самая мощная модель с открытыми весами на планете. Она же — наименее практичная модель в этой категории для большинства читателей.
Веса MXFP4 занимают примерно 1,4 терабайта. Минимальная экспериментальная конфигурация, описанная Moonshot, требует восемь GPU H100 по 80 ГБ — 640 гигабайт VRAM, что соответствует примерно 200 000 долларов оборудования по текущим ценам. Продакшен хочет 64 и более ускорителей на нескольких узлах, соединённых высокоскоростными интерконнектами. Это не рабочая станция. Это маленький суперкомпьютер.
Сравните с GLM-5.2 — текущим номером 1 в этой категории. GLM-5.2 — модель на 744 миллиарда параметров (примерно 40 миллиардов активных), помещающаяся примерно в 241 гигабайт при агрессивном 2-битном квантовании — в досягаемости Mac Studio с 256 ГБ объединённой памяти или рабочей станции с двумя GPU. Она несёт чистую лицензию MIT. За ней — месяцы независимого подтверждения сообщества, включая первое место в кодинговом рейтинге Design Arena.
K3 выигрывает по чистому интеллекту, мультимодальным возможностям и абсолютному масштабу. GLM-5.2 выигрывает по всему, что определяет, может ли обычный человек или небольшая команда реально ею воспользоваться. Для категории под названием «Локальный / Приватный ИИ» эта практическая разница решающая — поэтому K3 входит на 2-е место, а не на 1-е.
Что K3 действительно хорошо делает
Отложив вопрос оборудования, профиль возможностей впечатляет. В собственных тестах Moonshot K3 достигает FrontierSWE 81,2 % (реальные задачи программной инженерии на крупных репозиториях), Terminal-Bench 88.3 (компетентность как агента командной строки) и GPQA Diamond 93.5 (научное рассуждение аспирантского уровня). На бенчмарке оптимизации ядер Moonshot сообщает, что K3 существенно превзошёл GPT-5.6 Sol, GPT-5.5 и Opus 4.8 — хотя это цифры от компании, ожидающие независимого подтверждения.
Нативная мультимодальность — особенность, которая наиболее чётко отделяет K3 от GLM-5.2 в этой категории. GLM-5.2 работает только с текстом и кодом. K3 читает изображения, скриншоты, графики и видео. Для селф-хостинг-процессов с визуальным вводом — разбор PDF, отладка интерфейса по скриншоту, анализ визуализации данных — K3 обрабатывает это нативно без добавления отдельной vision-модели. Это реальное архитектурное преимущество для команд, строящих мультимодальные пайплайны за собственным файрволом.
Реальность развёртывания
Если ваша организация уже эксплуатирует GPU-кластер — исследовательская лаборатория, облачная компания, корпоративная ИИ-команда — история развёртывания удивительно зрелая для релиза возрастом в один день. vLLM опубликовал превью поддержки в продакшен-масштабе 22 июля с оптимизациями prefix-caching для KDA, которые Moonshot вернула в open-source сообщество. SGLang, Docker, Together AI и HuggingChat предлагают немедленные пути развёртывания модели. Инструменты — не барьер; оборудование — да.
Для всех остальных API Moonshot предлагает ту же модель по 3 доллара за миллион входных токенов и 15 долларов за миллион выходных (с кэшированным входом по 0,30 доллара). Это разумная цена для работы передового уровня, но она сводит на нет смысл рейтинга «локального ИИ»: данные покидают вашу машину.
Известные шероховатости
Moonshot достойно прозрачна в отношении ограничений K3 в собственной документации. Модель чувствительна к режиму истории рассуждений — переключение inference-движка посреди сессии может дестабилизировать вывод, что важно для команд, эксплуатирующих несколько фреймворков обслуживания. Она также может быть избыточно проактивной, принимая самостоятельные решения, не запрошенные пользователем. Moonshot рекомендует явные ограничения в system prompt или файле AGENTS.md, чтобы удерживать модель в русле.
Существует также заметный разрыв в пользовательском опыте по сравнению с отполированными закрытыми продуктами вроде Claude Fable 5 и GPT-5.6 Sol, как признаёт сам Moonshot. Чистый интеллект на месте; плавность — ещё нет.
Итог
Kimi K3 — модель, доказывающая, что эра передовых открытых весов наступила. Загружаемый мозг, конкурирующий с лучшими закрытыми моделями, читающий изображения и видео и несущий коммерческую лицензию, больше не гипотеза — это файл на Hugging Face. Физика его запуска (1,4 терабайта, минимум восемь H100) означает, что большинство читателей будут восхищаться им издалека или добираться до него через API, а не через собственные серверы. Но для команд с инфраструктурой и для всех, кто отслеживает, куда движется открытый ИИ, K3 — новый потолок, и потолок только что резко поднялся.