Место #2 Локальный / приватный ИИ — ваш мозг, ваша машина, ваши правила
Z.ai (Zhipu AI)

GLM-5.3-Flash

Оптимальный премиальный вариант семейства GLM для частного кластера: интеллект почти передового уровня, нативное зрение, контекст 1M и веса MIT. Всё ещё сотни гигабайт, но намного практичнее флагманской GLM-5.3.

Обновлено 29 августа 2026 года Open WeightsMIT320B MoE
Лучше всего для

Оптимальный премиальный вариант семейства GLM для частного кластера: интеллект почти передового уровня, нативное зрение, контекст 1M и веса MIT. Всё ещё сотни гигабайт, но намного практичнее флагманской GLM-5.3.

Почему он побеждает

Artificial Analysis оценивает модель в 57 по Intelligence Index, а стандартная лицензия MIT устраняет нюанс флагмана для MaaS. Официальный FP8 занимает около 306 GiB, а агрессивные сторонние однобитные сборки приближаются к классу 90–100 ГБ.

Обратите внимание

Это не модель 18B для ноутбука. Хранить в памяти нужно все 320B параметров, официальное обслуживание рассчитано на несколько GPU дата-центра, квантование может ухудшить качество, а скорость вывода у самой Z.ai составляет лишь около 50 токенов в секунду.

01

Что это на самом деле

Модель mixture-of-experts похожа на больницу со множеством специалистов. Для каждого пациента в кабинет входят лишь несколько врачей, поэтому консультация остаётся эффективной. Но самому зданию всё равно нужны кабинеты для всех. GLM-5.3-Flash активирует около 18 миллиардов параметров на токен, однако вся больница на 320 миллиардов параметров должна поместиться в памяти.

Это различие объясняет и восторг, и осторожность. Flash предлагает интеллект рядом с передовым краем при значительно меньших активных вычислениях, чем можно было бы ожидать по её полному размеру. Artificial Analysis оценивает модель в 57, она принимает текст, изображения и видео и поддерживает контекст на миллион токенов. Но официальный чекпоинт FP8 всё равно занимает около 306 GiB до накладных расходов среды выполнения. «Эффективный» не означает «маленький».

Для компании с частным кластером комплект необычайно привлекателен. Лицензия — стандартная MIT. Нет специального положения о выручке MaaS, отдельной лицензии для рабочих AI-ассистентов и двусмысленности вокруг коммерческой модификации сверх обычного требования атрибуции и закона. Документы, скриншоты, схемы и записи интерфейсов могут оставаться в едином мультимодальном процессе вместо отправки в отдельный облачный vision-сервис.

Выбор оборудования образует лестницу. Официальное обслуживание FP8 ведёт к нескольким GPU дата-центра. Сторонние квантования спускаются к классу 90–100 ГБ, где уже можно обсуждать систему с большим объёмом объединённой памяти или щедро оснащённую рабочую станцию. Но каждая ступень вниз меняет модель. Однобитный quant — не тот же победитель benchmark, просто сложенный в чемодан поменьше: округление миллионов значений может неравномерно повредить редкие знания, точность зрения, рассуждение или работу с инструментами.

Контекст добавляет ещё один чемодан. Окно на миллион токенов полезно для репозиториев и коллекций документов, но запоминающий эти токены KV-кэш расходует память рядом с весами. Машина, которая едва загружает чекпоинт, может поддерживать лишь скромный контекст или небольшую параллельность. Планирование мощности должно учитывать реальную среду выполнения, точность кэша, размер batch, модальности и ожидаемое число одновременных пользователей.

Скорость так же зависит от конфигурации. Artificial Analysis измеряет около пятидесяти выходных токенов в секунду в API Z.ai — не особенно быстро. Специализированные поставщики показали гораздо большую пропускную способность на другом оборудовании и serving-стеках. Оба результата могут быть правдой. Гоночный автомобиль и фургон доставки способны иметь родственную конструкцию двигателя, но проходить маршрут за разное время, потому что окружающая система имеет значение.

В сравнении с флагманской GLM-5.3 Flash теряет несколько баллов максимальных возможностей и часть силы в самых трудных долгих текстовых задачах. Взамен она получает нативное зрение, стандартную лицензию, намного меньший чекпоинт и примерно десятую часть обычной цены API. По сравнению с Qwen3.8-27B она гораздо способнее, но намного менее удобна. Относительно Qwen3.8-Flash-Next ей нужно больше активных вычислений и памяти, зато она предлагает права MIT и немного более высокие независимые сводные результаты.

Так у Flash появляется ясная роль. Это не коробка под столом энтузиаста. Это модель для команды, которой нужно держать данные внутри своего периметра, работать с несколькими модальностями и для которой покупка или аренда кластера разумна. Локальный ИИ полезен, когда его границы описывают честно; GLM-5.3-Flash превосходна именно как модель для частного кластера, потому что мы не притворяемся, будто она крошечная.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • MIT означает обычные и понятные права: Официальный чекпоинт использует знакомую лицензию MIT, которая разрешает использование, изменение, размещение и коммерческое распространение с сохранением уведомления.
  • Мультимодальная приватность встроена: Текст, изображения и видео могут оставаться в едином частном процессе — это полезно для документов, скриншотов, графиков и отладки интерфейсов.
  • Возможности на доллар обслуживания исключительны: Artificial Analysis даёт Flash 57 по Intelligence Index — на один балл выше Qwen3.8-Flash-Next и близко к намного более дорогим закрытым системам.
  • Она значительно меньше флагмана: Около 306 GiB при официальном FP8 — всё ещё задача для кластера, но заметно меньше примерно 756 ГБ чекпоинта FP8 и 1,51 ТБ BF16 у GLM-5.3.

Честные ограничения

  • Восемнадцать активных миллиардов — не восемнадцать миллиардов в памяти: Router выбирает для каждого токена лишь часть экспертов, но система всё равно хранит модель на 320B параметров. Активные вычисления и объём памяти отвечают на разные вопросы.
  • Официальное развёртывание требует нескольких GPU: Рецепты Z.ai и vLLM рассчитаны, например, на системы 8×H100/H200 или конфигурации класса GB200. Обычный игровой ПК не является целевой машиной.
  • Крошечные quants — это новая конфигурация: Однобитные и другие агрессивные сборки могут занимать около 90–100 ГБ, но результаты benchmark облачной или официальной версии нельзя переносить на них без проверки.
  • Скорость обслуживания сильно различается: Эндпоинт Z.ai выдаёт около 50 выходных токенов в секунду, тогда как специализированные площадки сообщают о значительно большей пропускной способности. Оборудование, batching и ПО поставщика становятся частью результата.
03

Результаты тестов

Artificial Analysis Intelligence Index — 57

Независимая сводная оценка ставит GLM-5.3-Flash в число сильнейших систем с открытыми весами — позади флагманской GLM-5.3, но впереди большинства практичных частных развёртываний.

Официальный чекпоинт FP8 — около 306 GiB

Это честно определяет класс оборудования ещё до буферов среды выполнения и KV-кэша: премиальный частный кластер, а не потребительская локальная машина.

Скорость вывода — около 50 ток/с на Z.ai

Artificial Analysis считает эндпоинт медленным для его сравнительного класса. Более быстрые сторонние системы следует называть конкретно, а не обобщать их результат.

Контекст — 1 048 576 на вход / до 128K на выход

Официальное окно продукта вмещает очень большие частные корпуса, хотя память кэша длинного контекста всё равно должна поместиться рядом с моделью.

Terminal-Bench 2.1 — около 84,3

Сильные данные по coding-агенту подтверждают роль в частной инженерии. Крошечный перевес над отдельно настроенным запуском флагманской модели не меняет общего порядка возможностей моделей; на воспроизводимость влияют scaffold, семплирование и оборудование.

04

Вердикт

GLM-5.3-Flash входит в категорию «Локальный / приватный ИИ» на 2-е место с оценкой 9,1. Qwen3.8-27B остаётся на 1-м месте (#1), потому что квантованная версия класса 18 ГБ может жить на оборудовании, которым способен владеть частный пользователь. Flash — следующая ступень для организации: гораздо сильнее по сводным возможностям, нативно мультимодальна, предоставляет стандартные права MIT и имеет достаточно конкурирующих API, чтобы провести тест до покупки оборудования. Qwen3.8-Flash-Next следует на 3-м месте (#3) благодаря эффективности на системах с большим объёмом RAM, а флагманская GLM-5.3 опускается на 5-е место (#5) из-за размера файлов и требований лицензии к инфраструктуре. Выбирайте Flash, когда приватность — требование к развёртыванию и кластер доступен как рабочий инструмент, а не когда «локально» означает один ноутбук.

05

Часто задаваемые вопросы