Место #3 Локальный / Приватный ИИ — Ваш мозг, Ваша машина, Ваши правила
Z.ai (Zhipu AI)

GLM-5.3

Самая интересная локальная модель, которую пока нельзя скачать. GLM-5.3 сохраняет MoE-базу GLM-5.2 на 744B и получает большой прирост в коде и агентах только за счёт постобучения. Z.ai обещает веса примерно через две недели; до этого перед нами облачная модель с правдоподобным локальным будущим.

Обновлено 14 августа 2026 года Weights Pending1M Context Evals744B MoE
Лучше всего для

Самая интересная локальная модель, которую пока нельзя скачать. GLM-5.3 сохраняет MoE-базу GLM-5.2 на 744B и получает большой прирост в коде и агентах только за счёт постобучения. Z.ai обещает веса примерно через две недели; до этого перед нами облачная модель с правдоподобным локальным будущим.

Почему он побеждает

Z.ai сообщает 28,3 на Terminal-Bench 3.0, 66,9 на DeepSWE v1.1, 48,2 на AutomationBench и 84,5% на CyberGym. Весь прирост приписан масштабированию долгих RL-сред, а не увеличению базы 744B/~40B активных параметров.

Обратите внимание

На старте нет публичных весов, объявленной лицензии и общей API; доступ идёт через Coding Plan и ZCode. Большинство тестов провёл поставщик, модель требует серверного железа, а нативное зрение не заявлено.

01

Что это на самом деле

Представьте мастерскую, которая стала сильнее без расширения здания. Инструменты остались на местах, но работники научились планировать сложный заказ, проверять результат и менять курс после неудачи. Такова главная идея GLM-5.3: база GLM-5.2 не меняется, а месяц масштабированного постобучения улучшает долгие инженерные и исследовательские задачи.

Для приватного ИИ разница существенна. Размер модели похож на аренду: каждый параметр требует хранения, пропускной способности и обслуживания. 5.3 не уменьшает высокую аренду 5.2, но обещает больше навыков в том же здании. Z.ai сохраняет 744 миллиарда параметров, около 40 миллиардов активных, и добавляет среды, разнообразие, SAO и slime.

Результаты предварительно соответствуют рассказу. Terminal-Bench растёт с 4,6 до 28,3, DeepSWE с 46,2 до 66,9, AutomationBench с 26,2 до 48,2. Это не дополнение одной строки: агент использует инструменты, читает итог и исправляет план. Модель может блеснуть один раз и потеряться после двадцати действий; обучение борется именно с этим.

Киберрезультаты впечатляют, но требуют точности. 84,5% CyberGym лидирует в поиске и подтверждении уязвимостей. Более глубокая эксплуатация—другая гора: 54,4% ExploitBench удваивает 5.2, но Fable 5 достигает 78,0, а Sol 76,5. Опасные двери находятся лучше, однако закрытые лидеры увереннее проходят лабиринт за ними.

Z.ai публикует реестр 2 436 находок в 269 проектах после экспертной проверки и удаления дублей; 53 случая открыты на старте. Это всё ещё свидетельство поставщика, но проверяемый живой список полезнее рекламного предложения.

Слово локальная требует честности. В день запуска скачать нечего. Веса обещаны через две недели, лицензия не названа, общая API тоже появится позже. Сегодня доступны Coding Plan и ZCode. Будущий файл ещё не лежит на вашем сервере.

Если обещание выполнено, развёртывание будет похоже на 5.2: много памяти, зрелое ПО и осторожное квантование. Операторы 5.2 начнут быстрее, но точные требования проверяются только после релиза. Поэтому временное #2 справедливо; DeepSeek V4 Flash остаётся первым, потому что его можно запустить уже сейчас.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Настоящее обновление той же базы: больше сред, разнообразия и постобучения с SAO и slime обещают дополнительные способности без увеличения будущего размера развёртывания.
  • Фокус на долгой работе: Terminal-Bench растёт с 4,6 до 28,3, DeepSWE с 46,2 до 66,9, AutomationBench с 26,2 до 48,2—здесь агент действует, проверяет и исправляется.
  • Знакомый будущий путь: неизменная база делает инфраструктуру 5.2 разумной оценкой: огромная unified memory или несколько GPU, не обычный ноутбук.
  • Конкретные данные по безопасности: Z.ai заявляет 84,5% CyberGym и 54,4% ExploitBench; публичный реестр отслеживает 2 436 проверенных находок в 269 проектах, 53 уже раскрыты.
  • Облачный тест доступен сейчас: модель есть во всех уровнях Coding Plan и ZCode, поэтому команда может проверить свои репозитории до покупки железа.

Честные ограничения

  • Сегодня она не локальная: веса обещаны примерно через две недели после 14 августа. Пока «открытые веса»—обещание, а не доступный продукт.
  • Лицензия неизвестна: условия 5.2 не гарантируют условия 5.3. Следует дождаться карточки и фактической лицензии.
  • Огромные требования: 744B всего и около 40B активных параметров указывают на 256GB-класс или несколько GPU даже после квантования.
  • Нет независимого воспроизведения: Z.ai подробно описывает настройки, но выполнила или собрала почти все цифры. Отдельные внешние оценщики не подтверждают всю картину.
  • Текст и обязательное мышление: нативное зрение не объявлено; мышление нельзя выключить, лишь выбрать low, high или max.
03

Результаты тестов

Terminal-Bench 3.0 — 28,3 (Z.ai)

Большой скачок с 4,6; Fable 5 с 33,7 и GPT-5.6 Sol с 34,6 впереди.

DeepSWE v1.1 — 66,9 (Z.ai)

Рост с 46,2 почти до Kimi K3 с 67,5; Sol лидирует с 72,7.

AutomationBench v1.0.6 — 48,2 (Z.ai)

Рост с 26,2 поддерживает тезис о долгой автоматизации.

CyberGym — 84,5% (Z.ai)

Лучший результат поиска в таблице, но не проверка всей цепочки эксплуатации.

ExploitBench — 54,4% (Z.ai)

Больше чем вдвое выше 24,4, но далеко от Fable 5 с 78,0 и Sol с 76,5.

04

Вердикт

GLM-5.3 занимает #2 в Local / Private AI: выше 5.2, но ниже уже доступного и меньшего DeepSeek V4 Flash. Траектория отличная, однако локальность означает владение весами. Без файлов и лицензии #1 невозможен. Тестируйте через Coding Plan, а развёртывайте после карточки, лицензии, контрольных сумм, поддержки serving и независимых квантованных запусков.

05

Часто задаваемые вопросы