Место #7 Программирование — ИИ, который пишет код для продакшена
Z.ai (Zhipu AI)

GLM-5.3

Тяжеловесный coding-агент с открытыми весами, обученный для этапа после первого ответа: планировать, редактировать, тестировать, восстанавливаться после ошибок и не терять нить в долгой работе с репозиторием.

Обновлено 30 августа 2026 года Coding AgentLong-Horizon1M Context

Рейтинг обновлён Рейтинг в категории «Программирование» пересматривался с момента последнего обновления этого обзора (30 августа 2026 года). Место, указанное выше, всегда актуально. Сейчас № 1: GPT-6 Astra

Лучше всего для

Тяжеловесный coding-агент с открытыми весами, обученный для этапа после первого ответа: планировать, редактировать, тестировать, восстанавливаться после ошибок и не терять нить в долгой работе с репозиторием.

Почему он побеждает

Artificial Analysis оценивает GLM-5.3 в 59,5 по Intelligence, 74,8 по Coding и 59,1 по Agentic — по всем трём показателям выше Qwen3.8-Max. В новейшей открытой таблице Terminal-Bench 4.0 GLM занимает третье место с 41,8%.

Обратите внимание

Официальный чекпоинт содержит примерно 753B параметров всего и 40B активных, работает только с текстом, всегда рассуждает и даже в FP8 занимает около 756 ГБ. Многие подробные результаты по программированию и кибербезопасности по-прежнему получены самой Z.ai, а нестандартная лицензия — не MIT.

01

Что это на самом деле

Проще всего показать coding-модель на первом ответе. Попросите написать функцию, посмотрите на аккуратный код и остановите запись до того, как столкнутся зависимости или тесты обнаружат неверное предположение. Настоящая инженерная работа начинается там, где заканчивается такая демонстрация. GLM-5.3 создана для второго, двадцатого и сотого действия: понять, что произошло, пересмотреть план и удержать достаточно контекста, чтобы довести дело до конца.

По словам Z.ai, сама базовая модель та же, что использовалась в GLM-5.2. Улучшение обеспечило постобучение в большем числе исполняемых сред и на более длинных профессиональных задачах. Представьте знающего выпускника, который приходит на стажировку. Объём фактов в его голове может почти не измениться, зато постоянная практика учит понимать, когда нужно измерить результат, когда усомниться в гипотезе и когда отменить работу, которая пять минут назад казалась блестящей.

Теперь эту историю подтверждают данные двух типов. Z.ai сообщает о крупных улучшениях в Terminal-Bench, DeepSWE, AutomationBench и наборах по безопасности. Что ещё важнее, по независимой оценке Artificial Analysis GLM-5.3 получает 59,5 по Intelligence, 74,8 по Coding и 59,1 по Agentic, опережая Qwen3.8-Max с результатами 58,1, 71,8 и 58,4. Устойчивый вывод таков: в рейтинге моделей для программирования GLM должна стоять выше Qwen, хотя на каждом репозитории всё равно стоит провести прямое сравнение в одинаковых условиях.

Выпуск весов 28 августа существенно меняет оценку. До этой даты «открытые веса» описывали намерение. Теперь файлы FP8 и BF16, конфигурацию, chat template и рецепты обслуживания можно изучить. Воспроизводимость наконец стала возможной. Но дешёвой она не стала: чекпоинт FP8 занимает примерно три четверти терабайта, а официальные рецепты указывают на машины с несколькими ускорителями класса H200. Модель может свободно скачиваться и всё же требовать небольшой машинный зал.

Лицензию стоит объяснить так же прямо. GLM-5.3 — не MIT. Нестандартная лицензия в целом разрешает использование, изменение, дообучение, развёртывание и продажу. Необычный пункт действует, когда лицензиат или аффилированное лицо одновременно ведёт бизнес Model-as-a-Service и получает совокупную выручку свыше десяти миллиардов долларов за последовательный двенадцатимесячный период: до коммерческого использования такой оператор должен пройти проверку безопасности Z.ai. Большинство частных пользователей и обычных продуктовых команд далеко от этого порога, но называть модель «open source без условий» всё равно было бы неверно.

Названия benchmark имеют значение. Результат Z.ai 88,2 в Terminal-Bench 2.1 и более низкий независимый запуск могут быть одинаково честными, потому что модель — лишь один участник агентной системы. В новейшем скользящем наборе Terminal-Bench 4.0 GLM-5.3 занимает третье место с 41,8% ±3,2 — позади Opus 5 и Fable 5, но впереди GPT-5.6 Sol и Grok 4.6. У Qwen3.8-Max нет опубликованной записи 4.0, поэтому это усиливает уверенность в позиции GLM, не превращаясь в прямой очный результат.

В эксплуатации облачную модель проверить проще, чем веса. Она принимает уровни усилия рассуждения low, high и max, по умолчанию используя max. Отключить мышление нельзя. Это помогает в трудных задачах, но делает ошибочный путь дорогим: настойчивый агент полезен лишь тогда, когда настойчиво движется к доказательствам. Передавайте долгие запуски потоком, ограничивайте циклы, правильно сохраняйте состояние рассуждений и требуйте прохождения тестов, прежде чем принимать сообщение о завершении.

Поэтому GLM-5.3 заслуживает более уверенной рекомендации, чем в день запуска, но волшебной не становится. Это серьёзный coding-движок с открытыми весами для команд со сложной терминальной работой, длинным контекстом и бюджетом на API либо кластер. Это не лучший визуальный отладчик, не самая простая частная модель и не доказательство, что каждый benchmark поставщика перенесётся на ваш репозиторий. Дайте ей те же инструменты, бюджет, тесты и стандарт ревью, что и текущей модели, а затем сравнивайте проверенную работу, а не уверенную прозу.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Долгие задачи — его основное назначение: GLM-5.3 обучена диагностировать, редактировать, запускать инструменты, разбирать сбои и восстанавливаться на протяжённых траекториях. Это гораздо ближе к сопровождению настоящей кодовой базы, чем к победе в соревновании по написанию функции одним промптом.
  • Независимые сводные данные теперь убедительны: Artificial Analysis оценивает модель в 59,5 по Intelligence, 74,8 по Coding и 59,1 по Agentic. Qwen3.8-Max отстаёт с результатами 58,1, 71,8 и 58,4 соответственно.
  • Веса действительно доступны: 28 августа Z.ai выпустила чекпоинты в FP8 и BF16. Теперь команды могут изучать, обслуживать и воспроизводить модель, а не считать открытые веса обещанием на будущее.
  • Облачный путь несложен: Z.ai предлагает контекст 1M, уровни усилия рассуждения low/high/max, интерфейсы, совместимые с OpenAI и Anthropic, и цены $1.40/M за вход, $0.26/M за кэшированный вход и $4.40/M за выход.

Честные ограничения

  • Открытые веса не означают размер для рабочей станции: Официальный репозиторий FP8 занимает около 756 ГБ, BF16 — около 1,51 ТБ, а документированные развёртывания используют системы с несколькими ускорителями класса H200. Это модель для частного кластера, а не загрузка на ноутбук.
  • Большинство узкоспециализированных громких результатов всё ещё получено поставщиком: Terminal-Bench 3.0, DeepSWE, AutomationBench, CyberGym и закрытый Z.ai Code Bench используют раскрытые, но чувствительные к настройкам среды. Это полезные свидетельства, а не универсальные оценки.
  • Она работает только с текстом и всегда думает: Модель не умеет напрямую разбирать скриншоты или записи интерфейсов, а запросы с отключённым мышлением завершаются ошибкой. Low effort помогает на простых задачах, но каждый запрос всё равно несёт некоторую задержку рассуждения.
  • Лицензию нужно действительно прочитать: Коммерческое использование в целом разрешено, но оператор MaaS и его аффилированные лица с выручкой свыше $10 млрд за любые последовательные 12 месяцев обязаны пройти проверку безопасности Z.ai. Корректное определение — открытые веса, а не безусловно открытый исходный код.
03

Результаты тестов

Artificial Analysis Intelligence / Coding / Agentic — 59,5 / 74,8 / 59,1

Независимые сводные данные ставят GLM-5.3 выше Qwen3.8-Max с результатами 58,1 / 71,8 / 58,4 и подтверждают обновлённый порядок моделей на сайте.

Terminal-Bench 2.1 — 88,2 у поставщика; около 83,9 независимо

Разрыв наглядно показывает чувствительность к тестовой среде. Указывайте runner и конфигурацию, а не преподносите одно число как неизменное свойство модели.

Terminal-Bench 4.0 — 41,8% ±3,2, #3

В новейшей открытой таблице терминальных задач GLM уступает Opus 5 и Fable 5, но опережает GPT-5.6 Sol и Grok 4.6. У Qwen3.8-Max опубликованного результата нет, поэтому отсутствие записи — лишь дополнительный контекст, а не прямое сравнение.

DeepSWE v1.1 — 66,9 (запуск Z.ai)

Сильное свидетельство долгой работы с репозиторием при использовании mini-swe-agent и шестичасовом бюджете, но в официальном публичном артефакте оно ещё не воспроизведено независимо.

GDPval-AA v2 — ведущая группа, текущий Elo

Недавние снимки ставят GLM-5.3 примерно в середину диапазона 1700, а интервалы уверенности пересекаются с GLM Flash и другими лидерами. Указывайте дату получения: Elo пересчитывается.

04

Вердикт

GLM-5.3 поднимается на 5-е место (#5) в категории «Программирование» с оценкой 9,2 — позади Grok 4.6 и впереди Qwen3.8-Max на #6 и GLM-5.3-Flash на #7. Перестановка основана на данных: GLM опережает Qwen по индексам Intelligence, Coding и Agentic от Artificial Analysis, а также в приведённых Z.ai в одной таблице результатах Terminal-Bench 2.1 и DeepSWE. Выбирайте её для сложных и долгих задач с текстом и терминалом, если можете оплатить API или кластер; выбирайте Flash, когда важнее мультимодальный ввод и стоимость.

05

Часто задаваемые вопросы