Место #7 Программирование — ИИ, который пишет код для продакшена
Z.ai (Zhipu AI)

GLM-5.3-Flash

Программирование и агентная работа почти передового уровня по необычно низкой цене, с нативным зрением и контекстом 1M. Здесь «Flash» означает эффективность и дешевизну, а не малый размер и не особенно высокую скорость.

Обновлено 29 августа 2026 года Multimodal CodingOpen WeightsMIT
Лучше всего для

Программирование и агентная работа почти передового уровня по необычно низкой цене, с нативным зрением и контекстом 1M. Здесь «Flash» означает эффективность и дешевизну, а не малый размер и не особенно высокую скорость.

Почему он побеждает

Artificial Analysis присваивает GLM-5.3-Flash 57 по Intelligence Index при стоимости около $0.09 за задачу индекса по обычному прайсу. Результат Terminal-Bench 2.1 составляет примерно 84,3, а веса MIT и мультимодальный вход позволяют программировать по скриншотам.

Обратите внимание

На трудных задачах модель уступает сильнейшим закрытым coding-моделям и флагманской GLM-5.3. API Z.ai генерирует около 50 токенов в секунду, рассуждение всегда включено, ответы могут быть многословными, а большинство подробных результатов запуска получено поставщиком.

01

Что это на самом деле

Представьте двух инженеров. Один немного чаще решает самую трудную головоломку. Второй почти так же способен, умеет смотреть на экран и стоит настолько дешевле, что вы можете позволить ему весь день искать, тестировать и проверять. GLM-5.3-Flash — второй инженер. Её преимущество не в кубке за абсолютный интеллект, а в объёме полезной работы, который выдерживает ваш бюджет.

Название подталкивает к неверному выводу. В API самой Z.ai Artificial Analysis измеряет примерно пятьдесят выходных токенов в секунду — медленнее флагманской GLM-5.3. «Flash» обозначает переработанный класс эффективности и цены. В модели 320 миллиардов параметров всего, но для каждого токена активируются около 18 миллиардов; разреженное и линейное внимание снижают стоимость длинного контекста. Ресторан может готовить каждое блюдо небольшой бригадой, хотя для работы ему всё равно нужно целое здание.

Эта архитектура поддерживает контекст на миллион токенов и нативный мультимодальный вход. В программировании зрение — не украшение. Модель может изучить сломанную вёрстку, прочитать диалог ошибки на скриншоте, сравнить график с создавшим его компонентом или по кадрам видео понять последовательность действий интерфейса. Флагманская GLM-5.3 без внешнего этапа распознавания этого не умеет.

Независимые данные обнадёживают. Artificial Analysis присваивает Flash 57 по текущему Intelligence Index и измеряет Terminal-Bench 2.1 примерно в 84,3. Z.ai сообщает о 63,4 в DeepSWE, 78,4 в Toolathlon Verified и 48,8 в AutomationBench. Последние строки описывают реальные виды работы, но в основном остаются запусками поставщика или доступны для изучения лишь частично. Хороший обзор использует их как подписанные улики, а не как кирпичи для памятника победе.

Экономика необычно прозрачна. Стандартные тарифы API — пятнадцать центов за миллион входных токенов, три цента за кэшированный вход и пятьдесят центов за миллион выходных токенов. До 9 сентября 2026 года, 24:00 UTC+8, Z.ai снижает эти цены вдвое. Artificial Analysis оценивает задачу Intelligence Index примерно в девять центов по обычному прайсу, а Z.ai называет около 4,5 цента во время акции. Акционная цена временна; возможности модели — нет.

Во время бесплатного предварительного запуска Ox Alpha объём использования на OpenRouter был огромным, но число токенов — не опрос удовлетворённости. Бесплатный доступ, промпты на миллион токенов и многословное рассуждение раздувают счётчик. Справедливый вывод состоит в том, что разработчики испытали модель в поразительном масштабе, а платный запуск уверенно стартовал, — но не в том, что триллионы токенов доказывают предпочтение каждого пользователя.

Рассуждение нельзя отключить. Приложения выбирают low, high или max, причём для воспроизведения benchmark используется max. Модель способна потратить много токенов на размышления, а настойчивая неверная идея даже при низкой цене единицы может превратиться в дорогой цикл. Задавайте бюджеты, обнаруживайте повторные вызовы инструментов, требуйте тестов и используйте low effort для обычных преобразований.

Итак, GLM-5.3-Flash — выгодный специалист с диапазоном почти передового уровня. Поставьте её за верстак повторяющейся работы: найти нужное в репозитории, изучить скриншот, внести обычное исправление, запустить тест и объяснить результат. Держите более сильную модель наготове для редкой задачи, где один дополнительный решённый случай важнее стоимости сотни повседневных. Такое разделение труда полезнее, чем притворяться, будто каждый новый релиз обязан свергнуть короля.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Главная новость — стоимость решённой задачи: Обычные цены составляют $0.15/M за вход и $0.50/M за выход, а до 9 сентября действует временная скидка 50%. Это делает долгие агентные циклы достаточно доступными, чтобы использовать модель как постоянного работника, а не по особым случаям.
  • Зрение входит прямо в coding-цикл: Модель умеет читать скриншоты, схемы, документы и видео как контекст. Frontend-агенты и агенты поддержки могут связать то, что показывает интерфейс, с содержимым репозитория.
  • Независимые испытания подтверждают способности почти передового уровня: Artificial Analysis ставит модели 57 по Intelligence Index и независимо фиксирует около 84,3 в Terminal-Bench 2.1 — близко к опубликованному Z.ai результату.
  • Веса под MIT уменьшают сложности развёртывания: Команды могут изучать, изменять, размещать и коммерциализировать модель по стандартной разрешительной лицензии, используя vLLM, SGLang, TokenSpeed и другие способы обслуживания.

Честные ограничения

  • Flash — ценовая категория, а не секундомер: В тестировании Artificial Analysis эндпоинт самой Z.ai выдаёт примерно 50 токенов в секунду. Есть более быстрые сторонние площадки, но тогда выбор поставщика становится частью продукта.
  • Она дешевле флагмана, а не лучше него: GLM-5.3 получает более высокие оценки широкого интеллекта и трудных долгих наборов. В таблице Z.ai Flash выигрывает Toolathlon и некоторые строки автоматизации, но не всё сравнение.
  • Рассуждение обязательно и многословно: Доступны уровни low, high и max, по умолчанию используется max. Даже обычная правка может запустить долгий внутренний поиск, поэтому приложениям нужны бюджеты и ограничения циклов.
  • Достоверность подробных бенчмарков различается: DeepSWE, Toolathlon, AutomationBench, HLE с инструментами и результаты по зрению в основном получены Z.ai или доступны для независимого изучения лишь частично. Указывайте источник каждого числа, а не называйте таблицу запуска консенсусом.
03

Результаты тестов

Artificial Analysis Intelligence Index — 57

Независимая сводная оценка ставит Flash рядом с интеллектом GPT-5.6 класса Terra при небольшой доле стоимости токенов, хотя модель всё ещё уступает Opus 5 и флагманской GLM-5.3.

Terminal-Bench 2.1 — около 84,3

Один из самых сильных независимо подтверждённых узкоспециализированных сигналов. Небольшой численный перевес над отдельно настроенным запуском флагманской модели не означает превосходства по чистому качеству: различаются тестовая среда и семплирование. Версию 2.1 нельзя смешивать с намного более трудным Terminal-Bench 3.0.

DeepSWE v1.1 — 63,4 (запуск Z.ai)

Большой прирост относительно GLM-5.2 и сильное свидетельство работы агента с репозиторием, но в указанной таблице результат ниже GPT-5.6 Sol и пока не воспроизведён независимо.

Toolathlon Verified — 78,4 (официальный сервис / отчёт Z.ai)

Flash лидирует в сравнении Z.ai на этом наборе реального использования инструментов. Указанное среднее охватывает три запуска, но отдельный независимый артефакт найти не удалось.

GDPval-AA v2 — ведущая группа, текущий Elo

Снимки конца августа ставят Flash и флагманскую GLM в статистически пересекающуюся область позади сильнейших настроек Opus. Текущий Elo всегда следует сопровождать датой.

04

Вердикт

GLM-5.3-Flash входит в категорию «Программирование» на 7-е место с оценкой 9,2, сразу после флагманской GLM-5.3. Это не модель, которую стоит короновать по одной таблице; её стоит развёртывать, когда тысячи полезных агентных шагов важнее последних нескольких баллов экзамена передового уровня. Используйте её для массового поиска по репозиторию, обычных исправлений, frontend-работы по скриншотам, вызова инструментов и циклов проверки. Самые трудные текстовые задачи передавайте флагманской GLM-5.3 или ведущей закрытой модели и измерьте скорость поставщика, прежде чем обещать пользователям, что «Flash» будет ощущаться быстрой.

05

Часто задаваемые вопросы