Многие демонстрации заканчиваются до трудной части. Модель рисует чистый интерфейс или пишет правдоподобную функцию, камера выключается, и никто не показывает третий упавший тест зависимости. GLM-5.3 нацелен на продолжение: прочитать ошибку, пересмотреть план, провести новый опыт и сохранить ориентацию до проверенного результата.
Z.ai не увеличивала базу. Она добавила исполняемые среды, разновидности профессиональных задач и постобучение на длинных траекториях. Базу можно сравнить с талантливым выпускником, постобучение—с практикой. Выпускник знает язык инженерии; практика учит, когда исследовать, тестировать и отказываться от плохой идеи.
Цифры складываются в связную, хотя и поставщицкую, картину. Terminal-Bench растёт с 4,6 до 28,3, DeepSWE с 46,2 до 66,9, SWE-Marathon с 19,4 до 42,5, AutomationBench с 26,2 до 48,2. ALE-CLI получает 28,5. Широта важнее заявления, что один показатель решает всё.
Закрытый Code Bench добавляет экономику. На Max модель завершает 34,5% примерно при 75 тысячах токенов против 23,4% при 96 тысячах у 5.2. High достигает 31,4% при 50 тысячах выше указанной точки Opus; Fable 5 сохраняет 39,5%. Воспроизвести закрытые задачи нельзя, но вопрос верен: сколько подтверждённой работы получено за время и токены?
Вторая история—кибербезопасность: 84,5% CyberGym и 54,4% ExploitBench, при отставании в глубокой эксплуатации. Правильное применение защитное: разрешённый код в песочнице, воспроизведение, исправление и регрессионные тесты. Это не разрешение проверять чужие системы.
Модель есть во всех Coding Plan и ZCode от $18 в месяц, но баллы зависят от входа, кэша, выхода и времени. Общая API появится позже, поэтому сравнение по расходу пока мутное.
Мышление обязательно: low, high и max регулируют усилие, но старый отключённый режим вызывает ошибку. Без нативного зрения и независимых запусков #6 уместен—серьёзный соперник для длинных сессий, которого нужно тестировать с теми же инструментами и проверками.