O'rin #6 Dasturlash — Ishlab chiqarish (Production) uchun kod yozadigan SI
Z.ai (Zhipu AI)

GLM-5.3

Birinchi javobdan keyingi kodlash uchun bir xil bazadagi post-trening sakrashi. GLM-5.3 uzoq ishda rejalaydi, tahrirlaydi, test qiladi va tiklanadi. Start natijalari hamda cyber qobiliyati kuchli, ammo dalillarning deyarli barchasi reliz kuniga tegishli.

Yangilangan 2026-yil 14-avgust Coding AgentLong-Horizon1M Context Evals
9.210 dan
Rasmiy veb-sayt
Eng mos

Birinchi javobdan keyingi kodlash uchun bir xil bazadagi post-trening sakrashi. GLM-5.3 uzoq ishda rejalaydi, tahrirlaydi, test qiladi va tiklanadi. Start natijalari hamda cyber qobiliyati kuchli, ammo dalillarning deyarli barchasi reliz kuniga tegishli.

Nima uchun bu eng yaxshisi

Z.ai Terminal-Bench 3.0 da 28.3, DeepSWE da 66.9, SWE-Marathon da 42.5, AutomationBench da 48.2 va ALE-CLI da 28.5 bildiradi. Private Code Bench 5.2 dan va ayrim nuqtalarda Opus 4.8 dan kamroq token bilan yuqori completion ko‘rsatadi.

E'tibor bering

Mustaqil coding run va umumiy API hali yo‘q, asosiy kirish Coding Plan. Model text-first, fikrlash o‘chmaydi va ayrim chuqur testlarda yopiq tizimlardan ortda.

01

Aslida bu nima

Ko‘p coding demo qiyin qismdan oldin tugaydi. Model chiroyli interfeys yoki ishonarli funksiya yozadi, kamera to‘xtaydi va uchinchi dependency testi yiqilganda nima bo‘lishini hech kim ko‘rsatmaydi. GLM-5.3 keyingi bosqichni nishonga oladi: xatoni o‘qish, rejani almashtirish, yana tajriba qilish va tekshirilgan natijagacha yo‘nalishni saqlash.

Z.ai kattaroq baza qurmadi. 5.2 bazasini saqlab, ko‘proq executable muhit, professional vazifa va uzoq trajectory lar uchun post-trening compute qo‘shdi. Bazani iste’dodli bitiruvchiga, post-treningni amaliyotga o‘xshatish mumkin. Bitiruvchi muhandislik tilini biladi; amaliyot qachon tekshirish, test qilish yoki yomon g‘oyadan voz kechishni o‘rgatadi.

Raqamlar vendor manbali bo‘lsa ham bir xil hikoya beradi. Terminal-Bench 4.6 dan 28.3 ga, DeepSWE 46.2 dan 66.9 ga, SWE-Marathon 19.4 dan 42.5 ga, AutomationBench 26.2 dan 48.2 ga ko‘tariladi. ALE-CLI 28.5. Kenglik bitta raqamni mutlaq haqiqat deb e’lon qilishdan muhimroq.

Private Code Bench iqtisodiy tarafni ko‘rsatadi. Max da 5.3 75 mingga yaqin tokenda 34.5% tugatadi, 5.2 esa 96 ming tokenda 23.4%. High 50 ming atrofida 31.4% bo‘lib, ko‘rsatilgan Opus nuqtasidan yuqori; Fable 5 39.5% bilan yuqorida. Tashqi tomon private vazifani takrorlay olmaydi, ammo savol to‘g‘ri: vaqt va tokenga qancha tekshirilgan ish?

Ikkinchi hikoya cyber: CyberGym 84.5% va ExploitBench 54.4%, chuqur exploitation da esa yopiq liderlar oldinda. Oddiy jamoa uchun to‘g‘ri foydalanish defensive: ruxsatli kod, sandbox, reproduksiya, patch va regression test. Bu boshqa birovning tizimini tekshirishga ruxsat bermaydi.

5.3 barcha Coding Plan va ZCode da oyiga $18 dan mavjud, lekin point input, cache, output va vaqtga qarab farq qiladi. Umumiy API keyin keladi, shuning uchun xarajat taqqoslovi hali noaniq.

Fikrlash majburiy. Low, high va max effort ni boshqaradi, ammo eski disabled so‘rov xato beradi. Native vision va mustaqil run bo‘lmagani uchun #6 adolatli: ayni tool va testlar bilan hozirgi agentga qarshi sinovdan o‘tishi kerak bo‘lgan jiddiy uzoq-ish raqibi.

02

Kuchli tomonlar va halol cheklovlar

Asosiy afzalliklari

  • Ishni tugatishga o‘rgatilgan: muhitlar ekspertning bir necha kunlik ishini taqlid qiladi—diagnostika, real stack ni o‘zgartirish, tajriba, to‘g‘rilikni saqlash va o‘lchanadigan natija.
  • Keng public o‘sish: Terminal-Bench, DeepSWE, SWE-Marathon, AutomationBench va ALE-CLI yaxshilanadi; turli uzoq vazifalar bitta qulay harness dan kuchliroq dalil.
  • Private samaradorlik umidli: Max ~75K tokenda 34.5%, 5.2 esa 96K da 23.4%; High 50K da 31.4% bo‘lib, ko‘rsatilgan Opus nuqtasidan yuqori. Fable 5 sifatda yetakchi.
  • Cyber ko‘nikma himoyaga yordam beradi: vulnerability topish, tasdiqlash va patch qilish secure review uchun foydali. CyberGym 84.5% va 2,436 tekshirilgan topilma ruxsatli sandbox da jiddiy signal.
  • Tanish agentlarda ishlaydi: barcha Coding Plan va ZCode 5.3 ni beradi; Claude Code, OpenCode va boshqa client lar aytilgan. Low, high va max effort ni belgilaydi.

Haqiqiy cheklovlar

  • Start jadvallari konsensus emas: Z.ai sozlamalarni hujjatlagan, lekin taqqoslashlarning ko‘pini o‘zi bajargan yoki yig‘gan. Teng repo va xarajatli public test kerak.
  • Hamma joyda yutmaydi: Fable 5 va Sol Terminal-Bench, Sol DeepSWE, Kimi K3 va Opus SWE-Marathon, Fable private Max da oldinda.
  • Kirish to‘liq emas: Coding Plan $18 dan boshlanadi, point token turi va vaqtga bog‘liq. Umumiy APIsiz pay-as-you-go taqqoslash yo‘q.
  • Fikrlash majburiy: thinking.type: disabled xato beradi. Bu breaking change oddiy editga ham latency qo‘shadi va migration talab qiladi.
  • Native visual workflow aytilmagan: screenshot, diagramma va UI video uchun tashqi vision tool yoki multimodal model kerak.
03

Benchmark natijalari

Terminal-Bench 3.0 — 28.3 (Z.ai)

4.6 dan olti martadan ko‘p, ammo Fable 5 33.7 va Sol 34.6 dan past.

DeepSWE v1.1 — 66.9 (Z.ai)

+20.7 punkt, Kimi K3 67.5 ga yaqin va Sol 72.7 dan past.

SWE-Marathon v1.1 — 42.5 (Z.ai)

19.4 dan ikki baravardan ko‘p va Sol bilan teng; Kimi K3 hamda Opus yuqori.

AutomationBench v1.0.6 — 48.2 (Z.ai)

Jadvaldagi eng yuqori raqam, mustaqil takrorlashni kutayotgan foydali signal.

Z.ai Code Bench — Max 34.5% (private)

5.2 dan kam token bilan ko‘proq completion; public rekord emas, product dalili.

04

Xulosa

GLM-5.3 Coding da 9.2 bilan #6 ga kiradi. O‘rin eng chiroyli natijasidan ataylab past: dalil keng va hujjatlangan, lekin hali mustaqil emas. Uzoq repo, terminal va defensive review uchun zo‘r nomzod. Uni ayni repo, tool, vaqt, test va review bilan hozirgi agentga qarshi sinang. Har tokenga ko‘proq tekshirilgan ish bajarsa, sakrash jamoangiz uchun real.

05

Ko'p so'raladigan savollar