O'rin #3 Lokal / Shaxsiy SI — Sizning miyangiz, Sizning qurilmangiz, Sizning qoidalaringiz
Z.ai (Zhipu AI)

GLM-5.3

Hali yuklab bo‘lmaydigan eng qiziqarli lokal model. GLM-5.3 GLM-5.2 ning 744B MoE bazasini saqlab, faqat post-trening orqali kodlash va agentlarda katta sakrash ko‘rsatadi. Z.ai vaznlarni taxminan ikki haftada chiqarishni va’da qildi; hozircha bu lokal kelajagi ishonchli bo‘lgan bulut modeli.

Yangilangan 2026-yil 14-avgust Weights Pending1M Context Evals744B MoE
9.210 dan
Rasmiy veb-sayt
Eng mos

Hali yuklab bo‘lmaydigan eng qiziqarli lokal model. GLM-5.3 GLM-5.2 ning 744B MoE bazasini saqlab, faqat post-trening orqali kodlash va agentlarda katta sakrash ko‘rsatadi. Z.ai vaznlarni taxminan ikki haftada chiqarishni va’da qildi; hozircha bu lokal kelajagi ishonchli bo‘lgan bulut modeli.

Nima uchun bu eng yaxshisi

Z.ai Terminal-Bench 3.0 da 28.3, DeepSWE v1.1 da 66.9, AutomationBench da 48.2 va CyberGym da 84.5% natija bildiradi. Barcha o‘sish 744B/~40B faol bazani kattalashtirishdan emas, uzoq RL muhitlarini kengaytirishdan kelgani aytiladi.

E'tibor bering

Start paytida ochiq vazn, e’lon qilingan litsenziya va umumiy API yo‘q; kirish Coding Plan va ZCode orqali. Natijalarning ko‘pini vendor bajargan, model data-markaz hajmida va native vision e’lon qilinmagan.

01

Aslida bu nima

Binoni kattalashtirmasdan kuchaygan ustaxonani tasavvur qiling. Asboblar o‘sha joyida, lekin ishchilar murakkab buyurtmani rejalash, natijani tekshirish va xatodan keyin yo‘lni o‘zgartirishni yaxshiroq o‘rganadi. GLM-5.3 ning asosiy g‘oyasi shu: GLM-5.2 bazasi o‘zgarmaydi, bir oylik kengaytirilgan post-trening uzoq muhandislik va tadqiqot ishini yaxshilaydi.

Bu farq private AI uchun muhim. Model hajmi ijara kabi: har bir qo‘shimcha parametr storage, bandwidth va xizmat talab qiladi. 5.3 5.2 ning qimmat “ijarasi”ni kamaytirmaydi, lekin shu binoda ko‘proq mahorat va’da qiladi. Z.ai jami 744 milliard, taxminan 40 milliard faol parametr, ko‘proq muhit va SAO hamda slime orqali RL ni aytadi.

Natijalar hozircha hikoyaga mos. Terminal-Bench 4.6 dan 28.3 ga, DeepSWE 46.2 dan 66.9 ga, AutomationBench 26.2 dan 48.2 ga ko‘tariladi. Bu bir qator kodni tugatish emas: agent tool ishlatadi, natijani o‘qiydi va rejani tuzatadi. Model bir javobda aqlli ko‘rinib, yigirmanchi qadamdanoq adashishi mumkin; trening shu muammoni nishonga oladi.

Xavfsizlik raqamlari kuchli, ammo ehtiyot talqin qilinadi. CyberGym 84.5% discovery va validation jadvalini boshqaradi. Chuqur exploitation boshqa tog‘: ExploitBench 54.4% 5.2 ni ikki baravar oshiradi, ammo Fable 5 78.0 va Sol 76.5. GLM xavfli eshikni yaxshi topadi; yopiq yetakchilar uning ortidagi labirintni yaxshiroq o‘tadi.

Z.ai ekspert tekshiruvi va deduplication dan keyin 269 loyihadagi 2,436 topilma ledgerini ochdi; startda 53 tasi public. Bu ham vendor dalili, ammo ko‘riladigan jonli ro‘yxat oddiy g‘alaba shioridan foydaliroq.

Lokal so‘zi aniqlik talab qiladi. Start kuni download yo‘q. Vaznlar ikki haftada va’da qilingan, litsenziya aytilmagan, umumiy API ham keyin keladi. Bugungi yo‘l Coding Plan va ZCode. Kelajakdagi fayl hali sizning serveringizdagi fayl emas.

Va’da bajarilsa, deployment 5.2 ga o‘xshaydi: juda katta memory, yetuk serving va ehtiyot quantization. 5.2 operatorlari tezroq boshlaydi, lekin aniq memory va sifat yo‘qotilishi faqat relizdan keyin o‘lchanadi. Shu sabab vaqtincha #2; DeepSeek V4 Flash bugun yuklanib ishlagani uchun birinchi tavsiya bo‘lib qoladi.

02

Kuchli tomonlar va halol cheklovlar

Asosiy afzalliklari

  • Bir xil bazadagi haqiqiy yangilanish: ko‘proq muhit, turli vazifa va SAO hamda slime bilan post-trening kelajakdagi hosting hajmini oshirmasdan ko‘proq qobiliyat va’da qiladi.
  • Uzoq kodlash markazda: Terminal-Bench 4.6 dan 28.3 ga, DeepSWE 46.2 dan 66.9 ga, AutomationBench 26.2 dan 48.2 ga chiqadi; agent harakat qiladi, tekshiradi va tuzatadi.
  • Kelajakdagi deployment tanish bo‘lishi kerak: baza o‘zgarmagani uchun 5.2 infratuzilmasi taxmin bo‘la oladi—katta unified memory yoki bir necha GPU, oddiy noutbuk emas.
  • Xavfsizlik dalili aniq: Z.ai CyberGym 84.5% va ExploitBench 54.4% ni ko‘rsatadi; ochiq ledger 269 loyihadagi 2,436 tekshirilgan topilmani, startda 53 ochilgan holatni kuzatadi.
  • Kutish paytida hosted test bor: 5.3 barcha Coding Plan darajalari va ZCode da mavjud; jamoa hardware xarididan oldin o‘z reposida sinaydi.

Haqiqiy cheklovlar

  • Bugun lokal emas: vaznlar 14-avgustdan taxminan ikki hafta keyin va’da qilingan. Hozir “open weight” mavjud mahsulot emas, niyatdir.
  • Litsenziya noma’lum: 5.2 shartlari 5.3 ga avtomatik o‘tmaydi. Model card va haqiqiy litsenziyani kutish kerak.
  • Hardware talabi ulkan: jami 744B va ~40B faol parametr quantization bilan ham 256GB sinfi yoki multi-GPU ni anglatadi.
  • Mustaqil takrorlash yo‘q: Z.ai sozlamalarni yaxshi hujjatlagan, ammo deyarli barcha raqamni o‘zi bajargan yoki yig‘gan. Ayrim tashqi baholar butun hikoyani tasdiqlamaydi.
  • Text-first va fikrlash majburiy: native vision aytilmagan, thinking o‘chmaydi; low, high va max faqat darajani belgilaydi.
03

Benchmark natijalari

Terminal-Bench 3.0 — 28.3 (Z.ai)

4.6 dan katta sakrash; Fable 5 33.7 va GPT-5.6 Sol 34.6 bilan oldinda.

DeepSWE v1.1 — 66.9 (Z.ai)

46.2 dan o‘sib, Kimi K3 67.5 ga yaqin; Sol 72.7 bilan yetakchi.

AutomationBench v1.0.6 — 48.2 (Z.ai)

26.2 dan o‘sish uzoq avtomatlashtirish da’vosini qo‘llaydi.

CyberGym — 84.5% (Z.ai)

Jadvaldagi eng yaxshi discovery natijasi, lekin to‘liq ekspluatatsiya zanjiri emas.

ExploitBench — 54.4% (Z.ai)

24.4 dan ikki baravardan ko‘p, ammo Fable 5 78.0 va Sol 76.5 dan ancha past.

04

Xulosa

GLM-5.3 Local / Private AI da #2 bo‘ladi: 5.2 dan yuqori, lekin hozir yuklanadigan va kichikroq DeepSeek V4 Flash dan past. Yo‘nalishi juda kuchli, ammo lokal degani vaznga egalik qilishdir. Fayl va litsenziyasiz #1 emas. Coding Plan orqali sinang, deployment uchun model card, litsenziya, checksum, serving qo‘llovi va mustaqil quantized testlarni kuting.

05

Ko'p so'raladigan savollar