O'rin #7 Dasturlash — ishlab chiqarishga tayyor kod yozadigan SI
Z.ai (Zhipu AI)

GLM-5.3

«Menga shuni yozib ber» qabilidagi ilk so'rovlardan keyin boshlanadigan eng asosiy bosqichlar — reja tuzish, tahrirlash, kodni sinab ko'rish, xatolarni to'g'rilash va butun boshli repozitoriydagi uzoq ish jarayonida yo'nalishni yo'qotmaslik uchun maxsus o'qitilgan og'ir toifadagi, ochiq vaznli dasturchi agent.

Yangilangan 2026-yil 30-avgust Coding AgentLong-Horizon1M Context

Reyting yangilandi Bu sharh oxirgi marta yangilanganidan beri (2026-yil 30-avgust) «Dasturlash» reytingi qayta ko'rib chiqildi. Yuqorida ko'rsatilgan o'rin har doim dolzarb. Hozirgi 1-o'rin: GPT-6 Astra

9.210 dan
Rasmiy veb-sayt
Eng mos

«Menga shuni yozib ber» qabilidagi ilk so'rovlardan keyin boshlanadigan eng asosiy bosqichlar — reja tuzish, tahrirlash, kodni sinab ko'rish, xatolarni to'g'rilash va butun boshli repozitoriydagi uzoq ish jarayonida yo'nalishni yo'qotmaslik uchun maxsus o'qitilgan og'ir toifadagi, ochiq vaznli dasturchi agent.

Nima uchun bu eng yaxshisi

Artificial Analysis platformasi GLM-5.3 ni umumiy intellekt bo'yicha 59.5, dasturlashda 74.8 va agentlik ishlarida 59.1 ballga baholadi. E'tiborli jihati, model bu ko'rsatkichlarning har uchalasida ham Qwen3.8-Max dan o'zib ketdi. Eng so'nggi yangilangan ochiq Terminal-Bench 4.0 reytingida esa GLM 41.8 foiz natija bilan uchinchi o'rinni egallab turibdi.

E'tibor bering

Modelning rasmiy e'lon qilingan vaznlari umumiy hisobda 753 milliard parametrga ega, ishlash vaqtida ularning taxminan 40 milliardi faollashadi. Model faqat matn qabul qiladi, doimo mantiqiy o'ylash (reasoning) rejimida turadi va uning xajmi hatto siqilgan FP8 formatida ham naq 756 GB joyni egallaydi. Qolaversa, dasturlash va kiberxavfsizlikka oid ko'plab yuqori ko'rsatkichlar hamon Z.ai kompaniyasining ichki sinovlariga asoslangan, uning maxsus litsenziyasini ham ochiq kodli MIT deb bo'lmaydi.

01

Aslida bu nima

Sun’iy intellekt uchun eng oson kod namoyishi — bu uning birinchi javobi. Siz modeldan biror funksiya yozib berishni so’raysiz, u silliq va chiroyli kod chiqarib beradi va mo’‘jizani namoyish etayotgan video dasturdagi kutubxonalar bir-biriga mos kelmay qolmasidan yoki birinchi xato kelib chiqmasidanoq shu joyida to’xtatiladi. Haqiqiy muhandislik esa aynan o’sha reklama videosi tugagan joydan boshlanadi. GLM-5.3 faqatgina birinchi emas, balki ikkinchi, yigirmanchi va yuzinchi amallar uchun yaratilgandir: u o’zidan oldin nima bo’lganini o’qiydi, rejasini qayta ko’rib chiqadi va ishni oxiriga yetkazish uchun xotirasida yetarlicha katta kontekstni saqlab qola oladi.

Z.ai ma’lum qilishicha, ushbu yirik modelning poydevori undan oldingi GLM-5.2 bazasi bilan butunlay bir xil. Undagi barcha kutilmagan ijobiy yutuqlar faqatgina o’quv muhitini kengaytirish va uzoq davom etuvchi professional amaliyotlar (post-training) hisobiga erishilgan. Buni shunday tasavvur qiling: universitetni bitirgan iqtidorli talaba amaliyot o’tash uchun yirik kompaniyaga ishga kirdi. Uning boshidagi bilimlari aslida o’zgarmagan bo’lishi mumkin, ammo tinimsiz ravishda o’tkazilgan takroriy amaliyotlar unga qachon hisob-kitob qilishni, qachon o’zining faraziga shubha bilan qarashni va besh daqiqa oldin juda aqlli bo’lib tuyulgan noto’g’ri rejani qachon tashlab yuborishni o’rgatadi.

Bu ta’riflarning ortida asosan ikki xil dalil mavjud. Z.ai kompaniyasining o’zi Terminal-Bench, DeepSWE, AutomationBench kabi testlarda va kiberxavfsizlik yo’nalishlarida ulkan o’sish borligini ta’kidlaydi. Eng muhimi esa, mustaqil baholash platformasi bo’lmish Artificial Analysis o’z reytingida GLM-5.3 ga umumiy intellekt bo’yicha 59.5, dasturlash yo’nalishida 74.8 va mustaqil agent sifatida ishlashda 59.1 ball berganini ko’rishimiz mumkin; raqobatchi Qwen3.8-Max esa mos ravishda 58.1, 71.8 va 58.4 ball bilan undan biroz ortda qolmoqda. Barcha ko’rsatkichlar shuni tasdiqlamoqdaki, GLM haqiqatan ham dasturlash bobida Qwen dan yuqori o’rinda turishi kerak, biroq loyihani boshlashdan oldin xususiy repozitoriylarda yana bir marta mustaqil sinovlar o’tkazib olish zarar qilmaydi.

28-avgust kuni model vaznlarining hammaga ochiqlanishi loyiha haqidagi fikrlarni butunlay o’zgartirib yubordi. Shu sanaga qadar «ochiq vaznli model» degan tushuncha shunchaki qandaydir niyatni anglatardi, xolos. Endilikda modelning FP8 va BF16 fayllarini, turli xil sozlamalar, suhbat shablonlari va ishga tushirish uchun zarur bo’ladigan rasmiy qo’llanmalarni bemalol tekshirib ko’rish imkoni bor. Nihoyat uning natijalarini amalda mustaqil ravishda takrorlash mumkin bo’ldi. Biroq bu arzon takrorlash emas: faqatgina FP8 fayllarining o’zi kompyuter xotirasidan terabaytning qariyb to’rtdan uch qismini egallab oladi, rasmiy yo’riqnomalar esa bir nechta eng kuchli H200 videokartalari o’rnatilgan serverlardan foydalanishni talab qiladi. To’g’ri, modelni internetdan bemalol yuklab olish mumkin, biroq uning to’laqonli ishlashi uchun mo’jazgina server xonasi kerak bo’ladi.

Uning litsenziyasini ham huddi shunday oddiy va xalqchil tilda tushuntirish kerak. GLM-5.3 ochiq kodli MIT emas. Uning maxsus litsenziyasi foydalanuvchilariga modelni qo’llash, o’zgartirish, qo’shimcha o’qitish (fine-tuning), o’rnatish va sotishga juda keng huquq beradi. Biroq uning bitta g’ayrioddiy sharti bor: agar litsenziya egasi yoki uning hamkorlaridan biri Model-as-a-Service (MaaS) biznesini yuritadigan bo’lsa va ularning bir yillik daromadi o’n milliard dollardan oshsa, u holda o’sha operator modeldan tijorat maqsadlarida foydalanishdan oldin Z.ai ning qat’iy xavfsizlik tekshiruvidan o’tishi shart. To’g’ri, ko’pchilik jismoniy shaxslar va odatiy kompaniyalar bunday milliardlik chegaradan ancha uzoqda, shunga qaramay uni mutlaqo shartlarsiz ochiq kodli model deyish adolatsizlik bo’ladi.

Benchmark nomlarining ham o’z o’rni bor. Terminal-Bench 2.1 da Z.ai o’zi ko’rsatgan 88.2 natija ham, mustaqil o’tkazilgan boshqa sinovlardagi nisbatan pastroq natijalar ham mutlaqo halol bo’lishi mumkin, chunki mustaqil agent tizimida model undagi ishtirokchilardan faqat bittasidir, xolos. Eng so’nggi va doimiy yangilanib turadigan Terminal-Bench 4.0 reytingida GLM-5.3 41.8% ±3.2 aniqlik bilan uchinchi o’rinni egalladi: u o’zidan yuqoridagi Opus 5 va Fable 5 modellaridan ortda bo’lsa-da, GPT-5.6 Sol va Grok 4.6 ni bemalol ortda qoldirdi. Qwen3.8-Max uchun bu platformada hali natijalar taqdim etilmagan, shu sababli ham uning jadvalda yo’qligi GLM ga bo’lgan ishonchni oshirsa-da, ularni yuzma-yuz solishtirish imkonini bermaydi.

Amaliyotda, fayllarni kompyuterga ko’chirib yurgandan ko’ra tayyor pullik (hosted) modelni sinab ko’rish ancha oson. U o’ylashning (reasoning) past, yuqori va maksimal rejimlarini qo’llab-quvvatlaydi, odatiy holatda esa maksimal rejimga sozlangan bo’ladi. Mantiqiy fikrlashni umuman o’chirib qo’yishning iloji yo’q. Bu albatta murakkab ishlarda asqatadi, ammo noto’g’ri yo’nalishga tushib qolganda uning narxini juda qimmat qilib yuborishi mumkin: tinimsiz harakat qiladigan agent o’z xatosini to’g’rilay olsa va foydali dalillar sari intilsagina o’z samarasini beradi. Uzoq davom etuvchi jarayonlarni doimiy kuzatib boring (stream), amaliyot sikllarini (loops) cheklab qo’ying, fikrlash zanjirini toza tuting va ish muvaffaqiyatli tugaganligi haqidagi yakuniy xabarni qabul qilishdan oldin, bajarilgan kodning to’g’riligini doimo sinab ko’ring (test).

Shunday qilib, GLM-5.3 taqdimot kunidagidan ko’ra endilikda yanada kuchliroq e’tibor va ishonchga loyiq modelga aylandi; ammo u mo’‘jiza degani emas. U asosan terminal ustidagi murakkab vazifalarni bajarish, uzun va katta matnlar bilan ishlashni xohlovchi, buning API xarajatlarini ko’tara oladigan yoki modelni ko’tarib tura oladigan ulkan infratuzilmaga (klaster) ega jamoalar uchun juda jiddiy ochiq vaznli dasturlash dvigatelidir. U vizual ma’lumotlarni tahlil qiluvchi (visual debugger) eng zo’r vosita ham emas, uni xususiy kompyuterga o’rnatish ham ancha mashaqqatli ish; qolaversa, ishlab chiquvchining bergan har qanday balandparvoz raqamlari sizning aniq repozitoriyingizda o’z tasdig’ini topishiga hech kim kafolat bermaydi. Yaxshisi, uni hozir ishlatayotgan modelingiz bilan bir xil muhitda sinab ko’ring: ularga bir xil vositalar, budjet va testlar bering, so’ngra model yozib bergan uzun jumlalarga chalg’imasdan, aynan tekshiruvdan o’tgan haqiqiy kodlarni o’zaro taqqoslab xulosa chiqaring.

02

Kuchli tomonlar va halol cheklovlar

Asosiy afzalliklari

  • Uzoq muddatli ish jarayonlariga ixtisoslashgan: GLM-5.3 kodni tekshirish, tahrirlash, turli vositalarni ishga tushirish, xatolarni qidirib topish va ularni uzoq muddatli sessiyalar davomida to’g’rilash uchun maxsus o’qitilgan. Bu bitta oddiy buyruq bilan qandaydir funksiya yozib berish musobaqasida g’olib chiqishdan ko’ra, haqiqiy loyihaning kod bazasini yuritishga ancha yaqinroqdir.
  • Mustaqil va keng ko’lamli dalillar ancha salmoqli: Artificial Analysis platformasi modelni intellekt bo’yicha 59.5, dasturlash yo’nalishida 74.8 va mustaqil agent sifatida 59.1 ballga munosib ko’rdi. Uning asosiy raqobatchisi bo’lmish Qwen3.8-Max esa bu borada mos ravishda 58.1, 71.8 va 58.4 ball bilan ortda qolmoqda.
  • Model vaznlari endi haqiqatan ham hammaga ochiq: Z.ai kompaniyasi 28-avgust kuni modelning FP8 va BF16 formatidagi vaznlarini ommaga taqdim etdi. Dasturchilar jamoasi endilikda «ochiq vaznli» degan so’zni kelajakka qilingan qandaydir va’da deb qabul qilmasdan, modelni o’zlari tekshirishi, mustaqil ishga tushirishi va uning natijalarini amalda sinab ko’rishi mumkin.
  • Tayyor xizmat ko’rinishida ishlatish osonlashtirilgan: Z.ai ishlab chiquvchilarga 1 million tokenlik ulkan kontekst oynasini, fikrlashning past (low), yuqori (high) va maksimal (max) rejimlarini, shuningdek, OpenAI va Anthropic platformalari bilan mos keladigan tanish interfeyslarni taklif etadi. Buning ustiga narxlar ham hamyonbop: har 1 million kiruvchi token uchun $1.40, keshga tushgan kiruvchi tokenlar uchun $0.26 va chiquvchi javoblar uchun $4.40 etib belgilangan.

Haqiqiy cheklovlar

  • Vaznlarning ochiqligi kompyuterga sig’ishini anglatmaydi: Modelning rasmiy FP8 versiyasi salkam 756 GB, BF16 versiyasi esa taxminan 1.51 TB joy egallaydi. Hujjatlashtirilgan ko’rsatmalar ham bir nechta H200 videokartalari o’rnatilgan tizimlardan foydalanishni talab qiladi. Shuning uchun ham bu noutbukingizga yuklab olib ishlatadigan oddiy dastur emas, balki xususiy server va klasterlarga mo’ljallangan ulkan modeldir.
  • Eng shov-shuvli yutuqlarning ko’pchiligi ishlab chiquvchining o’zi tomonidan o’tkazilgan: To’g’ri, Terminal-Bench 3.0, DeepSWE, AutomationBench, CyberGym kabi testlar va Z.ai kompaniyasining yopiq Code Bench natijalari ochiq e’lon qilingan; ammo ular maxsus tayyorlangan, sezgir sinov muhitlarida o’tkazilganligini unutmaslik kerak. Ularga foydali bir dalil sifatida qarash mumkin, mutlaq universal baho sifatida emas.
  • U faqat matn qabul qiladi va tinimsiz o’ylaydi: Model skrinshotlarni yoki yozib olingan vizual interfeyslarni to’g’ridan-to’g’ri ko’ra olmaydi. Agar siz uning o’ylash (reasoning) funksiyasini o’chirishga urinsangiz, so’rovingiz xatolik bilan tugaydi. Uning quyi rejimi (low effort) garchi oddiy vazifalar uchun yordam bersa-da, qilingan har bir so’rov baribir qisman bo’lsa ham fikrlash uchun kutish vaqtini (latency) sarflaydi.
  • Litsenziya matnini erinmay o’qib chiqish talab etiladi: Garchi modeldan tijorat maqsadlarida foydalanishga deyarli barcha huquqlar berilgan bo’lsa-da, kichik bir istisno mavjud: agar Model-as-a-Service (MaaS) xizmatini ko’rsatuvchi kompaniya va uning hamkorlari yillik aylanmasi ketma-ket istalgan 12 oy ichida 10 milliard dollardan oshsa, u holda Z.ai ning maxsus xavfsizlik tekshiruvidan o’tishlari shart bo’ladi. Shu sababli uni hech qanday shartsiz ochiq kodli emas, balki shunchaki ochiq vaznli model deb atagan ma’qul.
03

Benchmark natijalari

Artificial Analysis Intelligence / Coding / Agentic — 59.5 / 74.8 / 59.1

Mustaqil baholash platformasining kompozit natijalari GLM-5.3 ni raqobatchisi Qwen3.8-Max (58.1 / 71.8 / 58.4) dan doimiy ravishda yuqoriga qo'yadi va saytimizdagi ushbu yangilangan reytingni to'la oqlaydi.

Terminal-Bench 2.1 — vendor sinovida 88.2; mustaqil sinovda qariyb 83.9

Natijalardagi bu tafovut aslida sinov muhitining nechog'lik ta'sir doirasiga ega ekanligidan saboq beradi. Qandaydir bitta raqamni modelning o'zgarmas qobiliyati sifatida qabul qilish o'rniga, uning aynan qanday sharoitda va kim tomondan o'tkazilganiga e'tibor qarating.

Terminal-Bench 4.0 — 41.8% ±3.2, #3

Terminal uchun chiqarilgan eng so'nggi ochiq reyting jadvalida GLM o'zidan oldingi Opus 5 va Fable 5 modellaridan keyin, ammo GPT-5.6 Sol hamda Grok 4.6 modellarini ortda qoldirib uchinchi o'rinni egalladi. Qwen3.8-Max uchun ushbu reytingning natijalari e'lon qilinmagan; shu sababli bu yerda uning yo'qligi modelning bevosita mag'lubiyatini bildirmaydi.

DeepSWE v1.1 — 66.9 (Z.ai sinovi)

Bu «mini-swe-agent» yordamida, olti soatlik vaqt oralig'ida butun boshli repozitoriy ustida ishlangan uzoq va qiyin jarayonning kuchli isbotidir. Biroq, bu ajoyib natija hali boshqa mustaqil mutaxassislar tomonidan ochiq platformalarda to'liq takrorlanmagan.

GDPval-AA v2 — yetakchi guruh, jonli Elo

Avgust oyi oxiridagi natijalar GLM-5.3 ni 1700 ballar atrofida, ya'ni boshqa yetakchi modellar bilan elkama-elka ko'rsatdi. Jonli Elo reytingi doimiy ravishda qayta hisoblanib turgani sababli, bu natijani keltirishda doim sanani ham ko'rsatib o'tish lozim.

04

Xulosa

Endilikda GLM-5.3 o’zining 9.2 bali bilan «Dasturlash» bo’limida faxrli 5-o’ringa ko’tarilib oldi. U reytingda Grok 4.6 dan keyin, shuningdek, 6-o’rindagi Qwen3.8-Max va 7-o’rindagi GLM-5.3-Flash dan oldinda turibdi. Bunday o’zgarish mustahkam dalillarga asoslangan: Artificial Analysis platformasining intellekt, dasturlash va agentlik indekslarida, qolaversa Z.ai tomonidan taqdim etilgan Terminal-Bench 2.1 va DeepSWE reytinglarida ham GLM raqobatchisi Qwen ni ortda qoldirgan. Agar cho’ntagingiz uning API narxlari yoki ulkan xususiy server qurish xarajatlarini ko’tara olsa, u holda terminal bilan bog’liq murakkab va uzoq davom etadigan dasturlash vazifalari uchun uni ikkilanmay tanlashingiz mumkin; biroq sizga turli formatdagi (multimodal) ma’lumotlar bilan ishlash muhimroq bo’lsa, unda yaxshisi arzonroq bo’lgan Flash versiyasini tanlaganingiz ma’qul.

05

Ko'p so'raladigan savollar