O'rin #8 Dasturlash — ishlab chiqarishga tayyor kod yozadigan SI
Alibaba / Qwen Team

Qwen3.8-Max

Vizual va uzun kontekstli dasturlash bo'yicha yuqori qiymatga ega raqobatchi. Endilikda, mustaqil testlar GLM-5.3 flagmanini oldinga qo'ygandan so'ng, u 6-o'rinni egallab turibdi. Uning yuklab olinadigan Max darajasidagi modeli hali ham ajoyib, ammo 2.4 trillion parametr uni o'zi xosting qilish uchun ma'lumotlar markazi darajasidagi loyihaga aylantiradi.

Yangilangan 2026-yil 30-avgust Agentic CodingVision + Video1M Context

Reyting yangilandi Bu sharh oxirgi marta yangilanganidan beri (2026-yil 30-avgust) «Dasturlash» reytingi qayta ko'rib chiqildi. Yuqorida ko'rsatilgan o'rin har doim dolzarb. Hozirgi 1-o'rin: GPT-6 Astra

9.210 dan
Rasmiy veb-sayt
Eng mos

Vizual va uzun kontekstli dasturlash bo'yicha yuqori qiymatga ega raqobatchi. Endilikda, mustaqil testlar GLM-5.3 flagmanini oldinga qo'ygandan so'ng, u 6-o'rinni egallab turibdi. Uning yuklab olinadigan Max darajasidagi modeli hali ham ajoyib, ammo 2.4 trillion parametr uni o'zi xosting qilish uchun ma'lumotlar markazi darajasidagi loyihaga aylantiradi.

Nima uchun bu eng yaxshisi

Frontend Code Arena-da kuchli erta natija (1668 Elo, 4-o'rin), bitta yuklab olinadigan model to‘plamidagi 2.4T/95B parametrlar va 1M gacha kengaytiriladigan kontekst, hamda xosting qilingan Max-da multimodal kirish imkoniyatlari.

E'tibor bering

GLM-5.3 endi mustaqil Intellekt, Dasturlash va Agent indekslarida, shuningdek, Z.ai ning bir jadvaldagi Terminal-Bench va DeepSWE taqqoslashlarida Qwen'dan oldinda bormoqda. Qwen ning eng kuchli batafsil ballari hali ham ishlab chiquvchi (vendor) tomonidan taqdim etiladi va real xatolarni (bug) tuzatish testlari aralash natijalarni ko'rsatmoqda.

01

Aslida bu nima

Qwen3.8-Max ning qiziqarli tomoni shundaki, u har bir qatorda eng katta raqamga ega emas. Yo’q, unday emas. Qiziqarli qismi bu kombinatsiya: juda katta kontekst oynasi, vizual kirish, jiddiy agent ambitsiyalari va takroriy urinishlarni hamyonbop qiladigan narxga ega model. Dasturlash, asosan, urinib ko’rish, tekshirish va yana urinib ko’rish jarayonidir; arzonroq token hisobi bu jarayonni nazariyadan ko’ra ko’proq amaliyotga aylantiradi.

Alibaba modelni har million kirish (input) tokeni uchun $2 va har million chiqarish (output) tokeni uchun $6 narxida e’lon qildi. Taqqoslash uchun, ushbu qo’llanmada Kimi K3 ning oldingi tarifi $3/$15 edi. Dasturlash agenti repozitoriy kontekstini qayta o’qishi kerak bo’lganda yoki siz ikkinchi modeldan patchni ko’rib chiqishni xohlaganingizda bu tejamkorlik ayniqsa foydalidir. Arzon bo’lish har doim yaxshi degani emas, lekin bu yaxshi muhandislik odatlarini — testlar, qayta urinishlar va mustaqil ko’rib chiqishni (review) — amalda qo’llashni ancha arzonga tushirishi mumkin.

Frontend bo’yicha erta dalillar e’tiborga loyiqdir. Frontend Code Arena’ning dastlabki olingan natijalariga ko’ra, Qwen3.8-Max 1668 Elo bilan #4-o’rinni egallaydi. Bu reytinglar odamlarning aynan qaysi model interfeysni yaratganini bilmagan holda bitta tayyor interfeysni boshqasidan afzal ko’rishiga asoslanadi. Bu testni mahsulot prototipi ortidagi haqiqiy savolga yaqinlashtiradi: sahifa uyg’un ko’rinadimi va foydalanuvchi kutganidek ishlaydimi? Ball o’zgarishi mumkin va chiroyli interfeys hali ham mo’rt kodni yashirishi mumkin, ammo bu juda muhim boshlang’ich signaldir.

Xosting qilingan Max ning kirish imkoniyatlari vizual rivojlantirishga juda mos keladi: skrinshot, dizayn namunasi, brauzer yozuvi, vazifalar qisqacha mazmuni va repozitoriy matni bitta suhbatni bo’lishishi mumkin. Ochiq model farq qiladi: u faqat matndan iborat bo’lib, o’ziga xos 262K kontekstga ega va taxminan 1.01M gacha kengaytirilishi mumkin. Jamoalar xosting qilingan yoki ochiq shaklni o’zlari ehtiyoj sezadigan haqiqiy xususiyatlar (modality) va infratuzilmaga qarab tanlashlari kerak.

Ochiq nashr etish mo’jizaviy tarzda benchmark ishonchini o’zgartirish o’rniga joylashtirishni (deployment) o’zgartiradi. Jamoalar kodni o’z muhitlarida saqlashlari va qo’llab-quvvatlanadigan dasturiy ta’minot (stack) orqali modelga xizmat ko’rsatishlari mumkin. Shunday bo’lsa-da, 2.4 trillion parametr ma’lumotlar markazi darajasidagi (datacenter-scale) masshtab bo’lib qoladi va maxsus litsenziya yuqori foydalanuvchi yoki daromad chegaralarida model nomini ko’rsatish va alohida litsenziya olish shartlarini qo’shadi. Ochiq vaznlar faqatgina qulfni ishlab chiquvchining eshigidan sizning o’z server xonangizga ko’chiradi; ular server xonasini kichiklashtirib qo’ymaydi.

Alibaba Terminal Bench 2.1 da 86.6 natijani xabar qildi, bu buyruqlar satri (command-line) vazifalari orqali ishlaydigan agent uchun kuchli natijadir. Z.ai xuddi shu ishga tushirish jadvalida GLM-5.3 uchun 88.2 va DeepSWE da Qwen’ning 56.6 balliga qarshi 66.9 ballni xabar qildi. Artificial Analysis mustaqil ravishda GLM ni Dasturlashda 74.8 ga qarshi 71.8 va Agent ishlarida 59.1 ga qarshi 58.4 bilan oldinga qo’yadi. Shuningdek, GLM Qwen’da ma’lumot yo’q bo’lgan eng yangi ommaviy Terminal-Bench 4.0 reytingida 41.8% bilan uchinchi o’rinda turadi. Turli xil sinov muhitlari hali ham muhim ahamiyatga ega, ammo hozirda dalillar tartibni o’zgartirish uchun yetarlicha izchil ko’rsatmoqda.

Eng aniq ogohlantirish bu repozitoriyni ta’mirlashdir. Alibaba’ning SWE-bench Pro da 67.7 natijasi hurmatga sazovor, biroq u yetakchi natijalardan pastda turadi va dastlabki mustaqil xatolarni (bug) tuzatish bo’yicha hisobotlar bir tekis emas. Bu sun’iy intellekt rivojlanishida yaxshi tanish bo’lgan farqdir: ishonchli yangi interfeysni yaratish va g’alati eski kod bazasini ta’mirlash bir xil vositalarni bo’lishadi, lekin har doim ham bir xil intizomni emas. Agar o’z testlaringizda o’zini oqlasa, ikkalasi uchun ham Qwen dan foydalaning; birinchi g’alabadan ikkinchisini to’g’ridan-to’g’ri xulosa qilib olmang.

Hozircha, Qwen3.8-Max 9.2 ball bilan #6-o’rinda. U ko’p modalli xosting qilingan Max orqali frontend ishlari uchun, va ochiq matnli model to‘plami orqali xususiy uzoq kontekstli dasturlash uchun jozibador bo’lib qolmoqda, biroq GLM-5.3 flagmani endi dasturlash ro’yxatida uning tepasida o’tiradi. Ruxsatlarni qat’iy cheklangan holatda saqlang va to’liq natijani o’lchang: muvaffaqiyatli testlar, ko’rib chiqilgan kod o’zgarishlari (diff), foydali xatti-harakatlar, infratuzilma narxi va litsenziya mosligi.

02

Kuchli tomonlar va halol cheklovlar

Asosiy afzalliklari

  • Narx nimalarni sinab ko’rishga arziydiganligini o’zgartiradi: Har million token uchun $2 kiritish / $6 chiqarish narxi bilan Qwen3.8-Max eng qimmat dasturlash agentlaridan ancha arzon va Kimi K3 ning avvalgi $3/$15 tarifidan ham past. Bu iterativ xatolarni tuzatish (debugging), uzun kontekst va ikkinchi marta mustaqil ko’rib chiqishni moliyaviy jihatdan realistik qiladi.
  • U frontendda rag’batlantiruvchi natija bilan boshlanadi: Frontend Code Arena dastlabki holatda Qwen3.8-Max ni 1668 Elo (#4) bilan ro’yxatga oladi, bunga kuchli iste’molchi mahsulotlari pozitsiyalari ham kiradi. Olingan interfeysga nisbatan ko’r-ko’rona ustunlik (blind preference) berish UI (foydalanuvchi interfeysi) ishlari uchun foydali signaldir, garchi bu butun repozitoriyni qamrab oluvchi muhandislik mahoratini isbotlamasa ham.
  • Uzoq, vizual vazifalar uning kiritish (input) dizayniga mos keladi: Model 1M tokenli kontekst oynasi orqali matn, skrinshotlar, diagrammalar va videolarni qabul qilishi mumkin. Bu dizaynni kodga aylantirish, yozib olingan UI nosozligini aniqlash yoki katta repozitoriy va uning mahsulot talablarini bitta ish sessiyasida saqlab turish uchun juda foydali.
  • Ishlab chiquvchining terminal-agent natijasi kuchli: Alibaba Terminal Bench 2.1 da 86.6 natijani xabar qildi, bu uning taqqoslashida eng yuqoriga yaqin. Bu Qwen tizimi buyruqlar satri (command-line) vazifalarini boshqara olishi, fayllar yozishi va vositalar qaytargan javoblarga (tool feedback) munosabat bildira olishiga dalildir.
  • U fikrlash jarayonini ataylab boshqarish imkonini beradi: reasoning_effort (fikrlash harakati) yuqori, o’rta va past sozlamalarni qo’llab-quvvatlaydi, preserve_thinking (fikrlashni saqlash) esa sukut bo’yicha yoqilgan. Dasturchilar qiyin dizayn uchun ko’proq vaqt sarflashlari yoki kichik, aniq belgilangan tahrir uchun kechikishni (latency) kamaytirishlari mumkin.
  • Jamoalar Max darajasini o’zlari xosting qilishlari mumkin: Ochiq model to‘plami Hugging Face va ModelScope’da mavjud va uning model kartasida vLLM, SGLang va TokenSpeed mosligi ko’rsatilgan. Bu jamoada ma’lumotlar markazi miqyosidagi apparat vositalari bo’lsa, shaxsiy baholash va nozik sozlash (fine-tuning) imkonini beradi.

Haqiqiy cheklovlar

  • Mustaqil dalillar endi pastroq shiftni belgilaydi: Artificial Analysis Qwen3.8-Max ni Dasturlash bo’yicha 71.8 va Agent ishlari bo’yicha 58.4 ball bilan, 74.8 va 59.1 ballga ega GLM-5.3 dan orqada baholaydi. Alibaba ning batafsil Terminal Bench va PaperBench qatorlari hali ham foydali, ammo ular testni sozlash (setup) usuliga bog’liq.
  • Repozitoriyni ta’mirlash eng aniq bo’shliq bo’lib qolmoqda: Alibaba SWE-bench Pro da 67.7 natijani xabar qildi, bu texnologiya chegarasidagi (frontier) eng kuchli natijalardan orqada. Shuningdek, erta mustaqil xatolarni (bug) tuzatish bo’yicha hisobotlar ham bir xil emas, shuning uchun yaxshi frontend namoyishini yirik ishlab chiqarish kod bazasini ishonchli saqlash deb adashtirmaslik kerak.
  • Katta kontekst yomon rejaning uzoqroq saqlanib qolishiga olib kelishi mumkin: Bir million token modelga juda ko’p narsani ko’rishga imkon beradi, lekin u baribir arxitektura bo’yicha farazni noto’g’ri tushunishi yoki matnning o’rtasidagi biror faktni o’tkazib yuborishi mumkin. Bitta uzun sessiyaga cheksiz vazifani topshirish o’rniga, kichik commit’lar, testlar va nazorat nuqtalaridan foydalaning.
  • Fikrlash sifati, tezlik va narx o’zaro bog’liq (trade-off) tushunchalardir: Yuqori harakat murakkab muammoda yordam berishi mumkin, ammo o’ylash tokenlari chiqarish (output) sifatida hisoblanadi va dastlabki foydalanuvchilar kvota yoki tokenning yuqori sarflanishi haqida xabar berishmoqda. Odatiy tahrirlar uchun o’rta yoki past harakatdan foydalaning va qo’shilgan, test qilingan har bir o’zgarish narxini o’lchang.
  • Xizmatga kirish va integratsiyalar joylashuvga qarab farq qilishi mumkin: API larga kirish oson, lekin mavjudlik, to’lov, kvotalar va kechikish vaqti mintaqaga qarab farq qilishi mumkin. Modelni standart sifatida qabul qilishdan oldin, u sizning jamoangiz va ilovangiz ishlayotgan joyda ishonchli tarzda mavjudligini tasdiqlang.
  • Litsenziya va apparat vositalari hali ham chegaralarni o’rnatadi: 2.4 trillion parametrlarga xizmat ko’rsatish bu ma’lumotlar markazi (datacenter) loyihasidir. Shuningdek, maxsus litsenziya juda yirik mahsulotlar uchun model nomini ko’rsatishni hamda belgilangan daromad chegarasidan oshadigan yirik model xizmatlari yoki dasturlash/ofis yordamchisi bizneslari uchun alohida ruxsatnomani talab qiladi.
03

Benchmark natijalari

Frontend Code Arena — 1668 Elo (#4, erta)

Tugallangan frontend ishi bo'yicha inson afzalliklarining dastlabki natijasi. Bu UI yaratish uchun kuchli dalil, to'liq dasturiy injiniring reytingi emas.

Terminal Bench 2.1 — 86.6 (Alibaba xabar qilgan)

Ishlab chiquvchi xabar qilgan yuqori terminal-agent natijasi, u keltirilgan GPT-5.6 Sol'ning 88.8 balldan orqada. Agentlar uchun turli xil sinov muhitlari to'g'ridan-to'g'ri model taqqoslashlari mukammal emasligini ko'rsatadi.

SWE-bench Pro — 67.7 (Alibaba xabar qilgan)

Repozitoriyni ta'mirlash bo'yicha hurmatga sazovor ball, lekin u hali ham ishlab chiquvchining jadvalidagi Claude oilasining eng kuchli natijalaridan ortda qolmoqda.

PaperBench — 93.0 (Alibaba xabar qilgan)

Ilmiy tadqiqot ishlari uchun kuchli signal, rejalashtirish va uzoq muddatli fikrlash uchun foydali kontekst, ammo to'g'ridan-to'g'ri dasturlash benchmarki emas.

Artificial Analysis Dasturlash / Agent ishlari — 71.8 / 58.4

Mustaqil umumlashtirilgan dalillar GLM-5.3 (74.8 / 59.1) dan orqada qolmoqda va GLM flagmanini Qwen'dan yuqoriga qo'yishni qo'llab-quvvatlaydi. Ushbu xom indekslarda Qwen GLM-5.3-Flash'dan biroz oldinda turibdi.

04

Xulosa

Qwen3.8-Max formula bilan to’g’irlangan 9.2 ball bilan Dasturlash bo’yicha 6-o’ringa tushdi. U vizual, uzun kontekstli va narxga sezgir bo’lgan ajoyib raqobatchi bo’lib qolmoqda, ammo so’nggi mustaqil dalillar endi uni GLM-5.3 flagmanidan ustun qo’yishni qo’llab-quvvatlamaydi. Grok 4.6 #4, GLM-5.3 #5, Qwen #6 va GLM-5.3-Flash #7-o’rinda. Qwen dan uning ko’p modalli xosting qilingan mahsuloti va narxi vazifaga mos keladigan joyda foydalaning, so’ngra CI va kodni ko’rib chiqish (code review) jarayonlari u sizning repozitoriyingizda haqiqatan ham ushbu modellardan ustunligini hal qilsin.

05

Ko'p so'raladigan savollar