Qwen3.8-Max ning qiziqarli tomoni shundaki, u har bir qatorda eng katta raqamga ega emas. Yo’q, unday emas. Qiziqarli qismi bu kombinatsiya: juda katta kontekst oynasi, vizual kirish, jiddiy agent ambitsiyalari va takroriy urinishlarni hamyonbop qiladigan narxga ega model. Dasturlash, asosan, urinib ko’rish, tekshirish va yana urinib ko’rish jarayonidir; arzonroq token hisobi bu jarayonni nazariyadan ko’ra ko’proq amaliyotga aylantiradi.
Alibaba modelni har million kirish (input) tokeni uchun $2 va har million chiqarish (output) tokeni uchun $6 narxida e’lon qildi. Taqqoslash uchun, ushbu qo’llanmada Kimi K3 ning oldingi tarifi $3/$15 edi. Dasturlash agenti repozitoriy kontekstini qayta o’qishi kerak bo’lganda yoki siz ikkinchi modeldan patchni ko’rib chiqishni xohlaganingizda bu tejamkorlik ayniqsa foydalidir. Arzon bo’lish har doim yaxshi degani emas, lekin bu yaxshi muhandislik odatlarini — testlar, qayta urinishlar va mustaqil ko’rib chiqishni (review) — amalda qo’llashni ancha arzonga tushirishi mumkin.
Frontend bo’yicha erta dalillar e’tiborga loyiqdir. Frontend Code Arena’ning dastlabki olingan natijalariga ko’ra, Qwen3.8-Max 1668 Elo bilan #4-o’rinni egallaydi. Bu reytinglar odamlarning aynan qaysi model interfeysni yaratganini bilmagan holda bitta tayyor interfeysni boshqasidan afzal ko’rishiga asoslanadi. Bu testni mahsulot prototipi ortidagi haqiqiy savolga yaqinlashtiradi: sahifa uyg’un ko’rinadimi va foydalanuvchi kutganidek ishlaydimi? Ball o’zgarishi mumkin va chiroyli interfeys hali ham mo’rt kodni yashirishi mumkin, ammo bu juda muhim boshlang’ich signaldir.
Xosting qilingan Max ning kirish imkoniyatlari vizual rivojlantirishga juda mos keladi: skrinshot, dizayn namunasi, brauzer yozuvi, vazifalar qisqacha mazmuni va repozitoriy matni bitta suhbatni bo’lishishi mumkin. Ochiq model farq qiladi: u faqat matndan iborat bo’lib, o’ziga xos 262K kontekstga ega va taxminan 1.01M gacha kengaytirilishi mumkin. Jamoalar xosting qilingan yoki ochiq shaklni o’zlari ehtiyoj sezadigan haqiqiy xususiyatlar (modality) va infratuzilmaga qarab tanlashlari kerak.
Ochiq nashr etish mo’jizaviy tarzda benchmark ishonchini o’zgartirish o’rniga joylashtirishni (deployment) o’zgartiradi. Jamoalar kodni o’z muhitlarida saqlashlari va qo’llab-quvvatlanadigan dasturiy ta’minot (stack) orqali modelga xizmat ko’rsatishlari mumkin. Shunday bo’lsa-da, 2.4 trillion parametr ma’lumotlar markazi darajasidagi (datacenter-scale) masshtab bo’lib qoladi va maxsus litsenziya yuqori foydalanuvchi yoki daromad chegaralarida model nomini ko’rsatish va alohida litsenziya olish shartlarini qo’shadi. Ochiq vaznlar faqatgina qulfni ishlab chiquvchining eshigidan sizning o’z server xonangizga ko’chiradi; ular server xonasini kichiklashtirib qo’ymaydi.
Alibaba Terminal Bench 2.1 da 86.6 natijani xabar qildi, bu buyruqlar satri (command-line) vazifalari orqali ishlaydigan agent uchun kuchli natijadir. Z.ai xuddi shu ishga tushirish jadvalida GLM-5.3 uchun 88.2 va DeepSWE da Qwen’ning 56.6 balliga qarshi 66.9 ballni xabar qildi. Artificial Analysis mustaqil ravishda GLM ni Dasturlashda 74.8 ga qarshi 71.8 va Agent ishlarida 59.1 ga qarshi 58.4 bilan oldinga qo’yadi. Shuningdek, GLM Qwen’da ma’lumot yo’q bo’lgan eng yangi ommaviy Terminal-Bench 4.0 reytingida 41.8% bilan uchinchi o’rinda turadi. Turli xil sinov muhitlari hali ham muhim ahamiyatga ega, ammo hozirda dalillar tartibni o’zgartirish uchun yetarlicha izchil ko’rsatmoqda.
Eng aniq ogohlantirish bu repozitoriyni ta’mirlashdir. Alibaba’ning SWE-bench Pro da 67.7 natijasi hurmatga sazovor, biroq u yetakchi natijalardan pastda turadi va dastlabki mustaqil xatolarni (bug) tuzatish bo’yicha hisobotlar bir tekis emas. Bu sun’iy intellekt rivojlanishida yaxshi tanish bo’lgan farqdir: ishonchli yangi interfeysni yaratish va g’alati eski kod bazasini ta’mirlash bir xil vositalarni bo’lishadi, lekin har doim ham bir xil intizomni emas. Agar o’z testlaringizda o’zini oqlasa, ikkalasi uchun ham Qwen dan foydalaning; birinchi g’alabadan ikkinchisini to’g’ridan-to’g’ri xulosa qilib olmang.
Hozircha, Qwen3.8-Max 9.2 ball bilan #6-o’rinda. U ko’p modalli xosting qilingan Max orqali frontend ishlari uchun, va ochiq matnli model to‘plami orqali xususiy uzoq kontekstli dasturlash uchun jozibador bo’lib qolmoqda, biroq GLM-5.3 flagmani endi dasturlash ro’yxatida uning tepasida o’tiradi. Ruxsatlarni qat’iy cheklangan holatda saqlang va to’liq natijani o’lchang: muvaffaqiyatli testlar, ko’rib chiqilgan kod o’zgarishlari (diff), foydali xatti-harakatlar, infratuzilma narxi va litsenziya mosligi.