O'rin #5 Kundalik ekotizim — Yetakchi SI yordamchilari
Alibaba / Qwen Team

Qwen3.8-Max

Qwen3.8-Max chegaradagi kuchli modelni Qwen oilasi — chat, chuqur tadqiqot, rasm va video yaratish, ilovalar hamda API — bilan birlashtiradi. Alibabaning yangi MoE flagmani matn, rasm va videoni tushunadi, 1M token kontekst beradi va eng qimmat ilg‘or API'lardan ancha arzon. Max — miya; Qwen Studio esa uning atrofidagi ustaxona.

Yangilangan 2026-yil 14-avgust Multimodal1M ContextDeep Research
9.510 dan
Rasmiy veb-sayt
Eng mos

Qwen3.8-Max chegaradagi kuchli modelni Qwen oilasi — chat, chuqur tadqiqot, rasm va video yaratish, ilovalar hamda API — bilan birlashtiradi. Alibabaning yangi MoE flagmani matn, rasm va videoni tushunadi, 1M token kontekst beradi va eng qimmat ilg‘or API'lardan ancha arzon. Max — miya; Qwen Studio esa uning atrofidagi ustaxona.

Nima uchun bu eng yaxshisi

Qwen3.8-Max jami 2,4T parametrga, 95B faol parametrga, 1M kontekstga ega va million token uchun $2 kirish / $6 chiqish turadi. Alibaba PaperBench'da 93,0, IFBench'da 82,8 va Terminal Bench 2.1'da 86,6 natijani bildiradi. Frontend Code Arena'ning dastlabki ko‘rinishida u 1668 Elo bilan #4; Qwen Studio tadqiqot, rasm va video vositalarini ham qo‘shadi.

E'tibor bering

Reliz juda yangi. Katta benchmark jadvali Alibaba tomonidan berilgan, dastlabki mustaqil kod sinovlari turlicha, kvota va hisob-kitobda ham noqulayliklar bo‘lishi mumkin. Qwen keng ekotizimga aylangan, ammo ayniqsa Osiyodan tashqarida Google, Microsoft yoki OpenAI kabi kundalik xizmatlarga hali shunchalik tabiiy ulanmagan.

01

Aslida bu nima

Qwen3.8-Max’ni yaxshi jihozlangan ustaxonadagi yangi kuchli motor deb tasavvur qilish oson. Motor — Alibabaning flagman modeli: jami 2,4 trillion parametr, so‘rovda shundan 95 milliard faol. Ustaxona esa Qwen Studio: chat, Deep Research, rasm, video va veb-artefaktlar. Kundalik vazifada ustaxonaning o‘zi motor kabi muhim bo‘lishi mumkin.

Birinchi diqqatga tushadigan narsa — narx. Million token uchun $2 kirish va $6 chiqish, kesh uchun $0,25 uzoq tahlil va ikkinchi tekshiruvga joy qoldiradi. Uzoq reasoning baribir chiqish sifatida hisoblanadi, demak hamma ish arzon emas. Ammo arzonroq urinish birinchi chiroyli javobga ishonish o‘rniga uni tekshirish imkonini beradi.

Model bir million token kontekstida matn, rasm va videoni birga ko‘ra oladi. Strategiya hujjati, jadval, maket, boshqaruv paneli skrinshoti va buzilgan jarayon videosi bitta stolga tushadi. Bu mukammal xotira yoki hukm emas, lekin tadqiqot bilan vizual ish orasidagi noaniq topshirishlarni kamaytiradi.

Natijalar umidli, ammo yakuniy emas. Alibaba PaperBench, IFBench, OSWorld-Verified va Terminal Bench’da kuchli natijalarni aytadi; Frontend Code Arena’ning ilk ko‘rinishida model 1668 Elo bilan #4. Ayniqsa, avtonom ish namoyishlari qiziq: Alibaba ma’lumotiga ko‘ra, model 10–16 kun nazoratsiz holda bo‘sh papkadan o‘zini rivojlantiruvchi harness yaratgan, 265 commit qilgan, 127 pull request ochgan va 151 issue yozgan. Kompaniya 45 yuborishda multimodal dialog aniqligi 0,60 dan 0,853 ga ko‘tarilganini, chip dizayni va e-commerce bo‘yicha uzoq simulyatsiyalarni ham aytadi. Bular vendor hisobotlari, mustaqil tasdiq emas, ammo jamoa bitta javobdan ko‘ra uzoq professional ish zanjirini nishonga olayotganini aniq ko‘rsatadi.

Kodda ehtiyotkorlik ayniqsa zarur: SWE-bench Pro 67,7 modelni haqiqiy repolardagi muammolarni hal qilish bo‘yicha frontier yetakchilar qatoriga chiqarmaydi, ilk bug sinovlari ham aralash. Chiroyli interfeys yaratish va eski loyihani ishonchli tuzatish boshqa-boshqa qobiliyat. Shuning uchun Qwen3.8-Max #5 ga loyiq — universal, tejamkor alternativ sifatida. Uni real, chegaralangan vazifada sinang, manbalar va natijalarni tekshiring, mustaqil dalillar uning standart vosita bo‘lishini hal qilsin.

Kundalik tanlovda «eng aqlli model qaysi?» degan savoldan ko‘ra «hozir vaqt qayerda yo‘qolyapti?» degani foydaliroq. PDF, jadval, skrinshot va qisqa ekran yozuvi orasida ma’lumotni doim ko‘chiradigan odam bitta multimodal ish maydonidan yutadi. Ishlari Gmail, Google Docs, Outlook yoki ruxsatlari sozlangan korporativ muhitda bo‘lgan kishi esa o‘sha yerga allaqachon o‘rnatilgan yordamchi bilan ko‘proq vaqt tejashi mumkin. Ekotizim faqat funksiyalar ro‘yxati emas; u yo‘q qiladigan topshirishlar soni hamdir.

Avtonomlik namoyishlarini va’da emas, case study deb o‘qish kerak. 265 commitning o‘zi har biri to‘g‘ri, xavfsiz va saqlashga yaroqli ekanini isbotlamaydi. Muhimi, Alibaba ko‘rsatmoqchi bo‘lgan ish usuli: maqsadni bo‘laklash, vositalardan foydalanish, natijani tekshirish va kontekstni yo‘qotmasdan davom etish. Jamoa avval kichik, qaytarish mumkin bo‘lgan jarayonni—manbali tadqiqot, prototip yoki checklistli tahlilni—sinab ko‘rgani ma’qul; tanqidiy ishni agentga birdan bermaslik kerak.

Qwen oilasining oddiy amaliy foydasi ham bor: ishning har bosqichi uchun alohida hisob ochish shart emas. Bir joyda tadqiqotdan boshlash, keyin skrinshotni ko‘rish va qoralama yoki vizual material tayyorlash mumkin. Ammo qulaylik ko‘r-ko‘rona ishonchga aylanmasin: asl hujjatlarni saqlang, tekshiriladigan manbani so‘rang va pul, obro‘ yoki muhim qarorga ta’sir qiladigan xulosani qayta tekshiring.

14-avgustdan boshlab birinchi Max weights haqiqatan ham ochiq. Yuklab olinadigan checkpoint matnli, native 262 144 token kontekstga ega va qariyb 1.01M gacha uzayadi; hosted Max esa vision, vositalar va standart 1M ni qo‘shadi. 2.4T jami parametr baribir datacenter loyihasi, tijoriy litsenziya chegaralari esa deploymentdan oldin tekshirilishi kerak.

02

Kuchli tomonlar va halol cheklovlar

Asosiy afzalliklari

  • API dollari uchun katta imkoniyat: million token uchun $2 kirish va $6 chiqish, kesh esa $0,25; bu avvalgi Kimi K3 chiqish narxining taxminan yarmi.
  • U faqat matnni emas, ko‘proq narsani ko‘radi: 1M token bilan matn, rasm va video hisobot, skrinshot, grafik va yozuvni birgalikda tahlil qilishga imkon beradi.
  • Qwen oilasi chat oynasidan kattaroq: Qwen Studio Deep Research, veb-artefaktlar, rasm va video generatsiyasi, veb, mobil va desktop ilovalarni jamlaydi.
  • Avtonom ish namoyishlari juda aniq: Alibaba Qwen3.8-Max bo‘sh papkadan boshlab 10–16 kun nazoratsiz ishlaganini, o‘zini rivojlantiruvchi harness yaratib 265 commit, 127 pull request va 151 issue qilganini aytadi. Kompaniya multimodal dialog tanlovida 45 yuborishda aniqlik 0,60 dan 0,853 ga oshganini ham bildiradi. Bu Alibaba namoyishlari, ammo ular ko‘zlangan professional ish ko‘lamini ko‘rsatadi.
  • Birinchi frontend belgisi raqobatbardosh: dastlabki Frontend Code Arena natijasida 1668 Elo (#4). Bu interfeys sifati uchun foydali dalil, to‘liq muhandislik hukmi emas.
  • Chatdan mahsulotga o‘tish qulay: Qwen Studio va bulut OpenAI hamda Anthropic bilan mos API beradi; agentni boshidan qayta yozish shart emas.

Haqiqiy cheklovlar

  • Asosiy raqamlar ishlab chiqaruvchi dalilidir: harness, sozlama va qayta urinishlar natijani o‘zgartiradi; jadval sinovni boshlashi, uning o‘rnini bosmasligi kerak.
  • Haqiqiy repolardagi muammolarni hal qilish hali aniq g‘alaba emas: Alibaba bildirgan SWE-bench Pro 67,7 eng yaxshi Claude natijalaridan past, ilk bug-testlar ham aralash.
  • Keng bo‘lish hamma yerga ulangan degani emas: Qwen Studio ko‘pchilikning Gmail, Office, kalendar, brauzer va korporativ ruxsatlarida avtomatik yashamaydi.
  • 1M kontekst mukammal xotira emas: keraksiz sahifalar va noaniq maqsad modelni ham chalg‘itadi; katta ishni bosqichlarga bo‘ling.
  • Dastlabki kirish qirralari qo‘pol bo‘lishi mumkin: foydalanuvchilar kvota, billing va tezlik muammolarini aytmoqda; avval chegaralangan vazifani o‘lchang.
  • Ochiq degani kichik yoki shartsiz emas: Qwen3.8-2.4T-A95B Hugging Face va ModelScope da bor, ammo datacenter talab qiladi. Litsenziya katta tijoriy chegaralarda model nomini ko‘rsatish va alohida ruxsat olish shartlarini qo‘yadi.
03

Benchmark natijalari

Frontend Code Arena — 1668 Elo (#4, dastlabki)

Tayyor frontend uchun inson afzalligining ilk belgisi; reyting siljishi mumkin.

PaperBench — 93,0 (Alibaba bildirgan)

Murakkab tadqiqot ishlari uchun ishlab chiqaruvchi bergan natija.

IFBench — 82,8 (Alibaba bildirgan)

Ishlab chiqaruvchi ma'lumotidagi kuchli ko‘rsatma bajarish.

Terminal Bench 2.1 — 86,6 (Alibaba bildirgan)

Yuqori terminal agent natijasi; harness farqi muhim.

SWE-bench Pro — 67,7 (Alibaba bildirgan)

Yaxshi, ammo yetakchi bo‘lmagan repo ta'miri natijasi.

04

Xulosa

Qwen3.8-Max Everyday Ecosystem’da Kimi K3 o‘rniga #5 bo‘ladi: o‘xshash erta frontier va’dasi, pastroq xarajat va tadqiqot hamda ijod uchun kengroq vositalar oilasi. Hujjat, vizual kirish, tadqiqot, rasm, video va kod o‘rtasida ishlaydiganlar uchun ayniqsa jozibali. O‘rin ataylab vaqtinchalik: katta da’volar mustaqil tekshiruvga muhtoj va kundalik integratsiya hali yetakchilarnikidek emas. Muhim fakt, kod va natijani tekshiring.

05

Ko'p so'raladigan savollar