O'rin #4 Dasturlash — Ishlab chiqarish (Production) uchun kod yozadigan SI
Alibaba / Qwen Team

Qwen3.8-Max

Qwen3.8-Max kod uchun #4 o‘rinni qiymatli raqib sifatida oladi: 1M kontekst, rasm va video kirishi, frontend uchun kuchli ilk signal va premium modellardan ancha arzon API. Reyting vaqtinchalik, chunki asosiy raqamlar vendor tomonidan berilgan, mustaqil repo-ta'mir sinovlari esa hali kam va aralash.

Yangilangan 2026-yil 14-avgust Agentic CodingVision + Video1M Context
9.710 dan
Rasmiy veb-sayt
Eng mos

Qwen3.8-Max kod uchun #4 o‘rinni qiymatli raqib sifatida oladi: 1M kontekst, rasm va video kirishi, frontend uchun kuchli ilk signal va premium modellardan ancha arzon API. Reyting vaqtinchalik, chunki asosiy raqamlar vendor tomonidan berilgan, mustaqil repo-ta'mir sinovlari esa hali kam va aralash.

Nima uchun bu eng yaxshisi

Alibaba Terminal Bench 2.1 uchun 86,6 ni bildiradi; dastlabki Frontend Code Arena Qwen3.8-Max'ni 1668 Elo bilan #4 ga qo‘yadi. Model matn, rasm va videoni qabul qiladi, 2,4T jami / 95B faol parametr, 1M kontekst va million kirish/chiqish tokeni uchun $2/$6 mos API'ga ega.

E'tibor bering

Tez va arzon raqib avtomatik coding chempioni emas. Natijalar harnessga bog‘liq, SWE-bench Pro 67,7 yetakchilardan past, ayrim ilk bug-testlar esa kuchsiz. Production kirishidan oldin o‘z CI tizimingiz qaror qilishi kerak.

01

Aslida bu nima

Qwen3.8-Max qiziq bo‘lishining sababi har bir qatorda eng katta son emas. Muhimi — katta kontekst, vizual kirish, agent ambitsiyasi va qayta urinishga imkon beradigan narx kombinatsiyasi. Kodlash sinash, tekshirish va yana sinashdan iborat; token hisobining kichikligi bu jarayonni amaliy qiladi.

Million token uchun $2 kirish va $6 chiqish API’ni Kimi’ning avvalgi $3/$15 narxidan ancha arzon qiladi. Agent repo kontekstini qayta o‘qishi yoki ikkinchi model patchni ko‘rishi kerak bo‘lsa, bu foydali. Arzon degani to‘g‘ri degani emas, ammo test, qayta urinish va mustaqil review kamroq xarajat bo‘ladi.

Frontend Code Arena’ning ilk ko‘rinishida Qwen3.8-Max 1668 Elo bilan #4. Odamlar qaysi model yaratganini bilmay tayyor interfeysni afzal ko‘radi. Bu prototip uchun foydali, ammo chiroyli sahifa mo‘rt kodni yashirishi mumkin va ko‘proq ovoz bilan reyting o‘zgaradi.

Matn, skrinshot, dizayn, yozuv va katta repo 1M kontekstdagi bitta sessiyaga sig‘adi: bu katta ish stoli, kafolat emas. Alibaba Terminal Bench 2.1’dа 86,6 deydi, lekin harness, vosita va takrorlash raqamlarga ta’sir qiladi. SWE-bench Pro 67,7 modelni haqiqiy repolardagi muammolarni hal qilish bo‘yicha yetakchilar qatoriga olib chiqmaydi, aralash bug sinovlari esa eski kodda ehtiyot bo‘lishni talab qiladi.

Shuning uchun #4 vaqtinchalik: frontend, vizual debugging va uzun kontekstda kuchli. Ochiq weights endi matnli modelni private joylashtirish imkonini beradi, ammo CI, infratuzilma narxi, litsenziya va diff review hal qiluvchi bo‘lib qoladi.

Frontend ishida Arena o‘rni ko‘ringanidan foydaliroq. Foydalanuvchi model ichida chiroyli reasoning bo‘lganini ko‘rmaydi; u navigatsiya, oraliqlar, xato holatlari va keyingi qadam tushunarlimi, shuni ko‘radi. Tayyor interfeysni model nomini bilmasdan afzal ko‘rish prototip va mahsulot uchun yaxshi signal. Biroq u accessibility, telefon ekraniga moslashish, yuklanish tezligi va ekran ortidagi kod tekshiruvining o‘rnini bosa olmaydi. Bu to‘rt narsa prompt hamda qabul mezonida bo‘lishi kerak.

Bir million token ham butun repozitoriyni tartibsiz tashlashga taklif emas. Yaxshisi ish papkasini tuzing: avval maqsad, tegishli fayllar, qayta tiklanadigan xato, testlar va arxitektura qarorlari; keyin zarur bo‘lsa qo‘shimcha tarix. Shunda agent minglab sahifani jim ko‘rish o‘rniga gipoteza tuzib, tekshiradi. Qiyin xatoda Qwen kuchli birinchi tekshiruv hisobotini bera oladi. Lekin xavfsiz merge uchun qaysi o‘zgarish yetarlicha kichikligini odam hal qiladi.

Mavjud agent bilan adolatli taqqoslash uchun vazifa, vosita, vaqt limiti va testlar bir xil bo‘lsin. Faqat patch oxirida ishlaganini emas, qancha urinish, token va inson daqiqasi ketganini ham yozing. Qwen iqtisodi tekshirilgan yaxshi urinishlar sonini oshirgandagina qimmatli; shunchaki ko‘proq matn yozganda emas.

Birinchi yaxshi tajriba cheksiz loyiha emas, balki yiqilayotgan test va aniq qabul mezoniga ega muammodir. Qwen’dan o‘zgartirishdan oldin rejasini tushuntirishni so‘rang, keyin testni ishga tushiring va shu xatoda mavjud yordamchingiz bilan taqqoslang. Shunda jamoa bitta leaderboard raqamiga mahliyo bo‘lmay, tuzatish sifati, vaqt va token sarfini birgalikda o‘lchaydi.

02

Kuchli tomonlar va halol cheklovlar

Asosiy afzalliklari

  • Narx ko‘proq haqiqiy urinish beradi: million token uchun $2/$6 iterativ debugging va ikkinchi review’ni Kimi’ning avvalgi $3/$15 narxidan qulayroq qiladi.
  • Frontend kuchli boshlaydi: Frontend Code Arena’da 1668 Elo (#4) yaxshi UI signal, ammo to‘liq repo muhandisligi isboti emas.
  • Uzoq va vizual vazifalar mos keladi: matn, skrinshot, diagramma va video 1M kontekst bilan design-to-code hamda debugging uchun foydali.
  • Terminal natijasi yuqori: Alibaba aytgan Terminal Bench 2.1 86,6 Qwen tizimi vosita fikr-mulohazasi bilan ishlashini ko‘rsatadi.
  • Reasoning boshqariladi: reasoning_effort yuqori, o‘rta va past darajaga ega; preserve_thinking standart faol.
  • Joriy qilish maxsus qayta yozishni talab qilmaydi: OpenAI va Anthropic mos API mavjud agentda modelni sinashga yordam beradi.

Haqiqiy cheklovlar

  • Asosiy coding dalili mustaqil tasdiqlanmagan: harness, prompt, takrorlash va vositalar vendor jadvalini o‘zgartiradi.
  • Mavjud repolardagi muammolarni hal qilish aniq bo‘shliq: SWE-bench Pro 67,7 va aralash bug-suitlar buni g‘alaba deb aytish uchun yetarli emas.
  • Katta kontekst noto‘g‘ri rejani uzaytirishi mumkin: kichik commit, test va checkpoint hali ham shart.
  • Sifat, tezlik va narx uchburchak: yuqori reasoning chiqish tokeni va kvotani yeydi; tekshirilgan patch bo‘yicha o‘lchang.
  • Kirish va kechikish mintaqaga qarab farq qiladi: jamoa ishlaydigan joyda to‘lov, kvota va mavjudlikni tekshiring.
  • Ochiq weights hardware va litsenziyani hal qilmaydi: matnli 2.4T/95B faol model mavjud, ammo self-hosting datacenter talab qiladi va litsenziya juda katta mahsulot hamda servislar uchun shartlar qo‘yadi.
03

Benchmark natijalari

Frontend Code Arena — 1668 Elo (#4, dastlabki)

UI uchun kuchli inson signali, to‘liq engineering reytingi emas.

Terminal Bench 2.1 — 86,6 (Alibaba)

Yuqori terminal agent natijasi; harnesslar bevosita taqqoslashni cheklaydi.

SWE-bench Pro — 67,7 (Alibaba)

Yaxshi, ammo eng yaxshi ta'mirlardan past.

PaperBench — 93,0 (Alibaba)

Rejalash signali, bevosita kod testi emas.

IFBench — 82,8 (Alibaba)

Batafsil qabul mezoniga yaxshi amal qilish.

04

Xulosa

Qwen3.8-Max Coding’da Kimi K3 o‘rniga #4: ilk frontend va terminal signallari yaxshiroq API iqtisodi bilan birlashadi. U vizual ish, uzoq kontekstli debugging va tejamkor iteratsiya uchun mavjud coding agent yonida sinashga kuchli nomzod. Hozircha yuqoriga chiqmaydi: vendor natijalari, yetakchi bo‘lmagan SWE-bench Pro va aralash bug xabarlari CI hamda review bilan boshma-bosh sinovni talab qiladi.

05

Ko'p so'raladigan savollar