O'rin #3 Lokal / Shaxsiy SI — ongingiz, qurilmangiz, qoidalaringiz
Alibaba (Qwen Team)

Qwen3.8-Flash-Next

Taxminan 180B parametrni saqlab, har token uchun atigi 6B ni faollashtiradigan Qwen4 arxitekturasi previewi. U ilg‘or darajaga yaqin multimodal qobiliyatni yuqori RAMli mashinalarga olib keladi — noodatiy litsenziyasi mahsulotingizga mos tushsa.

Yangilangan 2026-yil 29-avgust Open WeightsQwen License125B MoE
9.010 dan
Rasmiy veb-sayt
Eng mos

Taxminan 180B parametrni saqlab, har token uchun atigi 6B ni faollashtiradigan Qwen4 arxitekturasi previewi. U ilg‘or darajaga yaqin multimodal qobiliyatni yuqori RAMli mashinalarga olib keladi — noodatiy litsenziyasi mahsulotingizga mos tushsa.

Nima uchun bu eng yaxshisi

Artificial Analysis hosted yo‘lga Intelligence bo‘yicha 56 ball va soniyasiga qariyb 77 token beradi. Native kontekst 262K, agressiv bir-bitli GGUFlar 72.5–75 GB atrofidan boshlanadi, ulkan n-gram jadvalini esa tanqis akselerator xotirasidan tashqarida saqlash mumkin.

E'tibor bering

Ochiq vaznlar to‘plami bulutli Qwen3.8-Flash xizmati emas, tajribaviy model. Qwen Community License tijoriy MaaS va AI ishchi assistenti bizneslari uchun alohida litsenziya talab qiladi, juda kichik kvantlangan variantlar (quant) sifat yo‘qotishi mumkin, 75 GB esa baribir odatiy iste’molchi GPU sidan ancha katta.

01

Aslida bu nima

Zamonaviy til modellari odatda kattaroq parametrlar omborini qurib, har bir javobda ko‘proq quti tashish orqali qobiliyatliroq bo‘ladi. Qwen3.8-Flash-Next g‘alatiroq tartibni sinaydi: katta ombor, kichik faol jamoa va arzonroq xotirada yashashi mumkin bo‘lgan ulkan iboralar indeksi.

Asosiy til modeli 125 milliard parametrga ega va har token uchun qariyb olti milliardini faollashtiradi. 51 milliard parametrli n-gram embedding jadvali qisqa token ketma-ketliklaridan tuzilgan naqshlarni saqlaydi, qariyb to‘rt milliard parametrli multi-token-prediction moduli esa kelajakdagi bir nechta tokenni samarali chiqarishga yordam beradi. Yaxlitlaganda fayllar qariyb 180 milliard parametrni ifodalaydi. “6B faol” — ombor hajmi emas, bir qadamdagi mehnat.

Attention ham gibrid. Ko‘p qatlamlar axborotni samarali olib yurish uchun yaratilgan chiziqli attention tizimi Gated DeltaNet dan foydalanadi. Vaqti-vaqti bilan Qwen Sparse Attention oldingi kontekstning har bir tokenini teng ko‘rish o‘rniga tegishli kichik bloklarni tanlaydi. Uzun yuridik arxivni qaysi bir necha javonga qarashni ko‘rsatadigan indeks bilan o‘qishni tasavvur qiling. Indeks yurishni kamaytiradi, ammo kitoblarning o‘zi baribir mavjud.

Natija mustaqil bahoda ta’sirli. Artificial Analysis hosted yo‘lga Intelligence Index bo‘yicha 56 ball beradi va soniyasiga qariyb 77 tokenlik decodingni o‘lchaydi. Qwen dasturlash, ofis va vosita ishlatishda kuchli natijalarni, jumladan SWE-bench Pro da 62.5 va ichki CoWorkBench da 73.9 ni bildiradi. Bu ballar ehtiyotkor sozlangan tizimlarni tasvirlaydi. Ular kuchli quantization qilingan lokal build aynan shunday ishlashini kafolatlamaydi.

Lokal hajm siz tanlagan zinaga bog‘liq. Rasmiy BF16 o‘nlik birliklarda qariyb 360 GB, rasmiy FP8 esa taxminan 186 GB. Unsloth ning eng agressiv GGUFlari 72.5–75 GB yaqinidan boshlanadi; bunga qisman n-gram jadvali “hamma narsa uchun bir bit” degan sodda shiorga qaraganda ko‘proq aniqlikni saqlashi sabab. Bu yuqori xotirali Mac, server yoki noodatiy ish stansiyasiga sig‘ishi mumkin. Oddiy 24 GB videokartaga sig‘maydi, KV cache uchun ham joy qolishi kerak.

Native kontekst 262,144 token. Static YaRN uni bir millionga yaqin uzaytirishi mumkin, biroq Qwen doim yoqilgan scaling qisqa promptlar sifatini pasaytirishi mumkinligidan ogohlantiradi. Qwen3.8-Flash deb ataladigan hosted mahsulot standart holatda bir million tokenli kontekstni yoqadi va rasmiy vositalarni qo‘shadi. Bu hosted SKU yaqin qarindosh, sinonim emas. Uning o‘z API narxi, cachelari, uptime, limitlari va yangilanishlari bor.

Litsenziya hal qiluvchi cheklov. Qwen Community License 1.0 foydalanish va o‘zgartirishga keng ruxsat beradi, ammo tijoriy MaaS va “AI Work Assistant” bizneslari alohida litsenziya talab qiladi. Ta’rif mustaqil dasturlash va ofis unumdorligi assistentlarini ochiq qamrab oladi. Oyiga 100 milliondan ortiq foydalanuvchi yoki $20 million oylik daromadli mahsulotlar model nomini ko‘zga ko‘rinarli ko‘rsatishi ham kerak. Hech bir uchinchi tomon model, uning qobiliyatlari yoki outputini olmasa, ichki foydalanish ozod etilishi mumkin. Bu Apache 2.0 emas.

Jamiyatning dastlabki hisobotlari arxitektura va’dasi va uning yoshligini birday aks ettiradi. Operatorlar faol parametr boshiga qobiliyatni maqtaydi va ixtisoslashgan tizimlarda foydali tezlikni ko‘rsatadi. Shu bilan birga ular ortiqcha o‘ylash, katta kontekst sarfi, xotira tugashi, cache ifloslanishi va eng yangi runtime talab qiladigan kernellar haqida yozmoqda. Artificial Analysis indeks davomida qariyb 200 million output token sanagan — taqqoslash medianasidan deyarli ikki baravar.

Shuning uchun Qwen3.8-Flash-Next yangi oson lokal standart emas. Bu o‘rin Apache 2.0 ostida to‘rt-bitli fayllari 18 GB toifasiga sig‘adigan Qwen3.8-27B da qoladi. Flash-Next undan yuqori pog‘ona: katta faol hisoblash quvvatisiz ilg‘or darajaga yaqin xulqqa erisha oladigan qiziqarli yuqori RAMli tajriba. Olti milliard kichik eshitilgani uchun emas, uskunangiz, sabringiz va litsenziyangiz birday mos kelganda foydalaning.

02

Kuchli tomonlar va halol cheklovlar

Asosiy afzalliklari

  • Olti faol milliard compute tenglamasini o‘zgartiradi: 125B MoE har token uchun atigi 10 ekspert va bitta umumiy ekspertni yo‘naltiradi, 51B n-gram jadvali esa nisbatan kam hisoblash quvvati bilan xotirani kattalashtiradi. Dizayn har qadamda ulkan modelni faollashtirmasdan yuqori qobiliyatni ko‘zlaydi.
  • Mustaqil qobiliyat noodatiy darajada yuqori: Artificial Analysis Flash-Next ga Intelligence bo‘yicha 56 ball beradi — GLM-5.3-Flash dan atigi bir ball past — va soniyasiga qariyb 77 tokenlik tezroq decodingni o‘lchaydi.
  • Multimodal va uzun kontekst poydevori ichiga qurilgan: Vaznlar to‘plami matn, rasm va videoni qabul qiladi, 262,144 native token beradi va static YaRN bilan bir millionga yaqin sozlanishi mumkin.
  • Deployment ekotizimi tez paydo bo‘ldi: Rasmiy yoki hujjatlashtirilgan yo‘llar Transformers, vLLM, SGLang, TokenSpeed, llama.cpp, MLX, Ollama paketlari va Unsloth GGUFlarini qamrab oladi.

Haqiqiy cheklovlar

  • Litsenziya eng tabiiy tijoriy foydalanishni to‘sishi mumkin: Tijoriy MaaS yoki mustaqil dasturlash va ofis “AI Work Assistant” biznesiga alohida Qwen litsenziyasi kerak. Katta mahsulotlarda model nomini ko‘rsatish shartlari ham bor.
  • Flash-Next hosted Flash emas: Qwen3.8-Flash standart 1M kontekst va ichki vositalarga ega boshqariladigan production SKU. Uning narxi, limitlari, ishonchliligi va outputini har qanday lokal modelga indamay ko‘chirib bo‘lmaydi.
  • Eng kichik kvantlangan yig‘ma (quant) ham yuqori RAMli loyiha: Agressiv bir-bitli paket runtime va kontekst xotirasidan oldin qariyb 72.5–75 GB. Rasmiy BF16 o‘nlik hisobda qariyb 360 GB, FP8 esa taxminan 186 GB.
  • Sergap mulohaza yuritish (reasoning) va hali yosh ishga tushirish muhitlari nazorat talab qiladi: Artificial Analysis indeks davomida qariyb 200M output token kuzatgan; dastlabki operatorlar OOM, cache muammolari, hisoblash yadrolari (kernel) mos kelmasligi va konfiguratsiyaga sezgir sifat haqida yozmoqda.
03

Benchmark natijalari

Artificial Analysis Intelligence Index — 56

Hosted yo‘lning mustaqil sinovi Flash-Next ni ochiq vaznli frontierga yaqin qo‘yadi. Bu 75 GB lik lokal kvantlangan variant (quant) ayni ballni olishini isbotlamaydi.

Chiqish tezligi — qariyb 77 tok/s

Artificial Analysis sinovida decoding GLM-5.3-Flash dan tezroq, ammo birinchi javob keyinroq keladi, chunki mulohaza yuritish (reasoning) va birinchi token vaqti boshqa o‘lchovlardir.

GDPval-AA v2 — tekshirilgan snapshotda qariyb 1743 Elo

Ishonch oralig‘i va harakatlanuvchi jonli shkalaga ega kuchli professional vazifa signali. Sanani yozing va kichik farqni hal qiluvchi g‘alaba deb qabul qilmang.

SWE-bench Pro — 62.5 (Qwen sinovi)

Qwen ning tuzatilgan vazifalar to‘plami va Claude Code sinov muhitida kuchli repozitoriy tuzatishi. Vazifa tuzatishlari va sinov muhiti sabab natijaning manbasini ko‘rsatish kerak; bu universal lokal ball emas.

OSWorld 2.0 — 19.4 binary / 52.3 partial (Qwen sinovi)

Kuchli dasturlash va ofis ballari avtomatik tarzda mukammal kompyuter boshqaruviga aylanmasligini eslatadi; qat’iy binary natija kamtar bo‘lib qoladi.

04

Xulosa

Qwen3.8-Flash-Next «Lokal / Xususiy SI» bo‘limiga 9.0 baho bilan 3-o‘rinda (#3) kiradi. Qwen3.8-27B 1-o‘rinda (#1) shaxsiy kompyuterlar uchun eng yaxshi standart tanlov bo‘lib qoladi; GLM-5.3-Flash esa ozgina kuchliroq mustaqil qobiliyat, native 1M kontekst va toza MIT huquqlari bilan 2-o‘rinni (#2) oladi. Flash-Next qiziqarli o‘rta pog‘ona: tezroq, faol hisoblash quvvati ancha kam va agressiv quantization bilan qariyb 75 GB dan ishlay oladi. Litsenziyani o‘qigach, uni ichki tajribalar va yuqori RAMli lokal ish uchun tanlang. Qwen litsenziya yo‘lingizni tasdiqlamaguncha uning asosida tijoriy bulutli dasturlash assistenti qurmang; hosted Qwen3.8-Flash natijalarini sinalmagan lokal kvantlangan variantga dalil sifatida ishlatmang.

05

Ko'p so'raladigan savollar