Zamonaviy til modellari odatda kattaroq parametrlar omborini qurib, har bir javobda ko‘proq quti tashish orqali qobiliyatliroq bo‘ladi. Qwen3.8-Flash-Next g‘alatiroq tartibni sinaydi: katta ombor, kichik faol jamoa va arzonroq xotirada yashashi mumkin bo‘lgan ulkan iboralar indeksi.
Asosiy til modeli 125 milliard parametrga ega va har token uchun qariyb olti milliardini faollashtiradi. 51 milliard parametrli n-gram embedding jadvali qisqa token ketma-ketliklaridan tuzilgan naqshlarni saqlaydi, qariyb to‘rt milliard parametrli multi-token-prediction moduli esa kelajakdagi bir nechta tokenni samarali chiqarishga yordam beradi. Yaxlitlaganda fayllar qariyb 180 milliard parametrni ifodalaydi. “6B faol” — ombor hajmi emas, bir qadamdagi mehnat.
Attention ham gibrid. Ko‘p qatlamlar axborotni samarali olib yurish uchun yaratilgan chiziqli attention tizimi Gated DeltaNet dan foydalanadi. Vaqti-vaqti bilan Qwen Sparse Attention oldingi kontekstning har bir tokenini teng ko‘rish o‘rniga tegishli kichik bloklarni tanlaydi. Uzun yuridik arxivni qaysi bir necha javonga qarashni ko‘rsatadigan indeks bilan o‘qishni tasavvur qiling. Indeks yurishni kamaytiradi, ammo kitoblarning o‘zi baribir mavjud.
Natija mustaqil bahoda ta’sirli. Artificial Analysis hosted yo‘lga Intelligence Index bo‘yicha 56 ball beradi va soniyasiga qariyb 77 tokenlik decodingni o‘lchaydi. Qwen dasturlash, ofis va vosita ishlatishda kuchli natijalarni, jumladan SWE-bench Pro da 62.5 va ichki CoWorkBench da 73.9 ni bildiradi. Bu ballar ehtiyotkor sozlangan tizimlarni tasvirlaydi. Ular kuchli quantization qilingan lokal build aynan shunday ishlashini kafolatlamaydi.
Lokal hajm siz tanlagan zinaga bog‘liq. Rasmiy BF16 o‘nlik birliklarda qariyb 360 GB, rasmiy FP8 esa taxminan 186 GB. Unsloth ning eng agressiv GGUFlari 72.5–75 GB yaqinidan boshlanadi; bunga qisman n-gram jadvali “hamma narsa uchun bir bit” degan sodda shiorga qaraganda ko‘proq aniqlikni saqlashi sabab. Bu yuqori xotirali Mac, server yoki noodatiy ish stansiyasiga sig‘ishi mumkin. Oddiy 24 GB videokartaga sig‘maydi, KV cache uchun ham joy qolishi kerak.
Native kontekst 262,144 token. Static YaRN uni bir millionga yaqin uzaytirishi mumkin, biroq Qwen doim yoqilgan scaling qisqa promptlar sifatini pasaytirishi mumkinligidan ogohlantiradi. Qwen3.8-Flash deb ataladigan hosted mahsulot standart holatda bir million tokenli kontekstni yoqadi va rasmiy vositalarni qo‘shadi. Bu hosted SKU yaqin qarindosh, sinonim emas. Uning o‘z API narxi, cachelari, uptime, limitlari va yangilanishlari bor.
Litsenziya hal qiluvchi cheklov. Qwen Community License 1.0 foydalanish va o‘zgartirishga keng ruxsat beradi, ammo tijoriy MaaS va “AI Work Assistant” bizneslari alohida litsenziya talab qiladi. Ta’rif mustaqil dasturlash va ofis unumdorligi assistentlarini ochiq qamrab oladi. Oyiga 100 milliondan ortiq foydalanuvchi yoki $20 million oylik daromadli mahsulotlar model nomini ko‘zga ko‘rinarli ko‘rsatishi ham kerak. Hech bir uchinchi tomon model, uning qobiliyatlari yoki outputini olmasa, ichki foydalanish ozod etilishi mumkin. Bu Apache 2.0 emas.
Jamiyatning dastlabki hisobotlari arxitektura va’dasi va uning yoshligini birday aks ettiradi. Operatorlar faol parametr boshiga qobiliyatni maqtaydi va ixtisoslashgan tizimlarda foydali tezlikni ko‘rsatadi. Shu bilan birga ular ortiqcha o‘ylash, katta kontekst sarfi, xotira tugashi, cache ifloslanishi va eng yangi runtime talab qiladigan kernellar haqida yozmoqda. Artificial Analysis indeks davomida qariyb 200 million output token sanagan — taqqoslash medianasidan deyarli ikki baravar.
Shuning uchun Qwen3.8-Flash-Next yangi oson lokal standart emas. Bu o‘rin Apache 2.0 ostida to‘rt-bitli fayllari 18 GB toifasiga sig‘adigan Qwen3.8-27B da qoladi. Flash-Next undan yuqori pog‘ona: katta faol hisoblash quvvatisiz ilg‘or darajaga yaqin xulqqa erisha oladigan qiziqarli yuqori RAMli tajriba. Olti milliard kichik eshitilgani uchun emas, uskunangiz, sabringiz va litsenziyangiz birday mos kelganda foydalaning.