الترتيب #3 ذكاء اصطناعي محلي / خاص — عقلك، جهازك، قواعدك
Alibaba (Qwen Team)

Qwen3.8-Flash-Next

معاينة لبنية Qwen4 تخزن نحو 180B معلمة، لكنها تنشط 6B فقط لكل رمز. تجلب قدرة متعددة الوسائط قريبة من خط المقدمة إلى الأجهزة عالية الذاكرة، إذا كانت رخصتها غير المعتادة تناسب منتجك.

تم التحديث 29 أغسطس 2026 Open WeightsQwen License125B MoE
الأفضل لـ

معاينة لبنية Qwen4 تخزن نحو 180B معلمة، لكنها تنشط 6B فقط لكل رمز. تجلب قدرة متعددة الوسائط قريبة من خط المقدمة إلى الأجهزة عالية الذاكرة، إذا كانت رخصتها غير المعتادة تناسب منتجك.

لماذا تفوز

تمنح Artificial Analysis المسار المستضاف نتيجة 56 في Intelligence وسرعة تقارب 77 رمزاً في الثانية. يبلغ السياق الأصلي 262K، وتبدأ ملفات GGUF الشديدة ذات البت الواحد قرب 72.5–75 GB، ويمكن إبقاء جدول n-gram الضخم بعيداً عن ذاكرة المسرّع النادرة.

انتبه إلى

نقطة التحقق المفتوحة تجريبية، وليست منتج Qwen3.8-Flash المستضاف. تشترط Qwen Community License رخصة منفصلة لأعمال MaaS التجارية ومساعدات العمل بالذكاء الاصطناعي، وقد تخسر التكميمات الصغيرة الجودة، كما أن 75 GB تظل أكبر بكثير من بطاقة GPU استهلاكية عادية.

01

ما هو في الواقع

تزداد قدرة نماذج اللغة الحديثة عادة ببناء مستودع أكبر من المعلمات ونقل صناديق أكثر مع كل إجابة. يحاول Qwen3.8-Flash-Next ترتيب المستودع على نحو أغرب: مخزن كبير، وطاقم نشط صغير، وفهرس ضخم للعبارات يمكنه الإقامة في ذاكرة أرخص.

يضم نموذج اللغة الأساسي 125 مليار معلمة وينشط نحو ستة مليارات لكل رمز. ويخزن جدول تضمين n-gram ذو 51 مليار معلمة أنماطاً مبنية من سلاسل رموز قصيرة، فيما تساعد وحدة للتنبؤ بعدة رموز تبلغ نحو أربعة مليارات معلمة على إنتاج أكثر من رمز مستقبلي بكفاءة. وبالتقريب، تصف الملفات نحو 180 مليار معلمة. عبارة «6B نشطة» تعني حجم العمل في كل خطوة، لا حجم المستودع.

الانتباه هجين أيضاً. تستخدم معظم الطبقات Gated DeltaNet، وهو نظام انتباه خطي مصمم لحمل المعلومات بكفاءة. وعلى فترات، يختار Qwen Sparse Attention كتل صغيرة من السياق السابق ذي الصلة بدلاً من فحص كل رمز بالتساوي. تخيل قراءة أرشيف قانوني طويل باستخدام فهرس يشير إلى رفوف قليلة مرجحة. يقلل الفهرس المشي، لكن الكتب ما زالت موجودة.

النتيجة مثيرة للإعجاب وفق قياس مستقل. تمنح Artificial Analysis المسار المستضاف نتيجة 56 في Intelligence Index، وتقيس فك الترميز عند نحو 77 رمزاً في الثانية. وتعلن Qwen نتائج قوية في البرمجة والعمل المكتبي واستخدام الأدوات، منها 62.5 في SWE-bench Pro و73.9 في CoWorkBench الداخلي. تصف هذه النتائج أنظمة أُعدت بعناية، ولا تضمن تصرف نسخة محلية شديدة التكميم بالطريقة نفسها.

يعتمد الحجم المحلي على درجة السلم التي تختارها. تبلغ BF16 الرسمية نحو 360 GB بالوحدات العشرية، وFP8 الرسمية نحو 186 GB. وتبدأ ملفات GGUF الأشد من Unsloth قرب 72.5 إلى 75 GB، ويرجع ذلك جزئياً إلى احتفاظ جدول n-gram بدقة أعلى مما يوحي به شعار بسيط مثل «بت واحد لكل شيء». قد يتسع هذا على جهاز Mac عالي الذاكرة أو خادم أو محطة عمل غير معتادة. لكنه لا يتسع على بطاقة رسوميات عادية بذاكرة 24 GB، وتظل KV cache محتاجة إلى مساحة.

يبلغ السياق الأصلي 262,144 رمزاً. يستطيع static YaRN تمديده باتجاه مليون، لكن Qwen تحذر من أن التوسيع الدائم قد يخفض الجودة مع المطالبات القصيرة. يفعّل المنتج المستضاف المسمى Qwen3.8-Flash سياق مليون رمز افتراضياً ويضيف أدوات رسمية. ذلك المنتج قريب الصلة، لا مرادفاً. وله أسعار API ومخابئ ووقت تشغيل وحدود وتحديثات خاصة به.

الرخصة هي التحفظ الحاسم. تسمح Qwen Community License 1.0 عموماً بالاستخدام والتعديل، لكن أعمال MaaS التجارية و«AI Work Assistant» تحتاج إلى رخصة منفصلة. ويشمل التعريف صراحة مساعدات البرمجة والإنتاجية المكتبية المستقلة. كما تحتاج المنتجات التي تتجاوز 100 مليون مستخدم شهرياً أو $20 مليون إيرادات شهرية إلى إظهار اسم النموذج بوضوح. وقد يُعفى الاستخدام الداخلي عندما لا يتلقى طرف ثالث النموذج أو قدراته أو مخرجاته. هذه ليست Apache 2.0.

تتفق تقارير المجتمع المبكرة مع وعد البنية وحداثتها. يعجب المشغّلون بالقدرة لكل معلمة نشطة، ويعرضون سرعة مفيدة على أنظمة متخصصة. لكنهم يبلغون أيضاً عن إفراط في التفكير واستهلاك كبير للسياق ونفاد للذاكرة وتلوث في المخبأ ونوى تحتاج إلى أحدث بيئة تشغيل. أحصت Artificial Analysis نحو 200 مليون رمز إخراج عبر مؤشرها، أي ما يقارب ضعف وسيط المقارنة.

لذلك ليس Qwen3.8-Flash-Next الخيار المحلي السهل الجديد. يظل ذلك اللقب لـQwen3.8-27B، إذ تتسع ملفاته ذات الأربعة بتات في فئة 18 GB تقريباً وتستخدم Apache 2.0. أما Flash-Next فهو الدرجة الأعلى: تجربة رائعة عالية الذاكرة تستطيع الاقتراب من سلوك خط المقدمة من دون حوسبة نشطة بحجم خط المقدمة. استخدمه عندما يناسبه عتادك وصبرك ورخصتك، لا لمجرد أن ستة مليارات تبدو قليلة.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • ستة مليارات نشطة تغير معادلة الحوسبة: يوجّه نموذج MoE البالغ 125B إلى 10 خبراء فقط إضافة إلى خبير مشترك لكل رمز، فيما يوسع جدول n-gram البالغ 51B الذاكرة مع قدر قليل نسبياً من الحوسبة. يستهدف التصميم قدرة عالية من دون تنشيط نموذج عملاق في كل خطوة.
  • القدرة المستقلة مرتفعة على نحو غير معتاد: تمنح Artificial Analysis نموذج Flash-Next نتيجة 56 في Intelligence، أقل بنقطة واحدة فقط من GLM-5.3-Flash، مع فك ترميز أسرع مقاس عند نحو 77 رمزاً في الثانية.
  • أسس تعدد الوسائط والسياق الطويل مضمنة: تقبل نقطة التحقق النصوص والصور والفيديو، وتوفر 262,144 رمزاً أصلياً، ويمكن إعدادها باتجاه مليون رمز باستخدام static YaRN.
  • وصل نظام النشر سريعاً: تشمل المسارات الرسمية أو الموثقة Transformers وvLLM وSGLang وTokenSpeed وllama.cpp وMLX وحزم Ollama وملفات GGUF من Unsloth.

قيود صادقة

  • قد تمنع الرخصة الاستخدام التجاري البديهي: يحتاج نشاط MaaS تجاري أو «AI Work Assistant» مستقل للبرمجة أو العمل المكتبي إلى رخصة Qwen منفصلة. كما تخضع المنتجات الكبيرة لشروط إظهار اسم النموذج.
  • Flash-Next ليس Flash المستضاف: Qwen3.8-Flash منتج مُدار للإنتاج، بسياق افتراضي 1M وأدوات مدمجة. ولا يجوز إسناد سعره وحدوده وموثوقيته ومخرجاته بصمت إلى كل نقطة تحقق محلية.
  • أصغر تكميم يظل مشروعاً عالي الذاكرة: يغطي نحو 72.5–75 GB حزمة شديدة بأسلوب البت الواحد قبل ذاكرة التشغيل والسياق. تبلغ BF16 الرسمية نحو 360 GB عشرياً، وFP8 نحو 186 GB.
  • يحتاج الاستدلال المسهب وبيئات التشغيل الفتية إلى إشراف: رصدت Artificial Analysis نحو 200M رمز إخراج عبر مؤشرها، ويبلغ المشغلون الأوائل عن نفاد الذاكرة ومشكلات المخبأ وعدم توافق النوى وجودة حساسة للإعداد.
03

لمحة عن المعايير

Artificial Analysis Intelligence Index — 56

يضع الاختبار المستقل للمسار المستضاف Flash-Next قرب مقدمة النماذج المفتوحة الأوزان. ولا يثبت النتيجة نفسها لتكميم محلي حجمه 75 GB.

سرعة الإخراج — نحو 77 tok/s

فك ترميز أسرع من GLM-5.3-Flash في اختبار Artificial Analysis، مع تأخر الإجابة الأولى أكثر لأن الاستدلال وزمن الوصول إلى أول رمز أمران منفصلان.

GDPval-AA v2 — نحو 1743 Elo في اللقطة المفحوصة

إشارة قوية إلى المهام المهنية، مع فترة ثقة ومقياس مباشر متحرك. اذكر التاريخ ولا تعامل فرقاً صغيراً بوصفه فوزاً حاسماً.

SWE-bench Pro — ‏62.5 (تشغيل Qwen)

إصلاح قوي للمستودعات ضمن مجموعة مهام Qwen المنقحة ومنظومة Claude Code. تعني تصحيحات المهام والمنظومة وجوب نسب النتيجة إلى مصدرها، لا معاملتها كدرجة محلية عامة.

OSWorld 2.0 — ‏19.4 ثنائي / 52.3 جزئي (تشغيل Qwen)

تذكير بأن نتائج البرمجة والعمل المكتبي القوية لا تتحول تلقائياً إلى استخدام كامل قوي للحاسوب؛ فالنتيجة الثنائية الصارمة تظل متواضعة.

04

الحكم

يدخل Qwen3.8-Flash-Next فئة الذكاء الاصطناعي المحلي والخاص في المركز #3 بتقييم 9.0. يظل Qwen3.8-27B في المركز #1 كأفضل خيار افتراضي لجهاز شخصي، فيما يأخذ GLM-5.3-Flash المركز #2 لقدرة مستقلة أقوى قليلاً وسياق أصلي بطول 1M وحقوق MIT واضحة. Flash-Next هو الدرجة الوسطى المثيرة: أسرع، وأقل بكثير في الحوسبة النشطة، وقادر على العمل من نحو 75 GB مع تكميم شديد. اختره للتجارب الداخلية والعمل المحلي عالي الذاكرة بعد قراءة الرخصة. ولا تبنِ حوله مساعد برمجة مستضافاً تجارياً حتى تؤكد Qwen مسار الترخيص، ولا تستخدم نتائج Qwen3.8-Flash المستضاف دليلاً على تكميم محلي لم تختبره.

05

الأسئلة الشائعة