الترتيب #2 ذكاء اصطناعي محلي / خاص — عقلك، جهازك، قواعدك
Z.ai (Zhipu AI)

GLM-5.3-Flash

النقطة المثلى الممتازة للعناقيد الخاصة في عائلة GLM: ذكاء قريب من خط المقدمة، ورؤية أصلية، وسياق بطول 1M، وأوزان مرخصة وفق MIT؛ ما زال حجمه مئات الجيجابايت، لكنه عملي أكثر بكثير من GLM-5.3 الرئيسي.

تم التحديث 29 أغسطس 2026 Open WeightsMIT320B MoE
الأفضل لـ

النقطة المثلى الممتازة للعناقيد الخاصة في عائلة GLM: ذكاء قريب من خط المقدمة، ورؤية أصلية، وسياق بطول 1M، وأوزان مرخصة وفق MIT؛ ما زال حجمه مئات الجيجابايت، لكنه عملي أكثر بكثير من GLM-5.3 الرئيسي.

لماذا تفوز

تمنحه Artificial Analysis نتيجة 57 في Intelligence، فيما تلغي رخصة MIT المعيارية التعقيد الخاص ببند MaaS في الإصدار الرئيسي. يبلغ FP8 الرسمي نحو 306 GiB، وتقترب نسخ الطرف الثالث الشديدة ذات البت الواحد من فئة 90–100 GB.

انتبه إلى

هذا ليس نموذج 18B للحواسيب المحمولة. لا تزال المعلمات البالغ عددها 320B كلها تحتاج إلى التخزين والذاكرة، ويستهدف التشغيل الرسمي عدة بطاقات GPU لمراكز البيانات، وقد يخفض التكميم الجودة، ولا تنتج واجهة الطرف الأول إلا نحو 50 رمزاً في الثانية.

01

ما هو في الواقع

يشبه نموذج مزيج الخبراء مستشفى يضم عدداً كبيراً من الاختصاصيين. يدخل عدد قليل منهم الغرفة لكل مريض، فتبقى الاستشارة كفؤة. لكن المبنى يظل محتاجاً إلى مكاتب للجميع. ينشط GLM-5.3-Flash نحو 18 مليار معلمة لكل رمز، لكن مستشفى المعلمات الكامل البالغ 320 ملياراً يجب أن يتسع في الذاكرة.

يفسر هذا التمييز الحماس والحذر معاً. يقدم Flash ذكاء قريباً من خط المقدمة بحوسبة نشطة أقل بكثير مما يوحي به حجمه الإجمالي. تمنحه Artificial Analysis نتيجة 57، ويقبل النموذج النص والصور والفيديو ويحمل سياقاً بطول مليون رمز. ومع ذلك، تظل نقطة تحقق FP8 الرسمية نحو 306 GiB قبل أعباء التشغيل. «كفؤ» ليست مرادفاً لكلمة «صغير».

الحزمة جذابة على نحو غير معتاد لشركة تدير عنقوداً خاصاً. الرخصة هي MIT المعيارية. لا يوجد بند خاص بإيرادات MaaS، ولا رخصة منفصلة لمساعدات العمل، ولا غموض بشأن التعديل التجاري يتجاوز الإسناد المعتاد والقانون. ويمكن أن تبقى المستندات ولقطات الشاشة والمخططات والواجهات المسجلة داخل خط معالجة واحد متعدد الوسائط بدلاً من زيارة خدمة رؤية سحابية منفصلة.

يشكل اختيار العتاد سلماً. يشير تشغيل FP8 الرسمي إلى عدة بطاقات GPU من فئة مراكز البيانات. وتهبط تكميمات الطرف الثالث نحو فئة 90–100 GB، حيث قد يدخل نظام موحد عالي الذاكرة أو محطة عمل مجهزة بكثافة في النقاش. كل درجة إلى الأسفل تغير النموذج. فتكميم البت الواحد ليس الفائز نفسه في المعايير مطوياً ببساطة داخل حقيبة أصغر؛ إذ يمكن لتقريب ملايين القيم أن يضر المعرفة النادرة أو دقة الرؤية أو الاستدلال أو سلوك الأدوات بدرجات متفاوتة.

يضيف السياق حقيبة أخرى. نافذة المليون رمز مفيدة للمستودعات ومجموعات المستندات، لكن ذاكرة KV cache التي تتذكر تلك الرموز تستهلك مساحة بجوار الأوزان. قد تدعم آلة بالكاد تحمل نقطة التحقق سياقاً متواضعاً فقط أو تزامناً منخفضاً. يجب أن يشمل تخطيط السعة وقت التشغيل الفعلي ودقة المخبأ وحجم الدفعات والوسائط وعدد المستخدمين المتزامنين المتوقع.

وتعتمد السرعة بالمثل على الإعداد. تقيس Artificial Analysis نحو خمسين رمز إخراج في الثانية من واجهة Z.ai API، وهي ليست سرعة استثنائية. وقد عرض مزوّدون متخصصون إنتاجية أعلى بكثير على عتاد وحزم تشغيل مختلفة. كلا الأمرين صحيح. قد تشترك سيارة سباق وشاحنة توصيل في تصميم المحرك، لكنهما تسجلان زمنين مختلفين للرحلة لأن النظام المحيط مهم.

مقارنة بـGLM-5.3 الرئيسي، يتنازل Flash عن عدة نقاط من أقصى قدرة وعن بعض القوة في أصعب المهام النصية طويلة المدى. وفي المقابل يكتسب رؤية أصلية ورخصة معيارية ونقطة تحقق أصغر بكثير وسعراً معلناً لواجهة API يقارب العُشر. ومقارنة بـQwen3.8-27B، فهو أقوى بكثير وأقل راحة بكثير. أما أمام Qwen3.8-Flash-Next، فيستخدم حوسبة نشطة وذاكرة أكبر، لكنه يقدم حقوق MIT ونتائج تجميعية مستقلة أقوى قليلاً.

وهذا يمنح Flash دوراً واضحاً. ليس هو الصندوق تحت مكتب الهاوي. بل النموذج الذي يختاره فريق حين يجب أن تبقى البيانات خاصة، ويهم العمل متعدد الوسائط، ويكون شراء عنقود أو استئجاره خياراً معقولاً. يصبح الذكاء الاصطناعي المحلي مفيداً حين تكون حدوده صادقة؛ وGLM-5.3-Flash نموذج ممتاز للعناقيد الخاصة تحديداً لأننا لا نتظاهر بأنه صغير.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • MIT تعني إذناً عادياً واضحاً: تستخدم نقطة التحقق الرسمية رخصة MIT المألوفة، فتسمح بالاستخدام والتعديل والاستضافة والتوزيع التجاري مع الإسناد.
  • الخصوصية متعددة الوسائط مدمجة: يمكن إبقاء النصوص والصور والفيديو داخل مسار العمل الخاص نفسه، وهو مفيد للمستندات ولقطات الشاشة والرسوم البيانية وتصحيح الواجهات.
  • القدرة لكل دولار تشغيل استثنائية: تمنح Artificial Analysis نموذج Flash نتيجة 57 في Intelligence، أي أعلى بنقطة من Qwen3.8-Flash-Next وقريباً من أنظمة مغلقة أغلى بكثير.
  • إنه أصغر من الإصدار الرئيسي بفارق ملموس: يظل الحجم الرسمي البالغ نحو 306 GiB بصيغة FP8 مهمة لعُنقود، لكنه أدنى بكثير من نقطة GLM-5.3 الرئيسية البالغة نحو 756 GB بصيغة FP8 وإصدار BF16 البالغ 1.51 TB.

قيود صادقة

  • ثمانية عشر مليار معلمة نشطة لا تعني تخزين ثمانية عشر ملياراً: يختار الموجّه جزءاً من الخبراء لكل رمز، لكن النظام يظل محتفظاً بالنموذج ذي 320B معلمة. القدرة الحوسبية النشطة وبصمة الذاكرة تجيبان عن سؤالين مختلفين.
  • النشر الرسمي متعدد بطاقات GPU: تستهدف وصفات Z.ai وvLLM أنظمة مثل 8×H100/H200 أو إعدادات من فئة GB200. ليس حاسوب الألعاب المعتاد هو المضيف المقصود.
  • التكميمات الصغيرة إعداد جديد: قد تتسع نسخ البت الواحد وغيرها من النسخ الشديدة في نحو 90–100 GB، لكن لا يمكن نقل درجات النموذج المستضاف أو نقطة التحقق الرسمية إليها من دون اختبار.
  • تتباين سرعة التشغيل كثيراً: تقيس واجهة Z.ai نحو 50 رمز إخراج في الثانية، فيما يعلن مزوّدون متخصصون إنتاجية أعلى بكثير. يصبح العتاد والتجميع البرمجي وبرامج المزوّد جزءاً من النتيجة.
03

لمحة عن المعايير

Artificial Analysis Intelligence Index — 57

يضع الاختبار التجميعي المستقل GLM-5.3-Flash بين أقوى الأنظمة المفتوحة الأوزان، خلف GLM-5.3 الرئيسي، لكنه يتقدم على معظم عمليات النشر الخاص العملية.

نقطة تحقق FP8 الرسمية — نحو 306 GiB

يحدد هذا فئة العتاد بصدق قبل مخازن التشغيل وذاكرة KV cache: عنقود خاص ممتاز، لا جهازاً محلياً استهلاكياً.

سرعة الإخراج — نحو 50 tok/s على Z.ai

تصنف Artificial Analysis نقطة النهاية بأنها بطيئة ضمن فئة المقارنة. ينبغي تسمية الأنظمة الخارجية الأسرع بدلاً من تعميم نتائجها.

السياق — ‏1,048,576 للإدخال / حتى 128K للإخراج

تدعم نافذة المنتج الرسمية مجموعات بيانات خاصة هائلة، مع ضرورة أن تتسع ذاكرة مخبأ السياق الطويل بجوار النموذج.

Terminal-Bench 2.1 — نحو 84.3

يساعد الدليل القوي على وكلاء البرمجة في تبرير دوره في الهندسة الخاصة. ولا يقلب التفوق الضئيل على تشغيل منفصل الإعداد للنموذج الرئيسي ترتيب القدرات الإجمالي؛ إذ يؤثر إطار الوكيل وأسلوب أخذ العينات والعتاد في إمكانية إعادة إنتاج النتيجة.

04

الحكم

يدخل GLM-5.3-Flash فئة الذكاء الاصطناعي المحلي والخاص في المركز #2 بتقييم 9.1. يبقى Qwen3.8-27B في المركز #1 لأن تكميمه من فئة 18 GB يستطيع العيش على عتاد قد يمتلكه فرد. أما Flash فهو خطوة المؤسسة إلى الأعلى: قدرة تجميعية أقوى بكثير، وتعدد وسائط أصلي، وحقوق MIT معيارية، ومنافسة كافية بين واجهات API للاختبار قبل شراء العتاد. يأتي Qwen3.8-Flash-Next في المركز #3 لكفاءته على الذاكرة العالية، فيما يتراجع GLM-5.3 الرئيسي إلى المركز #5 لأن ملفاته ورخصته تتطلبان بنية أكبر. اختر Flash عندما تكون الخصوصية شرط نشر والعنقود أداة متاحة، لا عندما تعني كلمة «محلي» حاسوباً محمولاً واحداً.

05

الأسئلة الشائعة