الترتيب #7 البرمجة — ذكاء اصطناعي يكتب شيفرة جاهزة للإنتاج
Z.ai (Zhipu AI)

GLM-5.3

وكيل برمجة ثقيل مفتوح الأوزان، دُرّب للجزء الذي يأتي بعد الإجابة الأولى: التخطيط والتعديل والاختبار والتعافي والحفاظ على الاتجاه خلال المهام الطويلة داخل المستودعات.

تم التحديث 30 أغسطس 2026 Coding AgentLong-Horizon1M Context

تحديث الترتيب رُوجِع ترتيب فئة «البرمجة» منذ آخر تحديث لهذه المراجعة (30 أغسطس 2026). الترتيب المعروض أعلاه محدَّث دائمًا. الأول حاليًا: GPT-6 Astra

الأفضل لـ

وكيل برمجة ثقيل مفتوح الأوزان، دُرّب للجزء الذي يأتي بعد الإجابة الأولى: التخطيط والتعديل والاختبار والتعافي والحفاظ على الاتجاه خلال المهام الطويلة داخل المستودعات.

لماذا تفوز

تسجّل Artificial Analysis لنموذج GLM-5.3 نتيجة 59.5 في Intelligence و74.8 في Coding و59.1 في Agentic، متفوقاً على Qwen3.8-Max في المؤشرات الثلاثة. وتضع أحدث لوحة عامة لـTerminal-Bench 4.0 نموذج GLM في المركز الثالث عند 41.8%.

انتبه إلى

يضم الإصدار الرسمي نحو 753B معلمة إجمالاً و40B معلمة نشطة، وهو نصي فقط، دائم الاستدلال، ويبلغ حجمه قرابة 756 GB حتى بصيغة FP8. وما زالت Z.ai هي التي أجرت كثيراً من اختبارات البرمجة والأمن السيبراني التفصيلية، كما أن الرخصة المخصصة ليست MIT.

01

ما هو في الواقع

أسهل ما يمكن عرضه في البرمجة هو الإجابة الأولى. اطلب دالة، وشاهد النموذج يكتب شفرة مرتبة، ثم أوقف التسجيل قبل أن تتعارض الاعتماديات أو تكشف الاختبارات افتراضاً خاطئاً. تبدأ الهندسة الحقيقية عند النقطة التي ينتهي فيها ذلك العرض. صُمم GLM-5.3 للإجراء الثاني والعشرين والمئة: يقرأ ما حدث، ويعيد النظر في الخطة، ويحتفظ بما يكفي من الحالة حتى يُنهي المهمة.

تقول Z.ai إن النموذج الأساسي نفسه هو قاعدة GLM-5.2. جاء التحسن من مرحلة ما بعد التدريب داخل بيئات أكثر قابلية للتنفيذ وعبر مهام مهنية أطول. تخيل خريجاً واسع المعرفة يبدأ فترة تدريب مهني. قد لا تتغير الحقائق الموجودة في رأسه كثيراً، لكن الممارسة المتكررة تعلمه متى يقيس، ومتى يشك في فرضية، ومتى يتراجع عن عمل بدا ذكياً قبل خمس دقائق.

تدعم هذه الرواية الآن فئتان من الأدلة. تعلن Z.ai مكاسب كبيرة في Terminal-Bench وDeepSWE وAutomationBench وحزم الأمن. والأهم أن Artificial Analysis تضع GLM-5.3، في تقييم مستقل، عند 59.5 في Intelligence و74.8 في Coding و59.1 في Agentic، متقدماً على Qwen3.8-Max الذي يسجل 58.1 و71.8 و58.4. والخلاصة الأكثر ثباتاً هي أن GLM يستحق أن يأتي فوق Qwen في البرمجة، مع بقاء كل مستودع بحاجة إلى تجربة متكافئة خاصة به.

غيّر إصدار الأوزان في 28 أغسطس هذا التقييم جذرياً. قبل ذلك التاريخ، كانت عبارة «الأوزان المفتوحة» تصف نية. أما الآن فيمكن فحص ملفات FP8 وBF16 والإعداد وقالب المحادثة ووصفات التشغيل. أصبحت إعادة الإنتاج ممكنة أخيراً، لكنها ليست رخيصة: تبلغ نقطة تحقق FP8 نحو ثلاثة أرباع تيرابايت، وتشير الوصفات الرسمية إلى أجهزة متعددة من فئة H200. قد يكون النموذج قابلاً للتنزيل ومع ذلك يحتاج إلى غرفة آلات صغيرة.

وتستحق الرخصة الوضوح نفسه. GLM-5.3 ليس مرخصاً وفق MIT. تمنح الرخصة المخصصة حقوقاً واسعة في الاستخدام والتعديل والضبط الدقيق والنشر والبيع. ويُطبق بندها غير المعتاد عندما يكون المرخَّص له أو إحدى شركاته التابعة يدير نشاط Model-as-a-Service وتتجاوز إيراداتهما الإجمالية عشرة مليارات دولار خلال فترة متصلة من اثني عشر شهراً؛ فعلى ذلك المشغّل اجتياز مراجعة Z.ai الأمنية قبل الاستخدام التجاري. معظم الأفراد وفرق المنتجات العادية بعيدون جداً عن هذا الحد، لكن وصفه بأنه «مفتوح المصدر بلا شروط» يظل غير دقيق.

تكتسب أسماء المعايير أهمية هنا. قد تكون نتيجة Z.ai البالغة 88.2 في Terminal-Bench 2.1 والنتيجة المستقلة الأدنى صادقتين معاً، لأن النموذج ليس سوى عنصر واحد في نظام وكيل. وفي أحدث حزمة متجددة، Terminal-Bench 4.0، يأتي GLM-5.3 ثالثاً عند 41.8% ±3.2، خلف Opus 5 وFable 5، وأمام GPT-5.6 Sol وGrok 4.6. لا توجد نتيجة منشورة لـQwen3.8-Max في الإصدار 4.0، لذلك يعزز هذا الغياب الثقة في GLM من دون أن يتحول إلى نتيجة مقارنة مباشرة بين النموذجين.

من الناحية التشغيلية، اختبار النموذج المستضاف أسهل من تشغيل الأوزان. يقبل جهداً منخفضاً أو عالياً أو أقصى، ويستخدم max افتراضياً. ولا يمكن تعطيل التفكير. يفيد ذلك في المهام الصعبة، لكنه قد يجعل المسار الخاطئ مكلفاً: فالوكيل المثابر لا يفيد إلا إذا ثابر نحو الدليل. ابث الجولات الطويلة، وضع سقفاً للحلقات، واحفظ حالة الاستدلال بصورة صحيحة، واشترط اجتياز الاختبارات قبل قبول رسالة الإنجاز.

لذلك يستحق GLM-5.3 توصية أقوى من نسخته يوم الإطلاق، لكن ليس توصية سحرية. إنه محرك برمجة جاد مفتوح الأوزان للفرق التي لديها عمل طرفي شاق وسياقات طويلة وميزانية API أو بنية عنقودية. وليس أفضل مصحح بصري، ولا أسهل نموذج خاص، ولا دليلاً على أن كل معيار للمورّد سينتقل إلى مستودعك. أعطه الأدوات والميزانية والاختبارات ومعيار المراجعة نفسها التي تعطيها لنموذجك الحالي، ثم قارن العمل المتحقق منه لا النثر الواثق.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • المهام الطويلة هي الغاية الأساسية: دُرّب GLM-5.3 على التشخيص والتعديل وتشغيل الأدوات وفحص الإخفاقات والتعافي عبر مسارات ممتدة. وهذا أقرب إلى صيانة قاعدة شفرية حقيقية منه إلى الفوز في مسابقة لكتابة دالة من مطالبة واحدة.
  • الدليل التجميعي المستقل قوي الآن: تضع Artificial Analysis النموذج عند 59.5 في Intelligence و74.8 في Coding و59.1 في العمل الوكيلي. ويأتي Qwen3.8-Max خلفه عند 58.1 و71.8 و58.4 على الترتيب.
  • الأوزان متاحة فعلاً: أصدرت Z.ai نقاط تحقق بصيغتي FP8 وBF16 في 28 أغسطس. وبات بوسع الفرق فحص النموذج وتشغيله وإعادة إنتاج نتائجه، بدلاً من التعامل مع الأوزان المفتوحة بوصفها وعداً مستقبلياً.
  • مسار الاستضافة مباشر: توفر Z.ai سياقاً بطول 1M، ومستويات جهد استدلال low وhigh وmax، وواجهات متوافقة مع OpenAI وAnthropic، وأسعاراً قدرها $1.40/M للإدخال و$0.26/M للإدخال المخبأ و$4.40/M للإخراج.

قيود صادقة

  • الأوزان المفتوحة لا تعني حجماً مناسباً لمحطة عمل: يبلغ المستودع الرسمي بصيغة FP8 نحو 756 GB، وتبلغ نسخة BF16 نحو 1.51 TB، وتستخدم عمليات النشر الموثقة أنظمة متعددة من فئة H200. هذا نموذج لعنقود خاص، لا ملفاً تنزله على حاسوب محمول.
  • معظم النتائج المتخصصة ما زالت من تشغيل المورّد: تستخدم اختبارات Terminal-Bench 3.0 وDeepSWE وAutomationBench وCyberGym ومعيار Z.ai Code Bench الخاص منظومات تشغيل معلنة لكنها شديدة الحساسية للإعداد. إنها أدلة مفيدة، لا درجات عالمية ثابتة.
  • إنه نصي فقط ودائم التفكير: لا يستطيع النموذج فحص لقطات الشاشة أو الواجهات المسجلة مباشرة، وتفشل الطلبات التي تعطل التفكير. يساعد الجهد المنخفض في الأعمال البسيطة، لكن كل طلب يظل يدفع قدراً من زمن الاستدلال.
  • الرخصة تستحق قراءة فعلية: يُسمح بالاستخدام التجاري على نطاق واسع، لكن مشغّل MaaS وشركاته التابعة، إذا تجاوزت إيراداته $10B خلال أي اثني عشر شهراً متتالية، يجب أن يجتاز مراجعة أمنية من Z.ai. سمّه مفتوح الأوزان، لا مفتوح المصدر بلا قيد.
03

لمحة عن المعايير

Artificial Analysis Intelligence / Coding / Agentic — 59.5 / 74.8 / 59.1

تضع الأدلة المركبة المستقلة GLM-5.3 أمام Qwen3.8-Max الذي يسجل 58.1 / 71.8 / 58.4، ما يدعم ترتيب الموقع المنقح.

Terminal-Bench 2.1 — ‏88.2 لدى المورّد؛ نحو 83.9 مستقلاً

الفارق درس مفيد في حساسية النتائج لمنظومة التشغيل. اذكر المشغّل والإعداد بدلاً من تقديم رقم واحد كأنه صفة دائمة للنموذج.

Terminal-Bench 4.0 — ‏41.8% ±3.2، المركز #3

تضع أحدث لوحة عامة لاختبارات الطرفية GLM خلف Opus 5 وFable 5، وأمام GPT-5.6 Sol وGrok 4.6. لا توجد نتيجة منشورة لـQwen3.8-Max، لذلك يمثل غيابه سياقاً داعماً لا مقارنة مباشرة.

DeepSWE v1.1 — ‏66.9 (تشغيل Z.ai)

دليل قوي على العمل طويل الأمد داخل المستودعات باستخدام mini-swe-agent وميزانية ست ساعات، لكنه لم يُعَد إنتاجه مستقلاً بعد في الأثر العام الرسمي.

GDPval-AA v2 — ضمن المجموعة الرائدة، Elo مباشر

تضع اللقطات الحديثة GLM-5.3 قرب منتصف نطاق 1700، مع فترات ثقة متداخلة أمام GLM Flash وغيره من المتصدرين. اذكر تاريخ الاطلاع لأن مقياس Elo يعاد ضبطه.

04

الحكم

يصعد GLM-5.3 إلى المركز #5 في فئة البرمجة بدرجة 9.2، خلف Grok 4.6 وأمام Qwen3.8-Max في #6 وGLM-5.3-Flash في #7. هذا التغيير تقوده الأدلة: يتفوق GLM على Qwen في مؤشرات Artificial Analysis للذكاء والبرمجة والعمل الوكيلي، وكذلك في نتائج Terminal-Bench 2.1 وDeepSWE ضمن جدول Z.ai نفسه. اختره للمهام النصية والطرفية الصعبة والطويلة عندما تستطيع تحمل تكلفة API أو العنقود؛ واختر Flash حين تكون المدخلات متعددة الوسائط والتكلفة أهم.

05

الأسئلة الشائعة