دليل مرتب

البرمجة — ذكاء اصطناعي يكتب شيفرة جاهزة للإنتاج

هذه وكلاء برمجة، لا ألعاب للإكمال التلقائي. يتصدر GPT-6 Astra المركز #1 مدعوماً بتصدره لمنصة Code Arena التابعة لـ Arena.ai (بـ 1797 نقطة في WebDev)، وكفاءته في الطرفية واستخدام الحاسوب، وانخفاض كلفة المهمة المكتملة، بينما يأتي Opus 5 في المركز #2 بوصفه المتصدر في التحقق. ويوسّع GLM-5.3 وGLM-5.3-Flash متعدد الوسائط جانب النماذج مفتوحة الأوزان في قائمتنا.

القرار أولاً

ترتيبنا

ابدأ بالفائز، ثم قارن المفاضلات التي قد تغيّر الإجابة بالنسبة لك.

#1 البرمجة

GPT-6 Astra

OpenAI

يتوّج GPT-6 Astra عرش البرمجة بالطريقة الصادقة نفسها التي تمسك بها GPT-5.6 بالتاج: بإنجاز العمل ذي الطابع الوكيلي — جلسات الطرفية، وخطوط الأنابيب المتعثرة، وتحليل الحوادث، وإعداد بيئة العمل بالكامل — مدعومًا الآن بتصدره الجديد لمنصة Code Arena التابعة لـ Arena.ai (بـ 1797 نقطة في WebDev) مع استهلاك نحو ثلث رموز Sol.

لماذا تفوز

تصدر المركز الأول الجديد في منصة Code Arena التابعة لـ Arena.ai في مسار WebDev بـ 1797 نقطة (بفارق +35 نقطة عن Claude Fable 5.1 Max عند 1762، و+109 عن Opus 5 Max عند 1688، و+180 عن Sol في المركز 13)، متصدرًا فئات تحليل البيانات، والمنتجات الاستهلاكية، وأدوات إنشاء المحتوى. بالإضافة إلى 57.7–57.9% على Terminal-Bench 4.0 (مقابل 55.8% لـ Fable 5.1)، وأفضل نتيجة بالجدول على DeepSWE v1.1 بـ 74.1%، و64.6% على Terminal-Bench Science، و88% pass@1 / 99.2% pass@4 على SRE-Bench، و100% على ExploitBench. ورغم أن منصة Artificial Analysis الخاصة تضع Fable 5.1 متقدمًا قليلًا (70 مقابل 67)، يعيد Astra رسم حدود كفاءة باريتو عند 40 دولارًا لكل مليون رمز مدمج ويستهلك نحو ثلث رموز Sol.

العيب

حتى مع تتويجه بالمركز الأول في Code Arena لتطوير الويب وأدوات المنتجات، ما زال Fable 5(.1) يحمل الرقم القياسي في SWE-Bench Pro ويتصدر مؤشر Artificial Analysis الخاص بوكلاء البرمجة (70 مقابل 67). سعر API يعادل 2.5 ضعف Sol عند 10/50 دولارًا، وقراءة الذاكرة المؤقتة تكلف أربعة أضعاف الـ 0.25 دولار لدى Fable 5.1، والإجابات المقتضبة تتخطى خطوات صقل التقارير، والضمانات السيبرانية الأقوى تزيد الاحتكاك في العمل القريب من اختبار الثغرات. جداول الإطلاق تحركت بعد النشر: تعامل مع أي رقم منفرد بهامش ±1–2 نقطة.

9.9 تقييم التحرير
اقرأ المراجعة
الأفضل لـ

يتوّج GPT-6 Astra عرش البرمجة بالطريقة الصادقة نفسها التي تمسك بها GPT-5.6 بالتاج: بإنجاز العمل ذي الطابع الوكيلي — جلسات الطرفية، وخطوط الأنابيب المتعثرة، وتحليل الحوادث، وإعداد بيئة العمل بالكامل — مدعومًا الآن بتصدره الجديد لمنصة Code Arena التابعة لـ Arena.ai (بـ 1797 نقطة في WebDev) مع استهلاك نحو ثلث رموز Sol.

لماذا تفوز

تصدر المركز الأول الجديد في منصة Code Arena التابعة لـ Arena.ai في مسار WebDev بـ 1797 نقطة (بفارق +35 نقطة عن Claude Fable 5.1 Max عند 1762، و+109 عن Opus 5 Max عند 1688، و+180 عن Sol في المركز 13)، متصدرًا فئات تحليل البيانات، والمنتجات الاستهلاكية، وأدوات إنشاء المحتوى. بالإضافة إلى 57.7–57.9% على Terminal-Bench 4.0 (مقابل 55.8% لـ Fable 5.1)، وأفضل نتيجة بالجدول على DeepSWE v1.1 بـ 74.1%، و64.6% على Terminal-Bench Science، و88% pass@1 / 99.2% pass@4 على SRE-Bench، و100% على ExploitBench. ورغم أن منصة Artificial Analysis الخاصة تضع Fable 5.1 متقدمًا قليلًا (70 مقابل 67)، يعيد Astra رسم حدود كفاءة باريتو عند 40 دولارًا لكل مليون رمز مدمج ويستهلك نحو ثلث رموز Sol.

انتبه إلى

حتى مع تتويجه بالمركز الأول في Code Arena لتطوير الويب وأدوات المنتجات، ما زال Fable 5(.1) يحمل الرقم القياسي في SWE-Bench Pro ويتصدر مؤشر Artificial Analysis الخاص بوكلاء البرمجة (70 مقابل 67). سعر API يعادل 2.5 ضعف Sol عند 10/50 دولارًا، وقراءة الذاكرة المؤقتة تكلف أربعة أضعاف الـ 0.25 دولار لدى Fable 5.1، والإجابات المقتضبة تتخطى خطوات صقل التقارير، والضمانات السيبرانية الأقوى تزيد الاحتكاك في العمل القريب من اختبار الثغرات. جداول الإطلاق تحركت بعد النشر: تعامل مع أي رقم منفرد بهامش ±1–2 نقطة.

#2

Claude Opus 5

Anthropic

مبرمج حدودي يتصدر الأدلة ويتحقق بصبر لافت. يبقى Opus 5 في مركزنا #2 فقط لأن هذا الدليل يمنح GPT-6 Astra فاصلاً تحريرياً معلناً لتكامل Codex، وكفاءة الطرفية واستخدام الحاسوب، وتكلفة المهمة المكتملة.

9.9 تقييم التحرير
اقرأ المراجعة
#3

محرك تفكير من فئة Mythos تم تحسينه للبرمجة المستقلة (Agentic Coding). نفس أوزان Mythos 5.1 المقيد، لكنه مُحسّن بخصم 75% على الذاكرة المؤقتة (Cache) مما يغير اقتصاديات الهندسة طويلة الأمد. أفضل استخدام له في Claude Code، حيث يتصدر مجاله بدرجة 70 في AA Coding Agent.

9.8 تقييم التحرير
اقرأ المراجعة
#4

Grok 4.6

xAI

Grok 4.6 ترقية جدية لوكلاء البرمجة: أفضل في استكشاف المستودعات والتنفيذ الطويل والنماذج المرئية، مع سعر $2/$6 وتوافر فوري في Cursor وGrok Build.

9.7 تقييم التحرير
اقرأ المراجعة
#5

GLM-5.3

Z.ai (Zhipu AI)

وكيل برمجة ثقيل مفتوح الأوزان، دُرّب للجزء الذي يأتي بعد الإجابة الأولى: التخطيط والتعديل والاختبار والتعافي والحفاظ على الاتجاه خلال المهام الطويلة داخل المستودعات.

9.2 تقييم التحرير
اقرأ المراجعة
#6

Qwen3.8-Max

Alibaba / Qwen Team

منافس ذو قيمة عالية لبرمجة السياق الطويل والمهام البصرية، يحتل الآن المرتبة السادسة بعد أن وضعته الاختبارات المستقلة خلف النموذج الرائد GLM-5.3. يظل نقطة الفحص (checkpoint) القابلة للتنزيل من فئة Max استثنائية، لكن 2.4 تريليون معلمة تجعل الاستضافة الذاتية مشروعاً بحجم مركز بيانات.

9.2 تقييم التحرير
اقرأ المراجعة
#7

GLM-5.3-Flash

Z.ai (Zhipu AI)

قدرة تقترب من خط المقدمة في البرمجة والعمل الوكيلي بأسعار منخفضة على نحو غير معتاد، مع رؤية أصلية وسياق بطول 1M. تعني كلمة «Flash» هنا الكفاءة والرخص، لا الحجم الصغير ولا السرعة الفائقة.

9.2 تقييم التحرير
اقرأ المراجعة
أسئلة وإجابات

الأسئلة الشائعة