الترتيب #5 البرمجة — ذكاء اصطناعي يكتب شيفرة إنتاجية
xAI

Grok 4.5

يحتل Grok 4.5 المركز الرابع لأنه يجعل حلقات الوكلاء المتقدمة اقتصادية. يتقدمه Kimi K3 الآن في القدرة الخام وتفضيل الواجهات، لكن Grok Build يبقى ثالثًا في مؤشر وكلاء البرمجة وينجز المهمة بجزء من التكلفة.

تم التحديث 10 يوليو 2026 Agentic CodingCursorGrok Build
الأفضل لـ

يحتل Grok 4.5 المركز الرابع لأنه يجعل حلقات الوكلاء المتقدمة اقتصادية. يتقدمه Kimi K3 الآن في القدرة الخام وتفضيل الواجهات، لكن Grok Build يبقى ثالثًا في مؤشر وكلاء البرمجة وينجز المهمة بجزء من التكلفة.

لماذا تفوز

منحت Artificial Analysis نموذج Grok Build درجة 76 في مؤشر وكلاء البرمجة—ثالثًا بالتساوي مع GPT-5.5 في Codex—مع تكلفة تبلغ $2.49 للمهمة مقابل $5.07 لـ GPT-5.5 و $11.80 لـ Fable 5. تسجل xAI نسبة 83.3% في Terminal-Bench 2.1 و 29.0% في SWE Marathon، وسرعة 80 رمزًا/ثانية، وسعر $2/$6، مع استهلاك رموز إخراج أقل بـ 4.2 أضعاف في SWE-Bench Pro مقارنة بـ Opus 4.8. متاح في Cursor على كافة الباقات، و Grok Build، والـ API.

انتبه إلى

يكافئ المركز الرابع القيمة والكفاءة، لا التفوق على الجميع. يتأخر في SWE-Bench Pro وDeepSWE عن القادة، ويملك Kimi K3 الآن حجة أقوى في القدرة الخام. كما يبقى الكود الرخيص بحاجة إلى الاختبار والمراجعة الأمنية.

01

ما هو في الواقع

هناك طريقتان للحصول على وكيل برمجة: إما استئجار المستشار الأذكى في المدينة لكل مهمة، أو توظيف مهندس ممتاز وسريع وميسور التكلفة ليعاود المحاولة عندما تخفق المرة الأولى. Grok 4.5 هو الخيار الثاني، وهذا ليس مدحًا بسيطًا.

تضع Artificial Analysis نموذج Grok Build في المرتبة الثالثة بمؤشر وكلاء البرمجة بتقييم 76: متعادلاً مع GPT-5.5 في Codex وخلف Fable 5 في Claude Code. ثم يأتي الرقم الذي يغير قرار الشراء؛ حيث يقدر التحليل نفسه التكلفة بنحو $2.49 للمهمة البرمجية مع Grok Build، مقابل $5.07 لـ GPT-5.5 في Codex و $11.80 لـ Fable 5 في Claude Code، مع استهلاك رموز أقل بكثير للوصول لنفس النتيجة.

لهذا السبب يبقى Grok 4.5 في مركز رابع قوي بعد وصول Kimi K3. يوضحه الرسم البياني الرسمي لـ xAI تقريبًا في تعادل مع المتصدرين في Terminal-Bench 2.1 بنسبة 83.3%، ومتفوقًا في SWE Marathon بنسبة 29.0% pass@1. كما أنه متاح في Cursor على جميع الباقات وهو النموذج الافتراضي في Grok Build، مما يجعل حلقات الوكلاء الطويلة والعمل في الطرفية وتصحيح الأخطاء واستكشاف المستودعات البرمجية أمورًا ميسورة التكلفة للتكرار.

ما لا يجب ادعاؤه

لا يعد Grok 4.5 الملك الجديد للأرقام المطلقة؛ حيث تتأخر نتيجته المنشورة البالغة 64.7% في SWE-Bench Pro عن 80.4% لـ Fable 5 و 69.2% لـ Opus 4.8. كما تتأخر نتائجه في DeepSWE عن Fable و GPT-5.5 في مقارنات xAI. إذا كان سير عملك يقتصر على حل مشكلات المستودعات في اختبارات قياسية محضة، فإن النماذج الأعلى تحتفظ بالسجل الأقوى.

ما يجب فعله بدلاً من ذلك

ابدأ باستخدام Grok 4.5 في المهام التي يتحسن فيها الوكيل الكفء مع تكرار المحاولة: التحقيق، ومهام الطرفية، وإعادة بناء الكود (Refactoring)، وكتابة الاختبارات، وتطوير التطبيقات بالتكرار. استثمر التوفير المالي في التحقق واختبار المخرجات. وانتقل إلى GPT-5.6 أو Fable 5 عندما تثبت المهمة أنها تتطلب سقف أداء أعلى.

هذه هي القصة الحقيقية في البرمجة: Grok 4.5 ليس المطرقة الأغلى ثمناً؛ بل هو الأداة الكهربائية المتميزة التي يمكنك تحمل تكلفة إبقائها قيد التشغيل.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • مركز ثالث مستقل وليس تسويقًا ذاتيًا: صنفت Artificial Analysis نموذج Grok Build في المرتبة الثالثة بمؤشر وكلاء البرمجة بدرجة 76، متعادلاً مع GPT-5.5 في Codex ومباشرة خلف Fable 5 في Claude Code. إنه الادعاء الواقعي السليم: وكيل عملي متقدم لا ادعاءات مبالغ فيها.
  • فارق هائل في التكلفة لكل مهمة برمجية: تقرير Artificial Analysis يسجل $2.49 لمهمة مؤشر وكلاء البرمجة مع Grok Build، مقارنة بنحو $5.07 لـ GPT-5.5 في Codex و $11.80 لـ Fable 5 في Claude Code، مع استهلاك 1.9 مليون رمز للمهمة مقابل 6.2 و 7.2 مليون على التوالي.
  • أداء تنافسي حقيقي في مهام الطرفية (Terminal): تسجل تقارير xAI الرسمية 83.3% في Terminal-Bench 2.1—قريبًا جدًا من 84.3% لـ Fable 5 و 83.4% لـ GPT-5.5. بالنسبة لاستخدام الأدوات، وتوجيه الأوامر، وحلقات تصحيح الأخطاء، فهو أداء ممتاز.
  • سرعة واقتصاد يشجعان على ممارسات هندسية أفضل: يقدم Grok 4.5 سرعة 80 رمزًا/ثانية بسعر $2/$6 لكل مليون رمز، مما يسهل تشغيل اختبارات إضافية، أو طلب تنفيذ بديل، أو ترك الوكيل يحقق في المشاكل قبل تدخل المطور البشري.
  • سهولة النشر عبر Cursor و Grok Build: يعمل Grok 4.5 افتراضيًا في Grok Build ومتاح في Cursor على جميع الباقات، بالإضافة إلى الـ API، مما يوفر بيئة تطوير جاهزة دون الحاجة لبنية تحتية معقدة.

قيود صادقة

  • صدارة الأرقام المطلقة تنتمي لآخرين: تسجل xAI نسبة 64.7% في SWE-Bench Pro، خلف 80.4% لـ Fable 5 و 69.2% لـ Opus 4.8 في نفس الجدول. إذا كان عملك يقتصر فقط على حل مشكلات المستودعات المعقدة، فلا تتجاهل المتصدرين.
  • أداء تنافسي في DeepSWE ولكنه ليس مسيطرًا: في مقارنة xAI، حقق Grok 4.5 نسبة 62.0% في DeepSWE 1.0 و 53% في DeepSWE 1.1، متأخرًا عن Fable 5 و GPT-5.5 في الاختبارين. القيمة الاقتصادية لا تمحو فجوة الأداء الخام.
  • فرق الاتحاد الأوروبي لا يمكنها استخدامه اليوم عند الإطلاق: توضح xAI أن Grok 4.5 غير متاح بعد في الاتحاد الأوروبي عبر منتجاتها أو لوحة الـ API. توقع الإتاحة في منتصف يوليو هو خطة وليس توفرًا فعليًا.
  • كفاءة الرموز لا تضمن صحة الكود تلقائيًا: الخطوات الأقل والتكلفة المنخفضة ميزة حقيقية فقط بعد أن يجتاز التعديل البرمجي كافة الاختبارات والمراجعات وفحوصات الأمان في سياق عملك الفعلي.
  • إصدار حديث يتطلب التحقق التجريبي: استخدم مهام اختبار داخلية قبل الاعتماد الكامل عليه. النموذج جديد، وسلوك بيئات الوكلاء يؤثر على المخرجات، ومنحنى التكلفة الجيد لا يغني عن خطوط الاختبار (CI).
03

لمحة عن المعايير

مؤشر وكلاء البرمجة من Artificial Analysis — 76 (#3)

نتيجة مستقلة لنموذج Grok Build: يتعادل مع GPT-5.5 في Codex ويحل خلف Fable 5 في Claude Code.

تكلفة مؤشر وكلاء البرمجة — $2.49 للمهمة

تسجل Artificial Analysis تكلفة $2.49 لـ Grok Build مقابل $5.07 لـ GPT-5.5 في Codex و $11.80 لـ Fable 5 في Claude Code.

Terminal-Bench 2.1 — 83.3%

المقارنة الرسمية من xAI تضع Grok بالقرب من Fable 5 عند 84.3% و GPT-5.5 عند 83.4% في مهام الطرفية.

SWE Marathon — 29.0% pass@1

تفيد تقارير xAI بتفوق Grok على الأرقام المذكورة لكل من Opus 4.8 و Fable 5 في هذا التقييم الهندسي طويل المدى.

SWE-Bench Pro — 64.7%

الموازنة الأساسية: يضع الرسم البياني لـ xAI نموذج Grok خلف Fable 5 و Opus 4.8 في حل مشكلات المستودعات.

04

الحكم

يحتل Grok 4.5 المركز الرابع لأن القائمة يجب أن تكافئ القدرة وإمكان تكرار تشغيل الوكيل معًا. يتفوق Kimi K3 الآن في الأدلة الخام والواجهات؛ ويبقى Grok بديل القيمة والسرعة مع طرفية قوية، ومركز ثالث مستقل للوكلاء، وCursor، وتكلفة منخفضة. استخدم K3 أو Fable 5 أو GPT-5.6 للسقف الأعلى، وGrok للتكرار من دون حرق الميزانية.

05

الأسئلة الشائعة