هناك طريقتان للحصول على وكيل برمجة: إما استئجار المستشار الأذكى في المدينة لكل مهمة، أو توظيف مهندس ممتاز وسريع وميسور التكلفة ليعاود المحاولة عندما تخفق المرة الأولى. Grok 4.5 هو الخيار الثاني، وهذا ليس مدحًا بسيطًا.
تضع Artificial Analysis نموذج Grok Build في المرتبة الثالثة بمؤشر وكلاء البرمجة بتقييم 76: متعادلاً مع GPT-5.5 في Codex وخلف Fable 5 في Claude Code. ثم يأتي الرقم الذي يغير قرار الشراء؛ حيث يقدر التحليل نفسه التكلفة بنحو $2.49 للمهمة البرمجية مع Grok Build، مقابل $5.07 لـ GPT-5.5 في Codex و $11.80 لـ Fable 5 في Claude Code، مع استهلاك رموز أقل بكثير للوصول لنفس النتيجة.
لهذا السبب يبقى Grok 4.5 في مركز رابع قوي بعد وصول Kimi K3. يوضحه الرسم البياني الرسمي لـ xAI تقريبًا في تعادل مع المتصدرين في Terminal-Bench 2.1 بنسبة 83.3%، ومتفوقًا في SWE Marathon بنسبة 29.0% pass@1. كما أنه متاح في Cursor على جميع الباقات وهو النموذج الافتراضي في Grok Build، مما يجعل حلقات الوكلاء الطويلة والعمل في الطرفية وتصحيح الأخطاء واستكشاف المستودعات البرمجية أمورًا ميسورة التكلفة للتكرار.
ما لا يجب ادعاؤه
لا يعد Grok 4.5 الملك الجديد للأرقام المطلقة؛ حيث تتأخر نتيجته المنشورة البالغة 64.7% في SWE-Bench Pro عن 80.4% لـ Fable 5 و 69.2% لـ Opus 4.8. كما تتأخر نتائجه في DeepSWE عن Fable و GPT-5.5 في مقارنات xAI. إذا كان سير عملك يقتصر على حل مشكلات المستودعات في اختبارات قياسية محضة، فإن النماذج الأعلى تحتفظ بالسجل الأقوى.
ما يجب فعله بدلاً من ذلك
ابدأ باستخدام Grok 4.5 في المهام التي يتحسن فيها الوكيل الكفء مع تكرار المحاولة: التحقيق، ومهام الطرفية، وإعادة بناء الكود (Refactoring)، وكتابة الاختبارات، وتطوير التطبيقات بالتكرار. استثمر التوفير المالي في التحقق واختبار المخرجات. وانتقل إلى GPT-5.6 أو Fable 5 عندما تثبت المهمة أنها تتطلب سقف أداء أعلى.
هذه هي القصة الحقيقية في البرمجة: Grok 4.5 ليس المطرقة الأغلى ثمناً؛ بل هو الأداة الكهربائية المتميزة التي يمكنك تحمل تكلفة إبقائها قيد التشغيل.