الترتيب #5 البرمجة — ذكاء اصطناعي يكتب شيفرة إنتاجية
xAI

Grok 4.6

Grok 4.6 ترقية جدية لوكلاء البرمجة: أفضل في استكشاف المستودعات والتنفيذ الطويل والنماذج المرئية، مع سعر $2/$6 وتوافر فوري في Cursor وGrok Build.

تم التحديث 14 أغسطس 2026 Agentic CodingCursorGrok Build
الأفضل لـ

Grok 4.6 ترقية جدية لوكلاء البرمجة: أفضل في استكشاف المستودعات والتنفيذ الطويل والنماذج المرئية، مع سعر $2/$6 وتوافر فوري في Cursor وGrok Build.

لماذا تفوز

مقابل 4.5 ارتفع في CursorBench ‏(69.9% مقابل 66.7%) وDeepSWE ‏(65.9% مقابل 54%) وFrontierCode ‏(61.3% مقابل 56.6%) وAPEX-Agents ‏(57.5% مقابل 47.1%) وTerminal-Bench v3 ‏(26% مقابل 15.7%) وAPEX-SWE ‏(56.4% مقابل 53.6%).

انتبه إلى

يتصدر GPT-5.6 Sol اختباري DeepSWE وTerminal-Bench v3، ويتصدر Fable 5 عدة صفوف أخرى. لا توجد نتيجة كاملة لـSWE-bench Verified، وتدعو إشارات الأمان المبكرة إلى العزل والمراجعة الصارمة.

01

ما هو في الواقع

وكيل البرمجة الجيد لا يشبه الإكمال التلقائي بقدر ما يشبه مهندساً مبتدئاً يحمل تذكرة عمل. عليه أن يستكشف المستودع، ويبني فرضية، ويشغّل الأوامر، ويفهم رسائل الخطأ، ويتذكر الهدف الأصلي بعد الالتفاف الثاني عشر. دُرّب Grok 4.6 لهذه الحلقة الطويلة تحديداً. تركز xAI على العمل عبر قاعدة الشفرة كلها، والبحث في مجالات غير مألوفة، وتطوير الويب، والتطبيقات المرئية، وجولات متعددة من التغذية الراجعة، واختبار الذات أكثر من Grok 4.5. الهدف ليس مقطع شفرة أنيقاً فحسب، بل مهمة تصل إلى نتيجة قابلة للفحص.

يدعم نمط الاختبارات وجود قفزة حقيقية بين الجيلين. ارتفع CursorBench v3.2 من 66.7% إلى 69.9%، وDeepSWE v1.1 من 54% إلى 65.9%، وFrontierCode v1.1 من 56.6% إلى 61.3%. كما تحسنت نتائج APEX-Agents وAPEX-SWE وTerminal-Bench v3. قد ينتج صف واحد جيد من تعليمات مناسبة أو بيئة تشغيل ملائمة، لكن التحسن عبر ستة اختبارات للبرمجة والوكلاء إشارة أقوى بكثير.

ومع ذلك لم يصبح Grok ملك البرمجة المطلق. ففي مقارنة xAI، حقق GPT-5.6 Sol نسبة 73% في DeepSWE وحقق Fable 5 نسبة 70%. وفي Terminal-Bench v3 بقيت نتيجة Grok البالغة 26% دون 34.6% و34.1% المنشورتين للمنافسين. ويحافظ Fable كذلك على تقدم صغير في CursorBench وFrontierCode وAPEX-Agents وAPEX-SWE. لا يقدم الإطلاق نتيجة كاملة لـSWE-bench Verified. ولا يصح ملء هذا الفراغ باختبار آخر؛ فإصلاح المستودع والعمل في الطرفية وبناء واجهة مهارات مترابطة، لكنها ليست المهارة نفسها.

يغير السعر والتوافر القرار العملي رغم ذلك. وصل Grok 4.6 إلى Cursor وGrok Build في اليوم الأول، إضافة إلى واجهة xAI وOpenRouter وVercel وCloudflare. بقي السعر القياسي عند دولارين لكل مليون رمز إدخال وستة دولارات لكل مليون رمز إخراج، بينما تكلف النسخة السريعة الضعف. تقيس Artificial Analysis نحو 0.84 دولار للمهمة في النموذج العام. عندما يحتاج الوكيل إلى ثلاثة تحقيقات ومحاولتي إصلاح ومراجعة أخيرة، تصبح كلفة كل دورة خاصية هندسية حقيقية.

ولهذا السبب بالذات، لا ينبغي استبدال التوفير بإزالة الحماية. تذكر التقارير العملية المبكرة تعديلات أمنية خطرة وردوداً غير منتجة بعد الفشل. لا تقيس هذه التقارير معدل المشكلة، لكنها تصف خطراً معقولاً. ابدأ باستكشاف المستودع في وضع القراءة فقط، وأبق الأسرار بعيداً، واقصر الكتابة على فرع معزول، واطلب فروقاً صغيرة، وشغّل CI بعد كل تغيير مهم. لا توسع الاستقلالية إلا بعد أن ينجح النموذج في مهام داخلية لم يرها من قبل.

وينبغي للمقارنة العادلة أن تختبر النظام كاملاً: التذكرة نفسها، والأدوات نفسها، وحدود الوقت والإعادة نفسها، والاختبارات نفسها. لا تسجل فقط هل ظهر تصحيح يعمل في النهاية؛ سجّل عدد الجولات والرموز ودقائق المراجعة البشرية اللازمة للوصول إلى تغيير صالح للدمج. أفضل وصف لـGrok 4.6 أنه وكيل برمجة متقدم وعالي القيمة: قوي بما يكفي للعمل الجاد متعدد الخطوات، ورخيص بما يكفي لمحاولة أخرى، ومتاح في الأدوات التي تستخدمها الفرق. ولا تصبح أفضليته حقيقية إلا حين يفحص سير العمل ما يكتبه بصرامة.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • تحسن واسع على 4.5: تقدم في ستة اختبارات منشورة، مع قفزات كبيرة خصوصاً في DeepSWE وTerminal-Bench v3؛ فلا يتعلق الأمر بصف محظوظ واحد.
  • مصمم للمشروعات الطويلة: تفضل xAI العمل عبر المستودع والمجالات المجهولة والويب والتطبيقات المرئية والاختبار الذاتي والتكرار على إجابات الشفرة القصيرة.
  • CursorBench منافس: 69.9% قريب من 70.5% لدى Fable 5.
  • تكرار منخفض الكلفة: $2/$6 لكل مليون ونحو 0.84 دولار للمهمة المقاسة يجعلان الاختبارات والمحاولات والمراجعة أيسر من الرهان على مرور واحد مكلف.
  • متاح منذ اليوم الأول: Cursor وGrok Build والواجهة وشركاء البنية التحتية.

قيود صادقة

  • ليس متصدر DeepSWE: 65.9% أقل من 73% لدى GPT-5.6 Sol و70% لدى Fable 5.
  • Terminal-Bench v3 ما زال أضعف: 26% تحسن كبير لكنه دون النتائج القريبة من 34%.
  • لا SWE-bench Verified كاملاً: لا يحسم الإطلاق كل مقارنات إصلاح المستودعات.
  • قصص الأمان تحذر: ابدأ بالقراءة فقط، وقيّد الأسرار، وراجع كل فرق.
  • النموذج وبيئة التشغيل نظام واحد: التعليمات والأدوات وقواعد التوقف والاختبارات تغير النتيجة.
03

لمحة عن المعايير

CursorBench v3.2 — 69.9%

أعلى من Grok 4.5 بـ3.2 نقاط وقريب من أفضل نتيجة مذكورة.

DeepSWE v1.1 — 65.9%

قفزة كبيرة بين الجيلين من دون صدارة.

FrontierCode v1.1 — 61.3%

أعلى من GPT-5.6 Sol وأقل من Fable 5 في جدول xAI.

APEX-Agents — 57.5%

إشارة وكيلية قوية وقريبة من أفضل منافس.

Terminal-Bench v3.0 — 26%

الموازنة المهمة: تحسن واضح من دون موقع متصدر.

04

الحكم

Grok 4.6 من أفضل وكلاء البرمجة من حيث القيمة، خصوصاً لاستكشاف المستودعات الطويل ونماذج المنتجات والتطبيقات المرئية والعمل ذي جولات التغذية الراجعة المتعددة. اختره لقدرة قريبة من القمة وكلفة تكرار منخفضة، لا لانتصار شامل غير موجود. يظل CI والعزل وبيانات الاعتماد الضيقة والمراجعة البشرية أجزاء من النظام.

05

الأسئلة الشائعة