وكيل البرمجة الجيد لا يشبه الإكمال التلقائي بقدر ما يشبه مهندساً مبتدئاً يحمل تذكرة عمل. عليه أن يستكشف المستودع، ويبني فرضية، ويشغّل الأوامر، ويفهم رسائل الخطأ، ويتذكر الهدف الأصلي بعد الالتفاف الثاني عشر. دُرّب Grok 4.6 لهذه الحلقة الطويلة تحديداً. تركز xAI على العمل عبر قاعدة الشفرة كلها، والبحث في مجالات غير مألوفة، وتطوير الويب، والتطبيقات المرئية، وجولات متعددة من التغذية الراجعة، واختبار الذات أكثر من Grok 4.5. الهدف ليس مقطع شفرة أنيقاً فحسب، بل مهمة تصل إلى نتيجة قابلة للفحص.
يدعم نمط الاختبارات وجود قفزة حقيقية بين الجيلين. ارتفع CursorBench v3.2 من 66.7% إلى 69.9%، وDeepSWE v1.1 من 54% إلى 65.9%، وFrontierCode v1.1 من 56.6% إلى 61.3%. كما تحسنت نتائج APEX-Agents وAPEX-SWE وTerminal-Bench v3. قد ينتج صف واحد جيد من تعليمات مناسبة أو بيئة تشغيل ملائمة، لكن التحسن عبر ستة اختبارات للبرمجة والوكلاء إشارة أقوى بكثير.
ومع ذلك لم يصبح Grok ملك البرمجة المطلق. ففي مقارنة xAI، حقق GPT-5.6 Sol نسبة 73% في DeepSWE وحقق Fable 5 نسبة 70%. وفي Terminal-Bench v3 بقيت نتيجة Grok البالغة 26% دون 34.6% و34.1% المنشورتين للمنافسين. ويحافظ Fable كذلك على تقدم صغير في CursorBench وFrontierCode وAPEX-Agents وAPEX-SWE. لا يقدم الإطلاق نتيجة كاملة لـSWE-bench Verified. ولا يصح ملء هذا الفراغ باختبار آخر؛ فإصلاح المستودع والعمل في الطرفية وبناء واجهة مهارات مترابطة، لكنها ليست المهارة نفسها.
يغير السعر والتوافر القرار العملي رغم ذلك. وصل Grok 4.6 إلى Cursor وGrok Build في اليوم الأول، إضافة إلى واجهة xAI وOpenRouter وVercel وCloudflare. بقي السعر القياسي عند دولارين لكل مليون رمز إدخال وستة دولارات لكل مليون رمز إخراج، بينما تكلف النسخة السريعة الضعف. تقيس Artificial Analysis نحو 0.84 دولار للمهمة في النموذج العام. عندما يحتاج الوكيل إلى ثلاثة تحقيقات ومحاولتي إصلاح ومراجعة أخيرة، تصبح كلفة كل دورة خاصية هندسية حقيقية.
ولهذا السبب بالذات، لا ينبغي استبدال التوفير بإزالة الحماية. تذكر التقارير العملية المبكرة تعديلات أمنية خطرة وردوداً غير منتجة بعد الفشل. لا تقيس هذه التقارير معدل المشكلة، لكنها تصف خطراً معقولاً. ابدأ باستكشاف المستودع في وضع القراءة فقط، وأبق الأسرار بعيداً، واقصر الكتابة على فرع معزول، واطلب فروقاً صغيرة، وشغّل CI بعد كل تغيير مهم. لا توسع الاستقلالية إلا بعد أن ينجح النموذج في مهام داخلية لم يرها من قبل.
وينبغي للمقارنة العادلة أن تختبر النظام كاملاً: التذكرة نفسها، والأدوات نفسها، وحدود الوقت والإعادة نفسها، والاختبارات نفسها. لا تسجل فقط هل ظهر تصحيح يعمل في النهاية؛ سجّل عدد الجولات والرموز ودقائق المراجعة البشرية اللازمة للوصول إلى تغيير صالح للدمج. أفضل وصف لـGrok 4.6 أنه وكيل برمجة متقدم وعالي القيمة: قوي بما يكفي للعمل الجاد متعدد الخطوات، ورخيص بما يكفي لمحاولة أخرى، ومتاح في الأدوات التي تستخدمها الفرق. ولا تصبح أفضليته حقيقية إلا حين يفحص سير العمل ما يكتبه بصرامة.