لسنوات اتبع الذكاء الاصطناعي المتقدم قاعدة المطاعم: كلما بدت القائمة أفخم، وجب أن تراقب الفاتورة بعناية أكبر. يكسر Grok 4.6 هذه القاعدة. فقد حصل على 61 نقطة في مؤشر الذكاء لدى Artificial Analysis، وتعادل مع GPT-5.6 Sol، ولم يتأخر إلا عن أعلى إعدادات Opus 5 وFable 5. ومع ذلك بقي السعر القياسي عند دولارين لكل مليون رمز إدخال وستة دولارات لكل مليون رمز إخراج. هذه المرة لم تأتِ زيادة القدرة مع فاتورة فاخرة جديدة.
تظهر القصة الأهم أسفل النتيجة المركبة. في GDPVal-AA v2، الذي يختبر العمل المهني الذي ينفذه الوكيل، حقق Grok عدد 1753 Elo. وفي AA-Briefcase، المخصص لمهام طويلة تشمل البحث والتحليل وإنتاج مادة نهائية، حقق 1577 Elo. رصدت Artificial Analysis في المتوسط نحو 53 جولة و0.5 مليار رمز إدخال لكل مهمة. أما Opus 5 max فاحتاج إلى قرابة 103 جولات وملياري رمز. تخيل فريقين يقدمان تقريرين متقاربين في الجودة، لكن أحدهما يعقد نصف الاجتماعات ويعيد قراءة ربع الملفات فقط. تقلل هذه الكفاءة الكلفة، وتقلل كذلك عدد الفرص التي قد ينسى فيها الوكيل الهدف الأصلي أثناء المسار الطويل.
درّبت xAI النموذج مباشرة على هذا النوع من الاستمرار. يصف الإعلان مرحلة تدريب إضافية أطول، وإعادة إنشاء مسارات للاستدلال والبرمجة، ثم تعلماً معززاً في العمل المعرفي والبرمجة العامة وتطوير الويب والتصميم بمساعدة الحاسوب وبيئات أخرى تستخدم الأدوات. لدى النموذج سياق يبلغ 500 ألف رمز ومستويات استدلال low وmedium وhigh وxhigh. وهو متاح في Grok Build وCursor وواجهة xAI وOpenRouter وVercel وCloudflare. توجد نسخة أسرع تقلل زمن الانتظار، لكنها تضاعف سعر الرمز.
لا تعني هذه الأرقام انتصاراً شاملاً. أوضح دليل لدى Grok يتعلق بالعمل المعرفي الوكيلي. ففي جدول xAI، بقيت نتيجته 65.9% في DeepSWE v1.1 دون GPT-5.6 Sol وFable 5، كما أن 26% في Terminal-Bench v3.0 أقل بوضوح من نتائجهما القريبة من 34%. وفوق ذلك، تأتي بعض أرقام المنافسين من بطاقات نماذج أو لوحات عامة تستخدم تعليمات وأدوات وقواعد توقف مختلفة. لذلك ينبغي فهم الفارق الصغير على أنه وجود في الفئة نفسها، لا قياس دقيق بالمسطرة.
وتستحق التجارب المبكرة اهتماماً أيضاً. فقد أبلغ بعض المطورين عن تعديلات أمنية خطرة أو سلوك غير موثوق بعد فشل المحاولة. هذه شهادات فردية وليست قياساً لمعدل الحدوث، لكنها تصف نوعاً من الأخطاء قد يخفيه متوسط الاختبار. المسار الحكيم هو تشغيل الوكيل في صندوق معزول، ومنحه الحد الأدنى من بيانات الاعتماد، وطلب تغييرات صغيرة، وفحص الفروق، وإبقاء الاختبارات والموافقة البشرية ضمن العملية. يستطيع سياق 500K حمل مشروع كامل، لكنه لا يضمن أن يلاحظ النموذج الحقيقة الحاسمة أو ينسب المصدر بصورة صحيحة.
لذلك ليست الخلاصة العملية «ثق بـGrok أكثر»، بل «يمكنك تحمّل كلفة التحقق من Grok بصورة أفضل». تقيس Artificial Analysis نحو 0.84 دولار للمهمة، مما يجعل الجولة الثانية أو تدقيق المصدر أو الاستعانة بنموذج مراجع أمراً منطقياً اقتصادياً. للبحث والتحليل ووثائق العمل والمهام الوكيلية الطويلة، أصبح Grok 4.6 خياراً حقيقياً في القمة مع أفضلية سعرية. وحين تؤثر النتيجة في المال أو السمعة أو الإنتاج، يجب أن يبقى الإنسان عند البوابة.