الترتيب #6 المنظومة اليومية — مساعدات الذكاء الاصطناعي الرائدة
xAI

Grok 4.6

يحوّل Grok 4.6 قصة السعر لدى xAI إلى قصة منافسة في القمة: 61 نقطة لدى Artificial Analysis، وأداء قوي في العمل الوكيلي طويل المدى، مع بقاء سعر الواجهة $2/$6.

تم التحديث 14 أغسطس 2026 AgenticKnowledge WorkOffice
الأفضل لـ

يحوّل Grok 4.6 قصة السعر لدى xAI إلى قصة منافسة في القمة: 61 نقطة لدى Artificial Analysis، وأداء قوي في العمل الوكيلي طويل المدى، مع بقاء سعر الواجهة $2/$6.

لماذا تفوز

سجّل Artificial Analysis عدد 61 نقطة، بزيادة خمس نقاط على Grok 4.5، وكلفة $0.84 للمهمة، و1753 Elo في GDPVal-AA v2 و1577 في AA-Briefcase. ويقدم سياق 500K عبر Grok Build وCursor والواجهة وOpenRouter وVercel وCloudflare.

انتبه إلى

أوضح المكاسب في العمل المعرفي الوكيلي، لا في اكتساح البرمجة أو المحادثة. تستخدم المقارنات بيئات تشغيل مختلفة، كما أن تقارير الأمان المبكرة تستدعي صندوقاً معزولاً وصلاحيات ضيقة ومراجعة بشرية.

01

ما هو في الواقع

لسنوات اتبع الذكاء الاصطناعي المتقدم قاعدة المطاعم: كلما بدت القائمة أفخم، وجب أن تراقب الفاتورة بعناية أكبر. يكسر Grok 4.6 هذه القاعدة. فقد حصل على 61 نقطة في مؤشر الذكاء لدى Artificial Analysis، وتعادل مع GPT-5.6 Sol، ولم يتأخر إلا عن أعلى إعدادات Opus 5 وFable 5. ومع ذلك بقي السعر القياسي عند دولارين لكل مليون رمز إدخال وستة دولارات لكل مليون رمز إخراج. هذه المرة لم تأتِ زيادة القدرة مع فاتورة فاخرة جديدة.

تظهر القصة الأهم أسفل النتيجة المركبة. في GDPVal-AA v2، الذي يختبر العمل المهني الذي ينفذه الوكيل، حقق Grok عدد 1753 Elo. وفي AA-Briefcase، المخصص لمهام طويلة تشمل البحث والتحليل وإنتاج مادة نهائية، حقق 1577 Elo. رصدت Artificial Analysis في المتوسط نحو 53 جولة و0.5 مليار رمز إدخال لكل مهمة. أما Opus 5 max فاحتاج إلى قرابة 103 جولات وملياري رمز. تخيل فريقين يقدمان تقريرين متقاربين في الجودة، لكن أحدهما يعقد نصف الاجتماعات ويعيد قراءة ربع الملفات فقط. تقلل هذه الكفاءة الكلفة، وتقلل كذلك عدد الفرص التي قد ينسى فيها الوكيل الهدف الأصلي أثناء المسار الطويل.

درّبت xAI النموذج مباشرة على هذا النوع من الاستمرار. يصف الإعلان مرحلة تدريب إضافية أطول، وإعادة إنشاء مسارات للاستدلال والبرمجة، ثم تعلماً معززاً في العمل المعرفي والبرمجة العامة وتطوير الويب والتصميم بمساعدة الحاسوب وبيئات أخرى تستخدم الأدوات. لدى النموذج سياق يبلغ 500 ألف رمز ومستويات استدلال low وmedium وhigh وxhigh. وهو متاح في Grok Build وCursor وواجهة xAI وOpenRouter وVercel وCloudflare. توجد نسخة أسرع تقلل زمن الانتظار، لكنها تضاعف سعر الرمز.

لا تعني هذه الأرقام انتصاراً شاملاً. أوضح دليل لدى Grok يتعلق بالعمل المعرفي الوكيلي. ففي جدول xAI، بقيت نتيجته 65.9% في DeepSWE v1.1 دون GPT-5.6 Sol وFable 5، كما أن 26% في Terminal-Bench v3.0 أقل بوضوح من نتائجهما القريبة من 34%. وفوق ذلك، تأتي بعض أرقام المنافسين من بطاقات نماذج أو لوحات عامة تستخدم تعليمات وأدوات وقواعد توقف مختلفة. لذلك ينبغي فهم الفارق الصغير على أنه وجود في الفئة نفسها، لا قياس دقيق بالمسطرة.

وتستحق التجارب المبكرة اهتماماً أيضاً. فقد أبلغ بعض المطورين عن تعديلات أمنية خطرة أو سلوك غير موثوق بعد فشل المحاولة. هذه شهادات فردية وليست قياساً لمعدل الحدوث، لكنها تصف نوعاً من الأخطاء قد يخفيه متوسط الاختبار. المسار الحكيم هو تشغيل الوكيل في صندوق معزول، ومنحه الحد الأدنى من بيانات الاعتماد، وطلب تغييرات صغيرة، وفحص الفروق، وإبقاء الاختبارات والموافقة البشرية ضمن العملية. يستطيع سياق 500K حمل مشروع كامل، لكنه لا يضمن أن يلاحظ النموذج الحقيقة الحاسمة أو ينسب المصدر بصورة صحيحة.

لذلك ليست الخلاصة العملية «ثق بـGrok أكثر»، بل «يمكنك تحمّل كلفة التحقق من Grok بصورة أفضل». تقيس Artificial Analysis نحو 0.84 دولار للمهمة، مما يجعل الجولة الثانية أو تدقيق المصدر أو الاستعانة بنموذج مراجع أمراً منطقياً اقتصادياً. للبحث والتحليل ووثائق العمل والمهام الوكيلية الطويلة، أصبح Grok 4.6 خياراً حقيقياً في القمة مع أفضلية سعرية. وحين تؤثر النتيجة في المال أو السمعة أو الإنتاج، يجب أن يبقى الإنسان عند البوابة.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • عودة إلى القمة: منحه Artificial Analysis عدد 61 نقطة في مؤشر من تسعة اختبارات؛ بالتساوي مع GPT-5.6 Sol، وبزيادة خمس نقاط على Grok 4.5، ودون أعلى إعدادات Opus 5 وFable 5.
  • العمل الطويل هو العنوان: 1753 Elo في GDPVal-AA v2 و1577 في AA-Briefcase يدعمان العمل المهني، كما تنشر xAI نتيجة 15.8% في Harvey LAB وهي الأفضل في الجدول.
  • كفاءة عملية: نحو 53 جولة و0.5 مليار رمز إدخال لمهمة Briefcase، مقابل 103 جولات و2.0 مليار لدى Opus 5 max؛ وتقع كلفة 0.84 دولار للمهمة على حد باريتو بين الذكاء والسعر.
  • السعر لم يرتفع: $2/$6 لكل مليون رمز، والإدخال المخزن $0.50؛ النسخة السريعة بضعف السعر.
  • توافر واسع: Grok Build وCursor وواجهة xAI وOpenRouter وVercel وCloudflare، مع سياق 500K.

قيود صادقة

  • صدارة البرمجة تعتمد على الاختبار: 65.9% في DeepSWE و26% في Terminal-Bench v3 دون أفضل النتائج المنشورة.
  • ليست كل الأرقام من مختبر واحد: اختلاف البطاقات ولوحات الصدارة وبيئات التشغيل يجعل الفروق الصغيرة غير حاسمة.
  • إشارات الأمان المبكرة مهمة: أبلغ مستخدمون عن تعديلات خطرة وسوء التعامل مع الفشل.
  • تفضيل المحادثة العامة أبطأ: الإشارة المبكرة أقوى في الوكلاء وتطوير الويب من النص العام.
  • سياق 500K لا يضمن الحقيقة: تظل المصادر ونقاط التحقق ومعايير القبول ضرورية.
03

لمحة عن المعايير

Artificial Analysis Intelligence Index — 61

مؤشر مستقل مركب من تسعة اختبارات، بالتساوي مع GPT-5.6 Sol.

GDPVal-AA v2 — 1753 Elo

نتيجة بارزة في العمل المهني الوكيلي.

AA-Briefcase — 1577 Elo

جودة قريبة من Fable بجولات ورموز أقل كثيراً من Opus 5 max.

الكلفة المقاسة — $0.84 للمهمة

حساب Artificial Analysis من الاستهلاك المرصود وسعر $2/$6.

04

الحكم

Grok 4.6 من أقوى خيارات السعر مقابل الأداء للعمل المعرفي الوكيلي: ذكاء مستقل في القمة، وكفاءة ممتازة في المهام الطويلة، وتوافر كافٍ لتجربته من دون إعادة بناء المنصة. لا يفوز بكل اختبار برمجي ولا يلغي مخاطر القرارات المهمة. استخدمه كوكيل مشروع يستطيع تحمل جولة أخرى، وضيّق صلاحياته، واجعل التحقق جزءاً ثابتاً من المهمة.

05

الأسئلة الشائعة