الترتيب #1 المنظومة اليومية — مساعدات الذكاء الاصطناعي الرائدة
Anthropic

Claude — Opus 5

القائد الجديد للذكاء اليومي: ينقل Opus 5 حكماً قريباً من Fable إلى نموذج يستطيع الأفراد والشركات تشغيله فعلياً على نطاق واسع. يتصدر اختبارات الذكاء المستقلة المبكرة، ويقود مقارنات Anthropic للعمل المعرفي واستخدام الحاسوب، ويكلف نصف Fable 5، ويتوفر على نطاق واسع عبر Claude والمنصات السحابية وواجهة API.

تم التحديث 29 أغسطس 2026 Knowledge Work SOTA1M ContextReasoning
الأفضل لـ

القائد الجديد للذكاء اليومي: ينقل Opus 5 حكماً قريباً من Fable إلى نموذج يستطيع الأفراد والشركات تشغيله فعلياً على نطاق واسع. يتصدر اختبارات الذكاء المستقلة المبكرة، ويقود مقارنات Anthropic للعمل المعرفي واستخدام الحاسوب، ويكلف نصف Fable 5، ويتوفر على نطاق واسع عبر Claude والمنصات السحابية وواجهة API.

لماذا تفوز

بلغ عند الإطلاق 1861 Elo في GDPval-AA v2، و30.2% في ARC-AGI-3، و70.6% في OSWorld 2.0، و64.7% في Humanity's Last Exam بمساعدة الأدوات. ويمنح Artificial Analysis v4.1.1 الآن جهد max نحو 63 والمركز #1 إجمالاً. كما يوفر Opus سياق 1M وإخراج 128K وتسعير $5/$25.

انتبه إلى

ما يزال Fable 5 يفوز ببعض التقييمات التخصصية، ويبقى GPT-5.6 منظومة المستهلك الأوسع، ولا يملك Opus 5 توليد صور أصلياً. جهد max بطيء ومسهب، وتتغير قيم Elo الحية، وما تزال حدود الاستخدام في خطط Claude المجانية والمدفوعة مهمة.

01

ما هو في الواقع

تشبه روبوتات محادثة كثيرة متدرباً لامعاً في صباح اثنين مزدحم: سريعاً ومتحمساً، وقادراً تماماً على تسليم جدول أنيق بينما مجموعه النهائي خاطئ من دون أن يلحظ أحد. أما Claude Opus 5 فيشبه زميلاً يعيد فحص الصيغ قبل الضغط على «إرسال».

هذا الحكم يدفعه مباشرة إلى المركز اليومي #1. تمنحه مقارنة Anthropic 1861 Elo في GDPval-AA v2، وهو تقييم لمهام مهنية مفيدة. يسجل Fable 5 مقدار 1747، وGPT-5.6 Sol مقدار 1736، وOpus 4.8 مقدار 1593. أبلغت Box عن تحسن عام 8% مقابل 4.8، مع مكاسب أكبر في تحليل البيانات والعناية الواجبة. ورأى عميل مالي دقة أعلى بتسع نقاط، وخطوات أقل، ووقتاً أقل 60%. إنها تقارير مبكرة، لكنها ترسم شكلاً واحداً: عناية أكبر ودوران أقل.

أكثر من آلة كاتبة قارئة

يسجل Opus 5 70.6% في OSWorld 2.0 حيث ينبغي استخدام الحاسوب فعلياً، و26.0% في AutomationBench، أي نحو مرة ونصف النتيجة التالية. وتفيد Zapier بأن Opus 5 أكمل مساراً كاملاً للاحتفاظ بالعملاء: قرأ مؤشرات سلامة الحسابات، وحدد العملاء المعرضين للمغادرة، ونبّه المسؤولين عن تلك الحسابات، ثم أعد ملخصاً. أما النماذج السابقة فلم تستطع إتمام السلسلة كلها.

الرقم الأغرب هو 30.2% في ARC-AGI-3. يختبر تعلم مسائل تفاعلية مجهولة، أقرب إلى اكتشاف قواعد لعبة جديدة منه إلى تذكر حقيقة. سجل Sol نسبة 7.8%. الاختبار ليس روحاً، لكنه يشير إلى موهبة حين تتوقف التعليمات عن إمساك اليد.

بات الاختبار المستقل يؤيد أكثر من مجرد اتجاه الإطلاق. يمنح Artificial Analysis v4.1.1 جهد max في Opus 5 نحو 63، والمركز الأول حالياً على Intelligence Index. يتغير السلم الدقيق مع تطور التقييم، ولذلك ينبغي وضع رقم الإصدار وتاريخ الاطلاع بجوار النتيجة.

لماذا يتجاوز Fable 5

ما زال Fable أفضل قليلاً في بضعة مواضع ضيقة: Humanity’s Last Exam بلا أدوات، وFrontierCode، وأعلى إعداد في CursorBench، واختبار لوكيل قانوني محجوب. إن كانت اختباراتك الخاصة تشبه أحد هذه المسارات، فاستخدمه. لكن Fable يكلف $10/$50 لكل مليون توكن إدخال/إخراج. أما Opus 5 فيكلف $5/$25، ولا يفرض شرطاً عاماً للاحتفاظ بالبيانات، ويُتوقع أن تتدخل مصنفات الأمان لديه بوتيرة أقل بكثير.

فكر في Fable بوصفه نموذجاً أولياً لسيارة سباق، وفي Opus 5 بوصفه سيارة طريق تكاد تساويه سرعة، وتكلف نصف ما يكلفه تشغيلها، ويمكنها قانوناً أن تسير بعيداً خارج الحلبة. في العمل اليومي، سيارة الطريق هي الآلة الأكثر نفعاً.

لماذا يبقى ChatGPT في الحوار

يبقى GPT-5.6 نظاماً عاماً ممتازاً. يجمع ChatGPT بين Work وCodex وتوليد الصور وSites والتطبيقات المتصلة والمتصفح واستخدام حاسوب سطح المكتب في منظومة هائلة واحدة. لا ينشئ Claude الصور أصلياً، وقد تكون حدود خططه أضيق. يقول ترتيبنا إن Opus 5 يقدم أفضل مزيج حالي من جودة الاستدلال والعمل الاحترافي والسعر وقابلية النشر؛ ولا يقول إن على كل شخص إلغاء ChatGPT.

العتاد وراء طاولة العمل هذه كبير: سياق 1M افتراضياً، وإخراج أقصى 128k، ورؤية للرسوم والمستندات، وPDF وملفات وذاكرة وبحث ويب وأدوات واستخدام الحاسوب. معرّف النموذج في API هو claude-opus-5، وهو مدعوم على منصة Anthropic والمنصات السحابية الكبرى. يعمل وضع Fast بسرعة تقارب 2.5 مرة، مقابل ضعف سعر التوكن الأساسي.

وثمة تحفظات. ما تزال البيانات المستقلة حديثة، وقد يكون جهد max مسهباً، فيما يملك xhigh زمناً ملحوظاً حتى أول توكن. كما يغيب web fetch في API وPriority Tier عند الإطلاق. العادة المعقولة هي أن تبدأ بجهد أقل، وتتحقق من النتيجة، ولا ترفع الجهد إلا حين تصبح تكلفة الخطأ أكبر من تكلفة التفكير.

Opus 5 ليس مجرد Fable 5 أرخص، بل هو قرار المنتج اليومي الأفضل. إنه يستبدل Opus 4.8، ويفوز بعدد كاف من الاختبارات المهمة لمنافسة الحدود القصوى، ويجعل حُسن التقدير الدقيق للذكاء الاصطناعي في متناول عمل يوم ثلاثاء عادي—لا المشروع الوحيد المهم بما يكفي للحصول على شيك على بياض.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • العمل المعرفي هو العنوان: يصل Opus 5 إلى 1861 Elo في GDPval-AA v2 ضمن مقارنة إطلاق Anthropic، أمام Fable 5 عند 1747 وGPT-5.6 Sol عند 1736. ويبلغ عملاء مبكرون أيضاً عن أداء أقوى في المال والقانون والجداول والعناية الواجبة.
  • يستطيع العمل، لا الإجابة فحسب: يسجل النموذج 70.6% في OSWorld 2.0 و26.0% في AutomationBench، متصدراً النماذج المقارنة. هذا دليل على التنقل داخل البرمجيات وإتمام مسارات العمل التجارية، لا مجرد كتابة فقرة ذكية.
  • المسائل الجديدة نقطة قوة حقيقية: نتيجته البالغة 30.2% في ARC-AGI-3 تقارب أربعة أضعاف نتيجة GPT-5.6 Sol البالغة 7.8% في جدول Anthropic. ويضع Artificial Analysis الآن جهد max في المركز الأول على Intelligence Index الأوسع، عند نحو 63.
  • جودة شبيهة بـ Fable من دون ضريبته: سعر API هو $5/$25 لكل مليون توكن إدخال/إخراج—نصف سعر Fable 5. كما لا يفرض Opus 5 شرطاً عاماً للاحتفاظ بالبيانات، بينما قد يتطلب Fable قبول الاحتفاظ في بعض عمليات النشر.
  • مساحة عمل احترافية جادة: مليون توكن من السياق، وإخراج 128k، ورؤية قوية للمستندات والرسوم، والعمل في جداول متعددة الأوراق، وإنشاء العروض، وبحث الويب، والملفات وPDF والذاكرة واستخدام الحاسوب؛ كل ذلك يجعله مفيداً خارج المحادثة.

قيود صادقة

  • حتى التاج يحتاج تاريخاً: قدمت Anthropic معظم المقارنات الخاصة بالمهام، فيما تواصل قيم Elo وإصدارات المؤشرات المركبة الحية تغيرها. نتيجة Artificial Analysis في المركز #1 دليل مستقل قوي، وليست دستوراً دائماً.
  • يبقى ChatGPT منصة المستهلك الأكبر: يفتقر Claude إلى توليد الصور الأصلي، ولا يضاهي جمع ChatGPT بين Chat وWork وCodex وSites والإضافات والمتصفح وسطح المكتب. يتصدر Opus 5 تقييمنا للجودة والقيمة؛ لكن GPT-5.6 قد يبقى الاشتراك الواحد الأسهل.
  • يحافظ Fable على انتصارات تخصصية: يتقدم Fable 5 بفارق ضئيل في Humanity’s Last Exam بلا أدوات وFrontierCode وCursorBench واختبار Legal Agent Benchmark المحجوب؛ ويبقى Mythos أقوى في الهجوم السيبراني والبيولوجيا الذاتية.
  • الجهد الأقصى جائع: قاس Artificial Analysis جهد max على أنه شديد الإسهاب، فيما كان xhigh أبطأ من المتوسط. ابدأ بـ high أو xhigh فقط حين تستحق المهمة ذلك، وقارن التكلفة الكلية للمهمة المكتملة لا سعر التوكن في القائمة.
  • تحتاج بعض التكاملات إلى ضبط: يغيب web fetch في API وPriority Tier عند الإطلاق. يعمل التفكير افتراضياً، وتخضع عناصر تحكم sampling لقيود، وقد توقف حدود استخدام Claude مساراً طويلاً للمستهلك.
03

لمحة عن المعايير

GDPval-AA v2 — 1861 Elo (#1)

أمام Fable 5 (1747) وSol (1736) وOpus 4.8 (1593) في العمل المهني.

ARC-AGI-3 — 30.2% (#1)

مسائل تفاعلية جديدة: قرابة أربعة أضعاف Sol (7.8%) وفوق 4.8 (1.5%) بكثير.

OSWorld 2.0 — 70.6% (#1)

استخدام تطبيقات سطح المكتب، أمام Fable 5 (66.1%) وSol (62.6%).

AutomationBench — 26.0% (#1)

مسارات أعمال مكتملة، نحو 1.5× نتيجة Fable 5 (17.4%).

Artificial Analysis Intelligence Index — نحو 63 (#1)

مؤشر مستقل مركب حالي بإصدار v4.1.1 عند جهد max. أصبحت درجة أسبوع الإطلاق البالغة 61 قديمة؛ كما يستهلك max توكنات كثيرة، ولذلك يهم اختيار مستوى الجهد.

04

الحكم

يأخذ Claude Opus 5 مركزنا #1 في الذكاء اليومي، بفارق ضئيل عن GPT-6 Astra وواضح عن Fable 5. والسبب ليس أنه يفوز بكل امتحان، بل لأنه يتصدر المزيج الأكثر صلة من العمل المعرفي، وحل المسائل الجديدة، والبحث في المتصفح، واستخدام الحاسوب، وإتمام مسارات العمل، ثم يطلب نصف سعر Fable بقيود نشر أقل. اختر ChatGPT إذا كانت منظومة استهلاكية هائلة واحدة أهم؛ واختر Fable فقط لقمة ضيقة يسدد فيها تفوقه البسيط ثمن السعر المضاعف؛ واختر Opus 5 حين يكون العمل غامضاً وكثيف المستندات ومهماً بما يكفي ليستحق حُسن التقدير.

05

الأسئلة الشائعة