الترتيب #1 المنظومة اليومية — مساعدات الذكاء الاصطناعي الرائدة
Anthropic

Claude — Opus 5

القائد الجديد للذكاء اليومي: ينقل Opus 5 حكماً قريباً من Fable إلى نموذج يستطيع الأفراد والشركات استخدامه على نطاق واسع. يتصدر الاختبارات المستقلة المبكرة، ويكلف نصف Fable 5، ويتوفر على نطاق واسع.

تم التحديث 25 يوليو 2026 Knowledge Work SOTA1M ContextReasoning
الأفضل لـ

القائد الجديد للذكاء اليومي: ينقل Opus 5 حكماً قريباً من Fable إلى نموذج يستطيع الأفراد والشركات استخدامه على نطاق واسع. يتصدر الاختبارات المستقلة المبكرة، ويكلف نصف Fable 5، ويتوفر على نطاق واسع.

لماذا تفوز

GDPval-AA v2 Elo 1861 وARC-AGI-3 بنسبة 30.2% وBrowseComp 90.8% وOSWorld 2.0 بنسبة 70.6% وAutomationBench 26.0% وHLE مع الأدوات 64.7%. يمنحه Artificial Analysis درجة 61 و#1 عند max. سياق 1M وإخراج 128k وسعر $5/$25 بلا شرط احتفاظ عام.

انتبه إلى

التاج مؤقت: البيانات المستقلة أقل من 48 ساعة. يفوز Fable باختبارات تخصصية، ويظل GPT-5.6 أكبر منظومة للمستهلك، ولا يولد Claude الصور. max بطيء ومسهب، وحدود الخطط ما زالت مهمة.

01

ما هو في الواقع

تشبه روبوتات محادثة كثيرة متدرباً لامعاً في صباح اثنين مزدحم: سريعاً ومتحمساً، وقادراً تماماً على تسليم جدول أنيق بينما مجموعه النهائي خاطئ من دون أن يلحظ أحد. أما Claude Opus 5 فيشبه زميلاً يعيد فحص الصيغ قبل الضغط على «إرسال».

هذا الحكم يدفعه مباشرة إلى المركز اليومي #1. تمنحه مقارنة Anthropic 1861 Elo في GDPval-AA v2، وهو تقييم لمهام مهنية مفيدة. يسجل Fable 5 مقدار 1747، وGPT-5.6 Sol مقدار 1736، وOpus 4.8 مقدار 1593. أبلغت Box عن تحسن عام 8% مقابل 4.8، مع مكاسب أكبر في تحليل البيانات والعناية الواجبة. ورأى عميل مالي دقة أعلى بتسع نقاط، وخطوات أقل، ووقتاً أقل 60%. إنها تقارير مبكرة، لكنها ترسم شكلاً واحداً: عناية أكبر ودوران أقل.

أكثر من آلة كاتبة قارئة

يسجل Opus 5 70.6% في OSWorld 2.0 حيث ينبغي استخدام الحاسوب فعلياً، و26.0% في AutomationBench، أي نحو مرة ونصف النتيجة التالية. وتفيد Zapier بأن Opus 5 أكمل مساراً كاملاً للاحتفاظ بالعملاء: قرأ مؤشرات سلامة الحسابات، وحدد العملاء المعرضين للمغادرة، ونبّه المسؤولين عن تلك الحسابات، ثم أعد ملخصاً. أما النماذج السابقة فلم تستطع إتمام السلسلة كلها.

الرقم الأغرب هو 30.2% في ARC-AGI-3. يختبر تعلم مسائل تفاعلية مجهولة، أقرب إلى اكتشاف قواعد لعبة جديدة منه إلى تذكر حقيقة. سجل Sol نسبة 7.8%. الاختبار ليس روحاً، لكنه يشير إلى موهبة حين تتوقف التعليمات عن إمساك اليد.

يؤيد Artificial Analysis الاتجاه: 61 والمركز الأول عند max، و59 عند high و60 عند xhigh. يمكنك شراء تفكير أكثر لعقد أو نموذج مالي، ثم خفض القرص لمسودة عادية.

لماذا يتجاوز Fable 5

ما زال Fable أفضل قليلاً في HLE بلا أدوات وFrontierCode وأقصى CursorBench واختبار قانوني. إن كانت اختباراتك الخاصة تشبه ذلك فاستخدمه. لكنه يكلف $10/$50، بينما يكلف Opus 5 $5/$25 بلا احتفاظ عام وبمصنفات أقل تقييداً. Fable نموذج سباق أولي؛ Opus 5 سيارة طريق تكاد تساويه سرعة، بنصف الوقود ومسموح لها على طرق أكثر.

يبقى GPT-5.6 نظاماً عاماً ممتازاً. يجمع ChatGPT Work وCodex والصور وSites والتطبيقات والمتصفح والحاسوب. لا ينشئ Claude الصور وقد تكون حدوده أضيق. يقول ترتيبنا إن Opus 5 يقدم أفضل مزيج حالي من الحكم والعمل الاحترافي والسعر والتوفر، لا إن على الجميع إلغاء ChatGPT.

تضم طاولة العمل سياق 1M وإخراج 128k ورؤية وPDF وملفات وذاكرة وبحث ويب واستخدام الحاسوب. لكن البيانات المستقلة فتية، وmax مسهب، وweb fetch وPriority Tier غائبان. Opus 5 ليس Fable رخيصاً؛ بل قرار يومي أفضل.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • العمل المعرفي هو العنوان: 1861 Elo في GDPval-AA v2، أمام Fable 5 (1747) وSol (1736)، مع مكاسب مبكرة في المال والقانون والجداول والعناية الواجبة.
  • يعمل ولا يكتفي بالإجابة: 70.6% في OSWorld 2.0 و26.0% في AutomationBench يتصدران استخدام البرامج ومسارات الأعمال.
  • قوي أمام المسائل الجديدة: 30.2% في ARC-AGI-3، قرابة أربعة أضعاف Sol (7.8%)، ويضعه Artificial Analysis أولاً عند 61.
  • جودة Fable بلا ضريبة Fable: سعر $5/$25، أي النصف، بلا احتفاظ عام وبمصنفات أقل تدخلاً.
  • مساحة عمل احترافية: سياق 1M وإخراج 128k وفهم وثائق وجداول معقدة وعروض وبحث ويب وملفات وPDF وذاكرة واستخدام الحاسوب.

قيود صادقة

  • تاج أسبوع الإطلاق: أغلب المقارنات الفردية من Anthropic؛ مؤشر مستقل واحد ليس حكماً أبدياً.
  • ChatGPT يبقى المنصة الأكبر: يفتقر Claude إلى توليد الصور وإلى جمع Work وCodex وSites والإضافات والمتصفح وسطح المكتب.
  • يحافظ Fable على انتصارات تخصصية: HLE بلا أدوات وFrontierCode وCursorBench والقانون؛ ويبقى Mythos أقوى في الهجوم السيبراني والبيولوجيا الذاتية.
  • max جائع: الإسهاب مرتفع وتأخر xhigh ملحوظ. قارن تكلفة المهمة المنجزة لا قائمة سعر الرمز.
  • تحتاج التكاملات إلى ضبط: لا web fetch ولا Priority Tier، والتفكير يعمل، وsampling محدود، وقد توقف حدود الخطة عملاً طويلاً.
03

لمحة عن المعايير

GDPval-AA v2 — 1861 Elo (#1)

أمام Fable 5 (1747) وSol (1736) وOpus 4.8 (1593) في العمل المهني.

ARC-AGI-3 — 30.2% (#1)

مسائل تفاعلية جديدة: قرابة أربعة أضعاف Sol (7.8%) وفوق 4.8 (1.5%) بكثير.

OSWorld 2.0 — 70.6% (#1)

استخدام تطبيقات سطح المكتب، أمام Fable 5 (66.1%) وSol (62.6%).

AutomationBench — 26.0% (#1)

مسارات أعمال مكتملة، نحو 1.5× نتيجة Fable 5 (17.4%).

Artificial Analysis Intelligence Index — 61 (#1)

مؤشر مستقل من تسعة اختبارات؛ high 59 وxhigh 60، مع استهلاك كبير للرموز عند max.

04

الحكم

يأخذ Claude Opus 5 مركزنا اليومي #1، بفارق صغير عن GPT-5.6 وواضح عن Fable 5. يقود المزيج الأهم من العمل المهني والمسائل الجديدة والبحث والحاسوب والأتمتة، بنصف سعر Fable وقيود أقل.

05

الأسئلة الشائعة