الترتيب #2 البرمجة — ذكاء اصطناعي يكتب شيفرة إنتاجية
Anthropic

Claude Opus 5

مبرمج حدودي عملي: يجمع Opus 5 حُسن تقدير قريباً من Fable مع سعر Opus وتحقق صبور على نحو لافت. يحتل المركز #2 لأنه يتصدر Frontier-Bench، ويكاد يعادل Fable 5 في CursorBench، ويكلف نصف السعر لكل رمز.

تم التحديث 25 يوليو 2026 Agentic CodingFrontier-Bench SOTARoot-Cause Debugging
الأفضل لـ

مبرمج حدودي عملي: يجمع Opus 5 حُسن تقدير قريباً من Fable مع سعر Opus وتحقق صبور على نحو لافت. يحتل المركز #2 لأنه يتصدر Frontier-Bench، ويكاد يعادل Fable 5 في CursorBench، ويكلف نصف السعر لكل رمز.

لماذا تفوز

43.3% في Frontier-Bench v0.1، مقابل 34.4% لـ GPT-5.6 Sol و33.7% لـ Fable 5. عند max يبتعد 0.5 نقطة فقط عن ذروة Fable في CursorBench 3.2 بنصف تكلفة المهمة. DeepSWE 68.8% وFrontierCode 53.4% وسياق 1M وإخراج 128k وتسعير $5/$25.

انتبه إلى

ليس بطلاً مطلقاً: يقود Sol اختباري DeepSWE وTerminal-Bench، وينهي المهمة أسرع وبتكلفة أقل في مقارنة Artificial Analysis الحالية، رغم تعادل النظامين عند 67 في Coding Agent Index. ويحافظ Fable على تقدم ضئيل في FrontierCode وCursorBench؛ أما البيانات المستقلة فما تزال حديثة وقد يكون max مسهباً.

01

ما هو في الواقع

تخيل عاملين أمام بقعة رطوبة على الجدار. يطلي الأول فوقها سريعاً ويغلق البلاغ. أما الثاني فيتتبع الأثر حتى الأنبوب المتسرب، ويصلحه، ثم يفحص الغرفة المجاورة. صُمم Claude Opus 5 ليبرمج بعقلية العامل الثاني.

لهذا فإن أهم رقم هو 43.3% في Frontier-Bench v0.1. يطلب التقييم من الوكيل حل أعمال هندسية غير مألوفة عبر الطرفية والأدوات. في مقارنة Anthropic سجل GPT-5.6 Sol نسبة 34.4%، وFable 5 نسبة 33.7%، وOpus 4.8 نسبة 21.1%. لا يستبدل Opus 5 الإصدار 4.8 فحسب، بل يضاعف نتيجته تقريباً.

يوضح مثال طبيعته. طُلب منه إعادة بناء قطعة ميكانيكية من رسم لا يستطيع رؤيته مباشرة، فكتب مسار رؤية حاسوبية، واستخرج الهندسة من البكسلات، وبنى القطعة في FreeCAD. وفي مهمة أخرى وجد السبب الجذري لخلل وحالة طرفية فاتت تصحيح المجتمع. هذه أمثلة من الشركة وليست قوانين كونية، لكنها تكشف الهدف: واصل التحقيق حتى تتفق الأدلة.

لماذا يتجاوز Fable 5

ما زال Fable يفوز ببعض صور خط النهاية: 53.5% مقابل 53.4% في FrontierCode ونحو نصف نقطة في أقصى CursorBench. لكن الترتيب قرار شراء، لا متحف للكسور العشرية. يكلف Opus 5 $5/$25 لكل مليون رمز، نصف Fable تماماً، ولا يفرض احتفاظاً عاماً بالبيانات، كما أن مصنفاته أقل تقييداً.

قدم Artificial Analysis أول إشارة مستقلة: 61 والمركز الأول عند max، و59 عند high و60 عند xhigh. لكن التحذير مهم: أنتج max رموزاً كثيرة جداً. قد يقدم نموذج بنصف السعر فاتورة كاملة إذا كتب رواية لإصلاح زر.

لماذا يفوته المركز #1 بفارق ضئيل

يتصدر GPT-5.6 Sol اختبار DeepSWE v1.1 بنسبة 72.7%، أمام Fable عند 69.7% وOpus 5 عند 68.8%. لكن المقارنة المباشرة الحالية من Artificial Analysis تمنح Claude Code مع Opus 5 وCodex مع GPT-5.6 Sol الدرجة نفسها، 67، في Coding Agent Index العام. وتفيد التفاصيل أكثر من التعادل: يفوز GPT في DeepSWE وTerminal-Bench وينهي المهام أسرع وبتكلفة أقل، بينما يفوز Opus في اختبار فهم المستودع. لذلك يحصل GPT-5.6 على المركز الأول بفاصل الكفاءة والعمل الطرفي، لا لأنه يتفوق بوضوح على Opus 5 في كل أعمال البرمجة.

التوجيه العملي: Opus 5 للخلل الغامض وتحليل السبب والتغيير متعدد الملفات والتحقق البصري؛ Sol لأصعب ماراثون طرفية؛ Fable فقط عندما تبرر أفضليته الصغيرة ضعف السعر.

يحافظ الانتقال على سياق 1M وإخراج 128k والرؤية وPDF والتخزين المؤقت والدُفعات والأدوات. التفكير التكيفي يعمل افتراضياً. يغيب فقط web fetch وPriority Tier. يستبدل Opus 5 إصدار 4.8 بالكامل ويجعل تبرير Fable للحجم اليومي أصعب بكثير.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • صدارة Frontier-Bench: يحقق 43.3% مقابل 34.4% لـ Sol و33.7% لـ Fable و21.1% لـ Opus 4.8. يكافئ الاختبار وكيلاً يعمل في الطرفية ويستخدم الأدوات وينهي مهمة هندسية غير مألوفة.
  • يتحقق قبل الاحتفال: وجد الأسباب الجذرية، وبنى منصة اختبار حين لم تتوفر بيانات حية، وفحص الواجهات على الحاسوب والهاتف قبل إعلان اكتمالها.
  • قريب من Fable بنصف السعر: يفصله 0.5 نقطة عن ذروة CursorBench، بينما تكلف الرموز $5/$25 بدلاً من $10/$50.
  • المستودع كله على الطاولة: سياق 1M افتراضي وإخراج 128k، مع ثبات التعليمات والأدوات والاستدلال عبر السياق الطويل.
  • متاح حيث تعمل الفرق: claude-opus-5 في Claude Code وAPI وBedrock وVertex AI وMicrosoft Foundry؛ وضع Fast أسرع نحو 2.5× بسعر مضاعف.

قيود صادقة

  • مسارات مهمة ما زالت لـ GPT-5.6: يسجل Opus 68.8% في DeepSWE مقابل 72.7% لـ Sol. وفي المقارنة المباشرة من Artificial Analysis يتعادلان 67 مقابل 67 إجمالاً، لكن GPT-5.6 يفوز في DeepSWE وTerminal-Bench وينهي المهام أسرع وبتكلفة أقل. وهذه الكفاءة هي فاصلنا الضيق للمركز #1.
  • يحتفظ Fable بقمم ضيقة: 53.5% مقابل 53.4% في FrontierCode وحد أقصى أعلى قليلاً في CursorBench.
  • قد يلتهم max التوفير: قاس Artificial Analysis إخراجاً غزيراً جداً. لا يفيد الرمز الأرخص إن استهلك الوكيل ضعفي العدد.
  • عقبتان في الترحيل: لا web fetch ولا Priority Tier؛ التفكير يعمل افتراضياً، ومعلمات sampling المخصصة مرفوضة، ويجب إعادة اختبار الميزانيات.
  • حدود الأمان واضحة: يستطيع كشف ثغرات المصدر، لكنه يحجب اختبار الاختراق وتوليد الاستغلال وفحص الملفات الثنائية خارج البرامج المعتمدة.
03

لمحة عن المعايير

Frontier-Bench v0.1 — 43.3% (#1)

تشغيل Anthropic باستخدام mini-SWE-agent وخمس محاولات لكل مهمة؛ أمام Sol (34.4%) وFable 5 (33.7%).

CursorBench 3.2 — بفارق 0.5 نقطة عن Fable 5

شبه تعادل عند max بنصف التكلفة؛ ينبه Cursor إلى أن الفروق الصغيرة قد لا تكون ذات دلالة إحصائية.

DeepSWE v1.1 — 68.8%

قوي في عمل المستودعات الطويل، لكنه خلف Fable 5 (69.7%) وSol (72.7%).

FrontierCode 1.1 Main — 53.4%

تعادل عملي مع Fable 5 (53.5%) وتقدم على Sol (47.5%).

Artificial Analysis Intelligence Index — 61 (#1)

نتيجة مستقلة مبكرة عبر تسعة اختبارات؛ تؤيد القدرة وتحذر أيضاً من استهلاك الرموز.

04

الحكم

Claude Opus 5 هو #2 للبرمجة لدينا: أعلى من Fable 5 ومتعادل عملياً مع GPT-5.6 في القدرة العامة على البرمجة. يفوز Opus في Frontier-Bench واختبار فهم المستودعات، ويكاد يعادل قمم Fable ويكلف نصفه. ويحسم GPT-5.6 فاصلنا الضيق بفضل DeepSWE وTerminal-Bench وإنهاء المهام بسرعة أكبر وتكلفة أقل. ابدأ بـ Opus 5 للمهمة الغامضة متعددة الملفات التي تحتاج حكماً وتحققاً.

05

الأسئلة الشائعة