الترتيب #2 البرمجة — ذكاء اصطناعي يكتب شيفرة جاهزة للإنتاج
Anthropic

Claude Opus 5

مبرمج حدودي يتصدر الأدلة ويتحقق بصبر لافت. يبقى Opus 5 في مركزنا #2 فقط لأن هذا الدليل يمنح GPT-6 Astra فاصلاً تحريرياً معلناً لتكامل Codex، وكفاءة الطرفية واستخدام الحاسوب، وتكلفة المهمة المكتملة.

تم التحديث 29 أغسطس 2026 Agentic CodingFrontier-Bench SOTARoot-Cause Debugging
الأفضل لـ

مبرمج حدودي يتصدر الأدلة ويتحقق بصبر لافت. يبقى Opus 5 في مركزنا #2 فقط لأن هذا الدليل يمنح GPT-6 Astra فاصلاً تحريرياً معلناً لتكامل Codex، وكفاءة الطرفية واستخدام الحاسوب، وتكلفة المهمة المكتملة.

لماذا تفوز

وضعت بيانات فترة الإطلاق من Artificial Analysis لوكلاء البرمجة Opus عند نحو 78.0، أمام GPT-5.6 Sol بفارق ضئيل عند 77.4؛ وقد أُعيدت معايرة اللوحة مع إطلاق GPT-6 Astra في سبتمبر (Fable 5.1 نحو 70 وAstra 67)، فهذه الأجيال من الأرقام غير قابلة للمقارنة. وتسجل لوحة Terminal-Bench 3.0 العامة نحو 42.7%، بينما يبلغ Intelligence Index v4.1.1 نحو 63. ويحتفظ بسياق 1M وإخراج 128K وتسعير $5/$25.

انتبه إلى

مركزه #2 حكم تحريري على المنتج، لا ترتيب اللوحة الحية. ما يزال GPT-6 Astra يتصدر Terminal-Bench وDeepSWE ومساري العلوم وSRE، بينما قد يكون Opus عند جهد max مسهباً وأبطأ. درجات إطلاق Anthropic واللوحات العامة الحالية لقطات مترابطة، لكنها ليست أرقاماً قابلة للتبادل.

01

ما هو في الواقع

تخيل عاملين أمام بقعة رطوبة على الجدار. يطلي الأول فوقها سريعاً ويغلق البلاغ. أما الثاني فيتتبع الأثر حتى الأنبوب المتسرب، ويصلحه، ثم يفحص الغرفة المجاورة. صُمم Claude Opus 5 ليبرمج بعقلية العامل الثاني.

يسمى تقييم الإطلاق هذا الآن Terminal-Bench 3.0. أعلنت Anthropic في الأصل نتيجة 43.3%؛ أما اللوحة العامة الحالية فتظهر نحو 42.7% لـ Opus 5 و34.6% لإعداد GPT-5.6 Sol المذكور. تختلف اللقطتان قليلاً، لكن كلتيهما تؤيدان الدرس نفسه: Opus بارع على نحو غير معتاد في أعمال الطرفية غير المألوفة.

يوضح مثال طبيعته. طُلب منه إعادة بناء قطعة ميكانيكية من رسم لا يستطيع رؤيته مباشرة، فكتب مسار رؤية حاسوبية، واستخرج الهندسة من البكسلات، وبنى القطعة في FreeCAD. وفي مهمة أخرى وجد السبب الجذري لخلل وحالة طرفية فاتت تصحيح المجتمع. هذه أمثلة من الشركة وليست قوانين كونية، لكنها تكشف الهدف: واصل التحقيق حتى تتفق الأدلة.

لماذا يتجاوز Fable 5

ما زال Fable يفوز ببعض صور خط النهاية: 53.5% مقابل 53.4% في FrontierCode ونحو نصف نقطة في أقصى CursorBench. لكن الترتيب قرار شراء، لا متحف للكسور العشرية. يكلف Opus 5 $5/$25 لكل مليون رمز، نصف Fable تماماً، ولا يفرض احتفاظاً عاماً بالبيانات، كما أن مصنفاته أقل تقييداً.

ازدادت قوة الإشارة المستقلة. يمنح Artificial Analysis v4.1.1 نموذج Opus 5 نحو 63 والمركز الأول في Intelligence Index، بينما يبلغ Coding Agent Index الخاص به نحو 78.0. وما يزال التحذير نفسه قائماً في الاختبار: قد يولد جهد max عدداً كبيراً جداً من التوكنات.

لماذا يفوته المركز #1 بفارق ضئيل

يتصدر GPT-6 Astra اختبار DeepSWE v1.1 بنسبة 74.1%، أمام Opus 5 عند 73.7% في جداول سبتمبر، يضاف إليها 57.9% في Terminal-Bench 4.0 وأفضل استخدام للحاسوب في السوق. أعادت Artificial Analysis معايرة لوحتها لوكلاء البرمجة عند إطلاق Astra (Fable 5.1 نحو 70 وAstra 67)، فأرقام حقبة Opus القديمة ليست خانات قابلة للمقارنة. وما يزال مركزنا #1 من نصيب Astra بفاصل يوازن Codex والكفاءة وقيمة التنفيذ—لا لأنه يتفوق بوضوح على Opus في البرمجة.

لذلك وجّه العمل بحسب المهمة:

المهمة أفضل نقطة بداية
خلل غامض، أو بحث عن السبب الجذري، أو تغيير متعدد الملفات، أو تحقق بصري لواجهة Opus 5
عمل كثيف في الطرفية تكون فيه السرعة وتكلفة المهمة المكتملة والتنفيذ أهم GPT-6 Astra
مهمة عند ذروة CursorBench أو FrontierCode والميزانية فيها ثانوية Fable 5
تذاكر عادية بسقف تكلفة صارم ابدأ بجهد أقل ثم صعّد عند الحاجة

مسار الترقية العملي رحيم على نحو غير معتاد. يحتفظ Opus 5 بسياق 1M وإخراج أقصى 128k والرؤية وملفات PDF والتخزين المؤقت للمطالبات والمعالجة بالدفعات وأدوات Claude. يعمل التفكير تكيفياً وافتراضياً، وتتدرج مستويات الجهد من low إلى max. يُفترض أن تنتقل معظم مطالبات Opus 4.8، لكن على المطورين الانتباه إلى أن web fetch في API وPriority Tier غير متاحين عند الإطلاق.

الخلاصة بسيطة: يستبدل Opus 5 إصدار Opus 4.8 بالكامل، ويجعل تبرير Fable 5 لأحجام الإنتاج اليومية أصعب. يبقى Fable الاختصاصي المكلف صاحب بعض الانتصارات الضيقة. أما Opus 5 فهو النموذج الذي تستطيع إتاحته لمهندسين أكثر، ولمهام أكثر، ولمدة أطول—مع القدرة على تحمل تكلفة دورة التحقق التي تمنح حكمه قيمته.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • صدارة Terminal-Bench 3.0: يسجل المعيار الذي قُدم أولاً باسم Frontier-Bench الآن نحو 42.7% لـ Opus 5 على لوحته العامة، أمام إعداد GPT-5.6 Sol المذكور عند 34.6%. وهو يكافئ الوكيل القادر على العمل داخل الطرفية وإنهاء مهمة هندسية غير مألوفة.
  • يتحقق قبل الاحتفال: في أمثلة Anthropic، وجد Opus 5 الأسباب الجذرية التي لم يعالجها نموذج آخر إلا سطحيًا، وبنى منصة اختبار خاصة به حين لم تتوفر تغذية بيانات حية، وفحص واجهات الويب بعرض سطح المكتب والهاتف قبل إعلان اكتمالها.
  • برمجة قريبة من Fable بنصف سعر التوكن: عند الجهد الأقصى (max effort) يقترب بفارق 0.5 نقطة مئوية من ذروة نتيجة Fable 5 في CursorBench 3.2، وفقًا لـ Anthropic، بينما تكلف توكنات الإدخال والإخراج $5/$25 بدلاً من $10/$50.
  • المستودع بأكمله يتسع على المكتب: نافذة السياق بحجم 1M توكن هي الافتراضية، والحد الأقصى للإخراج هو 128k، وتقول Anthropic إن اتباع التعليمات واستخدام الأدوات والاستدلال تبقى متسقة عبر السياق الطويل. هذا أمر بالغ الأهمية لعمليات الترحيل والتحقيقات متعددة الملفات.
  • متاح حيث تبني الفرق بالفعل: مُعرف النموذج هو claude-opus-5؛ وهو متوفر في Claude Code وواجهة برمجة تطبيقات Claude (API)، مع إدراجات في Amazon Bedrock وGoogle Cloud Vertex AI وMicrosoft Foundry. يستبدل الوضع السريع (Fast mode) ضعف السعر الأساسي بزيادة سرعة تبلغ حوالي 2.5 ضعف.

قيود صادقة

  • ما تزال لـ GPT-6 Astra مسارات مهمة: يسجل Opus 5 نسبة 73.7% في DeepSWE v1.1، خلف Astra عند 74.1% في جداول سبتمبر مباشرة؛ ويقود Astra كذلك Terminal-Bench 4.0 بنسبة 57.9% مع استهلاكه نحو ثلث رموز Sol. أعادت Artificial Analysis معايرة لوحة البرمجة عند إطلاق Astra (Fable 5.1 نحو 70 وAstra 67)، فمقارنات المؤشر بين الحقب غير مكافئة — لكن تكامل Astra مع Codex وكفاءته في الرموز تبقى فاصلنا للمركز #1.
  • يحتفظ Fable بانتصارات ضيقة في الذروة: يسجل Fable 5 نسبة 53.5% مقابل 53.4% لـ Opus 5 في FrontierCode 1.1 Main، وتصف Anthropic نموذج Opus 5 بأنه أقل بقليل من الحد الأقصى لدرجة Fable في CursorBench. الفجوات الصغيرة ليست حقائق مطلقة، ولكن لا ينبغي محوها أيضًا.
  • الجهد الأقصى قد يلتهم التوفير: وجدت اختبارات Artificial Analysis المستقلة أن Opus 5 عند الجهد الأقصى ذو قدرة عالية ولكنه مسهب. لا يفيد التوكن الأرخص إذا استهلك الوكيل ضعف العدد منها؛ قم بتجربة مستويات الجهد على مهامك الخاصة.
  • الترحيل يحتوي على عقبتين في المنصة: جلب الويب (Web fetch) ومستوى الأولوية (Priority Tier) غير مدعومين عند الإطلاق. التفكير (Thinking) يعمل افتراضيًا، ويتم رفض معلمات أخذ العينات غير الافتراضية، ويجب على الفرق القادمة من تكاملات Claude القديمة إعادة اختبار ميزانيات التوكنات والمطالبات.
  • حدود الأمان تظل واضحة: يمكن لـ Opus 5 العثور على نقاط الضعف في الكود المصدري، لكن المصنفات (classifiers) تحظر اختبار الاختراق، وإنشاء الاستغلال، وفحص نقاط الضعف القائمة على الثنائيات خارج البرامج المعتمدة. قد يواجه المتخصصون في الدفاع إيجابيات كاذبة.
03

لمحة عن المعايير

Terminal-Bench 3.0 — نحو 42.7%

تأتي النتيجة العامة الحالية بعد تشغيل الإطلاق السابق باسم Frontier-Bench ونتيجة 43.3%. تختلف تفاصيل اللقطة ومنصة الاختبار، لذلك استخدم الاسم الحالي وأرفق التاريخ بالنتيجة.

CursorBench 3.2 — بفارق 0.5 نقطة عن Fable 5

شبه تعادل عند max بنصف التكلفة؛ ينبه Cursor إلى أن الفروق الصغيرة قد لا تكون ذات دلالة إحصائية.

DeepSWE v1.1 — 68.8%

قوي في عمل المستودعات الطويل، لكنه خلف Fable 5 (69.7%) وSol (72.7%).

FrontierCode 1.1 Main — 53.4%

تعادل عملي مع Fable 5 (53.5%) وتقدم على Sol (47.5%).

Artificial Analysis Intelligence Index — نحو 63 (#1)

تضع أحدث بيانات الإصدار v4.1.1 المستقلة Opus 5 عند حدود الذكاء العام. أصبحت درجة أسبوع الإطلاق السابقة، 61، قديمة.

04

الحكم

Claude Opus 5 هو نموذج البرمجة #2 لدينا، مع أن أحدث الأدلة المستقلة الواسعة تضعه في المركز الأول بفارق ضئيل. هذا متعمد: يمنح الدليل GPT-6 Astra فاصلاً متعلقاً بالمنتج لتكامل Codex، وكفاءة الطرفية واستخدام الحاسوب، والتوجيه، وتكلفة المهمة المكتملة. ابدأ بـ Opus في العمل الغامض متعدد الملفات حيث تهم الهندسة المعمارية والتحقق؛ وابدأ بـ Astra عندما تكون الإنتاجية في الطرفية وعمل المكتب أهم. يعلن الترتيب أوزانه بدلاً من إعادة كتابة اللوحة الحية.

05

الأسئلة الشائعة