تخيل عاملين أمام بقعة رطوبة على الجدار. يطلي الأول فوقها سريعاً ويغلق البلاغ. أما الثاني فيتتبع الأثر حتى الأنبوب المتسرب، ويصلحه، ثم يفحص الغرفة المجاورة. صُمم Claude Opus 5 ليبرمج بعقلية العامل الثاني.
يسمى تقييم الإطلاق هذا الآن Terminal-Bench 3.0. أعلنت Anthropic في الأصل نتيجة 43.3%؛ أما اللوحة العامة الحالية فتظهر نحو 42.7% لـ Opus 5 و34.6% لإعداد GPT-5.6 Sol المذكور. تختلف اللقطتان قليلاً، لكن كلتيهما تؤيدان الدرس نفسه: Opus بارع على نحو غير معتاد في أعمال الطرفية غير المألوفة.
يوضح مثال طبيعته. طُلب منه إعادة بناء قطعة ميكانيكية من رسم لا يستطيع رؤيته مباشرة، فكتب مسار رؤية حاسوبية، واستخرج الهندسة من البكسلات، وبنى القطعة في FreeCAD. وفي مهمة أخرى وجد السبب الجذري لخلل وحالة طرفية فاتت تصحيح المجتمع. هذه أمثلة من الشركة وليست قوانين كونية، لكنها تكشف الهدف: واصل التحقيق حتى تتفق الأدلة.
لماذا يتجاوز Fable 5
ما زال Fable يفوز ببعض صور خط النهاية: 53.5% مقابل 53.4% في FrontierCode ونحو نصف نقطة في أقصى CursorBench. لكن الترتيب قرار شراء، لا متحف للكسور العشرية. يكلف Opus 5 $5/$25 لكل مليون رمز، نصف Fable تماماً، ولا يفرض احتفاظاً عاماً بالبيانات، كما أن مصنفاته أقل تقييداً.
ازدادت قوة الإشارة المستقلة. يمنح Artificial Analysis v4.1.1 نموذج Opus 5 نحو 63 والمركز الأول في Intelligence Index، بينما يبلغ Coding Agent Index الخاص به نحو 78.0. وما يزال التحذير نفسه قائماً في الاختبار: قد يولد جهد max عدداً كبيراً جداً من التوكنات.
لماذا يفوته المركز #1 بفارق ضئيل
يتصدر GPT-6 Astra اختبار DeepSWE v1.1 بنسبة 74.1%، أمام Opus 5 عند 73.7% في جداول سبتمبر، يضاف إليها 57.9% في Terminal-Bench 4.0 وأفضل استخدام للحاسوب في السوق. أعادت Artificial Analysis معايرة لوحتها لوكلاء البرمجة عند إطلاق Astra (Fable 5.1 نحو 70 وAstra 67)، فأرقام حقبة Opus القديمة ليست خانات قابلة للمقارنة. وما يزال مركزنا #1 من نصيب Astra بفاصل يوازن Codex والكفاءة وقيمة التنفيذ—لا لأنه يتفوق بوضوح على Opus في البرمجة.
لذلك وجّه العمل بحسب المهمة:
| المهمة | أفضل نقطة بداية |
|---|---|
| خلل غامض، أو بحث عن السبب الجذري، أو تغيير متعدد الملفات، أو تحقق بصري لواجهة | Opus 5 |
| عمل كثيف في الطرفية تكون فيه السرعة وتكلفة المهمة المكتملة والتنفيذ أهم | GPT-6 Astra |
| مهمة عند ذروة CursorBench أو FrontierCode والميزانية فيها ثانوية | Fable 5 |
| تذاكر عادية بسقف تكلفة صارم | ابدأ بجهد أقل ثم صعّد عند الحاجة |
مسار الترقية العملي رحيم على نحو غير معتاد. يحتفظ Opus 5 بسياق 1M وإخراج أقصى 128k والرؤية وملفات PDF والتخزين المؤقت للمطالبات والمعالجة بالدفعات وأدوات Claude. يعمل التفكير تكيفياً وافتراضياً، وتتدرج مستويات الجهد من low إلى max. يُفترض أن تنتقل معظم مطالبات Opus 4.8، لكن على المطورين الانتباه إلى أن web fetch في API وPriority Tier غير متاحين عند الإطلاق.
الخلاصة بسيطة: يستبدل Opus 5 إصدار Opus 4.8 بالكامل، ويجعل تبرير Fable 5 لأحجام الإنتاج اليومية أصعب. يبقى Fable الاختصاصي المكلف صاحب بعض الانتصارات الضيقة. أما Opus 5 فهو النموذج الذي تستطيع إتاحته لمهندسين أكثر، ولمهام أكثر، ولمدة أطول—مع القدرة على تحمل تكلفة دورة التحقق التي تمنح حكمه قيمته.