تخيل عاملين أمام بقعة رطوبة على الجدار. يطلي الأول فوقها سريعاً ويغلق البلاغ. أما الثاني فيتتبع الأثر حتى الأنبوب المتسرب، ويصلحه، ثم يفحص الغرفة المجاورة. صُمم Claude Opus 5 ليبرمج بعقلية العامل الثاني.
لهذا فإن أهم رقم هو 43.3% في Frontier-Bench v0.1. يطلب التقييم من الوكيل حل أعمال هندسية غير مألوفة عبر الطرفية والأدوات. في مقارنة Anthropic سجل GPT-5.6 Sol نسبة 34.4%، وFable 5 نسبة 33.7%، وOpus 4.8 نسبة 21.1%. لا يستبدل Opus 5 الإصدار 4.8 فحسب، بل يضاعف نتيجته تقريباً.
يوضح مثال طبيعته. طُلب منه إعادة بناء قطعة ميكانيكية من رسم لا يستطيع رؤيته مباشرة، فكتب مسار رؤية حاسوبية، واستخرج الهندسة من البكسلات، وبنى القطعة في FreeCAD. وفي مهمة أخرى وجد السبب الجذري لخلل وحالة طرفية فاتت تصحيح المجتمع. هذه أمثلة من الشركة وليست قوانين كونية، لكنها تكشف الهدف: واصل التحقيق حتى تتفق الأدلة.
لماذا يتجاوز Fable 5
ما زال Fable يفوز ببعض صور خط النهاية: 53.5% مقابل 53.4% في FrontierCode ونحو نصف نقطة في أقصى CursorBench. لكن الترتيب قرار شراء، لا متحف للكسور العشرية. يكلف Opus 5 $5/$25 لكل مليون رمز، نصف Fable تماماً، ولا يفرض احتفاظاً عاماً بالبيانات، كما أن مصنفاته أقل تقييداً.
قدم Artificial Analysis أول إشارة مستقلة: 61 والمركز الأول عند max، و59 عند high و60 عند xhigh. لكن التحذير مهم: أنتج max رموزاً كثيرة جداً. قد يقدم نموذج بنصف السعر فاتورة كاملة إذا كتب رواية لإصلاح زر.
لماذا يفوته المركز #1 بفارق ضئيل
يتصدر GPT-5.6 Sol اختبار DeepSWE v1.1 بنسبة 72.7%، أمام Fable عند 69.7% وOpus 5 عند 68.8%. لكن المقارنة المباشرة الحالية من Artificial Analysis تمنح Claude Code مع Opus 5 وCodex مع GPT-5.6 Sol الدرجة نفسها، 67، في Coding Agent Index العام. وتفيد التفاصيل أكثر من التعادل: يفوز GPT في DeepSWE وTerminal-Bench وينهي المهام أسرع وبتكلفة أقل، بينما يفوز Opus في اختبار فهم المستودع. لذلك يحصل GPT-5.6 على المركز الأول بفاصل الكفاءة والعمل الطرفي، لا لأنه يتفوق بوضوح على Opus 5 في كل أعمال البرمجة.
التوجيه العملي: Opus 5 للخلل الغامض وتحليل السبب والتغيير متعدد الملفات والتحقق البصري؛ Sol لأصعب ماراثون طرفية؛ Fable فقط عندما تبرر أفضليته الصغيرة ضعف السعر.
يحافظ الانتقال على سياق 1M وإخراج 128k والرؤية وPDF والتخزين المؤقت والدُفعات والأدوات. التفكير التكيفي يعمل افتراضياً. يغيب فقط web fetch وPriority Tier. يستبدل Opus 5 إصدار 4.8 بالكامل ويجعل تبرير Fable للحجم اليومي أصعب بكثير.