تحديث 25 يوليو: يدفع Opus 5 نموذج Fable 5 إلى #3. يحتفظ Fable بنتيجة SWE-Bench Pro وفروق صغيرة في CursorBench وFrontierCode؛ لكن Opus 5 يفوز بـ Frontier-Bench ويقدم شبه تعادل بنصف سعر الرمز. تبقى مراجعة يونيو دليلاً مفيداً، لا الترتيب العام الحالي.
هناك رقم يجعل كتابة هذه المراجعة سهلة: 80.3%. هذه نتيجة Claude Fable 5 على SWE-Bench Pro — المعيار الذي لا يهتم بالمسائل البسيطة، فقط ما إذا كان الذكاء الاصطناعي يستطيع إصلاح أخطاء حقيقية في قواعد أكواد إنتاجية حقيقية. GPT-5.5 يسجّل 58.6%. الملك السابق Opus 4.8 سجّل 69.2%. Fable 5 لا يفوز فحسب — بل يفوز بفارق يجعلك تعيد التحقق من الأرقام.
لكن SWE-Bench Pro نصف القصة فقط. FrontierCode Diamond — معيار Cognition لمعرفة ما إذا كانت النماذج تستطيع كتابة كود إنتاجي عالي الجودة بكفاءة رمزية — يروي النصف الآخر. Fable 5: 29.3%. Opus 4.8: 13.4%. GPT-5.5: 5.7%. هذا ليس تقدّماً؛ إنه رياضة مختلفة. والنموذج يحقق هذه النتائج بجهد تفكير متوسط، مما يعني أنه يحرق رموزاً أقل لإنتاج كود أفضل. النموذج الغالي الذي هو فعلاً أرخص لكل مهمة واقعية.
دراسة حالة Stripe ليست خيالاً صحفياً. قاعدة أكواد Ruby من 50 مليون سطر — من النوع الذي يجعل المهندسين يتعرّقون — تمّ ترحيلها في يوم واحد. عمل كان سيستغرق فريقاً كاملاً شهرين. النموذج خطّط ونفّذ وتحقّق ذاتياً وسلّم. على CursorBench، قال الرئيس التنفيذي لـ Cursor إنه “فتح فئة من المشاكل طويلة الأفق كانت بعيدة المنال عن النماذج السابقة.” وعلى Senior Engineer Benchmark، سجّل 91/100 — بينما GPT-5.5 وOpus 4.8 كلاهما حلّ في أوائل الستينات.
هذا ما تبدو عليه بنية فئة Mythos عندما تغلّفها بحواجز أمان وتسلّمها للمطورين. الحواجز حقيقية — الاستعلامات عن الأمن السيبراني والبيولوجيا والكيمياء تُحوَّل إلى Opus 4.8 (لا يزال ممتازاً، لكن ليس المحرك الكامل). لكن لأكثر من 95% من أعمال البرمجة التي لا تُنشّط مُصنّفات الأمان، أنت تعمل مع أقدر نموذج أُطلق للعموم على الإطلاق. عصر البرمجة الوكيلية حصل للتو على بطله الأوضح.