تشبه روبوتات محادثة كثيرة متدرباً لامعاً في صباح اثنين مزدحم: سريعاً ومتحمساً، وقادراً تماماً على تسليم جدول أنيق بينما مجموعه النهائي خاطئ من دون أن يلحظ أحد. أما Claude Opus 5 فيشبه زميلاً يعيد فحص الصيغ قبل الضغط على «إرسال».
هذا الحكم يدفعه مباشرة إلى المركز اليومي #1. تمنحه مقارنة Anthropic 1861 Elo في GDPval-AA v2، وهو تقييم لمهام مهنية مفيدة. يسجل Fable 5 مقدار 1747، وGPT-5.6 Sol مقدار 1736، وOpus 4.8 مقدار 1593. أبلغت Box عن تحسن عام 8% مقابل 4.8، مع مكاسب أكبر في تحليل البيانات والعناية الواجبة. ورأى عميل مالي دقة أعلى بتسع نقاط، وخطوات أقل، ووقتاً أقل 60%. إنها تقارير مبكرة، لكنها ترسم شكلاً واحداً: عناية أكبر ودوران أقل.
أكثر من آلة كاتبة قارئة
يسجل Opus 5 70.6% في OSWorld 2.0 حيث ينبغي استخدام الحاسوب فعلياً، و26.0% في AutomationBench، أي نحو مرة ونصف النتيجة التالية. وتفيد Zapier بأن Opus 5 أكمل مساراً كاملاً للاحتفاظ بالعملاء: قرأ مؤشرات سلامة الحسابات، وحدد العملاء المعرضين للمغادرة، ونبّه المسؤولين عن تلك الحسابات، ثم أعد ملخصاً. أما النماذج السابقة فلم تستطع إتمام السلسلة كلها.
الرقم الأغرب هو 30.2% في ARC-AGI-3. يختبر تعلم مسائل تفاعلية مجهولة، أقرب إلى اكتشاف قواعد لعبة جديدة منه إلى تذكر حقيقة. سجل Sol نسبة 7.8%. الاختبار ليس روحاً، لكنه يشير إلى موهبة حين تتوقف التعليمات عن إمساك اليد.
بات الاختبار المستقل يؤيد أكثر من مجرد اتجاه الإطلاق. يمنح Artificial Analysis v4.1.1 جهد max في Opus 5 نحو 63، والمركز الأول حالياً على Intelligence Index. يتغير السلم الدقيق مع تطور التقييم، ولذلك ينبغي وضع رقم الإصدار وتاريخ الاطلاع بجوار النتيجة.
لماذا يتجاوز Fable 5
ما زال Fable أفضل قليلاً في بضعة مواضع ضيقة: Humanity’s Last Exam بلا أدوات، وFrontierCode، وأعلى إعداد في CursorBench، واختبار لوكيل قانوني محجوب. إن كانت اختباراتك الخاصة تشبه أحد هذه المسارات، فاستخدمه. لكن Fable يكلف $10/$50 لكل مليون توكن إدخال/إخراج. أما Opus 5 فيكلف $5/$25، ولا يفرض شرطاً عاماً للاحتفاظ بالبيانات، ويُتوقع أن تتدخل مصنفات الأمان لديه بوتيرة أقل بكثير.
فكر في Fable بوصفه نموذجاً أولياً لسيارة سباق، وفي Opus 5 بوصفه سيارة طريق تكاد تساويه سرعة، وتكلف نصف ما يكلفه تشغيلها، ويمكنها قانوناً أن تسير بعيداً خارج الحلبة. في العمل اليومي، سيارة الطريق هي الآلة الأكثر نفعاً.
لماذا يبقى ChatGPT في الحوار
يبقى GPT-5.6 نظاماً عاماً ممتازاً. يجمع ChatGPT بين Work وCodex وتوليد الصور وSites والتطبيقات المتصلة والمتصفح واستخدام حاسوب سطح المكتب في منظومة هائلة واحدة. لا ينشئ Claude الصور أصلياً، وقد تكون حدود خططه أضيق. يقول ترتيبنا إن Opus 5 يقدم أفضل مزيج حالي من جودة الاستدلال والعمل الاحترافي والسعر وقابلية النشر؛ ولا يقول إن على كل شخص إلغاء ChatGPT.
العتاد وراء طاولة العمل هذه كبير: سياق 1M افتراضياً، وإخراج أقصى 128k، ورؤية للرسوم والمستندات، وPDF وملفات وذاكرة وبحث ويب وأدوات واستخدام الحاسوب. معرّف النموذج في API هو claude-opus-5، وهو مدعوم على منصة Anthropic والمنصات السحابية الكبرى. يعمل وضع Fast بسرعة تقارب 2.5 مرة، مقابل ضعف سعر التوكن الأساسي.
وثمة تحفظات. ما تزال البيانات المستقلة حديثة، وقد يكون جهد max مسهباً، فيما يملك xhigh زمناً ملحوظاً حتى أول توكن. كما يغيب web fetch في API وPriority Tier عند الإطلاق. العادة المعقولة هي أن تبدأ بجهد أقل، وتتحقق من النتيجة، ولا ترفع الجهد إلا حين تصبح تكلفة الخطأ أكبر من تكلفة التفكير.
Opus 5 ليس مجرد Fable 5 أرخص، بل هو قرار المنتج اليومي الأفضل. إنه يستبدل Opus 4.8، ويفوز بعدد كاف من الاختبارات المهمة لمنافسة الحدود القصوى، ويجعل حُسن التقدير الدقيق للذكاء الاصطناعي في متناول عمل يوم ثلاثاء عادي—لا المشروع الوحيد المهم بما يكفي للحصول على شيك على بياض.