25-iyul yangilanishi: Opus 5 Fable 5’ni #3 ga tushiradi. Fable e’lon qilingan SWE-Bench Pro va kichik CursorBench/FrontierCode ustunliklarini saqlaydi; Opus 5 Frontier-Bench’ni yutadi va yarim token narxida deyarli teng. Iyun sharhi foydali dalil bo‘lib qoladi, ammo joriy umumiy tartib emas.
Ushbu sharhni yozishni osonlashtiradigan bitta raqam bor: 80.3%. Bu Claude Fable 5 ning SWE-Bench Pro’dagi natijasi — bu benchmark o’yinchoq muammolarga e’tibor bermaydi, uni faqat SI haqiqiy ishlab chiqarish kod bazalaridagi haqiqiy xatolarni (buglarni) tuzata oladimi-yo’qmi qiziqtiradi. GPT-5.5 da 58.6% natija. Oldingi qirol, Opus 4.8 esa 69.2% ball olgan. Fable 5 shunchaki yengmaydi — u shu qadar katta farq bilan yengadiki, raqamlarni qayta tekshirishga majbur bo’lasiz.
Ammo SWE-Bench Pro bu hikoyaning faqat yarmi xolos. Modellar ishlab chiqarish sifatidagi tokenni tejaydigan kodni yoza oladimi-yo’qligini baholovchi Cognition’ning benchmarki — FrontierCode Diamond ikkinchi yarmini aytib beradi. Fable 5: 29.3%. Opus 4.8: 13.4%. GPT-5.5: 5.7%. Bu shunchaki yetakchilik emas; bu butunlay boshqa sport turi. Va model ushbu ballarga o’rtacha mantiqiy kuchlanish sarflab erishadi, ya’ni yaxshiroq kod ishlab chiqarish uchun kamroq token yondiradi. Aslida haqiqiy vazifalarda ancha arzonga tushadigan qimmat model.
Stripe misoli esa press-relizdagi xayoliy narsa emas. 50 million qatorli Ruby kod bazasi — muhandislarni terlatib yuboradigan ulkan monolit (tizim) — bir kunda ko’chirib (migratsiya) o’tkazildi. Butun boshli jamoa ikki oyda qiladigan ish. Model rejalashtirdi, bajardi, o’zini o’zi tekshirdi va natijani topshirdi. CursorBench haqida gapirar ekan, Cursor bosh direktori u “oldingi modellar uchun imkonsiz bo’lgan uzoq muddatli muammolar sinfini ochib berganini” aytdi. Senior Engineer Benchmark (katta muhandislar) sinovida u 100 dan 91 ball to’pladi — vaholanki GPT-5.5 va Opus 4.8 60 lar atrofida qolib ketgan edi.
Mythos sinfi arxitekturasini xavfsizlik to’siqlariga o’rab, dasturchilarga berganingizda u aynan shunday ko’rinishda bo’ladi. Xavfsizlik to’siqlari haqiqiy — kiberxavfsizlik, biologiya va kimyo so’rovlari Opus 4.8 ga (hali ham ajoyib model, biroq to’liq dvigatel emas) yo’naltiriladi. Ammo xavfsizlik klassifikatorlarini ishga tushirmaydigan 95%+ dasturlash ishlari uchun siz shu paytgacha ommaga taqdim etilgan eng kuchli model bilan ishlaysiz. Agentli dasturlash erasi endi o’zining eng yaqqol chempionini topdi.