Ko‘p chatbotlar dushanba tongidagi iqtidorli stajyorga o‘xshaydi: tez ishlaydi, hamma ishga ishtiyoq bilan kirishadi va ba’zan yakuniy summasi sezdirmay noto‘g‘ri hisoblangan, chiroyli bezatilgan elektron jadvalni topshiradi. Claude Opus 5 esa xatni jo‘natishdan oldin formulalarni yana bir bor tekshiradigan hamkasbga o‘xshaydi.
Aynan shu puxta mulohaza uni kundalik reytingimizda to‘g‘ridan-to‘g‘ri birinchi o‘ringa olib chiqadi. Anthropic jadvalida u GDPval-AA v2 bo‘yicha 1861 Elo olgan. Bu test foydali professional vazifalardagi natijani o‘lchaydi. Fable 5 — 1747, GPT-5.6 Sol — 1736, Opus 4.8 esa 1593 olgan. Box 4.8 ga nisbatan umumiy 8% yaxshilanishni, ma’lumotlarni tahlil qilish va kompaniyani har tomonlama tekshirishda esa kattaroq o‘sishni qayd etgan. Moliyaviy baholash bilan shug‘ullanuvchi bir mijoz aniqlik to‘qqiz foiz bandiga oshganini, modelga qayta murojaat qilish kamayganini va ish vaqti 60% qisqarganini aytadi. Bular hali dastlabki mijoz hisobotlari, ammo ularning mazmuni testlarga mos: ish puxtaroq, qayta-qayta tuzatishga ehtiyoj kamroq.
Shunchaki ko‘p o‘qigan yozuv mashinasi emas
Opus 5 kompyuter haqida gapirishni emas, undan amalda foydalanishni talab qiladigan OSWorld 2.0’da 70,6% oladi. AutomationBench’dagi 26,0% natija Anthropic taqqoslashidagi keyingi ko‘rsatkichdan qariyb bir yarim baravar yuqori. Zapier ma’lumotiga ko‘ra, Opus 5 mijozlarni saqlab qolish jarayonini boshidan oxirigacha mustaqil bajargan: akkauntlar holati haqidagi ma’lumotlarni o‘qigan, ketish xavfi bor mijozlarni aniqlagan, shu akkauntlarga mas’ul menejerlarni ogohlantirgan va yakuniy xulosa tayyorlagan. Avvalgi modellar ushbu qadamlarning barchasini oxirigacha bajara olmagan.
Eng noodatiy son — ARC-AGI-3’dagi 30,2%. Bu test notanish interaktiv masalalarni yechishni o‘lchaydi: tayyor faktni eslashdan ko‘ra, yangi stol o‘yinining qoidalarini o‘zingiz anglab olishga yaqinroq. Sol ayni jadvalda 7,8% olgan. Bitta benchmark butun aqlni o‘lchamaydi, ammo bu natija batafsil ko‘rsatmalar tugab, keyingi qadamni modelning o‘zi topishi kerak bo‘lganda Opus 5 ayniqsa kuchli ekanini ko‘rsatadi.
Mustaqil sinovlar ham umumiy yo‘nalishni tasdiqlaydi. Artificial Analysis max rejimida Opus 5 ga 61 ball va birinchi o‘rin beradi; high 59, xhigh esa 60 ball olgan. Demak, muhim shartnoma yoki moliyaviy model uchun chuqurroq fikrlashni tanlash, oddiy qoralama uchun esa darajani pasaytirib, xarajatni kamaytirish mumkin.
Nega Fable 5 dan yuqori
Fable vositasiz HLE, FrontierCode, CursorBench’ning eng yuqori rejimi va huquqiy testda biroz yaxshi. Agar sizning ichki testingiz aynan shunday vazifalarga o‘xshasa, Fable to‘g‘ri tanlov bo‘lishi mumkin. Ammo Fable narxi $10/$50, Opus 5 esa $5/$25; unda ma’lumotni umumiy tartibda saqlash talabi yo‘q va himoya klassifikatorlari kamroq cheklaydi. Fable’ni poyga uchun yaratilgan prototip, Opus 5 ni esa deyarli shuncha tez, ishlatish xarajati ikki baravar kam va poyga yo‘lidan tashqarida ham bemalol yuradigan avtomobil deb tasavvur qiling. Kundalik ishda ikkinchisi foydaliroq.
GPT-5.6 baribir ajoyib universal tizim bo‘lib qoladi. ChatGPT Work, Codex, rasm yaratish, Sites, ulangan ilovalar, brauzer va kompyuterni boshqarishni bitta katta ekotizimga jamlaydi. Claude o‘zi rasm yaratmaydi, tarif limitlari ham qattiqroq bo‘lishi mumkin. Bizning reytingimiz Opus 5 hozir mulohaza sifati, mustaqil professional ish, narx va foydalanish imkoniyatining eng yaxshi uyg‘unligini taklif qilishini anglatadi; bu hamma ChatGPT obunasini bekor qilishi kerak degani emas.
Ish imkoniyatlari keng: 1M kontekst, 128k gacha chiqish, hujjat va diagrammalarni ko‘rish, PDF, fayllar, xotira, internetdan qidirish, vositalar va kompyuterni boshqarish. Biroq mustaqil ma’lumotlar hali kam, max rejimi ko‘p yozishi mumkin, API web fetch va Priority Tier esa hozircha yo‘q. Eng oqilona yo‘l — avval pastroq fikrlash darajasidan boshlash, natijani tekshirish va xato qilish qiymati qo‘shimcha fikrlash xarajatidan katta bo‘lsagina darajani oshirish.
Opus 5 shunchaki arzonroq Fable emas — u kundalik ish uchun oqilona tanlov. U Opus 4.8 ni to‘liq almashtiradi va sun’iy intellektning puxta mulohazasini faqat deyarli cheklanmagan budjetli bitta ulkan loyiha uchun emas, seshanbadagi oddiy vazifalar uchun ham hamyonbop qiladi.