O'rin #1 Kundalik ekotizim — Yetakchi SI yordamchilari
Anthropic

Claude — Opus 5

Kundalik aqliy mehnatning yangi yetakchisi: Opus 5 Fable darajasiga yaqin mulohazani odamlar va kompaniyalar katta hajmda ishlata oladigan modelda taklif qiladi. U dastlabki mustaqil testlarda yetakchi, Fable 5 dan ikki baravar arzon va keng miqyosda mavjud.

Yangilangan 2026-yil 25-iyul Knowledge Work SOTA1M ContextReasoning
9.910 dan
Rasmiy veb-sayt
Eng mos

Kundalik aqliy mehnatning yangi yetakchisi: Opus 5 Fable darajasiga yaqin mulohazani odamlar va kompaniyalar katta hajmda ishlata oladigan modelda taklif qiladi. U dastlabki mustaqil testlarda yetakchi, Fable 5 dan ikki baravar arzon va keng miqyosda mavjud.

Nima uchun bu eng yaxshisi

GDPval-AA v2 Elo 1861, ARC-AGI-3 30,2%, BrowseComp 90,8%, OSWorld 2.0 70,6%, AutomationBench 26,0%, vositali HLE 64,7%. Artificial Analysis max’ga 61 va #1 beradi. 1M kontekst, 128k chiqish, $5/$25, umumiy data retention talabi yo‘q.

E'tibor bering

Toj hozircha vaqtinchalik: mustaqil ma’lumot 48 soatdan kam. Fable maxsus testlarda yutadi, GPT-5.6 iste’molchi ekotizimi kattaroq, Claude rasm yaratmaydi. Max sekin va sergap; tarif limitlari muhim.

01

Aslida bu nima

Ko‘p chatbotlar dushanba tongidagi iqtidorli stajyorga o‘xshaydi: tez ishlaydi, hamma ishga ishtiyoq bilan kirishadi va ba’zan yakuniy summasi sezdirmay noto‘g‘ri hisoblangan, chiroyli bezatilgan elektron jadvalni topshiradi. Claude Opus 5 esa xatni jo‘natishdan oldin formulalarni yana bir bor tekshiradigan hamkasbga o‘xshaydi.

Aynan shu puxta mulohaza uni kundalik reytingimizda to‘g‘ridan-to‘g‘ri birinchi o‘ringa olib chiqadi. Anthropic jadvalida u GDPval-AA v2 bo‘yicha 1861 Elo olgan. Bu test foydali professional vazifalardagi natijani o‘lchaydi. Fable 5 — 1747, GPT-5.6 Sol — 1736, Opus 4.8 esa 1593 olgan. Box 4.8 ga nisbatan umumiy 8% yaxshilanishni, ma’lumotlarni tahlil qilish va kompaniyani har tomonlama tekshirishda esa kattaroq o‘sishni qayd etgan. Moliyaviy baholash bilan shug‘ullanuvchi bir mijoz aniqlik to‘qqiz foiz bandiga oshganini, modelga qayta murojaat qilish kamayganini va ish vaqti 60% qisqarganini aytadi. Bular hali dastlabki mijoz hisobotlari, ammo ularning mazmuni testlarga mos: ish puxtaroq, qayta-qayta tuzatishga ehtiyoj kamroq.

Shunchaki ko‘p o‘qigan yozuv mashinasi emas

Opus 5 kompyuter haqida gapirishni emas, undan amalda foydalanishni talab qiladigan OSWorld 2.0’da 70,6% oladi. AutomationBench’dagi 26,0% natija Anthropic taqqoslashidagi keyingi ko‘rsatkichdan qariyb bir yarim baravar yuqori. Zapier ma’lumotiga ko‘ra, Opus 5 mijozlarni saqlab qolish jarayonini boshidan oxirigacha mustaqil bajargan: akkauntlar holati haqidagi ma’lumotlarni o‘qigan, ketish xavfi bor mijozlarni aniqlagan, shu akkauntlarga mas’ul menejerlarni ogohlantirgan va yakuniy xulosa tayyorlagan. Avvalgi modellar ushbu qadamlarning barchasini oxirigacha bajara olmagan.

Eng noodatiy son — ARC-AGI-3’dagi 30,2%. Bu test notanish interaktiv masalalarni yechishni o‘lchaydi: tayyor faktni eslashdan ko‘ra, yangi stol o‘yinining qoidalarini o‘zingiz anglab olishga yaqinroq. Sol ayni jadvalda 7,8% olgan. Bitta benchmark butun aqlni o‘lchamaydi, ammo bu natija batafsil ko‘rsatmalar tugab, keyingi qadamni modelning o‘zi topishi kerak bo‘lganda Opus 5 ayniqsa kuchli ekanini ko‘rsatadi.

Mustaqil sinovlar ham umumiy yo‘nalishni tasdiqlaydi. Artificial Analysis max rejimida Opus 5 ga 61 ball va birinchi o‘rin beradi; high 59, xhigh esa 60 ball olgan. Demak, muhim shartnoma yoki moliyaviy model uchun chuqurroq fikrlashni tanlash, oddiy qoralama uchun esa darajani pasaytirib, xarajatni kamaytirish mumkin.

Nega Fable 5 dan yuqori

Fable vositasiz HLE, FrontierCode, CursorBench’ning eng yuqori rejimi va huquqiy testda biroz yaxshi. Agar sizning ichki testingiz aynan shunday vazifalarga o‘xshasa, Fable to‘g‘ri tanlov bo‘lishi mumkin. Ammo Fable narxi $10/$50, Opus 5 esa $5/$25; unda ma’lumotni umumiy tartibda saqlash talabi yo‘q va himoya klassifikatorlari kamroq cheklaydi. Fable’ni poyga uchun yaratilgan prototip, Opus 5 ni esa deyarli shuncha tez, ishlatish xarajati ikki baravar kam va poyga yo‘lidan tashqarida ham bemalol yuradigan avtomobil deb tasavvur qiling. Kundalik ishda ikkinchisi foydaliroq.

GPT-5.6 baribir ajoyib universal tizim bo‘lib qoladi. ChatGPT Work, Codex, rasm yaratish, Sites, ulangan ilovalar, brauzer va kompyuterni boshqarishni bitta katta ekotizimga jamlaydi. Claude o‘zi rasm yaratmaydi, tarif limitlari ham qattiqroq bo‘lishi mumkin. Bizning reytingimiz Opus 5 hozir mulohaza sifati, mustaqil professional ish, narx va foydalanish imkoniyatining eng yaxshi uyg‘unligini taklif qilishini anglatadi; bu hamma ChatGPT obunasini bekor qilishi kerak degani emas.

Ish imkoniyatlari keng: 1M kontekst, 128k gacha chiqish, hujjat va diagrammalarni ko‘rish, PDF, fayllar, xotira, internetdan qidirish, vositalar va kompyuterni boshqarish. Biroq mustaqil ma’lumotlar hali kam, max rejimi ko‘p yozishi mumkin, API web fetch va Priority Tier esa hozircha yo‘q. Eng oqilona yo‘l — avval pastroq fikrlash darajasidan boshlash, natijani tekshirish va xato qilish qiymati qo‘shimcha fikrlash xarajatidan katta bo‘lsagina darajani oshirish.

Opus 5 shunchaki arzonroq Fable emas — u kundalik ish uchun oqilona tanlov. U Opus 4.8 ni to‘liq almashtiradi va sun’iy intellektning puxta mulohazasini faqat deyarli cheklanmagan budjetli bitta ulkan loyiha uchun emas, seshanbadagi oddiy vazifalar uchun ham hamyonbop qiladi.

02

Kuchli tomonlar va halol cheklovlar

Asosiy afzalliklari

  • Asosiy ustunlik — professional aqliy mehnat: GDPval-AA v2’da 1861 Elo, Fable 5 (1747) va Sol (1736) dan yuqori. Dastlabki mijozlar moliya, huquq, elektron jadvallar va kompaniyani har tomonlama tekshirishda ham yaxshilanish qayd etgan.
  • Faqat javob bermaydi — ishni bajaradi: OSWorld 2.0’da 70,6% va AutomationBench’da 26,0% natija dasturlarni boshqarish va biznes jarayonlarini oxirigacha yetkazishda yetakchilikni ko‘rsatadi.
  • Yangi muammolarda kuchli: ARC-AGI-3’da 30,2% — Sol’ning 7,8% natijasidan qariyb to‘rt baravar; Artificial Analysis ham 61 bilan birinchi qo‘yadi.
  • Fable sifati, ortiqcha Fable xarajatisiz: $5/$25 — narxning yarmi; ma’lumotni umumiy tartibda saqlash talabi yo‘q va xavfsizlik klassifikatorlari kamroq aralashadi.
  • To‘laqonli professional ish muhiti: 1M kontekst, 128k chiqish, hujjat va diagrammalarni tushunish, murakkab elektron jadvallar, taqdimotlar, internetdan qidirish, fayllar, PDF, xotira va kompyuterni boshqarish.

Haqiqiy cheklovlar

  • Reliz haftasi toji: Alohida taqqoslashlarning ko‘pi Anthropic’dan; bitta mustaqil indeks abadiy hukm emas.
  • ChatGPT kattaroq platforma: Claude’ning o‘zida rasm yaratish yo‘q; u Work, Codex, Sites, plaginlar, brauzer va ish stolini ChatGPT kabi bitta tizimda birlashtirmaydi.
  • Fable tor sohalardagi ayrim g‘alabalarni saqlaydi: Vositasiz HLE, FrontierCode, CursorBench va huquqiy test; Mythos esa hujumkor kiberxavfsizlik va avtonom biologiyada kuchliroq.
  • Max rejimi juda ko‘p sarflashi mumkin: U ko‘p yozadi, xhigh’da esa javob boshlanishi sekinlashadi. Token tarifini emas, oxirigacha bajarilgan vazifaning umumiy narxini taqqoslang.
  • Integratsiyalarni moslashtirish kerak: API web fetch va Priority Tier yo‘q, fikrlash sukut bo‘yicha yoqilgan, sampling parametrlari cheklangan, tarif limiti esa uzoq ishni yarim yo‘lda to‘xtatishi mumkin.
03

Benchmark natijalari

GDPval-AA v2 — 1861 Elo (#1)

Professional ishda Fable 5 (1747), Sol (1736) va Opus 4.8 (1593) dan yuqori.

ARC-AGI-3 — 30,2% (#1)

Yangi interaktiv muammolar: Sol (7,8%) dan qariyb to‘rt baravar, 4.8 (1,5%) dan ancha yuqori.

OSWorld 2.0 — 70,6% (#1)

Desktop ilovalardan foydalanish, Fable 5 (66,1%) va Sol (62,6%) dan oldinda.

AutomationBench — 26,0% (#1)

To‘liq biznes jarayonlari, Fable 5 (17,4%) natijasidan taxminan 1,5 baravar.

Artificial Analysis Intelligence Index — 61 (#1)

To‘qqiz testli mustaqil indeks; high 59, xhigh 60, max esa ko‘p token sarflaydi.

04

Xulosa

Claude Opus 5 kundalik reytingimizda #1: GPT-5.6 dan ozgina, Fable 5 dan aniq yuqori. U professional ish, yangi muammo, qidiruv, kompyuter va avtomatlashtirishning eng foydali aralashmasida yetakchi, Fable’dan ikki baravar arzon va kamroq cheklangan.

05

Ko'p so'raladigan savollar