O'rin #2 Dasturlash — Ishlab chiqarish (Production) uchun kod yozadigan SI
Anthropic

Claude Opus 5

Amaliy frontier dasturchisi: Opus 5 Fable darajasidagi mulohazani Opus narxi va sabrli tekshiruv bilan birlashtiradi. Frontier-Bench’da yetakchi, CursorBench’da Fable 5 ga juda yaqin va tokeni ikki baravar arzon bo‘lgani uchun bizda #2.

Yangilangan 2026-yil 25-iyul Agentic CodingFrontier-Bench SOTARoot-Cause Debugging
9.910 dan
Rasmiy veb-sayt
Eng mos

Amaliy frontier dasturchisi: Opus 5 Fable darajasidagi mulohazani Opus narxi va sabrli tekshiruv bilan birlashtiradi. Frontier-Bench’da yetakchi, CursorBench’da Fable 5 ga juda yaqin va tokeni ikki baravar arzon bo‘lgani uchun bizda #2.

Nima uchun bu eng yaxshisi

Frontier-Bench v0.1’da 43,3%: GPT-5.6 Sol 34,4%, Fable 5 esa 33,7%. Max rejimida CursorBench 3.2 bo‘yicha Fable cho‘qqisidan atigi 0,5 punkt ortda, vazifa narxi esa yarmi. DeepSWE 68,8%, FrontierCode 53,4%, 1M kontekst, 128k chiqish va million token uchun $5/$25.

E'tibor bering

Mutlaq chempion emas: Sol DeepSWE va Terminal-Bench’da oldinda hamda Artificial Analysis’ning hozirgi sinovida bajarilgan vazifa hisobida tezroq va arzonroq. Biroq umumiy Coding Agent Index’da ikkala tizim ham 67 ball olgan. Fable FrontierCode va CursorBench’da juda kichik ustunlikni saqlaydi; mustaqil ma’lumotlar esa hali kam.

01

Aslida bu nima

Devordagi nam dog‘ni ko‘rgan ikki ustani tasavvur qiling. Biri dog‘ ustidan tezda bo‘yoq surtadi va ishni yopadi. Ikkinchisi esa suv sizayotgan quvurni topadi, uni tuzatadi va namlik qo‘shni xonaga o‘tmaganini ham tekshiradi. Claude Opus 5 kod yozishda ikkinchi usta kabi ishlashga intiladi.

Shu sababli relizning asosiy soni — Frontier-Bench v0.1’dagi 43,3%. Baholash agentdan terminal va vositalar orqali notanish muhandislik ishlarini hal qilishni so‘raydi. Anthropic taqqoslashida GPT-5.6 Sol 34,4%, Fable 5 33,7%, Opus 4.8 21,1% olgan. Opus 5 shunchaki 4.8 o‘rnini bosmaydi; uning natijasini deyarli ikki baravar qiladi.

Bir misol uning xarakterini ko‘rsatadi. Ko‘ra olmaydigan chizma asosida mexanik detalni tiklash so‘ralganda, Opus 5 o‘z vision pipeline’ini yozdi, piksellardan geometriyani chiqardi va detalni FreeCAD’da qurdi. Boshqa vazifada bug’ning ildiz sababini va hamjamiyat patch’i o‘tkazib yuborgan chekka holatni topdi. Bular vendor misollari, tabiat qonuni emas, ammo sozlash maqsadi aniq: dalillar bir-biriga mos kelguncha tekshirish.

Nega Fable 5 dan yuqori

Fable ayrim foto-finishlarni yutadi: FrontierCode’da 53,5% ga 53,4% va maksimal CursorBench’da yarim punktga yaqin ustunlik. Lekin reyting o‘nli kasrlar muzeyi emas, xarid qarori. Opus 5 million token uchun $5/$25, Fable’dan aynan ikki baravar arzon; umumiy data retention talab qilmaydi va kamroq cheklovchi klassifikatorlarga ega.

Artificial Analysis ilk mustaqil signalni berdi: max’da 61 va birinchi o‘rin. High 59, xhigh 60. Ogohlantirish ham muhim: max juda ko‘p token chiqardi. Tugmani tuzatish uchun roman yozsa, yarim narxli model ham to‘liq hisob chiqaradi.

Nega baribir #1 emas

GPT-5.6 Sol DeepSWE v1.1’da 72,7% bilan yetakchi; Fable 69,7%, Opus 5 esa 68,8% olgan. Ammo Artificial Analysis’ning bevosita taqqoslashida Opus 5 bilan ishlaydigan Claude Code va GPT-5.6 Sol bilan ishlaydigan Codex umumiy Coding Agent Index’da bir xil — 67 ball oladi. Durang ichidagi farq muhimroq: GPT DeepSWE va Terminal-Bench’da yutadi, vazifalarni tezroq va arzonroq tugatadi; Opus esa repozitoriyni tushunish testida kuchliroq. Shuning uchun biz GPT-5.6 ga birinchi o‘rinni tezlik, xarajat va terminal vazifalari bo‘yicha tor qo‘shimcha mezon bilan berdik — u Opus 5 dan hamma kodlash ishida aniq ustun bo‘lgani uchun emas.

Amaliy taqsimot oddiy: noaniq xato, ildiz sababni topish, katta ko‘p faylli o‘zgarish va interfeysni ko‘z bilan tekshirish uchun Opus 5; tezlik va yakunlangan vazifa narxi muhim bo‘lgan terminal ishlari uchun Sol; tor sohadagi kichik ustunligi ikki baravar narxga arzigandagina Fable.

Migratsiya 1M kontekst, 128k chiqish, vision, PDF, caching, batch va Claude vositalarini saqlaydi. Adaptiv fikrlash standart yoqilgan. Faqat web fetch va Priority Tier yo‘q. Opus 5 Opus 4.8’ni to‘liq almashtiradi va kundalik hajmda Fable’ni oqlashni qiyinlashtiradi.

02

Kuchli tomonlar va halol cheklovlar

Asosiy afzalliklari

  • Frontier-Bench yetakchisi: 43,3%, Sol’da 34,4%, Fable’da 33,7%, Opus 4.8’da 21,1%. Test terminalda yashaydigan, vosita ishlatadigan va notanish muhandislik ishini tugatadigan agentni baholaydi.
  • Bayramdan oldin tekshiradi: Opus 5 ildiz sababni topdi, jonli ma’lumot bo‘lmaganda o‘z test stendini qurdi va interfeyslarni tayyor deyishdan oldin desktop hamda telefonda ko‘rdi.
  • Fable’ga yaqin, narxi yarmi: Max’da CursorBench farqi 0,5 punkt, token narxi esa $5/$25 — $10/$50 emas.
  • Butun repozitoriy stolga sig‘adi: Standart 1M kontekst, 128k maksimal chiqish, uzun kontekst bo‘ylab barqaror ko‘rsatma, vosita va mulohaza.
  • Jamoalar ishlaydigan joylarda mavjud: claude-opus-5 Claude Code, API, Bedrock, Vertex AI va Microsoft Foundry’da; Fast mode ikki baravar narxda taxminan 2,5× tez.

Haqiqiy cheklovlar

  • Muhim yo‘nalishlar GPT-5.6’da: DeepSWE’da Opus 5 — 68,8%, Sol — 72,7%. Artificial Analysis’ning to‘g‘ridan-to‘g‘ri taqqoslashida umumiy indeks 67:67, ammo GPT-5.6 DeepSWE va Terminal-Bench’da yutadi, vazifalarni tezroq va arzonroq tugatadi. Bizdagi #1 o‘rinni aynan shu tor qo‘shimcha mezon hal qiladi.
  • Fable tor cho‘qqilarni saqlaydi: FrontierCode 53,5% ga 53,4% va biroz yuqori CursorBench maksimumi.
  • Max tejashni yeb qo‘yishi mumkin: Artificial Analysis juda ko‘p chiqish tokenini o‘lchadi. Agent ikki baravar token sarflasa, arzon token yordam bermaydi.
  • Migratsiyada ikki ilmoq: Web fetch va Priority Tier yo‘q; fikrlash standart yoqilgan, nostandart sampling rad etiladi, prompt va budjet qayta tekshiriladi.
  • Xavfsizlik chegaralari seziladi: Manba kodidagi zaiflikni topadi, ammo tasdiqlangan dasturlardan tashqarida pentest, eksploit yaratish va binary skan bloklanadi.
03

Benchmark natijalari

Frontier-Bench v0.1 — 43,3% (#1)

Anthropic mini-SWE-agent bilan har vazifaga besh urinish qilgan; Sol (34,4%) va Fable 5 (33,7%) dan oldinda.

CursorBench 3.2 — Fable 5 dan 0,5 punkt ortda

Max’da deyarli teng va yarim narx; Cursor kichik farqlar statistik ahamiyatsiz bo‘lishi mumkinligini aytadi.

DeepSWE v1.1 — 68,8%

Uzoq repo ishida kuchli, ammo Fable 5 (69,7%) va Sol (72,7%) dan past.

FrontierCode 1.1 Main — 53,4%

Fable 5 (53,5%) bilan amaliy durang, Sol (47,5%) dan yuqori.

Artificial Analysis Intelligence Index — 61 (#1)

To‘qqiz bahodagi ilk mustaqil natija qobiliyatni tasdiqlaydi va token sarfi haqida ogohlantiradi.

04

Xulosa

Claude Opus 5 kodlashda bizning #2: Fable 5 dan yuqori va umumiy kodlash qobiliyati bo‘yicha GPT-5.6 bilan amalda teng. Opus Frontier-Bench va repozitoriyni tushunish testida yutadi, Fable’ning eng yaxshi natijalariga deyarli yetadi va undan ikki baravar arzon. GPT-5.6 esa DeepSWE, Terminal-Bench, tezlik va bajarilgan vazifa narxi tufayli tor qo‘shimcha mezonda #1 bo‘ladi. Noaniq, ko‘p faylli, chuqur mulohaza va tekshiruv talab qiluvchi ishni Opus 5 bilan boshlang.

05

Ko'p so'raladigan savollar