O'rin #2 Dasturlash — ishlab chiqarishga tayyor kod yozadigan SI
Anthropic

Claude Opus 5

Dalillar bo'yicha yetakchi frontier dasturchi, tekshiruvda esa g'ayrioddiy sabrli. Opus 5 bizda #2 bo'lib qolishining yagona sababi — ushbu qo'llanma Codex integratsiyasi, terminal va kompyuter-foydalanish samaradorligi hamda bajarilgan vazifa narxi uchun GPT-6 Astra ga ochiq qo'shimcha ustunlik beradi.

Yangilangan 2026-yil 29-avgust Agentic CodingFrontier-Bench SOTARoot-Cause Debugging
9.910 dan
Rasmiy veb-sayt
Eng mos

Dalillar bo'yicha yetakchi frontier dasturchi, tekshiruvda esa g'ayrioddiy sabrli. Opus 5 bizda #2 bo'lib qolishining yagona sababi — ushbu qo'llanma Codex integratsiyasi, terminal va kompyuter-foydalanish samaradorligi hamda bajarilgan vazifa narxi uchun GPT-6 Astra ga ochiq qo'shimcha ustunlik beradi.

Nima uchun bu eng yaxshisi

Artificial Analysis'ning ishga tushirish davri ma'lumoti Opus ni taxminan 78.0 ball bilan GPT-5.6 Sol ning 77.4 ballidan ozgina oldinga qo'ygan edi; GPT-6 Astra'ning sentabrdagi ishga tushirilishi bilan jadval qayta masshtablandi (Fable 5.1 taxminan 70, Astra 67), shuning uchun bu raqam avlodlari qiyoslanmaydi. Terminal-Bench 3.0 ning ochiq jadvalida qariyb 42.7%, Intelligence Index v4.1.1 da esa taxminan 63 ball. U 1M kontekst, 128K chiqish va $5/$25 narxni saqlaydi.

E'tibor bering

Uning #2 o'rni jonli benchmark tartibi emas, tahririy mahsulot bahosidir. GPT-6 Astra hanuz Terminal-Bench, DeepSWE hamda fan va SRE yo'nalishlarida oldinda, Opus max effort esa sergap va sekinroq bo'lishi mumkin. Anthropic ning reliz ballari bilan hozirgi ochiq jadvallar bir-biriga aloqador suratlar, ammo o'zaro almashtiriladigan sonlar emas.

01

Aslida bu nima

Devordagi nam dog’ga duch kelgan ikki dasturchini tasavvur qiling. Biri ustidan bo’yab, ticketni yopadi. Ikkinchisi dog’ni kuzatib, suv sizayotgan quvurni topadi, quvurni tuzatadi va keyin qo’shni xonani ham tekshiradi. Claude Opus 5 ikkinchi dasturchi bo’lish uchun yaratilgan.

Relizdagi ushbu baholash endi Terminal-Bench 3.0 deb ataladi. Anthropic dastlab 43.3% ni e’lon qilgan; hozirgi ochiq jadval Opus 5 uchun taxminan 42.7%, keltirilgan GPT-5.6 Sol konfiguratsiyasi uchun 34.6% ko’rsatadi. Suratlar bir oz farq qiladi, ammo ikkalasi ham bitta saboqni beradi: Opus notanish terminal ishlarida g’ayrioddiy darajada kuchli.

Bir misol bu son ortidagi xarakterni tushuntiradi. Bevosita ko’ra olmaydigan chizma asosida mashina detalini qayta qurish so’ralganda, Opus 5 o’z vision pipeline ini yozdi, piksellardan geometriyani ajratdi va detalni FreeCAD da yaratdi. Boshqa vazifada paket menejeri xatosining ildiz sababini topib, hamjamiyat yamog’i o’tkazib yuborgan chekka holatni ham tuzatdi. Bular vendor misollari, tabiatning mustaqil qonunlari emas, lekin Anthropic nimani sozlaganini ko’rsatadi: dalillar mos kelguncha tekshirishni davom ettirish.

Nega u Fable 5 dan yuqoriga ko’tariladi

Fable ayrim finish suratlarida hanuz g’olib. FrontierCode da u 53.5%, Opus 5 esa 53.4%; maksimal CursorBench 3.2 bali ham qariyb yarim ball yuqori. Ammo reyting o’nli kasrlar muzeyi emas, xarid qaroridir. Opus 5 million kirish/chiqish tokeniga $5/$25 turadi — Fable ning $10/$50 narxidan aynan ikki baravar arzon — Fable dagi umumiy ma’lumot saqlash talabini qo’ymaydi va kamroq cheklovchi klassifikatorlarga ega. Natija deyarli teng bo’lsa, narx va deploy qulayligi ham unumdorlikning bir qismidir.

Mustaqil signal kuchaydi. Artificial Analysis v4.1.1 Opus 5 ga Intelligence Index da qariyb 63 va birinchi o’rin, Coding Agent Index da esa taxminan 78.0 beradi. O’sha sinov muhim ogohlantirishni ham saqlaydi: max effort juda ko’p token yaratishi mumkin.

Nega u #1 o’ringa ozgina yetmaydi

GPT-6 Astra DeepSWE v1.1 da 74.1% bilan Opus 5 ning 73.7% natijasidan sentabr jadvallarida oldinda, ustiga Terminal-Bench 4.0 da 57.9% va bozordagi eng yaxshi kompyuter foydalanishi. Artificial Analysis Astra ishga tushirilishi bilan dasturlash agentlari jadvalini qayta masshtabladi (Fable 5.1 taxminan 70, Astra 67), demak Opus davrining eski raqamlari qiyoslanadigan kataklar emas. Bizning #1 baribir Astra ga Codex, samaradorlik va bajarish qiymati bo’yicha qo’shimcha mezon bilan beriladi — u Opus dan aniq yaxshiroq kod yozgani uchun emas.

Vazifani shunday yo’naltiring:

Vazifa Eng yaxshi boshlanish nuqtasi
Noaniq xato, ildiz sabab izlash, ko’p faylli o’zgarish, frontendni vizual tekshirish Opus 5
Tezlik, yakunlangan vazifa narxi va bajarish eng muhim bo’lgan terminal ishi GPT-6 Astra
Budjet ikkinchi o’rinda turadigan eng yuqori CursorBench/FrontierCode vazifasi Fable 5
Narx chegarasi qat’iy bo’lgan oddiy ticketlar Avval past effort, keyin zarur bo’lsa oshiring

Yangilash yo’li g’ayrioddiy darajada qulay. Opus 5 1M kontekst oynasi, 128k maksimal chiqish, vision, PDF, prompt caching, batch processing va Claude vositalarini saqlaydi. Fikrlash adaptiv va standart yoqilgan; effort low dan max gacha boradi. Mavjud Opus 4.8 promptlari asosan ko’chishi kerak, ammo API web fetch va Priority Tier reliz paytida mavjud emasligini unutmaslik kerak.

Xulosa oddiy: Opus 5 Opus 4.8 ni to’liq almashtiradi va kundalik production hajmida Fable 5 ni oqlashni qiyinlashtiradi. Fable ayrim tor yo’nalishlarda ustun qimmat mutaxassis bo’lib qoladi. Opus 5 ni esa ko’proq muhandisga, ko’proq vazifada va uzoqroq muddatga bera olasiz — uning mulohazasini qimmatli qiladigan tekshiruv sikliga ham pulingiz yetadi.

02

Kuchli tomonlar va halol cheklovlar

Asosiy afzalliklari

  • Terminal-Bench 3.0 dagi yetakchilik: Avval Frontier-Bench nomi bilan tanishtirilgan benchmarkning ochiq jadvali endi Opus 5 ni taxminan 42.7% ga qo’yadi; keltirilgan GPT-5.6 Sol konfiguratsiyasi 34.6%. Bu test terminalda yashab, notanish muhandislik ishini oxiriga yetkaza oladigan agentni qadrlaydi.
  • Bayramdan oldin tekshiradi: Anthropic misollarida Opus 5 boshqa model faqat yuzaki yamagan muammolarning ildiz sababini topdi, jonli ma’lumot oqimi bo’lmaganda o’z sinov muhitini yaratdi va veb-interfeyslarni tayyor deb e’lon qilishdan oldin desktop hamda telefon kengligida tekshirdi.
  • Fable darajasidagi kodlashga yarim token narxida yaqin: Anthropic ga ko’ra, max effort rejimida u Fable 5 ning CursorBench 3.2 dagi eng yuqori natijasidan 0.5 foiz bandi ichida qoladi, kirish/chiqish tokeni esa $10/$50 o’rniga $5/$25 turadi.
  • Butun repozitoriy stolga sig’adi: 1M tokenli kontekst oynasi standart, maksimal chiqish 128k; Anthropic uzun kontekst bo’ylab ko’rsatmaga amal qilish, vosita ishlatish va mulohaza izchil qolishini aytadi. Bu migratsiya hamda ko’p faylli tekshiruvlar uchun muhim.
  • Jamoalar kod yozadigan joylarda mavjud: model ID si claude-opus-5; u Claude Code va Claude API da, shuningdek Amazon Bedrock, Google Cloud Vertex AI va Microsoft Foundry ro’yxatlarida bor. Fast mode asosiy narxni ikki baravar oshirib, taxminan 2.5 baravar tezlik beradi.

Haqiqiy cheklovlar

  • Muhim yo’nalishlar hanuz GPT-6 Astra ga tegishli: Opus 5 DeepSWE v1.1 da 73.7%, sentabr jadvallaridagi Astra’ning 74.1% dan atigi orqada; Astra, shuningdek, Terminal-Bench 4.0 ni 57.9% bilan olib boradi va Sol’ning taxminan uchdan bir tokenini sarflaydi. Artificial Analysis Astra ishga tushirilishi bilan dasturlash jadvalini qayta masshtabladi (Fable 5.1 taxminan 70, Astra 67), shuning uchun davrlararo indeks qiyoslari teng emas — lekin Astra’ning Codex integratsiyasi va token samaradorligi bizning #1 o’rin uchun qo’shimcha mezonimiz bo’lib qoladi.
  • Fable tor cho’qqilarda hamon g’olib: FrontierCode 1.1 Main da Fable 5 53.5%, Opus 5 esa 53.4%; Anthropic Opus 5 Fable ning maksimal CursorBench natijasidan sal pastligini aytadi. Kichik farqlar universal haqiqat emas, ammo ularni o’chirish ham kerak emas.
  • Max effort tejashni yeb qo’yishi mumkin: Artificial Analysis mustaqil sinovida Opus 5 max juda qobiliyatli, ammo sergap chiqqan. Agar agent ikki baravar token sarflasa, arzon tokenning foydasi yo’qoladi; o’z vazifalaringizda effort darajalarini sinang.
  • Migratsiyada ikkita platforma ilmog’i bor: Web fetch va Priority Tier reliz paytida qo’llanmaydi. Fikrlash standart holatda yoqilgan, nostandart sampling parametrlari rad etiladi; eski Claude integratsiyasidan kelayotgan jamoalar token budjeti va promptlarni qayta sinashi kerak.
  • Xavfsizlik chegaralari ko’rinadi: Opus 5 manba kodidagi zaifliklarni topa oladi, ammo klassifikatorlar tasdiqlangan dasturlardan tashqari penetration testing, exploit yaratish va binary asosidagi zaiflik skanini bloklaydi. Himoyaviy mutaxassislar ham xato bloklarga duch kelishi mumkin.
03

Benchmark natijalari

Terminal-Bench 3.0 — taxminan 42.7%

Hozirgi ochiq natija avvalgi Frontier-Bench relizidagi 43.3% ko'rsatkichidan keyingi suratdir. Surat va sinov muhiti tafsilotlari farq qiladi, shu sabab amaldagi nomni ishlating va ballga sana qo'ying.

CursorBench 3.2 — Fable 5 dan 0.5 ball ichida

Max effort da Anthropic Fable ning eng yuqori natijasiga yarim vazifa narxida yaqinlikni bildiradi; Cursor juda kichik ball farqlari statistik jihatdan ahamiyatsiz bo'lishi mumkinligidan ogohlantiradi.

DeepSWE v1.1 — 68.8%

Uzoq repozitoriy ishida kuchli, ammo Anthropic taqqoslashida Fable 5 ning 69.7% va GPT-5.6 Sol ning 72.7% natijasidan past.

FrontierCode 1.1 Main — 53.4%

Fable 5 ning 53.5% natijasi bilan amaliy durang va GPT-5.6 Sol ning 47.5% natijasidan yuqori; o'ndan bir ball amaliy himoya devori emas.

Artificial Analysis Intelligence Index — taxminan 63 (#1)

Hozirgi v4.1.1 mustaqil ma'lumoti Opus 5 ni keng intellekt frontierida birinchi o'ringa qo'yadi. Reliz haftasidagi eski 61 ball endi yangiligini yo'qotgan.

04

Xulosa

Claude Opus 5 — hozirgi keng mustaqil dalillar uni ozgina birinchi o’ringa qo’ysa ham — bizning #2 dasturlash modelimiz. Bu ataylab qilingan: ushbu qo’llanma Codex integratsiyasi, terminal va kompyuter-foydalanish samaradorligi, yo’naltirish va yakunlangan vazifa narxi uchun GPT-6 Astra ga mahsulot bo’yicha qo’shimcha ustunlik beradi. Arxitektura va tekshiruv muhim bo’lgan noaniq, ko’p faylli ishni Opus bilan; terminalga og’ir, katta oqimli va ish stoli ishini Astra bilan boshlang. Reyting jonli jadvalni qayta yozmaydi, o’z mezonini ochiq ko’rsatadi.

05

Ko'p so'raladigan savollar