O'rin #3 Dasturlash — ishlab chiqarishga tayyor kod yozadigan SI
Anthropic

Claude Fable 5.1

Agentli dasturlash uchun noziklashtirilgan Mythos sinfidagi mantiqiy dvigatel. Cheklangan Mythos 5.1 bilan bir xil vaznlar, ammo uzoq muddatli injiniring iqtisodiyotini o'zgartiradigan 75% kesh chegirmasi bilan optimallashtirilgan. Eng yaxshisi Claude Code da joylashtiriladi, bu yerda uning AA Coding Agent dagi 70 balli maydonda hukmronlik qiladi.

ReasoningLong-ContextAgentic
9.810 dan
Rasmiy veb-sayt
Eng mos

Agentli dasturlash uchun noziklashtirilgan Mythos sinfidagi mantiqiy dvigatel. Cheklangan Mythos 5.1 bilan bir xil vaznlar, ammo uzoq muddatli injiniring iqtisodiyotini o'zgartiradigan 75% kesh chegirmasi bilan optimallashtirilgan. Eng yaxshisi Claude Code da joylashtiriladi, bu yerda uning AA Coding Agent dagi 70 balli maydonda hukmronlik qiladi.

Nima uchun bu eng yaxshisi

AA Coding Agent 70 (Claude Code ichida). CursorBench 3.2 73.4%. FrontierSWE v2 0.57. Terminal-Bench 4.0 55.8%. Kesh o'qishlari 75% ga arzonlashib, $0.25/MTok ga yetdi, bu repozitoriy bo'ylab chuqur izlanishlarni qulfdan chiqaradi.

E'tibor bering

Maksimal urinish ortiqcha tahrirlash tufayli SWE samaradorligini pasaytirishi mumkin (FrontierCode da o'rtacha urinish maksimalni ortda qoldiradi). DeepSWE 1.1 balli ortiqcha amalga oshirish tufayli 67.4% ga tushdi. Yuqori baza narxi ($10/$50) sovuq keshlarda limitlarni tezda tugatadi.

01

Aslida bu nima

Fable 5 ishga tushirilganda, u Mythos sinfidagi mantiqiy arxitektura, agar fikr yuritish uchun yetarli vaqt berilsa, dasturiy injiniring ko’rsatkichlarida hukmronlik qilishi mumkinligini isbotladi. Claude Fable 5.1 o’sha g’ildirakni qaytadan kashf etmaydi; aksincha, u ushbu fikrlash jarayonining iqtisodiyoti va integratsiyasini noziklashtiradi. Qattiq cheklangan Mythos 5.1 bilan bir xil vaznlarni keshni o’qishdagi ulkan 75% chegirma bilan birlashtirib, Anthropic o’ta qimmat uzoq ufqli agentni repozitoriy bo’ylab chuqur ishlash uchun amaliy vositaga aylantirdi.

To’g’ri jilovda (harness), Fable 5.1 deyarli tengsizdir. Claude Code ichida u Artificial Analysis Coding Agent da 70 ball to’plab, o’zini birinchi raqamli avtonom yordamchi sifatida namoyon qiladi. U CursorBench 3.2 da san’at cho’qqisini 73.4% ga ko’taradi va Terminal-Bench 4.0 da 55.8% ga sakraydi — Fable 5 ning 42.0% idan ulkan yaxshilanish. Cheklanmagan muhandislik ijrosini o’lchaydigan FrontierSWE v2 da uning 0.57 balli Opus 5 (0.52) dan qulay tarzda o’zib ketadi va Astra Sol (0.32) kabi raqobatchilarni uzoqda qoldiradi. Tajribali foydalanuvchilar, ayniqsa Jane Street uslubidagi murakkab kod bazalarini boshqaradiganlar, Fable 5.1 40 ta fayldan iborat chalkash bajarilish izlarida (execution traces) syujetni yo’qotmasdan izchillikni saqlashda ustun ekanligini ta’kidlamoqdalar.

Shu bilan birga, Fable 5.1 ning doimiy faol moslashuvchan fikrlashi katta ogohlantirish bilan birga keladi: ko’proq kuch sarflash aslida dasturiy injiniring samaradorligini yomonlashtirishi mumkin. Tizim kartasi ma’lumotlari shuni tasdiqlaydiki, FrontierCode da “o’rtacha” urinish (50.9%) “maksimal” urinishdan (50.3%) ustun turadi. Buning sababi, maksimal urinishda Fable 5.1 yechimlarni haddan tashqari ko’p muhandislik qilishga (over-engineer) moyil bo’lib, tasodifiy fayllarga o’zgartirishlar kiritadi, keraksiz hujjatlarni qo’shadi va faqat oddiy xatolikni tuzatish so’ralganda murakkab CI vazifalarini loyihalashtiradi. Aynan shu ortiqcha amalga oshirish (over-implementation) uning DeepSWE 1.1 balli biroz pasayib, 67.4% ga tushishiga sabab bo’ldi. Fable 5.1 dan eng yaxshi natijani olish uchun siz uni cheklashingiz kerak; standart vazifalar uchun uni o’rtacha urinishga mahkamlang va maksimal urinishni faqat uning fikrlashini boshqarish uchun ishonchli testlarga ega bo’lganingizdagina ishga tushiring.

Operatsion xarajatlar ham ehtiyotkorlik bilan boshqarishni talab qiladi. $0.25/MTok keshni o’qish narxi kashfiyot bo’lsa-da, Fable 5.1 o’zining ko’p so’zligi bilan mashhur va o’zidan oldingisiga qaraganda ~1.7 baravar ko’p token ishlab chiqaradi. MineBench foydalanuvchilari Fable 5 ga qaraganda 3 baravar qimmatroq va ikki baravar kechikishni ko’rganliklarini xabar qilishdi. Bundan tashqari, baza narxi million token uchun $10/$50 bo’lib qoladi; ulkan repozitoriyni sovuq keshga tushirish Claude dan foydalanish limitlaringizni tezda tugatadi. Va standart xavfsizlik tasniflagichlarini ishga tushirgani uchun, hujumkor xavfsizlik yoki ikki tomonlama foydalanishni rivojlantirishga qaratilgan vazifalar jimgina Opus ga yo’naltiriladi.

Claude Fable 5.1 - bu sizning React komponentingizning har bir qatorini avtomatik to’ldirishni xohlaydigan model emas. Astra kompyuterdan foydalanish va brauzerni avtomatlashtirishda yetakchilik qiladi va Opus 5 kundalik o’rtacha urinishli kodlash uchun ancha arzon. Ammo, qachonki siz chuqur o’rnashgan arxitektura xatosiga duch kelsangiz, sizga katta (senior) darajadagi rejalashtiruvchi kerak bo’lsa yoki ko’p soatlik seans davomida ulkan repozitoriyni sintez qila oladigan modelni talab qilsangiz — Fable 5.1 siz jangga olib kiradigan vositadir.

02

Kuchli tomonlar va halol cheklovlar

Asosiy afzalliklari

  • Claude Code chempioni: Anthropic ning o’z Claude Code ida foydalanilganda, Fable 5.1 Artificial Analysis Coding Agent da 70 ball to’plab, o’zidan oldingisini ham, Codex ga asoslangan muqobillarni ham ortda qoldiradi.
  • CursorBench va Terminal ustaligi: CursorBench 3.2 da 73.4% va Terminal-Bench 4.0 da 55.8% to’plab, chuqur integratsiyalashgan IDE vazifalari uchun yuqori darajadagi agent sifatidagi mavqeini mustahkamlaydi.
  • SWE uchun kesh iqtisodiyoti: Keshni o’qish narxining 75% ga pasayishi ($0.25/MTok) iterativ disk raskadrovka va repozitoriy miqyosida uzoq kontekstli qidiruvlarni kundalik muhandislik uchun iqtisodiy jihatdan foydali qiladi.
  • FrontierSWE yetakchisi: FrontierSWE v2 da 0.57 ga erishib, Opus 5 (0.52) ga nisbatan cheklanmagan, murakkab dasturiy ta’minot injiniringi vazifalarini hal qilishda ustun qobiliyatni namoyish etadi.
  • Jane Street uslubidagi chidamlilik: Tajribali foydalanuvchilarning ta’kidlashicha, Fable 5.1 Opus 5 ga qaraganda murakkabroq kodlash muammolarini hal qiladi va eng muhimi, uzun ko’p faylli bajarilish izlari (execution traces) bo’ylab o’qilishi oson va izchil bo’lib qoladi.

Haqiqiy cheklovlar

  • Ortiqcha tahrirlash tuzog’i: Ko’proq kuch sarflash har doim ham yaxshi kod degani emas. FrontierCode sinovlari shuni ko’rsatadiki, ‘o’rtacha’ urinish (50.9%) ‘maksimal’ (50.3%) ni ortda qoldiradi, chunki model fayllarga tasodifiy o’zgartirishlar kiritishga va yechimlarni haddan tashqari murakkablashtirishga moyil.
  • Tokenlarga chanqoqlik va kechikish: Model o’zining ko’p so’zligi bilan mashhur. MineBench foydalanuvchilari Fable 5 ga qaraganda ~3x qimmatroq va 2x ko’proq kechikishni qayd etishdi, chunki model o’rtacha ~1.7 baravar ko’p token ishlab chiqaradi.
  • Astra OS/Brauzer urushlarida g’alaba qozonmoqda: Fable 5.1 sof kodlashda porlasa-da, OSWorld 2.0 va kompyuterdan foydalanish vazifalarida Astra dan orqada qoladi, bu uni uchdan uchgacha brauzer avtomatlashtirish uchun unchalik ideal bo’lmagan tanlovga aylantiradi.
  • Sovuq kesh cheklovlari: $10/MTok sovuq o’qish narxi shuni anglatadiki, keshni isitmasdan ulkan repozitoriyni tushirish sizning Claude dan foydalanish limitlaringizni va API byudjetlaringizni tezda yondiradi.
  • Xavfsizlik tasniflagichlarining aralashuvi: U zaifliklarni topishi mumkin, lekin ekspluaytlar yozmaydi. Qonuniy hujumkor xavfsizlik tadqiqotlari yoki ikki tomonlama foydalanish mumkin bo’lgan kodlash vazifalari avtomatik ravishda Opus ga yo’naltiriladi.
03

Benchmark natijalari

AA Coding Agent — 70

Claude Code muhitida erishilgan, uni yetakchi agentli kodlash yordamchisi sifatida o'rnatadi.

CursorBench 3.2 — 73.4%

Fable 5 (70.5%) dan kuchli sakrash, uning uzoq ufqli IDE vazifalaridagi qadr-qimmatini isbotlaydi.

FrontierSWE v2 — 0.57

Cheklanmagan dasturiy ta'minot muhandisligi muammolarida Opus 5 (0.52) va Astra Sol (0.32) dan oldinda.

Terminal-Bench 4.0 — 55.8%

Fable 5 ning 42.0% idan ulkan sakrash, garchi u cheklanmagan Mythos 5.1 (60.9%) dan orqada qolsa ham.

04

Xulosa

Claude Fable 5.1 — bu ba’zan zanjirli arra bo’lishga harakat qiladigan skalpel. Agentli kodlash uchun muhim bo’lgan ko’rsatkichlarda — CursorBench, FrontierSWE va AA Coding Agent — u inkor etib bo’lmaydigan og’ir vaznli chempiondir. Keshni o’qishdagi 75% lik chegirma birinchi marta uzoq ufqli repozitoriy ishini yashovchan qiladi. Ammo uning yuqori urinishda ortiqcha amalga oshirish (over-implement) tendentsiyasi sezilarli token chanqoqligi bilan birgalikda, uning porlashi uchun intizomli so’rov (prompting) va jilovni (Claude Code kabi) talab qilishini anglatadi. Anthropic ning maslahati hali ham o’z kuchida: kundalik o’rtacha urinish talab qiladigan ishlaringiz uchun Opus 5 dan foydalaning, ammo sizga katta (senior) sharhlovchi, rejalashtiruvchi yoki allaqachon yozilgan testlarga ega murakkab xato (bug) kerak bo’lganda, maydonga Fable 5.1 ni chaqiring.