2026-yilning sentabr oyida dasturlash modellari haqidagi eng to’g’ri savol hali ham «qaysi biri aqlliroq?» degan mavhum bahs emas. Asosiy savol: «qaysi biri ushbu aniq vazifani oxiriga yetkaza oladi?» GPT-6 Astra boshqaruvni o’z qo’liga olib bunga javob beradi: u to’g’ridan-to’g’ri terminalda yashaydi, terminal yetmagan paytda brauzer va butun operatsion tizimni boshqaradi, birinchi muvaffaqiyatsizlikdan so’ng to’xtab qolmasdan harakatni davom ettiradi — va ayni bir xil vazifani bajarishda GPT-5.6 Sol sarflaydigan tokenlarning taxminan uchdan birini ishlatadi.
Haqiqiy foydalanuvchilar ovozlari va sintetik sinov raqamlari, barchasi xolis sanalari bilan: Arena.ai Code Arena reytingida Astra (Max) WebDev bo’yicha 1 797 ball bilan mutlaq 1-o’rinni egalladi — bu Claude Fable 5.1 Max (1 762 ball) dan +35 ballik, Opus 5 Max (1 688 ball) dan esa +109 ballik yaqqol ustunlik demakdir; shuningdek u Data & Analytics, Consumer Product hamda Content Creation Tools yo’nalishlarida 1-o’ringa chiqdi va aralash $40/Mtoken narxida Pareto chegarasini butunlay yangiladi. Sintetik testlarda esa: Terminal-Bench 4.0 da 57,7–57,9% (Fable 5.1: 55,8%), DeepSWE v1.1 da 74,1%, Terminal-Bench Science’da 64,6% va SRE-Bench’da 88% pass@1 / 99,2% pass@4. Artificial Analysis’ning o’z sinov muhiti hanuz Fable 5.1’ni 70, Astra’ni 67 ball bilan ko’rsatmoqda — biroq AA o’z reytingini Astra taqdimoti arafasida qayta masshtabladi. Bugungi kunda sinov muhitining tanlovi dasturlash ballariga yangi model avlodlaridan ham kuchliroq ta’sir ko’rsatmoqda.
Ushbu muvozanatning ikkinchi tomoni ham bor va biz uni aslo yashirmaymiz. SWE-Bench Pro bo’yicha murakkab dasturiy muammolarni bartaraf etish hamon Claude Fable ustunligi bo’lib qolmoqda, Anthropic’ning Claude Code sinov muhiti esa uzoq vaqt talab qiladigan keng ko’lamli repozitoriy ishlari uchun eng tabiiy makondir. Agar vazifangiz «ushbu muammolar ro’yxatini (issue tracker) to’g’ri va mukammal hal qil» shaklida bo’lsa, ishni Fable bilan boshlang. Agar ishingiz «veb-ilovani noldan qur, loyihamni yig’ (build), nosozlik sababini aniqla, tizimni sozla, ilmiy eksperimentni o’tkaz» ko’rinishida bo’lsa — ishni Astra bilan boshlang.
Vazifani to’g’ri yo’naltiring
| Vazifa turi | Qaysi birini tanlash kerak | Sababi |
|---|---|---|
| Veb-dasturlash, full-stack vositalar, ma’lumotlar tahlili | Astra | Arena.ai Code Arena: WebDev’da 1-o’rin (1 797 ball, Fable 5.1’dan +35 ball) |
| Og’ir terminal tahlillari, murakkab migratsiyalar, tizim nosozliklarini tekshirish | Astra | Terminal va SRE bo’yicha eng yaxshi isbotlangan natija, bitgan ishga eng kam token sarfi |
| Faqat shell emas, balki brauzer yoki butun ish stolini boshqarish talab qilinadigan ishlar | Astra | Dasturlash agentlari ichida eng mukammal kompyuter boshqaruvi |
| Uzoq davom etuvchi repozitoriy ishlari, Claude Code ichida muammolarni hal qilish | Fable 5 / Fable 5.1 | SWE-Bench Pro va AA sinov muhitidagi mustahkam ustunlik |
| Kundalik vazifalar, PR tekshirish, testlar, kodni tozalash (refaktoring) | Terra / Sol | Eski hamyonbop narxlardagi tejamkor GPT bazaviy varianti |
| Mexanik o’zgartirishlar, shablon kodlar (scaffolding), ommaviy tekshiruvlar | Luna | Natijani testlar orqali avtomatik tekshirish mumkin bo’lganda juda tez va arzon |
Iqtisodiy jihatlar ham alohida xolis tahlilga loyiq. Rasmiy narx million tokenga $10/$50 — bu Sol’dan 2,5 barobar yuqori deydi, $1lik keshdan o’qish narxi esa Fable 5.1 stavkasidan to’rt barobar baland — bu uzoq davom etadigan agentlik tsikllarida ancha sezilarli. Ammo Astra kamroq token sarflab fikrlaydi: o’xshash ishlarda Sol ishlatgan tokenlarning taxminan uchdan birini, Opus’ning esa beshdan birini sarflaydi. Shu sababli mustaqil tahlilchilar uni doimiy ravishda xarajat va samaradorlikning eng yuqori chegarasida ko’rishadi — ba’zan u bitta yakunlangan vazifa hisobida Fable 5’dan ham arzonroqqa tushadi. Ikkala tomonning hisob-kitoblariga ishonishdan oldin o’z repozitoriyangizni har ikki model orqali sinab ko’ring.
Ochiq aytilishi lozim bo’lgan kamchiliklar: Astra’ning o’ta qisqaligi tahlilchilar va baholovchi mezonlar kutadigan shakliy sayqallik qadamlarini chetlab o’tadi; uning yuqori kiberxavfsizlik ko’rsatkichlari (ExploitBench’da 100%, baholashda yangi 0-day zaifliklar) xavfsizlikka oid qonuniy ishlarni ham sekinlashtiradigan kuchaytirilgan cheklovlar bilan birga keladi; dastlabki ishga tushirish esa birmuncha noqulay bo’ldi — korporativ akkauntlarda Enterprise sukut bo’yicha o’chirilgan edi. Toj — haqiqiy, toj — tor va toj — aniq sanalarga bog’langan. Ikki haftadan so’ng jadvallarni yana bir bor qayta tekshirib ko’ring — biz buni albatta qilamiz.