O'rin #1 Dasturlash — ishlab chiqarishga tayyor kod yozadigan SI
OpenAI

GPT-6 Astra

GPT-6 Astra dasturlash toji sohibi bo'lish sharafini GPT-5.6 uni ushlab turgan xuddi shu xolis yo'l bilan saqlab qolmoqda: terminal sessiyalari, uzilgan konveyerlar (pipeline), nosozliklarni tergov qilish va butun tizimni sozlash kabi agentlik ishlarini oxirigacha yetkazish — endilikda Arena.ai Code Arena reytingida WebDev bo'yicha 1 797 ball bilan yangi 1-o'rinni egallagan holda va buning uchun Sol sarflagan tokenlarning taxminan uchdan birini ishlatib.

Yangilangan 2026-yil 5-sentabr Arena #1Coding AgentAgentic
9.910 dan
Rasmiy veb-sayt
Eng mos

GPT-6 Astra dasturlash toji sohibi bo'lish sharafini GPT-5.6 uni ushlab turgan xuddi shu xolis yo'l bilan saqlab qolmoqda: terminal sessiyalari, uzilgan konveyerlar (pipeline), nosozliklarni tergov qilish va butun tizimni sozlash kabi agentlik ishlarini oxirigacha yetkazish — endilikda Arena.ai Code Arena reytingida WebDev bo'yicha 1 797 ball bilan yangi 1-o'rinni egallagan holda va buning uchun Sol sarflagan tokenlarning taxminan uchdan birini ishlatib.

Nima uchun bu eng yaxshisi

Arena.ai'ning mustaqil Code Arena: WebDev reytingida 1 797 ball bilan yangi mutlaq 1-o'rin (Fable 5.1 Max'dan +35 ball, Opus 5 Max'dan +109 ball va Sol'dan +180 ball oldinda); shuningdek Data & Analytics, Consumer Product hamda Content Creation Tools bo'yicha 1-o'rin. Bunga qo'shimcha ravishda Terminal-Bench 4.0 bo'yicha 57,7–57,9% (Fable 5.1: 55,8%), DeepSWE v1.1 bo'yicha jadvaldagi eng yuqori 74,1%, Terminal-Bench Science bo'yicha 64,6%, SRE-Bench bo'yicha 88% pass@1 / 99,2% pass@4 hamda ExploitBench'da 100% natija. Artificial Analysis'ning agent indeksi hali ham Fable 5.1'ni biroz oldinda qo'ysa-da (70 ga 67), Astra aralash $40/Mtoken narxida Pareto chegarasini yangiladi va Sol tokenlarining uchdan birini sarflaydi.

E'tibor bering

WebDev va mahsulot vositalari bo'yicha Code Arena'da 1-o'rinni egallagan bo'lsa ham, Fable 5(.1) hali ham SWE-Bench Pro repozitoriy sinovlarida peshqadam va Artificial Analysis'ning o'z sinov indeksida (70 ga 67) oldinda bormoqda. API narxi Sol'dan 2,5 barobar yuqori ($10/$50), keshdan o'qish Fable 5.1'ning $0,25lik narxidan to'rt barobar qimmat, o'ta lo'nda javoblar hisobotni to'liq shakllantirish qadamlarini chetlab o'tadi, kuchaytirilgan kiberhimoya esa ekspluatatsiyaga yaqin vazifalarda qo'shimcha to'siq tug'diradi. Ishga tushirish jadvallari nashrdan keyin biroz o'zgardi: har bir alohida raqamni ±1–2 ball farq bilan qabul qiling.

01

Aslida bu nima

2026-yilning sentabr oyida dasturlash modellari haqidagi eng to’g’ri savol hali ham «qaysi biri aqlliroq?» degan mavhum bahs emas. Asosiy savol: «qaysi biri ushbu aniq vazifani oxiriga yetkaza oladi?» GPT-6 Astra boshqaruvni o’z qo’liga olib bunga javob beradi: u to’g’ridan-to’g’ri terminalda yashaydi, terminal yetmagan paytda brauzer va butun operatsion tizimni boshqaradi, birinchi muvaffaqiyatsizlikdan so’ng to’xtab qolmasdan harakatni davom ettiradi — va ayni bir xil vazifani bajarishda GPT-5.6 Sol sarflaydigan tokenlarning taxminan uchdan birini ishlatadi.

Haqiqiy foydalanuvchilar ovozlari va sintetik sinov raqamlari, barchasi xolis sanalari bilan: Arena.ai Code Arena reytingida Astra (Max) WebDev bo’yicha 1 797 ball bilan mutlaq 1-o’rinni egalladi — bu Claude Fable 5.1 Max (1 762 ball) dan +35 ballik, Opus 5 Max (1 688 ball) dan esa +109 ballik yaqqol ustunlik demakdir; shuningdek u Data & Analytics, Consumer Product hamda Content Creation Tools yo’nalishlarida 1-o’ringa chiqdi va aralash $40/Mtoken narxida Pareto chegarasini butunlay yangiladi. Sintetik testlarda esa: Terminal-Bench 4.0 da 57,7–57,9% (Fable 5.1: 55,8%), DeepSWE v1.1 da 74,1%, Terminal-Bench Science’da 64,6% va SRE-Bench’da 88% pass@1 / 99,2% pass@4. Artificial Analysis’ning o’z sinov muhiti hanuz Fable 5.1’ni 70, Astra’ni 67 ball bilan ko’rsatmoqda — biroq AA o’z reytingini Astra taqdimoti arafasida qayta masshtabladi. Bugungi kunda sinov muhitining tanlovi dasturlash ballariga yangi model avlodlaridan ham kuchliroq ta’sir ko’rsatmoqda.

Ushbu muvozanatning ikkinchi tomoni ham bor va biz uni aslo yashirmaymiz. SWE-Bench Pro bo’yicha murakkab dasturiy muammolarni bartaraf etish hamon Claude Fable ustunligi bo’lib qolmoqda, Anthropic’ning Claude Code sinov muhiti esa uzoq vaqt talab qiladigan keng ko’lamli repozitoriy ishlari uchun eng tabiiy makondir. Agar vazifangiz «ushbu muammolar ro’yxatini (issue tracker) to’g’ri va mukammal hal qil» shaklida bo’lsa, ishni Fable bilan boshlang. Agar ishingiz «veb-ilovani noldan qur, loyihamni yig’ (build), nosozlik sababini aniqla, tizimni sozla, ilmiy eksperimentni o’tkaz» ko’rinishida bo’lsa — ishni Astra bilan boshlang.

Vazifani to’g’ri yo’naltiring

Vazifa turi Qaysi birini tanlash kerak Sababi
Veb-dasturlash, full-stack vositalar, ma’lumotlar tahlili Astra Arena.ai Code Arena: WebDev’da 1-o’rin (1 797 ball, Fable 5.1’dan +35 ball)
Og’ir terminal tahlillari, murakkab migratsiyalar, tizim nosozliklarini tekshirish Astra Terminal va SRE bo’yicha eng yaxshi isbotlangan natija, bitgan ishga eng kam token sarfi
Faqat shell emas, balki brauzer yoki butun ish stolini boshqarish talab qilinadigan ishlar Astra Dasturlash agentlari ichida eng mukammal kompyuter boshqaruvi
Uzoq davom etuvchi repozitoriy ishlari, Claude Code ichida muammolarni hal qilish Fable 5 / Fable 5.1 SWE-Bench Pro va AA sinov muhitidagi mustahkam ustunlik
Kundalik vazifalar, PR tekshirish, testlar, kodni tozalash (refaktoring) Terra / Sol Eski hamyonbop narxlardagi tejamkor GPT bazaviy varianti
Mexanik o’zgartirishlar, shablon kodlar (scaffolding), ommaviy tekshiruvlar Luna Natijani testlar orqali avtomatik tekshirish mumkin bo’lganda juda tez va arzon

Iqtisodiy jihatlar ham alohida xolis tahlilga loyiq. Rasmiy narx million tokenga $10/$50 — bu Sol’dan 2,5 barobar yuqori deydi, $1lik keshdan o’qish narxi esa Fable 5.1 stavkasidan to’rt barobar baland — bu uzoq davom etadigan agentlik tsikllarida ancha sezilarli. Ammo Astra kamroq token sarflab fikrlaydi: o’xshash ishlarda Sol ishlatgan tokenlarning taxminan uchdan birini, Opus’ning esa beshdan birini sarflaydi. Shu sababli mustaqil tahlilchilar uni doimiy ravishda xarajat va samaradorlikning eng yuqori chegarasida ko’rishadi — ba’zan u bitta yakunlangan vazifa hisobida Fable 5’dan ham arzonroqqa tushadi. Ikkala tomonning hisob-kitoblariga ishonishdan oldin o’z repozitoriyangizni har ikki model orqali sinab ko’ring.

Ochiq aytilishi lozim bo’lgan kamchiliklar: Astra’ning o’ta qisqaligi tahlilchilar va baholovchi mezonlar kutadigan shakliy sayqallik qadamlarini chetlab o’tadi; uning yuqori kiberxavfsizlik ko’rsatkichlari (ExploitBench’da 100%, baholashda yangi 0-day zaifliklar) xavfsizlikka oid qonuniy ishlarni ham sekinlashtiradigan kuchaytirilgan cheklovlar bilan birga keladi; dastlabki ishga tushirish esa birmuncha noqulay bo’ldi — korporativ akkauntlarda Enterprise sukut bo’yicha o’chirilgan edi. Toj — haqiqiy, toj — tor va toj — aniq sanalarga bog’langan. Ikki haftadan so’ng jadvallarni yana bir bor qayta tekshirib ko’ring — biz buni albatta qilamiz.

02

Kuchli tomonlar va halol cheklovlar

Asosiy afzalliklari

  • Code Arena’da 1-o’rin va terminal yo’nalishi: Astra Arena.ai’ning Code Arena: WebDev reytingida 1 797 ball bilan umumiy 1-o’rinni egalladi — bu Fable 5.1 Max (1 762) dan +35 ball, Opus 5 Max (1 688) dan +109 ball ustunlik degani; shuningdek Data & Analytics, Consumer Product va Content Creation Tools toifalarida ham 1-o’ringa chiqdi. Bunga qo’shimcha tarzda Terminal-Bench 4.0 da 57,7–57,9% va DeepSWE v1.1 da 74,1% natija qayd etilib, mustaqil dasturchilarning real ovozlari uning sintetik testlardagi peshqadamligini to’liq tasdiqladi.
  • U olim kabi kod yozadi: Terminal-Bench Science testida 64,6% (Fable 5.1’dagi 52,6% va Sol’dagi 22,4%ga qarshi) hamda FrontierMath Tier 4’da taxminan 97,6%. Hisoblashga og’ir, ma’lumotlar bilan to’yingan va ilmiy tadqiqotga yaqin muhandislik ishlari uchun bu farq shunchaki kosmetik emas.
  • Token samaradorligi xarajatni butunlay o’zgartiradi: Mustaqil agent monitoringi Astra taqqoslanadigan dasturlash jarayonlarida Sol sarflagan tokenlarning uchdan bir qismini, Opus sarflagan tokenlarning esa beshdan bir qismini ishlatishini ko’rsatadi. Dasturlash agentlari sohasida Astra xarajat va qobiliyat chegarasida mustahkam turibdi va dastlabki qimmatroq narxiga qaramay, Fable 5’dan arzonroqqa ish bitirishi mumkin — buni narxlar ro’yxatida emas, o’z repozitoriyangizda sinab ko’ring.
  • Amalda qo’llash mumkin bo’lgan haqiqiy SRE va xavfsizlik muhandisligi: SRE-Bench’da 88% pass@1 va 99,2% pass@4, ExploitBench’da 100% natija hamda baholash davomida aniqlangan ilgari noma’lum bo’lgan nol kunlik (0-day) zaifliklar. Xavfsizlik va tizim ishonchliligi jamoalari bu yerda chinakam amaliy kuchga ega bo’ladi — ikki xil maqsadda ishlatilishi mumkin bo’lgan buyruqlarga rad javoblarining ko’payishi esa buning muqarrar to’lovidir.
  • Biror narsani ko’chirmasdan yangilanish: O’sha tanish Codex, o’sha ChatGPT Work, o’sha Responses API (gpt-6-astra), ustiga Azure, Bedrock, mos API ishlari uchun Zero Data Retention, taxminan 1,05 million tokenlik kontekst oynasi hamda Devin kabi vositalarda birinchi kungi integratsiya. Ish jarayoningizdagi hech bir infratuzilmani yangitdan ko’chirish shart emas.

Haqiqiy cheklovlar

  • O’z sinov muhiti indeksidagi peshqadamlik bugun Anthropic’ga tegishli: Artificial Analysis’ning o’z sinov muhiti Fable 5.1’ni 70, Astra’ni esa 67 ball bilan baholaydi (Codex konfiguratsiyasi); shuningdek SWE-Bench Pro bo’yicha masalalarni hal qilish hanuz Fable ustunligida qolmoqda (GPT-5.6 taqqoslashida Sol’ning 64,6%siga qarshi 80,3%). Claude Code muhiti ichida butun boshli repozitoriyni chuqur qayta qurish hali ham Fable foydasiga ishlaydi.
  • Yuqori premium narx: Million token uchun $10/$50 — bu Sol’dan 2,5 barobar qimmat. Keshdan o’qish $1 bo’lib, Fable 5.1’ning $0,25lik stavkasidan to’rt barobar baland, bu esa ko’p bosqichli agent ishlarida jiddiy xarajat tug’diradi; 272 ming tokendan oshgan buyruqlar 2x kirish / 1,5x chiqish hisoblanadi, tezkor rejim esa narxni ikki hissa oshiradi. Ko’pincha samaradorlik umumiy hisobni tejab qoladi, ammo har doim emas.
  • Amaliy to’siqlar mavjud: Lo’nda javoblar baholovchi tizimlar va tirik muhandislar e’tibor beradigan hisobot nozikliklarini chetlab o’tadi; birinchi kungi ishga tushirish tartibsiz kechdi va korporativ akkauntlarda Enterprise sukut bo’yicha o’chirilgan holda yetkazildi; kiberhimoya tizimlari ekspluatatsiyaga yaqin qonuniy buyruqlarni sekinlashtiradi; va vizual komponentlar bilan ishlash uchun modelning ichki tasvir yaratish imkoniyati yo’q.
03

Benchmark natijalari

Arena.ai Code Arena: WebDev — 1 797 ball (1-o'rin)

Arena.ai'ning mustaqil dasturchilar ovoziga asoslangan Code Arena reytingida yangi 1-o'rin (Claude Fable 5.1'dan +35, Opus 5'dan +109 va Sol'dan +180 ball oldinda); Data & Analytics, Consumer Product hamda Content Creation Tools toifalarida peshqadam va aralash $40/Mtoken narxida Pareto chegarasining yangi yetakchisi.

Artificial Analysis Coding Agent Index — Astra 67 · Fable 5.1 70

AA'ning o'z sinov muhiti, 2026-yil 4-sentabr holatiga. Jadval GPT-5.6 taqdimoti raqamlaridan so'ng (Sol 77,4 davri) qayta masshtablangan, shu sababli turli davrlardagi ko'rsatkichlar teng emas; sinov muhitining tanlovi ushbu ballarga modellarning yangilanishidan ko'ra kuchliroq ta'sir ko'rsatadi.

Terminal-Bench 4.0 — Astra 57,7–57,9%

OpenAI jadvali e'lon qilingandan so'ng biroz o'zgargan, oraliq shundan kelib chiqqan. Fable 5.1 ko'rsatkichi — 55,8%. Bu haqiqiy shell-muhandislik faoliyatiga eng yaqin ochiq sinov hisoblanadi.

DeepSWE v1.1 — Astra 74,1%

Amaldagi jadvalda eng yuqori natija, ammo o'ta zich raqobatda: Opus 5 — 73,7%, Gemini 3.8 Flash — 73,8%, Fable 5.1 — 67,4%. Bu ustunlik, lekin keskin farq emas.

Terminal-Bench Science — Astra 64,6%

Fable 5.1'ning 52,6% va Sol'ning 22,4%lik natijalariga nisbatan. Taqdimot to'plamidagi eng yaqqol va toza farq — sinov ishlab chiquvchi tomonidan o'tkazilgan, shu sababli uni o'z loyihalaringizda qayta tekshirib ko'ring.

SRE-Bench — 88% pass@1 · 99,2% pass@4

Tizim nosozliklarining real sharoitidagi ishonchlilik muhandisligi. ExploitBench'dagi 100%lik natija bilan birga, axborot xavfsizligi yo'nalishi ushbu relizning haqiqiy sakrashidir.

04

Xulosa

GPT-6 Astra kodlash bo’yicha bizning 1-o’rindagi tanlovimiz — u eng kuchli qo’shaloq asosga ega: mustaqil dasturchilarning ommaviy ovozlari bilan Arena.ai Code Arena’da WebDev, ma’lumotlar tahlili va mahsulot vositalari bo’yicha 1-o’rin, shuningdek terminaldagi mislsiz samaradorlik, ekotizim bilan chuqur integratsiya va yakunlangan har bir topshiriqning pastroq tannarxi. Veb-dasturlash, mustaqil agentlik, terminal va ilmiy yo’nalishdagi ishlarni Astra’ga topshiring; Claude Code muhitidagi uzoq davom etadigan murakkab repozitoriy ishlarini Fable 5’ga qoldiring; Sol, Terra va Luna esa arzon bazaviy tanlov bo’lib qolsin. Sinov muhitlari modellarning o’ziga qaraganda bir-biridan ko’proq farq qiladi — jamoangizni yangi modelga o’tkazishdan oldin natijani o’z repozitoriyangizda sinab ko’ring.

05

Ko'p so'raladigan savollar