Reytingli qo'llanma

Dasturlash — ishlab chiqarishga tayyor kod yozadigan SI

Bular avtoto'ldirish o'yinchoqlari emas, dasturlash agentlari. GPT-6 Astra yetakchi, chunki u terminal ishini eng kam token bilan bajaradi, Claude Opus 5.5 esa mustaqil testlarda u bilan teng va katta, chigal kod bazalarida eng kuchli. Claude Sonnet 5.5 esa aniq chegaralangan xatolar va funksiyalar uchun tez va token narxi ikki baravar arzon variant. GPT-6.1 Sol va Grok 4.7 yuqori darajaga yaqin dasturlashni narxning kichik bir qismiga beradi, GLM-5.3, GLM-5.3-Flash va Qwen3.8-Max esa ro'yxatni narx va sifat nisbati yaxshi variantlar bilan to'ldiradi.

Avval qaror

Bizning reyting

G'olibdan boshlang, so'ng tanlovingizni o'zgartirishi mumkin bo'lgan murosalarni solishtiring.

#1 Dasturlash

GPT-6 Astra

OpenAI

GPT-6 Astra dasturlash toji sohibi bo'lish sharafini GPT-5.6 uni ushlab turgan xuddi shu xolis yo'l bilan saqlab qolmoqda: terminal sessiyalari, uzilgan konveyerlar (pipeline), nosozliklarni tergov qilish va butun tizimni sozlash kabi agentlik ishlarini oxirigacha yetkazish — endilikda Arena.ai Code Arena reytingida WebDev bo'yicha 1 797 ball bilan yangi 1-o'rinni egallagan holda va buning uchun Sol sarflagan tokenlarning taxminan uchdan birini ishlatib.

Nima uchun bu eng yaxshisi

Arena.ai'ning mustaqil Code Arena: WebDev reytingida 1 797 ball bilan yangi mutlaq 1-o'rin (Fable 5.1 Max'dan +35 ball, Opus 5 Max'dan +109 ball va Sol'dan +180 ball oldinda); shuningdek Data & Analytics, Consumer Product hamda Content Creation Tools bo'yicha 1-o'rin. Bunga qo'shimcha ravishda Terminal-Bench 4.0 bo'yicha 57,7–57,9% (Fable 5.1: 55,8%), DeepSWE v1.1 bo'yicha jadvaldagi eng yuqori 74,1%, Terminal-Bench Science bo'yicha 64,6%, SRE-Bench bo'yicha 88% pass@1 / 99,2% pass@4 hamda ExploitBench'da 100% natija. Artificial Analysis'ning agent indeksi hali ham Fable 5.1'ni biroz oldinda qo'ysa-da (70 ga 67), Astra aralash $40/Mtoken narxida Pareto chegarasini yangiladi va Sol tokenlarining uchdan birini sarflaydi.

Kamchiliklari

WebDev va mahsulot vositalari bo'yicha Code Arena'da 1-o'rinni egallagan bo'lsa ham, Fable 5(.1) hali ham SWE-Bench Pro repozitoriy sinovlarida peshqadam va Artificial Analysis'ning o'z sinov indeksida (70 ga 67) oldinda bormoqda. API narxi Sol'dan 2,5 barobar yuqori ($10/$50), keshdan o'qish Fable 5.1'ning $0,25lik narxidan to'rt barobar qimmat, o'ta lo'nda javoblar hisobotni to'liq shakllantirish qadamlarini chetlab o'tadi, kuchaytirilgan kiberhimoya esa ekspluatatsiyaga yaqin vazifalarda qo'shimcha to'siq tug'diradi. Ishga tushirish jadvallari nashrdan keyin biroz o'zgardi: har bir alohida raqamni ±1–2 ball farq bilan qabul qiling.

9.9 Tahririyat bahosi
Sharhni o'qish
Eng mos

GPT-6 Astra dasturlash toji sohibi bo'lish sharafini GPT-5.6 uni ushlab turgan xuddi shu xolis yo'l bilan saqlab qolmoqda: terminal sessiyalari, uzilgan konveyerlar (pipeline), nosozliklarni tergov qilish va butun tizimni sozlash kabi agentlik ishlarini oxirigacha yetkazish — endilikda Arena.ai Code Arena reytingida WebDev bo'yicha 1 797 ball bilan yangi 1-o'rinni egallagan holda va buning uchun Sol sarflagan tokenlarning taxminan uchdan birini ishlatib.

Nima uchun bu eng yaxshisi

Arena.ai'ning mustaqil Code Arena: WebDev reytingida 1 797 ball bilan yangi mutlaq 1-o'rin (Fable 5.1 Max'dan +35 ball, Opus 5 Max'dan +109 ball va Sol'dan +180 ball oldinda); shuningdek Data & Analytics, Consumer Product hamda Content Creation Tools bo'yicha 1-o'rin. Bunga qo'shimcha ravishda Terminal-Bench 4.0 bo'yicha 57,7–57,9% (Fable 5.1: 55,8%), DeepSWE v1.1 bo'yicha jadvaldagi eng yuqori 74,1%, Terminal-Bench Science bo'yicha 64,6%, SRE-Bench bo'yicha 88% pass@1 / 99,2% pass@4 hamda ExploitBench'da 100% natija. Artificial Analysis'ning agent indeksi hali ham Fable 5.1'ni biroz oldinda qo'ysa-da (70 ga 67), Astra aralash $40/Mtoken narxida Pareto chegarasini yangiladi va Sol tokenlarining uchdan birini sarflaydi.

E'tibor bering

WebDev va mahsulot vositalari bo'yicha Code Arena'da 1-o'rinni egallagan bo'lsa ham, Fable 5(.1) hali ham SWE-Bench Pro repozitoriy sinovlarida peshqadam va Artificial Analysis'ning o'z sinov indeksida (70 ga 67) oldinda bormoqda. API narxi Sol'dan 2,5 barobar yuqori ($10/$50), keshdan o'qish Fable 5.1'ning $0,25lik narxidan to'rt barobar qimmat, o'ta lo'nda javoblar hisobotni to'liq shakllantirish qadamlarini chetlab o'tadi, kuchaytirilgan kiberhimoya esa ekspluatatsiyaga yaqin vazifalarda qo'shimcha to'siq tug'diradi. Ishga tushirish jadvallari nashrdan keyin biroz o'zgardi: har bir alohida raqamni ±1–2 ball farq bilan qabul qiling.

#2

Claude Opus 5.5

Anthropic

Claude Opus 5.5 — ish katta va chigal bo'lganda chaqiriladigan dasturlash modeli: yuz minglab qatorli migratsiya, beshta servis orqali o'tadigan xato yoki endi hech kim to'liq tushunmaydigan eski tizim. Anthropic'ning o'z benchmarklarida u GPT-6 Astra'dan oldinda, mustaqil testlarda esa ikkalasi teng. Birinchi emas, ikkinchi o'rinda turishining yagona sababi — Astra terminaldagi xuddi shu ishni ancha kam token bilan bajaradi.

9.9 Tahririyat bahosi
Sharhni o'qish
#3

Claude Sonnet 5.5

Anthropic

Claude Sonnet 5.5 — kun bo'yi yoqib qo'yish mumkin bo'lgan dasturlash modeli: tez, token narxi Opus 5.5 nikidan ikki baravar arzon va shunchalik yaxshiki, ko'pchilik xato tuzatishlar, yangi funksiyalar va refaktoringlar uchun flagman model umuman kerak bo'lmaydi. Faqat kuch sarfi regulyatorini oxirigacha burab qo'ymang: eng yuqori rejimda u Artificial Analysis o'lchagan har qanday modeldan ko'proq yozadi, ayrim natijalar esa hatto yomonlashadi.

9.8 Tahririyat bahosi
Sharhni o'qish
#4

GPT-6.1 Sol

OpenAI

GPT-6.1 Sol — bu kun bo'yi tinimsiz ishlata oladigan va narxidan xavotir olmaslik mumkin bo'lgan dasturlash agenti. Mustaqil testlarda u OpenAI'ning yetakchi GPT-6 Astra modelidan atigi bir yoki ikki ballga ortda qoladi, lekin odatiy vazifa narxi uning to'rtdan biridan ham kam. Token narxi GPT-6 Sol'ga nisbatan o'zgarmagan (har 1 million token uchun 2 dollar kiritish, 10 dollar chiqarish), lekin keshlangan kodni qayta o'qish endi har million token uchun bor-yo'g'i 0,10 dollar turadi va aynan shu yerda yirik kod bazalarida katta mablag' tejab qolinadi.

9.8 Tahririyat bahosi
Sharhni o'qish
#5

Claude Fable 5.1

Anthropic

Agentli dasturlash uchun noziklashtirilgan Mythos sinfidagi mantiqiy dvigatel. Cheklangan Mythos 5.1 bilan bir xil vaznlar, ammo uzoq muddatli injiniring iqtisodiyotini o'zgartiradigan 75% kesh chegirmasi bilan optimallashtirilgan. Eng yaxshisi Claude Code da joylashtiriladi, bu yerda uning AA Coding Agent dagi 70 balli maydonda hukmronlik qiladi.

9.8 Tahririyat bahosi
Sharhni o'qish
#6

Grok 4.7

xAI

Grok 4.7 — reyting cho'qqisiga yaqin turgan eng arzon jiddiy dasturlash modeli. Million token uchun kiritishga $2 va chiqishga $6 narxda u DeepSWE da 71,0% va CursorBench 4.0 da 46,3% natija ko'rsatadi hamda to'g'ridan-to'g'ri Cursor va Grok Build ichida ishlaydi. Bu kundalik ish uchun kuchli dasturlash hamkori, lekin hali terminalda soatlab yolg'iz qoldirsa bo'ladigan agent emas.

9.7 Tahririyat bahosi
Sharhni o'qish
#7

GLM-5.3

Z.ai (Zhipu AI)

«Menga shuni yozib ber» qabilidagi ilk so'rovlardan keyin boshlanadigan eng asosiy bosqichlar — reja tuzish, tahrirlash, kodni sinab ko'rish, xatolarni to'g'rilash va butun boshli repozitoriydagi uzoq ish jarayonida yo'nalishni yo'qotmaslik uchun maxsus o'qitilgan og'ir toifadagi, ochiq vaznli dasturchi agent.

9.2 Tahririyat bahosi
Sharhni o'qish
#8

Qwen3.8-Max

Alibaba / Qwen Team

Vizual va uzun kontekstli dasturlash bo'yicha yuqori qiymatga ega raqobatchi. Endilikda, mustaqil testlar GLM-5.3 flagmanini oldinga qo'ygandan so'ng, u 6-o'rinni egallab turibdi. Uning yuklab olinadigan Max darajasidagi modeli hali ham ajoyib, ammo 2.4 trillion parametr uni o'zi xosting qilish uchun ma'lumotlar markazi darajasidagi loyihaga aylantiradi.

9.2 Tahririyat bahosi
Sharhni o'qish
#9

GLM-5.3-Flash

Z.ai (Zhipu AI)

Noodatiy arzon narxda frontierga yaqin coding va agentlik ishi, native vision hamda 1M kontekst. Bu yerda “Flash” kichik yoki ayniqsa tez degani emas — samarali va arzon degani.

9.2 Tahririyat bahosi
Sharhni o'qish
Savol va javoblar

Ko'p so'raladigan savollar