Ikki duradgorni tasavvur qiling. Birinchisi — uyga yangi zinapoya kerak bo’lib, hali hech kim chizmasini chizmagan paytda chaqiriladigan usta. Ikkinchisi — bir haftada qirqta eshik o’rnatadigan, har birini tekis qilib qo’yadigan ishonchli hunarmand.
Dasturchilar jamoasi haftasining katta qismi zinapoya emas, eshiklardan iborat: yiqilgan test, yangi maydon kerak bo’lgan forma, nomini o’zgartirgan API. Claude Sonnet 5.5 eshiklar uchun yaratilgan.
Anthropic uni 2026-yil 28-sentabrda, Opus 5.5 dan bir hafta o’tib, Claude 5.5 oilasining ikkinchi modeli sifatida chiqardi. Narxi Sonnet 5 nikidek qoldi: million kirish tokeni uchun $2, million chiqish tokeni uchun $10 — bu Opus 5.5 narxining yarmi. Anthropic’ning aytishicha, u Sonnet 5 dan 30% dan ko’proq tezroq ishlaydi va har bir vazifa uchun 30% gacha arzonroq tushadi, chunki ishni kamroq qadamda tugatadi.
Mustaqil raqamlar
Dasturlash agentlari uchun biz eng ko’p ishonadigan test — Terminal-Bench 4.0: haqiqiy buyruqlar qatoridagi uzoq, ko’p bosqichli vazifalar. Unda model narsalarni o’rnatishi, ishga tushirishi, xatolarni o’qishi va qayta urinib ko’rishi kerak.
Artificial Analysis bu testni 2026-yil sentabrda mustaqil ravishda o’tkazdi. Sonnet 5.5 64% oldi — har biri taxminan 60% olgan Opus 5.5 va GPT-6 Astra’dan biroz oldinda. Anthropic’ning o’z natijasi yuqoriroq, 70,6%, ammo ishlab chiqaruvchilarning test muhitlari odatda o’z modellariga yon bosadi, shuning uchun eslab qolish kerak bo’lgan raqam — mustaqil 64%. Qanday bo’lmasin, bu Anthropic jadvalida 10,3% olgan Sonnet 5 ga nisbatan ulkan sakrash.
Ikkinchi mustaqil manba ham umumiy manzarani tasdiqlaydi. Vals AI Sonnet 5.5 ni o’z indeksida 69,22% bilan 66 ta model ichida ikkinchi o’ringa qo’yadi — Opus 5.5 dan yarim balldan ham kamroq orqada, bir test narxi esa taxminan uchdan ikki qism. Ikki dasturlash reytingida u birinchi: Vibe Code Bench (tavsif asosida kichik ilovalar yaratish) — 92,39%, Code Migration — 69,83%.
Anthropic’ning o’z testlari nimani qo’shadi
Anthropic’ning taqdimot jadvali tafsilotlarni to’ldiradi:
- Kod o’zgarishini odam tegmasdan birlashtirish mumkinmi, degan savolni beradigan FrontierCode v1.1: xhigh kuch sarfida 52,1%. Opus 5.5 — 54,4%, GPT-6 Sol — 49,3%.
- Cursor muharriridagi haqiqiy sessiyalardan tuzilgan CursorBench 4.0: 55,5% — Opus 5.5 dan taxminan ikki ball past va Sonnet 5 ning 34,1% natijasidan ancha oldinda.
Eng foydalisi — narx grafiklari: ularda har bir modelning natijasi har bir kuch sarfi darajasidagi vazifa narxi bilan solishtirilgan. Ikki xulosa ajralib turadi. High rejimda (API’dagi standart) Sonnet 5.5 FrontierCode’da GPT-6 Sol’ning eng yaxshi natijasiga vazifa narxining taxminan beshdan biriga yetadi. Medium rejimda esa (Claude Code’dagi standart) u Terminal-Bench’da Sonnet 5 ning eng yaxshi natijasidan narxning o’ndan biridan ham kamroq evaziga o’zib ketadi.
Ilk sinovchilar ham shuni soddaroq so’zlar bilan aytadi. Lovable har bir vazifada shell buyruqlari taxminan ikki baravar kamayganini ko’rdi. Slack Sonnet 5 ga nisbatan taxminan 14% kamroq chiqish tokeni o’lchadi. Vazifani faqat o’zgarish ishga tushganda haqiqatan ishlasagina bajarilgan deb hisoblaydigan Unity esa Sonnet 5.5 ishining katta qismi bu tekshiruvdan o’tganini aytadi.
Kuch sarfi regulyatori — va nega eng yuqori daraja teskari natija beradi
Opus 5.5 singari Sonnet 5.5 da ham beshta darajali kuch sarfi regulyatori bor: low, medium, high, xhigh va max. Yuqori darajalar modelga uzoqroq o’ylash va ishini puxtaroq tekshirish imkonini beradi. Max eng yaxshisi bo’lishini kutish tabiiy. Sonnet 5.5 da esa ko’pincha bunday emas.
Artificial Analysis butun diapazonni o’zining Intelligence Index’ida o’lchadi:
| Kuch sarfi | Intelligence Index | Vazifa narxi |
|---|---|---|
| Low | 36 | $0,41 |
| Medium | 41 | $0,59 |
| High | 47 | $1,08 |
| Xhigh | 52 | $2,74 |
| Max | 56 | $7,60 |
Xhigh’dan max’ga o’tish deyarli uch baravar qimmatroq narxga to’rt ball qo’shadi. Max’da Sonnet 5.5 har bir vazifaga taxminan 193 000 ta chiqish tokeni yozdi. Bu Artificial Analysis shu paytgacha o’lchagan eng yuqori ko’rsatkich: max’dagi Opus 5.5 dan taxminan 60% ko’p va GPT-6 Astra’dan taxminan yetti baravar ko’p.
Eng yomoni, ko’proq kuch har doim ham yaxshiroq kod degani emas. FrontierCode’da Sonnet 5.5 xhigh’da 52,1%, max’da esa atigi 46,2% oladi. Anthropic sababini izohda tushuntiradi: max rejimda model Claude Code’ning tekshiruvni ko’plab yordamchi agentlarga taqsimlaydigan kod tekshiruvi jarayonini tez-tez ishga tushirgan. Ba’zi hollarda bu vaqt tugashiga yoki vazifadan tashqari qo’shimcha tahrirlarga olib kelgan, FrontierCode esa hech kim so’ramagan o’zgarishlar uchun ball kamaytiradi.
Xulosa oddiy: xhigh’ni shift deb hisoblang. Agar vazifa xhigh’da ham bajarilmasa, keyingi eng yaxshi qadam odatda max emas, Opus 5.5 bo’ladi.
Halol kamchilik
Arxitektor hamon Opus. Anthropic buni ochiq aytadi: bir qator testlarda max’dagi Sonnet 5.5 Opus 5.5 ga yaqinlashadi, ammo Anthropic’ning o’z testlarida ham, tashqi sinovchilarda ham uzoq davom etadigan mulohazani talab qiladigan murakkab, ochiq ishlarda Opus 5.5 aniq kuchliroq bo’lib qoladi. Opus FrontierCode va CursorBench’da ham yetakchilikni saqlab qoladi.
Claude Code hisobi ikki baravar kamaymaydi. Dasturlash agentlari loyihangizni to’xtovsiz qayta o’qiydi, bu qayta o’qishlar esa keshdan o’qish sifatida hisoblanadi — Sonnet 5.5 da ham, Opus 5.5 da ham million token uchun $0,20. Siz yangi kirish va chiqishda tejaysiz, lekin keshga ko’p tayanadigan uzoq sessiya sarlavhadagi «yarim narx» va’da qilganchalik tejamaydi.
Xavfsizlik ishlari boshqa modelga o’tkaziladi. Sonnet 5.5 — Anthropic eng kuchli modellarida qo’llaydigan kiberxavfsizlik himoyalari bilan chiqqan birinchi Sonnet modeli. Oddiy xato tuzatishga bu ta’sir qilmaydi, ammo jamoangiz Anthropic’ning Cyber Verification Program dasturi orqali tasdiqlanmagan bo’lsa, xavfliroq xavfsizlik vazifalari foydalanuvchiga ko’rinadigan tarzda Sonnet 5 ga o’tkaziladi.
O’tish biroz mehnat talab qiladi. Anthropic Sonnet 5 ga nisbatan beshta mos kelmaydigan o’zgarishni sanab o’tadi. Vositadan majburiy foydalanish endi xato qaytaradi, temperature’ning standart bo’lmagan qiymatlari rad etiladi, vosita chaqiruvlari orasidagi matn esa boshqa formatda qaytadi. Bularni tuzatish qiyin emas, lekin bir qatorni almashtirish bilan ish bitmaydi.
Qayerda mos keladi
| Agar vazifa… bo’lsa | Tanlang | Nega |
|---|---|---|
| aniq chegaralangan xato, funksiya yoki migratsiya | Claude Sonnet 5.5 | medium yoki high’da tez va arzon |
| ochiq arxitektura yoki hali hech kim chegarasini aniqlamagan muammo | Claude Opus 5.5 | Anthropic va sinovchilarga ko’ra aniq kuchliroq mulohaza |
| vazifa narxi eng past bo’lgan, nazoratsiz uzoq terminal ishi | GPT-6 Astra | Eng yuqori rejimda tokenlarning kichik bir qismini sarflaydi |
| frontendni sayqallash, slaydlar, kichik vizual loyihalar | Claude Sonnet 5.5 | Dizaynni nozik his qilish va tez iteratsiya |
Xulosa
Claude Sonnet 5.5 — ko’pchilik dasturchilar yoqib qo’yib qo’yishi kerak bo’lgan model. U eshiklarni — qirqtasini ham — tez va flagman token narxining yarmiga o’rnatadi. Uni medium yoki high’da ushlang, qiyin holatlar uchun xhigh’ni ishlating, buyurtma zinapoya bo’lib chiqsa esa — Opus’ni chaqiring.