O'rin #4 Dasturlash — Ishlab chiqarish (Production) uchun kod yozadigan SI
Moonshot AI

Kimi K3

Kimi K3 dasturlash reytingida vaqtincha 3-o‘rinni egallaydi, chunki uchta dalil bir xil xulosaga olib keladi: Arena’ning ko‘r-ko‘rona frontend sinovida dastlabki 1-o‘rin, kuchli mustaqil natijalar va Moonshot’ning uzoq muhandislik vazifalaridagi noodatiy yuqori ko‘rsatkichlari. Tasvirlarni qabul qilish va bir million tokenli kontekst vazifa shunchalik cho‘ziladiki, oddiy chat modeli muhim narsani unutib qo‘yishi mumkin bo‘lgan paytda ayniqsa foydali.

Yangilangan 2026-yil 18-iyul Agentic CodingFrontend LeaderLong-Horizon
9.810 dan
Rasmiy veb-sayt
Eng mos

Kimi K3 dasturlash reytingida vaqtincha 3-o‘rinni egallaydi, chunki uchta dalil bir xil xulosaga olib keladi: Arena’ning ko‘r-ko‘rona frontend sinovida dastlabki 1-o‘rin, kuchli mustaqil natijalar va Moonshot’ning uzoq muhandislik vazifalaridagi noodatiy yuqori ko‘rsatkichlari. Tasvirlarni qabul qilish va bir million tokenli kontekst vazifa shunchalik cho‘ziladiki, oddiy chat modeli muhim narsani unutib qo‘yishi mumkin bo‘lgan paytda ayniqsa foydali.

Nima uchun bu eng yaxshisi

Arena Kimi K3’ni WebDev’da 1679 Elo bilan Claude Fable 5, GPT-5.6 Sol va Grok 4.5’dan oldinga qo‘yadi, ammo natija hozircha dastlabki. Artificial Analysis K3’ga umumiy 57 ball va GDPval-AA v2’da 1668 Elo beradi. Moonshot SWE Marathon’da 42% va Terminal-Bench 2.1’da 88.3% e’lon qilgan. Mahalliy tasvir kirishi, 1M kontekst, Kimi Code va API bu qobiliyatlarni amaliy qiladi.

E'tibor bering

Dastlabki natijalar hayajonli, ammo taqqoslashlar to‘liq adolatli emas. Kimi K3 uchun Artificial Analysis Coding Agent Index’ning to‘liq mustaqil natijasi hali yo‘q, Moonshot jadvalida esa modellar turli vositalar bilan sinalgan: KimiCode, Claude Code, Codex va Terminus. Arena yetakchiligi dastlabki, va’da qilingan vaznlar hali chiqmagan, Artificial Analysis esa 51% gallyutsinatsiya va juda yuqori token sarfini o‘lchagan.

01

Aslida bu nima

Hech bir dasturlash benchmarki modelning barcha qobiliyatini ko‘rsatmaydi. Qisqa test bitta to‘g‘ri javobni tekshirishi mumkin, real dasturiy ish esa repozitoriyni o‘qish, vositalardan foydalanish, xatodan keyin davom etish va ko‘p bosqich davomida asl maqsadni eslab qolishni ham talab qiladi. Kimi K3 qiziq, chunki uning eng kuchli dalillari shu murakkab sharoitlarning bir nechtasini qamrab oladi: vizual frontend, terminal vositalari, katta repozitoriylar va uzoq muhandislik sessiyalari.

Eng e’tiborli natija Arena’ning ko‘r-ko‘rona WebDev reytingidir. K3 1679 Elo bilan Claude Fable 5 (1631), GPT-5.6 Sol (1618) va Grok 4.5 (1558)dan oldinda. Odamlar yaratilgan ilovalarni qaysi model ishlab chiqqanini bilmasdan taqqoslaydi. Bu natija web interfeysi qanday ko‘rinishi va undan foydalanish qanchalik qulay ekaniga e’tibor beradiganlar uchun ayniqsa muhim. Biroq Arena natijani dastlabki deb belgilagan, shuning uchun ko‘proq ovoz kelishi bilan o‘rin o‘zgarishi mumkin.

Uzoq muddatli natijalar frontend g‘alabasi tasodif bo‘lmasligi mumkinligini tushuntiradi. SWE Marathon’da K3 42%, Fable 5 esa keltirilgan 35%ga ega, ikkalasi Claude Code bilan. Uzoq muhandislik ishi bitta daho javob emas. Repozitoriyni o‘qish, taxmin qurish, faylni o‘zgartirish, test ishlatish, xatoni ko‘rish va asl maqsadni unutmasdan qayta boshlash kerak.

Mustaqil umumiy dalillar ham kuchli. Artificial Analysis K3’ga Intelligence Index’da 57 ball va GDPval-AA v2’da 1668 Elo beradi. Model Fable 5 va GPT-5.6 Sol’dan keyinda, ammo Grok 4.5’dan oldinda turadi. Grok’ning o‘rniga K3’ni #3 qilishning asosiy sababi shu. Grok arzonroq, K3 esa talabchanroq vazifalarni bajarishga qodirroq ko‘rinadi.

K3 bir million tokenli kontekst, tasvirlarni qabul qilish va 2.8 trillion parametrli siyrak arxitekturaga ega. Amalda bu skrinshot va dizayn namunalarini ko‘rish bilan birga juda katta hajmdagi kod hamda hujjatlarni bitta vazifa ichida hisobga olish imkonini beradi. Bu har bir promptga million token joylash kerak degani emas; keraksiz material modelning diqqatini susaytirishi mumkin. Qo‘shimcha sig‘im loyiha haqiqatan ko‘p muhim fayl va hujjatdan iborat bo‘lganda foydali.

Kimi Code qobiliyatni terminal mahsulotiga aylantiradi, OpenAI-mos API esa sinovni osonlashtiradi. $3/$15 narx K3’ni arzon agentlar va premium modellar o‘rtasiga qo‘yadi. $0.30 kesh barqaror kontekst qayta ishlatilsa foydali. Lekin birinchi javobni emas, testdan o‘tgan patch narxini o‘lchang.

Muhim bir izoh bor: Moonshot jadvali turli agent vositalaridan foydalangan tizimlarni solishtiradi. K3 KimiCode bilan, GPT Codex bilan, Claude esa Claude Code yoki Terminus bilan ishlashi mumkin. Bu yordamchi vositalar mavjud buyruqlarni, qayta urinish tartibini va qaysi kontekst saqlanishini belgilaydi. K3 Terminal-Bench 2.1’da 88.3% olganini aytish to‘g‘ri. Faqat shu raqam K3 modelining o‘zi barcha raqiblardan ustunligini isbotlaydi, deyish esa noto‘g‘ri.

Yana ikki cheklov K3’ning yuqoriroq o‘rin olishiga to‘sqinlik qiladi. Moonshot’ning o‘z taqqoslashida Fable 5 FrontierSWE’da K3’dan oldinda va SWE-Bench Pro bo‘yicha ham ancha kuchliroq e’lon qilingan dalilga ega. K3 uchun to‘liq mustaqil Artificial Analysis Coding Agent Index natijasi ham hali yo‘q; aynan shu dalil Grok’ning dasturlash samaradorligi haqidagi da’vosini aniqroq qiladi.

Shuning uchun reyting ehtiyotkor: Kimi K3 vaqtincha #3. Uni vizual, frontendga yo‘naltirilgan, katta kontekst talab qiladigan yoki agent uzoq vaqt ishlaydigan vazifalar uchun tanlang. Mustaqil coding-agent dalillari Fable 5 va GPT-5.6 darajasida chuqurlashmaguncha, ular yuqorida qoladi. Qaysi model tanlanishidan qat’i nazar, test va kod tekshiruvini jarayonda qoldiring: katta kontekst oynasi agentning noto‘g‘ri taxminni uzoq vaqt davom ettirishiga to‘sqinlik qilmaydi.

02

Kuchli tomonlar va halol cheklovlar

Asosiy afzalliklari

  • Frontend natijasini e’tiborsiz qoldirish qiyin: Arena’ning ko‘r-ko‘rona WebDev jadvali Kimi K3’ga 1679 Elo beradi; Fable 5 — 1631, GPT-5.6 Sol — 1618, Grok 4.5 — 1558. Bu test savollari emas, tayyor interfeyslar bo‘yicha inson tanlovi—biroq Arena natijani hali dastlabki deb belgilaydi.
  • Uzoq muddatli muhandislik uning eng aniq kuchi: Moonshot SWE Marathon’da 42% ko‘rsatadi, Fable 5 uchun keltirilgan 35%dan yuqori; ikkisi ham Claude Code orqali baholangan. Shu nazoratli qism K3 uzoq vazifada izlash, o‘zgartirish, sinash va maqsadni saqlashini ko‘rsatadi.
  • Mustaqil umumiy dalil dasturlash hikoyasini qo‘llaydi: Artificial Analysis K3’ga Intelligence Index’da 57 va GDPval-AA v2’da 1668 Elo beradi. Bular faqat kod sovrinlari emas, ammo rejalash, vositalardan foydalanish va professional muammo yechish Moonshot testlarigagina bog‘liq emasligini ko‘rsatadi.
  • Tasvirlarni qabul qilish va bir million tokenli kontekst bir-birini yaxshi to‘ldiradi: K3 skrinshot, sxema, dizayn namunasi va repozitoriy kontekstini bitta jarayonda ishlatadi. Bu screenshot-to-code, vizual debugging, UI iteratsiyasi va katta kod bazasini har safar promptni qayta tuzmasdan o‘rganishda ayniqsa foydali.
  • Kimi Code amaliy dasturlash vositalarini beradi: Model Kimi Code terminal jarayonida va Moonshot’ning OpenAI-mos API’sida mavjud. Kimi Code K3’ga fayllarni ko‘rish, terminal vositalaridan foydalanish, loyihani tahrirlash va testdan o‘tgan natijagacha ishlash imkonini beradi.
  • Premium yetakchilardan arzonroq, ammo eng arzon variant emas: API narxi har million token uchun $3 kirish / $15 chiqish, keshlangan kirish esa $0.30. Bu Grok 4.5’dan qimmat, lekin Fable 5’ning asosiy narxlaridan ancha past va o‘xshash katta kontekst hamda tasvir imkoniyatlarini taklif qiladi.

Haqiqiy cheklovlar

  • Eng muhim mustaqil kod sinovi hali yetishmaydi: Artificial Analysis K3’ning umumiy va agent qobiliyatlarini o‘lchadi, lekin to‘liq Coding Agent Index’ni chiqarmadi. Shu sabab Grok 4.5’da kod vazifasi narxi bo‘yicha tozaroq mustaqil dalil bor.
  • Turli agent vositalari ishlab chiqaruvchi natijalarini to‘g‘ridan-to‘g‘ri taqqoslashni qiyinlashtiradi: K3 ko‘pincha KimiCode bilan, raqiblar esa Codex, Claude Code yoki Terminus bilan ishlaydi. Bu vositalar promptlar, qayta urinishlar, mavjud buyruqlar va kontekst boshqaruvini o‘zgartiradi; shu sabab 88.3% kuchli Kimi tizimini ko‘rsatadi, modelning o‘zi har bir raqibdan ustunligini emas.
  • Fable muhim yo‘nalishlarda hamon yutadi: Moonshot’ning o‘z taqqoslashida Fable 5 FrontierSWE’da oldinda, SWE-Bench Pro dalillari ham Fable foydasiga. K3 frontend va uzoq vazifalar uchun muvozanatli raqib, barcha repozitoriylarni tuzatish chempioni emas.
  • Ochiq vaznlar mavjud — ammo ularni ishga tushirish boshqa masala: Moonshot 27-iyulda to’liq 2.8 trillion parametrli vaznlarni Modified MIT litsenziyasi ostida nashr etdi. Biroq, MXFP4 formatida taxminan 1.4 terabayt hajmda, ishlab chiqarishda ishlash uchun o’nlab H100 sinfidagi GPU kerak. K3 haqiqatan ham o’z-o’ziga host qilish mumkin, ammo aksariyat dasturchilar uchun joylashtirilgan API amaliy yo’l bo’lib qoladi.
  • Gallyutsinatsiya va yuqori token sarfi ehtiyotkorlikni talab qiladi: Artificial Analysis 51% gallyutsinatsiya va Intelligence Index sinovida qariyb 130 million chiqish tokenini o‘lchadi. Yaratilgan kod baribir test, xavfsizlik tekshiruvi va jozibali kesh narxiga emas, yakunlangan vazifa qiymatiga asoslangan byudjetni talab qiladi.
03

Benchmark natijalari

Arena WebDev — 1679 Elo (#1, dastlabki)

Frontend va web vazifalarida ko‘r-ko‘rona inson tanlovi. K3 Fable 5, GPT-5.6 Sol va Grok 4.5’dan oldinda, ammo Arena yangi natijani aniq dastlabki deb belgilaydi.

Artificial Analysis Intelligence Index — 57

Fable 5 va GPT-5.6 Sol’dan keyin, Grok 4.5’dan oldinda turgan mustaqil yig‘ma natija. Alohida coding agent g‘alabasini da’vo qilmasdan frontier qobiliyatini tasdiqlaydi.

GDPval-AA v2 — 1668 Elo

Opus 4.8 va Grok 4.5’dan yuqori, Fable 5 va GPT-5.6 Sol’dan past mustaqil professional ish signali.

SWE Marathon — 42%

Moonshot’dagi eng toza kod taqqoslash: K3 va Fable 5 bir xil Claude Code’dan foydalanadi, K3 esa Fable’ning 35% natijasidan oldinda.

Terminal-Bench 2.1 — 88.3%

Terminal agenti uchun a’lo vendor natijasi, GPT-5.6 Sol’ning 88.8%idan sal past. Harnesslar turlicha bo‘lgani uchun modelaro taqqoslash ehtiyotkorlik talab qiladi.

04

Xulosa

Kimi K3 bugun Fable 5 va Grok 4.5 orasida vaqtinchalik 3-o‘ringa loyiq. Bu faqat launch shovqini emas: mustaqil frontier aql, katta dastlabki frontend ustunligi, SWE Marathon’da Fable ustidan nazoratli g‘alaba va haqiqiy dasturchi muhiti bor. U yuqoriga chiqmaydi, chunki Fable va GPT-5.6 agent kod bo‘yicha kengroq va yetukroq dalilga ega, aralash harnesslar va Coding Agent Index yo‘qligi esa noaniqlik qoldiradi. Uzoq, vizual, frontendga boy yoki ulkan repozitoriy ishlari uchun K3’ni; narx muhim bo‘lsa Grok’ni; eng chuqur dalilli qiyin yo‘nalishlar uchun Fable va Sol’ni tanlang.

05

Ko'p so'raladigan savollar