Hech bir dasturlash benchmarki modelning barcha qobiliyatini ko‘rsatmaydi. Qisqa test bitta to‘g‘ri javobni tekshirishi mumkin, real dasturiy ish esa repozitoriyni o‘qish, vositalardan foydalanish, xatodan keyin davom etish va ko‘p bosqich davomida asl maqsadni eslab qolishni ham talab qiladi. Kimi K3 qiziq, chunki uning eng kuchli dalillari shu murakkab sharoitlarning bir nechtasini qamrab oladi: vizual frontend, terminal vositalari, katta repozitoriylar va uzoq muhandislik sessiyalari.
Eng e’tiborli natija Arena’ning ko‘r-ko‘rona WebDev reytingidir. K3 1679 Elo bilan Claude Fable 5 (1631), GPT-5.6 Sol (1618) va Grok 4.5 (1558)dan oldinda. Odamlar yaratilgan ilovalarni qaysi model ishlab chiqqanini bilmasdan taqqoslaydi. Bu natija web interfeysi qanday ko‘rinishi va undan foydalanish qanchalik qulay ekaniga e’tibor beradiganlar uchun ayniqsa muhim. Biroq Arena natijani dastlabki deb belgilagan, shuning uchun ko‘proq ovoz kelishi bilan o‘rin o‘zgarishi mumkin.
Uzoq muddatli natijalar frontend g‘alabasi tasodif bo‘lmasligi mumkinligini tushuntiradi. SWE Marathon’da K3 42%, Fable 5 esa keltirilgan 35%ga ega, ikkalasi Claude Code bilan. Uzoq muhandislik ishi bitta daho javob emas. Repozitoriyni o‘qish, taxmin qurish, faylni o‘zgartirish, test ishlatish, xatoni ko‘rish va asl maqsadni unutmasdan qayta boshlash kerak.
Mustaqil umumiy dalillar ham kuchli. Artificial Analysis K3’ga Intelligence Index’da 57 ball va GDPval-AA v2’da 1668 Elo beradi. Model Fable 5 va GPT-5.6 Sol’dan keyinda, ammo Grok 4.5’dan oldinda turadi. Grok’ning o‘rniga K3’ni #3 qilishning asosiy sababi shu. Grok arzonroq, K3 esa talabchanroq vazifalarni bajarishga qodirroq ko‘rinadi.
K3 bir million tokenli kontekst, tasvirlarni qabul qilish va 2.8 trillion parametrli siyrak arxitekturaga ega. Amalda bu skrinshot va dizayn namunalarini ko‘rish bilan birga juda katta hajmdagi kod hamda hujjatlarni bitta vazifa ichida hisobga olish imkonini beradi. Bu har bir promptga million token joylash kerak degani emas; keraksiz material modelning diqqatini susaytirishi mumkin. Qo‘shimcha sig‘im loyiha haqiqatan ko‘p muhim fayl va hujjatdan iborat bo‘lganda foydali.
Kimi Code qobiliyatni terminal mahsulotiga aylantiradi, OpenAI-mos API esa sinovni osonlashtiradi. $3/$15 narx K3’ni arzon agentlar va premium modellar o‘rtasiga qo‘yadi. $0.30 kesh barqaror kontekst qayta ishlatilsa foydali. Lekin birinchi javobni emas, testdan o‘tgan patch narxini o‘lchang.
Muhim bir izoh bor: Moonshot jadvali turli agent vositalaridan foydalangan tizimlarni solishtiradi. K3 KimiCode bilan, GPT Codex bilan, Claude esa Claude Code yoki Terminus bilan ishlashi mumkin. Bu yordamchi vositalar mavjud buyruqlarni, qayta urinish tartibini va qaysi kontekst saqlanishini belgilaydi. K3 Terminal-Bench 2.1’da 88.3% olganini aytish to‘g‘ri. Faqat shu raqam K3 modelining o‘zi barcha raqiblardan ustunligini isbotlaydi, deyish esa noto‘g‘ri.
Yana ikki cheklov K3’ning yuqoriroq o‘rin olishiga to‘sqinlik qiladi. Moonshot’ning o‘z taqqoslashida Fable 5 FrontierSWE’da K3’dan oldinda va SWE-Bench Pro bo‘yicha ham ancha kuchliroq e’lon qilingan dalilga ega. K3 uchun to‘liq mustaqil Artificial Analysis Coding Agent Index natijasi ham hali yo‘q; aynan shu dalil Grok’ning dasturlash samaradorligi haqidagi da’vosini aniqroq qiladi.
Shuning uchun reyting ehtiyotkor: Kimi K3 vaqtincha #3. Uni vizual, frontendga yo‘naltirilgan, katta kontekst talab qiladigan yoki agent uzoq vaqt ishlaydigan vazifalar uchun tanlang. Mustaqil coding-agent dalillari Fable 5 va GPT-5.6 darajasida chuqurlashmaguncha, ular yuqorida qoladi. Qaysi model tanlanishidan qat’i nazar, test va kod tekshiruvini jarayonda qoldiring: katta kontekst oynasi agentning noto‘g‘ri taxminni uzoq vaqt davom ettirishiga to‘sqinlik qilmaydi.