الترتيب #4 البرمجة — ذكاء اصطناعي يكتب شيفرة إنتاجية
Moonshot AI

Kimi K3

يحتل Kimi K3 المركز الثالث مؤقتًا في البرمجة لأن ثلاثة دلائل تحكي القصة نفسها: المركز الأول الأولي في اختبارات Arena العمياء للواجهات، ونتائج مستقلة قوية، وأرقام Moonshot اللافتة في المهام الهندسية الطويلة. يفيد إدخال الصور وسياق المليون رمز خصوصًا حين تطول المهمة إلى درجة قد ينسى معها نموذج محادثة عادي تفصيلًا مهمًا.

تم التحديث 18 يوليو 2026 Agentic CodingFrontend LeaderLong-Horizon
الأفضل لـ

يحتل Kimi K3 المركز الثالث مؤقتًا في البرمجة لأن ثلاثة دلائل تحكي القصة نفسها: المركز الأول الأولي في اختبارات Arena العمياء للواجهات، ونتائج مستقلة قوية، وأرقام Moonshot اللافتة في المهام الهندسية الطويلة. يفيد إدخال الصور وسياق المليون رمز خصوصًا حين تطول المهمة إلى درجة قد ينسى معها نموذج محادثة عادي تفصيلًا مهمًا.

لماذا تفوز

تضع Arena نموذج Kimi K3 أولًا في WebDev بدرجة 1679 Elo، أمام Claude Fable 5 وGPT-5.6 Sol وGrok 4.5، مع بقاء النتيجة أولية. تمنحه Artificial Analysis درجة 57 إجمالًا و1668 Elo في GDPval-AA v2. وتعلن Moonshot عن 42% في SWE Marathon و88.3% في Terminal-Bench 2.1. كما تجعل الصور الأصلية وسياق 1M وKimi Code والـAPI هذه القدرة قابلة للاستخدام.

انتبه إلى

النتائج الأولى مثيرة، لكن المقارنات ليست عادلة تمامًا. لم يحصل Kimi K3 بعد على نتيجة كاملة ومستقلة في Coding Agent Index، كما تختبر جداول Moonshot النماذج بأدوات مختلفة: KimiCode وClaude Code وCodex وTerminus. صدارة Arena أولية، والأوزان الموعودة لم تصدر، وقاست Artificial Analysis معدل هلوسة 51% مع استهلاك مرتفع جدًا للرموز.

01

ما هو في الواقع

لا يوضح اختبار برمجة واحد كل ما يستطيعه النموذج. قد يقيس اختبار قصير إجابة صحيحة واحدة، بينما يتطلب تطوير البرمجيات الفعلي أيضًا قراءة مستودع، واستخدام الأدوات، وتصحيح الأخطاء، وتذكر الهدف عبر خطوات كثيرة. تكمن أهمية Kimi K3 في أن أفضل أدلته تغطي عدة ظروف من هذه الظروف الأصعب: واجهات بصرية، وأدوات طرفية، ومستودعات كبيرة، وجلسات هندسية طويلة.

أعلى النتائج صوتًا هي قائمة WebDev العمياء في Arena. دخل K3 بدرجة 1679 Elo أمام Claude Fable 5 عند 1631 وGPT-5.6 Sol عند 1618 وGrok 4.5 عند 1558. يقارن البشر التطبيقات من دون معرفة النموذج الذي أنشأها. هذا مهم لمن يريد واجهة تبدو جيدة وتعمل جيدًا، لا مجرد كود يمر عبر المترجم. لكن Arena تصف النتيجة بأنها أولية وقد تتغير مع زيادة الأصوات.

تشرح اختبارات العمل الطويل لماذا قد لا يكون فوز الواجهات مصادفة. في SWE Marathon يحقق K3 نسبة 42% مقابل 35% مذكورة لـFable 5، وكلاهما يستخدم Claude Code. فالمهمة الهندسية الطويلة ليست إجابة عبقرية واحدة؛ إنها قراءة المستودع، ووضع فرضية، وتعديل ملف، وتشغيل اختبار، واكتشاف الخطأ، ثم المحاولة من جديد من دون نسيان الهدف.

الأدلة المستقلة قوية أيضًا. تمنح Artificial Analysis النموذج 57 نقطة و1668 Elo في GDPval-AA v2. ما زال خلف Fable 5 وGPT-5.6 Sol، لكنه أمام Grok 4.5. هذه هي علة نقله إلى المركز الثالث: يبقى Grok العداء الأرخص، بينما يبدو سقف K3 أعلى.

تصبح المعمارية مفيدة حين نشرحها ببساطة. مليون رمز من السياق مع فهم الصور وتصميم MoE ضخم يعني أن K3 يستطيع النظر إلى لقطة شاشة ومرجع تصميم، مع إبقاء قدر كبير من الكود والوثائق على الطاولة نفسها. ليس ذلك دعوة إلى ملء كل طلب بالنفايات؛ بل مساحة عمل إضافية عندما تكون أجزاء المشروع كثيرة فعلًا.

يحوّل Kimi Code هذه القدرة إلى منتج طرفية، وتسهل الـAPI المتوافقة مع OpenAI التجربة. سعر 3/15 دولارًا لكل مليون رمز يضعه بين الوكلاء الاقتصاديين والنماذج الممتازة. يفيد سعر التخزين المؤقت إن أُعيد استخدام سياق ثابت، لكن القياس الصحيح هو تكلفة تصحيح اختُبر، لا تكلفة أول إجابة.

تبقى الحاشية الضرورية: تقارن Moonshot أغلفة مختلفة. قد يستخدم K3 برنامج KimiCode، وGPT برنامج Codex، وClaude برنامج Claude Code أو Terminus. يحدد هذا الغلاف الأدوات والمحاولات والذاكرة. يمكن القول إن K3 حقق 88.3% في Terminal-Bench 2.1، لكن لا يمكن جعل الرقم وحده انتصارًا خالصًا للنموذج.

يتقدم Fable كذلك في FrontierSWE ويملك أدلة أقوى في SWE-Bench Pro، بينما يفتقد K3 إلى Coding Agent Index مستقل كامل. لذلك الحكم محدد: Kimi K3 هو الثالث مؤقتًا. يناسب العمل البصري والواجهات والسياق الضخم والجلسات الطويلة، ويبقى Fable وGPT-5.6 فوقه حتى يصبح عمق الدليل مساويًا لحجم الوعد.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • نتيجة الواجهات يصعب تجاهلها: تضع قائمة Arena العمياء لـWebDev نموذج Kimi K3 عند 1679 Elo، أمام Fable 5 عند 1631 وGPT-5.6 Sol عند 1618 وGrok 4.5 عند 1558. إنها تفضيلات بشرية لتطبيقات مبنية وليست أسئلة اختيار من متعدد، لكن Arena ما زالت تصف النتيجة بأنها أولية.
  • الهندسة طويلة الأمد هي تخصصه الأوضح: تعلن Moonshot عن 42% في SWE Marathon مقابل 35% مذكورة لـFable 5، مع تشغيل النموذجين عبر Claude Code. يدعم هذا الجزء الأكثر ضبطًا قدرة K3 على الاستكشاف والتعديل والاختبار والمثابرة في عمل ممتد.
  • الأدلة العامة المستقلة تدعم قصة البرمجة: تمنح Artificial Analysis النموذج 57 في Intelligence Index و1668 Elo في GDPval-AA v2. ليست جوائز برمجة خالصة، لكنها تؤكد أن التخطيط واستخدام الأدوات وحل مشكلات العمل لا تأتي فقط من اختبارات Moonshot.
  • الرؤية ومليون رمز ينتميان إلى صندوق أدوات واحد: يستطيع K3 جمع لقطات الشاشة والمخططات ومراجع التصميم وسياق المستودع. يفيد ذلك في تحويل الصورة إلى كود، وتصحيح الواجهة بصريًا، وتكرار التصميم، وفهم قواعد كود ضخمة.
  • يوفر Kimi Code أدوات تطوير عملية: يتاح النموذج داخل طرفية Kimi Code وعبر API متوافق مع OpenAI. يتيح Kimi Code لـK3 فحص الملفات واستخدام أدوات الطرفية وتعديل المشروع ومواصلة العمل حتى يصل إلى نتيجة مختبرة.
  • أرخص من القادة الممتازين من دون الادعاء بأنه رخيص: تكلف الـAPI 3 دولارات للإدخال و15 دولارًا للإخراج لكل مليون رمز، و0.30 دولار للمدخلات المخبأة. هو أغلى من Grok 4.5، لكنه أدنى بكثير من Fable 5 مع مجال مشابه للبرمجة البصرية والسياق الطويل.

قيود صادقة

  • أهم اختبار مستقل للبرمجة ما زال مفقودًا: قاست Artificial Analysis قدرات K3 العامة والوكيلية، لكنها لم تنشر تشغيلًا كاملًا لـCoding Agent Index. لذلك يحتفظ Grok 4.5 بالدليل المستقل الأنظف على تكلفة مهمة البرمجة.
  • اختلاف أدوات الوكلاء يصعّب المقارنة المباشرة بين الدرجات: يستخدم K3 غالبًا KimiCode بينما يستخدم المنافسون Codex أو Claude Code أو Terminus. تغيّر هذه الأدوات التعليمات والمحاولات والأوامر المتاحة وإدارة السياق؛ لذا فإن 88.3% دليل على قوة نظام Kimi، لا على تفوق النموذج وحده على الجميع.
  • ما زال Fable يفوز في مسارات مهمة: تضع مقارنة Moonshot نفسها Fable 5 أمام K3 في FrontierSWE، كما تميل أدلة SWE-Bench Pro المنشورة إلى Fable. K3 منافس متوازن للواجهات والعمل الطويل، وليس بطل إصلاح المستودعات في كل الحالات.
  • الأوزان المفتوحة متاحة — لكن تشغيلها مسألة أخرى: نشرت Moonshot الأوزان الكاملة البالغة 2.8 تريليون معامل في 27 يوليو تحت رخصة Modified MIT. لكن بحجم يقارب 1.4 تيرابايت بصيغة MXFP4، يحتاج التشغيل الإنتاجي إلى عشرات معالجات H100. K3 قابل للاستضافة الذاتية فعلاً، لكن لمعظم المطورين تبقى واجهة API المستضافة هي المسار العملي.
  • ينبغي مراقبة الموثوقية وشهية الرموز: قاست Artificial Analysis هلوسة 51% ونحو 130 مليون رمز إخراج في اختبارها. ما زال الكود يحتاج اختبارات ومراجعة أمنية وميزانية محسوبة على المهمة المكتملة.
03

لمحة عن المعايير

Arena WebDev — ‏1679 Elo (المركز 1، أولي)

تفضيل بشري أعمى في مهام الواجهات والويب. يتقدم K3 على Fable 5 وGPT-5.6 Sol وGrok 4.5، لكن Arena تضع بوضوح علامة أولية على النتيجة.

Artificial Analysis Intelligence Index — ‏57

نتيجة مستقلة مركبة خلف Fable 5 وGPT-5.6 Sol وأمام Grok 4.5. تدعم مستوى رائدًا من دون اختلاق فوز مخصص لوكيل برمجة.

GDPval-AA v2 — ‏1668 Elo

إشارة مستقلة للعمل المهني تتقدم على Opus 4.8 وGrok 4.5، مع بقائها خلف Fable 5 وGPT-5.6 Sol.

SWE Marathon — ‏42%

أنظف مقارنة برمجية لدى Moonshot: يستخدم K3 وFable 5 غلاف Claude Code نفسه، ويتقدم K3 على نتيجة Fable المذكورة وهي 35%.

Terminal-Bench 2.1 — ‏88.3%

نتيجة ممتازة تعلنها الشركة لعمل الوكيل في الطرفية، خلف 88.8% المذكورة لـGPT-5.6 Sol مباشرة. يجب الحذر لأن الأغلفة تختلف.

04

الحكم

يستحق Kimi K3 اليوم المركز الثالث مؤقتًا بين Fable 5 وGrok 4.5. الأدلة أكثر من ضجيج إطلاق: ذكاء مستقل رائد، وتقدم أولي كبير في الواجهات، وفوز مضبوط على Fable في SWE Marathon، وبيئة تطوير حقيقية. لا يصعد أكثر لأن Fable وGPT-5.6 يملكان سجلًا أوسع وأنضج، ولأن خلط الأغلفة وغياب Coding Agent Index المستقل يتركان شكًا. اختر K3 للعمل الطويل أو البصري أو المتمحور حول الواجهات والمستودعات الضخمة؛ واختر Grok حين تكون الكلفة أولوية؛ واحتفظ بـFable وSol للمسارات الأصعب ذات الأدلة الأعمق.

05

الأسئلة الشائعة