لسنوات، عاشت مجتمعية الأوزان المفتوحة بقاعدة بسيطة: يمكنك امتلاك الخصوصية أو الذكاء المتقدم، لكن ليس كليهما معاً. كانت أفضل النماذج التي يمكنك تنزيلها وتشغيلها بنفسك دائماً درجة واحدة خلف العمالقة المغلقين. جيدة بما يكفي لكثير من المهام، لكن ليس للأصعب منها.
Kimi K3 هو النموذج الذي يجعل هذه القاعدة تبدو عفا عليها الزمن.
أصدرت Moonshot AI الأوزان الكاملة في 27 يوليو 2026، والأرقام مذهلة. 2.8 تريليون معامل منظمة في بنية خليط الخبراء — 896 خبيراً، يشتبك منها 16 عند كل رمز (104 مليار نشط). مُرمِّز رؤية مدمج يُدعى MoonViT-V2 يمكّن النموذج من قراءة لقطات الشاشة والمخططات والرسوم البيانية والمستندات وحتى إطارات الفيديو بشكل أصلي. تمتد نافذة السياق إلى مليون رمز، أي ما يعادل عشر روايات كاملة تقريباً. وكل ذلك تحت رخصة Modified MIT تسمح بالاستخدام التجاري.
تؤكد الأدلة المستقلة ادعاء القدرة. Artificial Analysis — أقرب ما يكون إلى حكم محايد في مجال الذكاء الاصطناعي — تُصنّف K3 بحوالي 80 من 100 على مؤشر الذكاء، ضائعة في المركز الخامس بين 215 نموذجاً عالمياً. يضعه ذلك على بعد ثلاث نقاط من Claude Fable 5، وهو نموذج مغلق يكلّف مالاً حقيقياً. لم يصل أي نموذج آخر بأوزان مفتوحة إلى هذه المرتبة.
قصة البنية
عدد المعاملات الخام هو العنوان الرئيسي، لكن الهندسة الموجودة تحته تستحق الاهتمام. يبني K3 على فكرتين تسميهما Moonshot Kimi Delta Attention (KDA) وAttention Residuals. KDA آلية انتباه فعّالة تتوسع أفضل من النُهج القياسية؛ وAttention Residuals تسترجع المعلومات بشكل انتقائي عبر عمق النموذج بدلاً من تجميعها بانتظام. معاً، تُعلن Moonshot عن تحسين بنحو 2.5× في كفاءة التوسع مقارنة بـ K2.
ما يعنيه ذلك عملياً: يستخدم النموذج ميزانية معاملاته الضخمة بذكاء أكبر مما يفعله التوسع الساذج. كما أنه يُشحن مع تكميم MXFP4 أصلي — تُخزَّن الأوزان بدقة 4 بت مع تنشيطات 8 بت، ودُمج هذا الضغط أثناء التدريب بدلاً من تطبيقه كإضافة لاحقة. لهذا السبب يمكن للنموذج أن يعمل على «فقط» ثمانية معالجات H100 بدلاً من طلب مركز بيانات كامل بالدقة الكاملة.
لماذا ليس الأول في هذه الفئة
هنا التوتر الصريح. Kimi K3 هو أكثر نموذج بأوزان مفتوحة قدرة على وجه الأرض. وهو أيضاً أقل النماذج عملية في هذه الفئة لمعظم القراء.
تبلغ أوزان MXFP4 حوالي 1.4 تيرابايت. الحد الأدنى للتكوين التجريبي الذي تصفه Moonshot يتطلب ثمانية معالجات رسومات H100 بسعة 80 غيغابايت — 640 غيغابايت من VRAM، أي ما يعادل حوالي 200,000 دولار من الأجهزة بالأسعار الحالية. الإنتاج يريد 64 مسرّعاً أو أكثر عبر عقد متعددة متصلة بوصلات عالية النطاق الترددي. هذه ليست محطة عمل. هذه حاسوب فائق صغير.
قارن ذلك بـ GLM-5.2، صاحب المركز الأول الحالي في هذه الفئة. GLM-5.2 نموذج بـ 744 مليار معامل (حوالي 40 مليار نشط) يتسع في حوالي 241 غيغابايت مع تكميم 2 بت عدواني — في متناول Mac Studio بذاكرة موحدة 256 غيغابايت أو محطة عمل بمعالجي رسومات. يحمل رخصة MIT نظيفة. يمتلك أشهراً من التحقق المجتمعي المستقل، بما في ذلك المركز الأول في لوحة تصنيف البرمجة على Design Arena.
K3 يتفوق في الذكاء الخام والقدرة متعددة الأوضاح والحجم الصرف. GLM-5.2 تتفوق في كل ما يحدد ما إذا كان شخص عادي أو فريق صغير يمكنه استخدامها فعلاً. لفئة تحمل اسم «الذكاء الاصطناعي المحلي / الخاص»، هذا الفرق العملي حاسم — ولهذا يدخل K3 في المركز الثاني، لا الأول.
ما يُجيده K3 فعلاً
بوضع مسألة الأجهزة جانباً، فإن ملف القدرات مثير للإعجاب. في تقييمات Moonshot الذاتية، يحقق K3 FrontierSWE 81.2% (مهام هندسة برمجيات حقيقية على مستودعات كبيرة)، وTerminal-Bench 88.3 (كفاءة كعامل سطر أوامر)، وGPQA Diamond 93.5 (استدلال علمي بمستوى الدراسات العليا). في اختبار تحسين النوى، تُفيد Moonshot بأن K3 تفوّق بشكل كبير على GPT-5.6 Sol وGPT-5.5 وOpus 4.8 — رغم أن هذه أرقام من الشركة تنتظر التأكيد المستقل.
القدرة متعددة الأوضاح الأصلية هي السمة التي تفصل K3 بوضوح عن GLM-5.2 في هذه الفئة. GLM-5.2 للنص والكود فقط. K3 يقرأ الصور ولقطات الشاشة والرسوم البيانية والفيديو. في سير العمل المستضاف ذاتياً الذي يتضمن مدخلات بصرية — تحليل ملف PDF أو تصحيح واجهة من لقطة شاشة أو فحص تصور بياني — يتعامل K3 مع ذلك أصلياً دون إضافة نموذج رؤية منفصل. هذه ميزة معمارية حقيقية للفرق التي تبني خطوط أنابيب متعددة الأوضاح خلف جدار الحماية الخاص بها.
واقعية النشر
إذا كانت مؤسستك تشغّل بالفعل مجموعة معالجات رسومات — مختبر أبحاث أو شركة سحابية أو فريق ذكاء اصطناعي مؤسسي — فإن قصة النشر ناضجة بشكل مفاجئ لإصدار عمره يوم واحد. نشرت vLLM معاينة دعم بمقياس الإنتاج في 22 يوليو، مع تحسينات prefix-caching لـ KDA أعادتها Moonshot إلى مجتمع المصادر المفتوحة. تقدم SGLang وDocker وTogether AI وHuggingChat جميعاً مسارات فورية لتقديم النموذج. الأدوات ليست العائق؛ الأجهزة هي.
للجميع غير ذلك، تقدم واجهة Moonshot البرمجية النموذج نفسه بـ 3 دولارات لكل مليون رمز دخول و15 دولاراً لكل مليون رمز إخراج (مع الدخل المخزّن مؤقتاً بـ 0.30 دولار). هذا سعر معقول لعمل من الطراز المتقدم، لكنه يهزم غرض تصنيف «الذكاء الاصطناعي المحلي»: تغادر البيانات جهازك.
خشونة معروفة
Moonshot صريحة بشكل يستحق الإشادة بشأن قيود K3 في وثائقها الخاصة. النموذج حساس لوضع سجل التفكير — تبديل محرك الاستدلال خلال الجلسة قد يُزعزع المخرجات، وهو أمر يهم الفرق التي تشغّل أُطُراً متعددة للخدمة. كما قد يكون مفرط المبادرة، متخذاً قرارات ذاتية لم يطلبها المستخدم. توصي Moonshot بقيود صريحة في تلميحات النظام أو ملف AGENTS.md لإبقاء النموذج على المسار.
يوجد أيضاً فجوة ملحوظة في تجربة المستخدم مقارنة بالمنتجات المغلقة المصقولة مثل Claude Fable 5 وGPT-5.6 Sol، كما يعترف Moonshot نفسه. الذكاء الخام موجود؛ السلاسة ليست كذلك بعد.
الخلاصة
Kimi K3 هو النموذج الذي يثبت أن حدود الأوزان المفتوحة قد وصلت. عقل قابل للتنزيل ينافس أفضل النماذج المغلقة، ويقرأ الصور والفيديو، ويحمل رخصة تجارية، لم يعد فرضية — إنه ملف على Hugging Face. فيزياء تشغيله (1.4 تيرابايت، ثمانية معالجات H100 كحد أدنى) تعني أن معظم القراء سيُعجبون به من بعيد، أو سيصلون إليه عبر واجهة برمجية بدلاً من خوادمهم. لكن للفرق التي تملك البنية التحتية، وللجميع الذين يتابعون مسار الذكاء الاصطناعي المفتوح، K3 هو السقف الجديد — والسقف تحرك للتو بشكل كبير نحو الأعلى.