معظم إطلاقات نماذج الذكاء الاصطناعي تمنحك نموذجًا واحدًا وقرارًا واحدًا: استخدمه أو لا تستخدمه. Gemma 4 يمنحك خمسة نماذج ويطرح سؤالاً مختلفًا: ما العتاد الذي تملكه؟
قد يبدو هذا كلامًا تسويقيًا، لكنه في الحقيقة أكثر شيء مفيد في هذه العائلة. كل عضو مختلف معماريًا — وليس مجرد نسخة مكبّرة من الشيء ذاته. نماذج الحافة تستخدم Per-Layer Embeddings. الـ 12B تخلّص من مشفّرات الرؤية والصوت بالكامل. الـ 26B يوجّه الرموز عبر خليط من 128 خبيرًا. الـ 31B ببساطة يُلقي بكل 30.7 مليار معامل على كل رمز. عائلة واحدة، فلسفات هندسية مختلفة، مقايضات مختلفة.
دعنا نستعرضها واحدًا تلو الآخر.
E2B — الذكاء الاصطناعي الجيبي (~1 غيغابايت ذاكرة)
أصغر عضو في عائلة Gemma 4. ملياران من المعاملات، مكمّم ليعمل في حوالي 1 غيغابايت من الذاكرة. يتعامل مع النصوص والصور والصوت الحي — كله على الجهاز، كله بدون اتصال. يحقق 37.5% في AIME 2026، وهو استدلال رياضي تنافسي على شيء يمكن أن يعمل على Raspberry Pi. السر يكمن في Per-Layer Embeddings (PLE)، التي تمنح كل طبقة فك ترميز تمثيلاً مخصّصًا لها لاستخلاص أقصى ذكاء بدون تضخيم عدد المعاملات. لن تخلط بينه وبين نموذج مكتبي، لكن للترجمات السريعة أو أسئلة عن الصور أو الاستعلامات الصوتية على هاتف اقتصادي — فهو مفيد فعلاً.
E4B — محطة الطاقة الهاتفية (4–6 غيغابايت ذاكرة)
الـ E4B هو ما يحدث عندما تمنح نموذجًا مُحسَّنًا للهاتف عددًا كافيًا من المعاملات ليفكّر فعلاً. يحقق 42.5% في AIME 2026 — أي أكثر من ضعف نتيجة نموذج Gemma 3 الأكبر بكثير 27B. يتعامل مع النصوص والصور والصوت بشكل أصلي، لديه نافذة سياق بحجم 128K، ويتضمّن وضع تفكير قابل للتهيئة للاستدلال متعدد الخطوات. إذا كان لديك هاتف رائد حديث بـ 8 غيغابايت ذاكرة أو أكثر، فهذا هو النموذج الذي يجعل عبارة «سأسأل هاتفي — بدون اتصال» خيارًا جدّيًا بدلاً من خدعة حفلات.
12B Unified — محرك الوكلاء الخصوصي لأجهزة الكمبيوتر المحمولة (~7 جيجابايت VRAM مع QAT)
هنا يصبح Gemma 4 مثيرًا لمعظم الناس. صدر في 3 يونيو 2026، والـ 12B Unified يفعل شيئًا لا يفعله أي نموذج آخر بحجمه: يتعامل مع النصوص والصور والصوت في محوّل واحد بمفكّك ترميز فقط (decoder-only) بدون مشفّرات منفصلة. رقع الصور الخام وأشكال الموجات الصوتية تدخل مباشرةً إلى فضاء التمثيل عبر طبقات خطية خفيفة. بنية أبسط، زمن استجابة أقل، ضبط دقيق أسهل.
الأرقام: 77.2% MMLU Pro، 77.5% AIME 2026، 72.0% LiveCodeBench، 78.8% GPQA Diamond. تقول جوجل إنه يقترب من 26B MoE «بأقل من نصف البصمة الإجمالية للذاكرة». مع متغيّر QAT (Quantization-Aware Training) الرسمي الذي صدر في 5 يونيو، نسخة Q4_0 تحتاج تقريبًا 6.7 غيغابايت VRAM. أضف إلى ذلك Multi-Token Prediction لفك الترميز التخميني، ومعايير المجتمع تُظهر 100–130+ رمز في الثانية على بطاقة 12 غيغابايت مثل RTX 4070 Super. بل يعمل حتى على حواسيب محمولة بـ 16 غيغابايت ذاكرة موحّدة — بدون حاجة لبطاقة رسومات مخصّصة.
إذا كنت ترغب في تشغيل وكلاء ذكاء اصطناعي مستقلين، أو مساعدين صوتيين محليين، أو سير عمل برمجي خاص مباشرة على جهاز الكمبيوتر المحمول الخاص بك دون الاعتماد على السحابة أو مخاطر الخصوصية، فهذا هو نموذجك المفضل.
26B MoE — خبير الكفاءة (15–18 غيغابايت VRAM مكمّم)
الـ 26B يحتوي على 26 مليار معامل إجمالاً، لكن الحيلة هنا: فقط 3.8 مليار تُنشَّط لكل رمز. موجّه متعلّم يختار 2 من 128 شبكة فرعية متخصصة لكل رمز، فيمنحك جودة قريبة من 31B بتكلفة حوسبة أقل بشكل كبير. فكّر في الأمر كمبنى مليء بالمتخصصين حيث تستدعي فقط الاثنين اللذين تحتاجهما لكل سؤال.
يدعم النصوص والصور والفيديو (وليس الصوت فقط كالنماذج الأصغر)، لديه نافذة سياق بحجم 256K، ويحتل المرتبة السادسة بين النماذج المفتوحة على Arena AI. المقايضة هي VRAM — تحتاج 15–18 غيغابايت مكمّمًا، ما يعني RTX 4090، أو RTX 5060 Ti 16GB، أو Mac بـ 32 غيغابايت+ ذاكرة موحّدة. إذا كان لديك العتاد وتريد أفضل نسبة ذكاء لكل واط، فهذا نموذجك.
31B Dense — العملاق بلا تنازلات (16–20 غيغابايت VRAM مكمّم)
لا توجيه، لا خليط خبراء، لا اختصارات. الـ 31B Dense يُطلق كل 30.7 مليار معامل على كل رمز. إنه سقف الجودة في عائلة Gemma 4 — يحتل المرتبة الثالثة بين جميع النماذج المفتوحة على Arena AI ويحقق 89.2% في AIME 2026. نفس الوسائط كالـ 26B (نصوص وصور وفيديو)، نفس نافذة السياق 256K، لكن بأقصى عمق استدلال في كل استجابة.
التكلفة هي الحوسبة. BF16 يحتاج حوالي 71 غيغابايت VRAM (أرض بطاقات الرسومات المؤسسية). لكن مكمّمًا إلى INT4، يعمل في 16–20 غيغابايت — قابل للإدارة على بطاقة رسومات استهلاكية متطورة. إذا كان لديك العتاد والدقة أهم من السرعة بالنسبة لك، فهذا هو النموذج المفتوح الأقرب لأداء السحابة الرائد.
أي نموذج يجب أن تختار؟
إليك ورقة الغش الصادقة:
- هاتف، بدون اتصال، مهام سريعة ← E4B (أو E2B لأجهزة محدودة جدًا)
- حاسوب محمول، بطاقة 8–12 غيغابايت ← 12B Unified مع QAT
- حاسوب محمول، 16 غيغابايت ذاكرة موحّدة، بدون بطاقة رسومات ← 12B Unified مع QAT (أبطأ لكنه يعمل)
- محطة عمل، RTX 4090 / Mac بـ 32 غيغابايت ← 26B MoE (أفضل جودة لكل واط)
- خادم أو محطة عمل متطورة ← 31B Dense (أقصى جودة)
جميع النماذج الخمسة تتشارك ترخيص Apache 2.0، وتدعم أكثر من 140 لغة، وتعمل مع Ollama وllama.cpp وLM Studio وvLLM ومجموعة أدوات Google AI Edge. العائلة تختلف في البنية المعمارية — لكنها تتفق على الفلسفة: ذكاء اصطناعي جدّي يعمل على عتادك أنت.