تخيل موقع بناء يضم مشغلين اثنين للرافعات.
أحدهما هو الخبير المخضرم الذي يُستدعى لتنفيذ عمليات الرفع المعقدة التي لا يجرؤ عليها غيره: كإمرار عارضة فولاذية عملاقة بين برجين في ظل رياح متقاطعة شديدة. أما المشغل الثاني، فهو بارع يكاد يضاهي الأول في المهارة، لكنه يتقاضى جزءاً بسيطاً فقط من الأجر اليومي للخبير. وفي جميع عمليات الرفع العادية، مثل نقل منصات الطوب، أو رفع دعامات السقف، أو مجرد تسيير العمل اليومي المعتاد، سيكون من الحماقة دفع تكلفة المشغل المخضرم.
إن نموذج GPT-6.1 Sol يمثل هذا المشغل الثاني تماماً، وفي هذا الشهر أصبح الفارق في المهارة بينهما ضئيلاً للغاية.
إطلاق نموذج وُلد من رحم الإلغاء
طرحت شركة OpenAI نموذج GPT-6.1 Sol في حدث DevDay يوم 29 سبتمبر 2026، بعد أسبوع واحد فقط من إصدار نموذج GPT-6 Sol. ووراء هذا التوقيت قصة: ففي اليوم السابق للحدث، ألغت OpenAI الإطلاق المقرر لنموذج GPT-6.1 Astra بعدما أظهرت الاختبارات الداخلية عدم موثوقية النموذج في الالتزام بحدود مهامه وصلاحياته. في المقابل، فإن نموذج Sol 6.1 المستقل والأصغر حجماً يحظى بتقرير أمني أنظف: ففي اختبار OpenAI لتحديد ما إذا كان وكيل الذكاء الاصطناعي سيعترف بتعطل أداة البحث الخاصة به بدلاً من تخمين الإجابات، فشل GPT-6.1 Sol بنسبة 2.1% فقط من الوقت، مقارنة بـ 4.9% لنموذج GPT-6 Sol و 1.5% لنموذج GPT-6 Astra.
رسالة الترويج التسويقية من OpenAI واضحة ومباشرة: أداء ذكاء يقارب نموذج Astra، وبخُمس السعر فقط.
هل هو حقاً قريب من أداء Astra؟
هذا هو الجانب الأهم، ولهذه المرة، لا يتعين علينا الاعتماد فقط على تصريحات الشركة المطورة.
أجرت مؤسسة Artificial Analysis المتخصصة في التقييم المستقل اختباراتها في يوم الإطلاق ذاته. في مؤشر الذكاء (Intelligence Index) الخاص بها، والذي يضم عشرة تقييمات صارمة، حصل نموذج GPT-6.1 Sol بأقصى جهد على 52 نقطة، ليتأخر بنقطة واحدة فقط عن الـ 53 نقطة التي حققها نموذج GPT-6 Astra ويتقدم بأربع نقاط على GPT-6 Sol. أما في مؤشر وكلاء البرمجة (Coding Agent Index)، فالنتائج أكثر تقارباً: بأقصى جهد (Max Effort)، يتأخر النموذج عن Astra بنقطتين فقط، وفي ثاني أعلى إعداد، وهو إعداد xhigh، فقد تخطى نموذج Astra فعلياً بنقطة واحدة، بتكلفة لا تتجاوز 15% من التكلفة لكل مهمة.
أما شركة Cognition المطورة لوكيل البرمجة Devin، فقد قاست أداءه على اختبار FrontierCode 1.1، وهو معيار تقييمي يطرح سؤالاً حاسماً: هل يوافق مهندس برمجيات ذو خبرة (Senior Engineer) على دمج (Merge) هذه التعديلات البرمجية في المشروع الفعلي؟ بلغت أفضل درجة حصل عليها نموذج GPT-6.1 Sol 60.4%، وهي تكاد تتطابق تماماً مع نتيجة GPT-6 Sol (60.7%). إن الفارق الحقيقي هنا يكمن في المال. فعلى مستوى الجهد المتوسط (Medium effort)، استهلك النموذج 0.31 دولار للمهمة، وهو أقل بنسبة 81% مما استهلكه GPT-6 Sol في أقصى جهد للوصول لأفضل أداء له. وعلى مستوى الجهد المنخفض، أحرز النموذج 58.1% مقابل 0.21 دولار فقط، بزيادة ملحوظة مقارنة بنسبة 50.5% لنموذج GPT-6 Sol على نفس الإعدادات.
كما تعكس الأرقام الخاصة بشركة OpenAI ذات التوجه. ففي اختبار المهام الهندسية المعقدة في قواعد أكواد واقعية، DeepSWE v1.1، يُظهر جدولهم نسبة 75.2% بمستوى الجهد العالي (High effort) بتكلفة قدرها 0.65 دولار فقط للمهمة. وهذا أعلى بمقدار 6.4 نقطة من أفضل أداء لنموذج GPT-6 Sol، وأعلى بقليل من أفضل أداء لـ Astra (74.1%) والذي يُكلف 4.43 دولار. ولكن تجدر الإشارة إلى نتيجة لافتة: ففي الإعدادين xhigh و Max، تنخفض درجة GPT-6.1 Sol فعلياً إلى 71.9%. وهو ما يثبت أن قضاء المزيد من الوقت في التفكير لا يُسفر دائماً عن نتائج تفكير أفضل.
وبالتالي، فإن الخلاصة الموضوعية هي: قدرة برمجية تقارب نموذج Astra، وذات الجودة في الكود المكتوب الذي قدمه نموذج Sol الأسبوع الماضي، ولكن بتخفيض كبير في السعر لكل مهمة تكتمل بنجاح.
لماذا يعتبر تسعير الكاش هو الخبر الحقيقي
لا يقوم أي وكيل برمجة بقراءة الكود المصدري للمشروع لمرة واحدة فقط. ففي كل مرة يقوم فيها الوكيل بتشغيل الاختبارات، أو قراءة الأخطاء، أو إعادة المحاولة، فإنه يقوم بإعادة قراءة نفس الملفات، والتعليمات البرمجية، وسجل الأوامر (History). في جلسات البرمجة الطويلة، يعني ذلك أن مئات الآلاف من الرموز (Tokens) نفسها تُمرَّر إلى النموذج عشرات المرات.
وهنا بالضبط يأتي دور ميزة المدخلات المؤقتة (Cached Input): وهي النصوص التي سبق واطلع عليها النموذج مؤخراً خلال الجلسة. يتم تسعير رموز الـ Cache في نموذج GPT-6.1 Sol بـ 0.10 دولار لكل مليون رمز، أي بخصم يصل إلى 95% من سعر الإدخال الأساسي (2 دولار)، وبنصف تكلفة سعر Cache نموذج GPT-6 Sol. في حين تظل أسعار الإدخال والإخراج العادية عند 2 دولار و 10 دولارات لكل مليون رمز، ما يمثل خُمس تكلفة نموذج GPT-6 Astra البالغة 10/50 دولاراً.
عند حساب الإجمالي، ستحصل على الرقم الأهم: قدرت مؤسسة Artificial Analysis أن تشغيل مؤشر الاختبار باستخدام نموذج GPT-6.1 Sol يكلف حوالي 0.72 دولار للمهمة، مقارنة بـ 3.26 دولار لنموذج GPT-6 Astra، و 5.98 دولار لـ Claude Opus 5.5، و 7.60 دولار لـ Claude Sonnet 5.5. مع تحذير بسيط وحيد: إذا تجاوز عدد رموز الطلب (Prompt) أكثر من 272 ألف رمز للإدخال، فسيكلفك الضعف (2x) للإدخال ومرة ونصف (1.5x) للإخراج، مما يجعل الطلبات الفردية الضخمة جداً أكثر كلفة.
لا ترفع مستويات الجهد إلى الحد الأقصى دائماً
يتضمن نموذج GPT-6.1 Sol خمسة مستويات للجهد: منخفض (low)، ومتوسط (medium) وهو الإعداد الافتراضي، وعالي (high)، وعالي جداً (xhigh)، وأقصى (max). من السهل الافتراض أن مستوى Max هو الأفضل دائماً، لكن في مؤشر وكلاء البرمجة التابع لمؤسسة Artificial Analysis، لم يكن الأمر كذلك: حيث سجل مستوى xhigh درجة أعلى من Max، بتكلفة أقل أيضاً. بالنسبة لإصلاحات الأكواد الروتينية، فإن المستوى المنخفض (low) أو المتوسط (medium) غالباً ما يكون كافياً تماماً؛ كما يتضح من تقييم مؤسسة Cognition البالغ 58.1% مقابل 0.21 دولار فقط. لذا يُفضل الاحتفاظ بإعداد “xhigh” فقط للمشاكل المعقدة التي تتطلب فعلياً هذا المستوى الإضافي من التفكير.
قيود النموذج الصريحة
- قيمة أفضل مقابل السعر، وليس كوداً أفضل. في اختبار FrontierCode 1.1، لم تشهد جودة الكود الجاهز للدمج تغييراً يُذكر مقارنة بنماذج GPT-6 Sol و GPT-5.6 Sol. فإذا كانت مشكلتك سابقاً هي أن الأكواد المقدمة من نموذج Sol ليست جيدة بالدرجة الكافية، فإن إصدار 6.1 لن يعالج هذا الأمر، كل ما يفعله هو توفير نفس الأكواد بتكلفة أقل بكثير.
- الأبحاث العلمية لا تزال مهمة نموذج Astra. في اختبار Terminal-Bench Science 0.1 لشركة OpenAI، المعني بتحليل البيانات، وتطوير المحاكاة العلمية، وإثبات النظريات في سطر الأوامر (Terminal)، يُسجل GPT-6.1 Sol 57.0% بالجهد الأقصى. ورغم أن هذه النتيجة تزيد على ضعف الـ 27.6% التي حققها نموذج GPT-6 Sol، إلا أنها ما تزال متأخرة بوضوح عن الـ 68.1% التي سجلها GPT-6 Astra و الـ 63.3% لنموذج Claude Opus 5.5. وتصل تكلفة المهمة إلى 5.47 دولار، مقارنة بحوالي 23 دولاراً لمنافسيه في هذه المهام.
- Claude لا يزال يتصدر المؤشرات العامة المستقلة. يحافظ كلا النموذجين Claude Opus 5.5 بـ (58) نقطة و Claude Sonnet 5.5 بـ (56) نقطة على تقدمهما على GPT-6.1 Sol (52) في مؤشر الذكاء لـ Artificial Analysis. وعلى الرغم من تحقيق GPT-6.1 Sol زيادة بـ 12 نقطة في اختبار Terminal-Bench 4.0 مقارنة بسلفه GPT-6 Sol، إلا أن الدرجة الأساسية البالغة 64% لنموذج Sonnet في هذا الاختبار تظل أعلى. ورغم ذلك يستهلك نموذج Sonnet قدراً هائلاً من الرموز لتحقيق هذا الأداء، مما يُبقي الأفضلية لصالح نموذج Sol من حيث التكلفة لكل مهمة.
- لا يتوفر في وضع الدردشة العادي. لا يُتاح نموذج GPT-6.1 Sol لمستخدمي واجهة ChatGPT التقليدية، بل يقتصر على واجهات ChatGPT Work و Codex للمستخدمين ذوي الاشتراكات المدفوعة: Plus، و Pro، و Business، و Enterprise، و Edu. في حين يستخدمه المطورون عبر واجهة برمجة التطبيقات (API) تحت مُسمى
gpt-6.1-sol. وتقول شركة OpenAI أنها بصدد إطلاق وضع فائق السرعة “Ultrafast” لمنصة Codex قريباً، لكنه غير متاح حالياً.
من الذي ينبغي عليه استخدامه؟
| إذا كان عملك اليومي يتمثل في… | فاختر | السبب |
|---|---|---|
| معالجة الأخطاء (Bugs)، الاختبار، إعادة هيكلة الأكواد، أو تشغيل وكلاء البرمجة طوال اليوم في (CI) | GPT-6.1 Sol | أداء برمجي يقارب النماذج الرائدة بجزء بسيط من التكلفة للمهمة. |
| الحوسبة العلمية، وأصعب مهام التحكم بالحاسوب | GPT-6 Astra | يحتفظ بمكانته المتقدمة بوضوح في أداء واجهات الأوامر العلمية. |
| التحكيم المعماري واتخاذ القرارات المفتوحة النهاية | Claude Opus 5.5 | صاحب أعلى درجة في المؤشر المستقل العام. |
| العمل في جلسات سطر أوامر طويلة جداً لا تعبأ بتكلفة الرموز | Claude Sonnet 5.5 | قدرة أفضل في سطر الأوامر المستقل، بمعدل استهلاك أكبر للرموز. |
الخلاصة في عالم البرمجة
لا يعمل نموذج GPT-6.1 Sol على كسر الحواجز وتجاوز القدرات الموجودة مسبقاً للنماذج الرائدة، بل يضع تلك القدرات العالية في متناول الميزانية اليومية العادية. فقد وضعته الاختبارات المستقلة على بُعد نقطة أو نقطتين فقط من النموذج الرائد لشركة OpenAI وبأقل من ربع التكلفة للمهمة الواحدة، علاوة على أن تسعيره الخاص بالكاش قد صُمم خصيصاً لملاءمة نمط عمل وكلاء البرمجة الفعلي. خصص لهذا النموذج قائمة أعمالك المتراكمة (Backlog)، واضبطه على إعداد “xhigh” في المهام الأكثر تحدياً، واحتفظ بنماذج Astra أو Opus للتدخلات الاستثنائية التي تتطلب قدرات عليا.