السؤال المفيد عن نماذج البرمجة في يوليو 2026 ليس «أيها أذكى؟» بل «أيها يستطيع إنهاء هذا النوع من العمل؟» يحتل GPT-5.6 الصدارة لأن Sol قوي خصوصاً عندما تتحول البرمجة إلى عمل وكيل: أوامر طرفية وأدوات وفشل وإعادة محاولات واختبارات ومستودع يرفض أن يكون مطالبة نظيفة.
في جدول OpenAI، يحقق Sol مع max قيمة 80 في Artificial Analysis Coding Agent Index أمام Claude Fable 5 بقيمة 77.2. ويصل Sol إلى 88.8% في Terminal-Bench 2.1، وإعداد Ultra المتوازي إلى 91.9%. وفي DeepSWE يحقق Sol 72.7%. ثلاث إشارات مختلفة تقول الشيء نفسه: للهندسة الطويلة التي تستخدم أدوات، هذه أقوى عائلة برمجة من OpenAI حتى الآن.
لكن Sol لا يفوز في كل رياضة. يمنحه الجدول نفسه 64.6% في SWE-Bench Pro مقابل 80.3% لـ Fable 5. الفجوة كبيرة ولا يجب تغطيتها بالاحتفال. الخلاصة الصادقة: GPT-5.6 يقود مسار العمل الوكيلي، بينما يحتفظ Fable بأفضل قصة منشورة لـ SWE-Bench Pro.
توجيه المهمة
| المهمة | استخدم | السبب |
|---|---|---|
| تحقيق متعدد الخطوات، عمل طرفية صعب، ترحيل معقد | Sol | أعلى قدرة لوكيل فردي في العائلة |
| مشروع ضخم بمسارات عمل منفصلة | Sol + ultra | وكلاء متوازون يمكنهم التحقيق والتنفيذ معاً |
| التذاكر، مراجعة PR، الاختبارات، إعادة الهيكلة، العمل اليومي في Codex | Terra | خيار افتراضي اقتصادي منافس لـ GPT-5.5 |
| التحويلات الميكانيكية، الهيكلة، التوثيق، عمليات التحقق الجماعية | Luna | سريع ورخيص وكافٍ عندما يختبر فحصٌ النتيجةَ |
عناصر التحكم الجديدة تستحق التعلم. max يوجه الوكيل لقضاء وقت أطول في التفكير وفحص البدائل والمراجعة. أما ultra فيبدأ افتراضياً بأربعة وكلاء بالتوازي؛ وهو مصمم لمشكلة لها جبهات متعددة فعلياً، وليس لتشكيل لجنة حول فاصلة منقوطة مفقودة.
بالنسبة لفرق الـ API، تعد ميزة Programmatic Tool Calling التحسين الأكثر هدوءاً. يمكن لـ GPT-5.6 كتابة وتشغيل برنامج صغير في الذاكرة لتنسيق الأدوات ومعالجة النتائج الوسيطة. بدلاً من تمرير كل سطر سجل عبر جولة مكلفة أخرى من النموذج، يقوم الوكيل بفلترة ما يهم ويقرر خطوته التالية بنفسه.
التسعير يمنحك سياسة توجيه حقيقية: Sol بسعر $5/$30، وTerra بسعر $2.50/$15، وLuna بسعر $1/$6 لكل مليون رمز إدخال/إخراج. ابدأ العمل العادي على Terra. وصعّد إلى Sol عندما تثبت المهمة أنها تستحق العقل الأقوى. وأرسل المهام الروتينية بالحجم الكبير إلى Luna. قس التكلفة الإجمالية لتغيير مدمج ومختبر، وليس فقط تكلفة الرد الأول.
يعمل Codex الآن أيضاً داخل تطبيق سطح المكتب الجديد لـ ChatGPT، مع تحرير الفروق المباشرة (inline diffs)، ومراجعة طلبات السحب (PR) في اللوحة الجانبية، واستخدام أسرع للكمبيوتر، ومشاريع متعددة المستودعات. هذا يجعل النموذج أداة أفضل في الأماكن التي يعمل فيها المطورون فعلاً، رغم أن الوصول إلى Sol و ultra يختلف حسب الخطة والواجهة.
الخلاصة: GPT-5.6 هو فريق برمجة متكامل، وليس نموذج بطل واحد. يحتل المركز #1 لأنه يقود المجال الذي تتجه إليه البرمجة الحديثة — وكلاء مستقلون يستخدمون الأدوات — بينما تجعل مستويات أسعاره توجيه التكلفة أمراً واقعياً. فقط احتفظ بملحوظة SWE-Bench في ذهنك واختبره على الكود الخاص بك قبل إطلاق الوكلاء في بيئة الإنتاج.