يتصدر GPT-5.6 ترتيب البرمجة لأن Sol يفوز في سباق وكلاء البرمجة الواسع، لا لأنه يفوز في كل اختبار منفرد. Sol يغلق المشكلة الصعبة، وTerra هو المهندس اليومي بنصف سعر Sol لكل توكن، وLuna لمعالجة الدفعات. مع max ووكلاء Ultra المتوازيين وProgrammatic Tool Calling وواجهة Codex أقوى، قدمت OpenAI تشكيلة برمجة لا قميصاً واحداً.
يسجل Sol مع استدلال max قيمة 80 في مقارنة OpenAI لمؤشر Artificial Analysis Coding Agent Index متقدماً على Claude Fable 5؛ ويحقق Sol نسبة 88.8% في Terminal-Bench 2.1 وSol Ultra نسبة 91.9%؛ ويصل Sol إلى 72.7% في DeepSWE. يقلل Programmatic Tool Calling عبء التنظيم، وتوفر Sol وTerra وLuna سلماً واضحاً للأسعار: $5/$30 و$2.50/$15 و$1/$6.
هذه قيادة في البرمجة الوكيلة وليست احتكاراً: ما زال Claude Fable 5 يحقق 80.3% مقابل 64.6% لـ Sol في مقارنة SWE-Bench Pro المنشورة. يزيد Ultra استهلاك التوكنات ويتوقف على الخطة. وقد تضيف الضمانات السيبرانية احتكاكاً إلى طلبات الدفاع أو الاستغلال؛ وكل رسم يحتاج اختباراً على مستودعك واختباراتك وقواعد النشر لديك.