الترتيب #1 البرمجة — ذكاء اصطناعي يكتب شيفرة جاهزة للإنتاج
OpenAI

GPT-6 Astra

يتوّج GPT-6 Astra عرش البرمجة بالطريقة الصادقة نفسها التي تمسك بها GPT-5.6 بالتاج: بإنجاز العمل ذي الطابع الوكيلي — جلسات الطرفية، وخطوط الأنابيب المتعثرة، وتحليل الحوادث، وإعداد بيئة العمل بالكامل — مدعومًا الآن بتصدره الجديد لمنصة Code Arena التابعة لـ Arena.ai (بـ 1797 نقطة في WebDev) مع استهلاك نحو ثلث رموز Sol.

تم التحديث 5 سبتمبر 2026 Arena #1Coding AgentAgentic
الأفضل لـ

يتوّج GPT-6 Astra عرش البرمجة بالطريقة الصادقة نفسها التي تمسك بها GPT-5.6 بالتاج: بإنجاز العمل ذي الطابع الوكيلي — جلسات الطرفية، وخطوط الأنابيب المتعثرة، وتحليل الحوادث، وإعداد بيئة العمل بالكامل — مدعومًا الآن بتصدره الجديد لمنصة Code Arena التابعة لـ Arena.ai (بـ 1797 نقطة في WebDev) مع استهلاك نحو ثلث رموز Sol.

لماذا تفوز

تصدر المركز الأول الجديد في منصة Code Arena التابعة لـ Arena.ai في مسار WebDev بـ 1797 نقطة (بفارق +35 نقطة عن Claude Fable 5.1 Max عند 1762، و+109 عن Opus 5 Max عند 1688، و+180 عن Sol في المركز 13)، متصدرًا فئات تحليل البيانات، والمنتجات الاستهلاكية، وأدوات إنشاء المحتوى. بالإضافة إلى 57.7–57.9% على Terminal-Bench 4.0 (مقابل 55.8% لـ Fable 5.1)، وأفضل نتيجة بالجدول على DeepSWE v1.1 بـ 74.1%، و64.6% على Terminal-Bench Science، و88% pass@1 / 99.2% pass@4 على SRE-Bench، و100% على ExploitBench. ورغم أن منصة Artificial Analysis الخاصة تضع Fable 5.1 متقدمًا قليلًا (70 مقابل 67)، يعيد Astra رسم حدود كفاءة باريتو عند 40 دولارًا لكل مليون رمز مدمج ويستهلك نحو ثلث رموز Sol.

انتبه إلى

حتى مع تتويجه بالمركز الأول في Code Arena لتطوير الويب وأدوات المنتجات، ما زال Fable 5(.1) يحمل الرقم القياسي في SWE-Bench Pro ويتصدر مؤشر Artificial Analysis الخاص بوكلاء البرمجة (70 مقابل 67). سعر API يعادل 2.5 ضعف Sol عند 10/50 دولارًا، وقراءة الذاكرة المؤقتة تكلف أربعة أضعاف الـ 0.25 دولار لدى Fable 5.1، والإجابات المقتضبة تتخطى خطوات صقل التقارير، والضمانات السيبرانية الأقوى تزيد الاحتكاك في العمل القريب من اختبار الثغرات. جداول الإطلاق تحركت بعد النشر: تعامل مع أي رقم منفرد بهامش ±1–2 نقطة.

01

ما هو في الواقع

أفضل سؤال عن نماذج البرمجة في سبتمبر 2026 ما زال ليس «أيها الأذكى؟» بل: «أيها يُنهي هذا النوع من العمل؟» يجيب GPT-6 Astra باستلام لوحة المفاتيح: يعيش في الطرفية، ويقود المتصفح والمكتب حين لا تكفي الطرفية، ويواصل بعد أول فشل — مستهلكًا نحو ثلث الرموز التي كان سيحرقها GPT-5.6 Sol في التشغيل نفسه.

الأرقام الواقعية والتركيبية بتأريخ صادق: على منصة Code Arena التابعة لـ Arena.ai، اقتنص Astra (Max) المركز الأول عالميًا بـ 1797 نقطة في مسار WebDev — فاتحًا فارقًا حاسمًا بـ +35 نقطة أمام Claude Fable 5.1 Max (1762 نقطة) و**+109 أمام Opus 5 Max (1688 نقطة)، مع تصدره فئات البيانات والمنتجات وأدوات المحتوى، وإعادة تشكيل حدود كفاءة باريتو عند 40 دولارًا لكل مليون رمز مدمج. وعلى صعيد معايير الطرفية، حقق Astra نسبة 57.7–57.9% على Terminal-Bench 4.0 (Fable 5.1 عند 55.8%)، وأفضل نتيجة 74.1% على DeepSWE v1.1، و64.6% على Terminal-Bench Science**، و88% pass@1 / 99.2% pass@4 على SRE-Bench. ولا تزال منصة Artificial Analysis الخاصة ترى Fable 5.1 عند 70 مقابل 67 لـ Astra — وقد أعادت AA معايرة لوحتها عند إطلاق Astra. اليوم يحرك اختيار المنصة نتائج البرمجة أكثر مما تفعل أجيال النماذج.

الوزن المقابل لم يتحرك، ولن نلوّح به بعيدًا. حل قضايا SWE-Bench Pro ما زال قصة Claude Fable، والبيئة البرمجية Claude Code لدى Anthropic هي البيت الطبيعي للتعديلات الهيكلية المطوّلة للمستودعات. إن كان عملك يشبه «حُل هذه القائمة من القضايا كما ينبغي» فابدأ بـ Fable. وإن كان يشبه «ابنِ هذا التطبيق للويب، أصلح البناء، تتبّع الحادث، جهّز الجهاز، نفّذ التجربة» فابدأ بـ Astra.

وجّه العمل

المهمة استخدم لماذا
تطوير الويب، أدوات Full-Stack، تحليل البيانات Astra المركز الأول في Code Arena: WebDev (1797 نقطة، +35 أمام Fable 5.1)
تحقيقات طرفية كثيفة، ترحيلات عنيدة، تحليل حوادث Astra أفضل أدلة الطرفية وSRE، وأقل الرموز لكل مهمة منجزة
عمل يحتاج المتصفح أو المكتب لا الطرفية وحدها Astra أفضل استخدام للحاسوب في وكيل برمجة
تعديلات هيكلية مطوّلة للمستودعات، حل القضايا داخل Claude Code Fable 5 / Fable 5.1 SWE-Bench Pro وصدارة منصة AA
تذاكر يومية، مراجعة PR، اختبارات، إعادة هيكلة Terra / Sol خيار GPT الاقتصادي بالأسعار القديمة
تحويلات آلية، هياكل بداية، فحوص دفعية Luna سريع ورخيص حين يستطيع اختبار التحقق من النتيجة

الاقتصاد يستحق فقرة صادقة. السعر يقول 10/50 دولارًا — 2.5 ضعف Sol — وقراءات الذاكرة المؤقتة بدولار تعادل أربعة أضعاف تعرفة Fable 5.1، وهذا يهم في حلقات الوكلاء الطويلة. لكن Astra يفكر برموز أقل: نحو ثلث رموز Sol وخُمس رموز Opus في تشغيلات متقاربة، ولهذا يواصل المختبِرون المستقلون العثور عليه عند حد الكلفة/القدرة — وأحيانًا أرخص لكل مهمة منجزة من Fable 5. مرّر مستودعك نفسه عبر كليهما قبل أن تصدق أية فاتورة من الاثنتين.

الثغرة الصادقة: اقتراب Astra يتخطى خطوات الصقل التي يلاحظها المراجعون والسلالم المرقّمة؛ وقدراته السيبرانية (100% على ExploitBench، وثغرات صفرية غير معروفة في التقييم) تأتي مع ضمانات تبطئ العمل المشروع القريب من الاستغلال؛ وكان إطلاق اليوم الأول خشنًا مع Enterprise معطلًا افتراضيًا. التاج حقيقي، والتاج ضيق، والتاج مؤرَّخ. أعد النظر في اللوحات بعد أسبوعين — وسنفعل.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • المركز الأول في Code Arena ومسار الطرفية: اقتنص Astra المركز الأول عالميًا في Code Arena: WebDev التابع لـ Arena.ai بـ 1797 نقطة — فاتحًا فارقًا حاسمًا بـ +35 نقطة أمام Fable 5.1 Max (1762) و+109 أمام Opus 5 Max (1688)، ومتصدرًا فئات البيانات والمنتجات وأدوات المحتوى. وباقتران ذلك مع 57.7–57.9% على Terminal-Bench 4.0 و74.1% على DeepSWE v1.1، فإن تفضيل المطورين الحقيقيين في الاختبارات العمياء يعزز الآن صدارته الاصطناعية بقوة.
  • يبرمج كعالِم: 64.6% على Terminal-Bench Science مقابل 52.6% لـ Fable 5.1 و22.4% لـ Sol، ونحو 97.6% على FrontierMath Tier 4. في الهندسة الحسابية والغنية بالبيانات والقريبة من البحث، الفجوة ليست تجميلية.
  • كفاءة الرموز تغيّر الفاتورة: تضع المتابعة المستقلة للوكلاء Astra عند نحو ثلث رموز Sol وخُمس رموز Opus في تشغيلات متقاربة. على وكلاء البرمجة يجلس Astra عند حد الكلفة/القدرة وقد يُنجز أرخص من Fable 5 رغم السعر الأكبر — قِس على مستودعك لا على صفحة الأسعار.
  • هندسة SRE وأمن قابلة للاستخدام فعلًا: 88% pass@1 و99.2% pass@4 على SRE-Bench، و100% على ExploitBench، وثغرات صفرية غير معروفة ظهرت أثناء التقييم. تحصل فرق الدفاع والموثوقية هنا على قدرة حقيقية — مقابل مزيد من الرفض في الأوامر ثنائية الاستخدام كضريبة ظاهرة.
  • ترقية دون انتقال: نفس Codex، ونفس ChatGPT Work، ونفس Responses API‏ (gpt-6-astra)، مع Azure وBedrock والاحتفاظ الصفري بالبيانات لأعمال API المؤهلة، وسياق يقارب 1.05 مليون رمز، وتكاملات من اليوم الأول مثل Devin. لا شيء في خط عملك بحاجة إلى الانتقال.

قيود صادقة

  • صدارة المؤشر بالمنصة الخاصة تعود إلى Anthropic اليوم: تقيّم منصة Artificial Analysis الخاصة Fable 5.1 عند 70 مقابل 67 لـ Astra (إعداد Codex)، وتبقى قصة SWE-Bench Pro ملكًا لـ Fable (80.3% مقابل 64.6% لـ Sol في مقارنة GPT-5.6 المنشورة). التعديلات المعقدة والمطوّلة للمستودعات داخل بيئة Claude Code ما زالت ترجّح كفة Fable.
  • السعر مميز باهظ: 10/50 دولارًا لكل مليون رمز — 2.5 ضعف Sol — مع قراءة ذاكرة مؤقتة بدولار مقابل 0.25 دولار لدى Fable 5.1، وهو ما يهيمن على فواتير الوكلاء متعددة الأدوار؛ والأوامر فوق 272 ألف رمز تكلف 2x إدخال / 1.5x إخراج، والوضع السريع يضاعف السعر. الكفاءة تكسب الحساب غالبًا لا دائمًا.
  • الاحتكاك حقيقي: الإجابات المقتضبة تتخطى لطائف السلم والتقرير التي تلاحظها التقييمات المرقّمة والمراجعون البشريون؛ وإطلاق اليوم الأول كان فوضويًا ووصل Enterprise معطلًا افتراضيًا؛ والضمانات السيبرانية تبطئ بعض الأوامر المشروعة القريبة من الاستغلال؛ ولا يوجد توليد صور أصلي لأعمال الأصول.
03

لمحة عن المعايير

Arena.ai Code Arena: WebDev — 1797 نقطة (المركز الأول)

المركز الأول الجديد على منصة Code Arena القائمة على تصويت المطورين (+35 نقطة فوق Claude Fable 5.1 عند 1762، و+109 فوق Opus 5 عند 1688، و+180 فوق Sol بالمركز 13)، متصدرًا مسارات الويب والبيانات وأدوات المنتجات، ومعيدًا رسم حدود كفاءة باريتو عند 40 دولارًا لكل مليون رمز مدمج.

Artificial Analysis Coding Agent Index — Astra 67 · Fable 5.1 70

منصة AA الخاصة، بتاريخ 4 سبتمبر 2026. أُعيد معايرة اللوحة منذ أرقام إطلاق GPT-5.6 (حقبة الـ 77.4 لـ Sol)، فالمقارنات بين الحقَب ليست مِثلًا بمثل؛ اختيار المنصة يحرك هذه النتائج أكثر مما تحدّثها النماذج.

Terminal-Bench 4.0 — Astra 57.7–57.9%

جدول OpenAI تحرك بعد النشر، ومن هنا المدى. Fable 5.1 عند 55.8%. أقرب اختبار عام إلى عمل الهندسة الحقيقي عبر الطرفية.

DeepSWE v1.1 — Astra 74.1%

الأفضل في الجدول الحالي لكن بتراص شديد: Opus 5 عند 73.7%، وGemini 3.8 Flash عند 73.8%، وFable 5.1 عند 67.4%. تقدم، لا انهيار أرضي.

Terminal-Bench Science — Astra 64.6%

مقابل 52.6% لـ Fable 5.1 و22.4% لـ Sol. أنظف فجوة في مجموعة الإطلاق — بتشغيل من المزوّد، فأرّخها وأعد الفحص على أحمالك.

SRE-Bench — 88% pass@1 · 99.2% pass@4

هندسة الموثوقية في ظروف حوادث حقيقية. ومع 100% على ExploitBench، يشكل مسار الأمن القفزة الحقيقية في هذا الإصدار.

04

الحكم

GPT-6 Astra هو اختيارنا الأول في البرمجة بالاستناد إلى أقوى ركيزتين مجتمعتين: الصدارة المجتمعية في منصة Code Arena التابعة لـ Arena.ai عبر تطوير الويب والبيانات وأدوات المنتجات، مقترنة بكفاءة الطرفية المتفوقة، وعمق التكامل، والتكلفة المنخفضة لكل مهمة مكتملة. وجِّه تطوير الويب والمهام الطرفية الوكيلية واستخدام الحاسوب والأعمال العلمية إلى Astra؛ وأبقِ Fable 5 للتعديلات الهيكلية المطوّلة للمستودعات داخل بيئة Claude Code؛ وأبقِ Sol وTerra وLuna كخيارات اقتصادية افتراضية. بيئات الاختبار تختلف فيما بينها أكثر مما تتفاوت النماذج — قِس على مستودعك قبل إعادة توجيه فريقك.

05

الأسئلة الشائعة