الترتيب #2 المنظومة اليومية — مساعدات الذكاء الاصطناعي الرائدة
OpenAI

GPT-6 Astra

GPT-6 Astra هو الرائد الجديد من OpenAI للجزء من العمل الذي يحدث خارج مربع المحادثة. يقود المتصفح، وينقر عبر تطبيقات سطح المكتب، ويُنفّذ مسارات العمل المهنية متعددة الخطوات حتى النهاية، ويتحقق من حقائقه بنفسه أفضل بنحو الضعف مقارنةً بـ GPT-5.6 Sol — داخل منظومة ChatGPT وCodex وAPI نفسها التي تعرفها.

تم التحديث 5 سبتمبر 2026 AgenticChatGPT WorkComputer Use
الأفضل لـ

GPT-6 Astra هو الرائد الجديد من OpenAI للجزء من العمل الذي يحدث خارج مربع المحادثة. يقود المتصفح، وينقر عبر تطبيقات سطح المكتب، ويُنفّذ مسارات العمل المهنية متعددة الخطوات حتى النهاية، ويتحقق من حقائقه بنفسه أفضل بنحو الضعف مقارنةً بـ GPT-5.6 Sol — داخل منظومة ChatGPT وCodex وAPI نفسها التي تعرفها.

لماذا تفوز

تمنح اختبارات Artificial Analysis المستقلة طراز Astra درجة 61.2 على مؤشر الذكاء — تعادل إحصائي مع Sol — بينما تُظهر جداول الإطلاق 72.6% على OSWorld 2.0 (استخدام الحاسوب) في نحو نصف وقت Sol، و59.3% على Agents' Last Exam، و62.7% على منصة ARC-AGI-3 القياسية (99.9% فقط مع محوّل OpenAI الخاص)، و64.6% على Terminal-Bench Science، وهلوسات انخفضت إلى نحو النصف مع دقة أعلى. متاح منذ اليوم الأول في ChatGPT وCodex وAPI وAzure وBedrock.

انتبه إلى

هذه ترقية لأخصائي، لا رقم قياسي جديد في الذكاء. درجات العمل المعرفي المستقلة (GDPval-AA) تراجعت دون مستوى Sol، وما زال Claude Fable 5.1 يتصدر المؤشرات المركبة للذكاء العام، وسعر API يعادل 2.5 ضعف Sol عند 10/50 دولارًا لكل مليون رمز مع قراءة ذاكرة مؤقتة بـ 1 دولار. إجابات Astra المقتضبة تراجعت في اختبارات القانون والمالية والعروض التقديمية، وكان إطلاق اليوم الأول قد حال دون وصول بعض المشتركين إلى الخدمة.

01

ما هو في الواقع

كل إطلاق لطراز رائد يصل بالملصق نفسه: أذكى نموذج بُني على الإطلاق. ملصق GPT-6 Astra مختلف، وأكثر فائدة. إنه يقول: هذا يستلم لوحة المفاتيح. فـ Astra هو الرائد الجديد من OpenAI للعمل خارج مربع المحادثة — تشغيل متصفح، والنقر عبر تطبيقات سطح المكتب، وحمل مسار مهني متعدد الخطوات إلى نهايته — ويتحقق من حقائقه أفضل بكثير وهو يفعل ذلك.

القصة المقيسة تطابق العرض. على OSWorld 2.0، اختبار عمليات سطح المكتب، يسجّل Astra 72.6% وينتهي في نحو 40 دقيقة حيث احتاج GPT-5.6 Sol نحو 75؛ ويقع Opus 5 عند 70.2%. وعلى Agents’ Last Exam، تقييم مسارات عمل مهنية طويلة الأمد عبر 55 مجالًا، يبلغ 59.3%. ويُظهر تتبع الدقة من Artificial Analysis انخفاض معدل الهلوسات إلى نحو النصف مقارنة بـ Sol مع دقة أعلى. أخطاء واثقة أقل وعمل منجز أسرع: هذه هي الترقية التي تشعر بها من الأسبوع الأول.

وها هو القول الصادق. على مؤشر الذكاء من Artificial Analysis يسجّل Astra 61.2 — تعادل إحصائي مع 60.9 لـ Sol — بينما يتصدر Claude Fable 5.1 بـ 65.7. وفي العمل المعرفي GDPval-AA v2 يقع نحو 1629 لـ Astra خلف Opus 5 (1824) وFable 5.1 (1853) — وخلف Sol. إن كان يومك تدقيقًا ومذكرات وحكمًا، فالرائد الجديد ليس تلقائيًا الأداة الأفضل؛ إنه أداة مختلفة. وسعر API — 10/50 دولارًا لكل مليون رمز، 2.5 ضعف Sol، مع قراءة ذاكرة مؤقتة بدولار — يعرض هذا الفرق بوضوح تام.

وجّه العمل

المهمة وجّهها إلى لماذا
«نفّذها على جهازي»: متصفح وملفات وتطبيقات حتى النهاية Astra أفضل استخدام حاسوب مقيس، أسرع نحو الضعف لكل مهمة
عمل معرفي كثيف الحكم، تدقيق، مستندات طويلة Opus 5 GDPval أعلى بربع سعر API
أصعب الاستدلال الصافي والسياق الطويل المشوّش Fable 5 / Fable 5.1 يتصدر المؤشرات المستقلة المركبة
الحجم والمسودات الروتينية وحزام النقل اليومي Sol / Terra / Luna ما زالت متاحة، وما زالت أرخص المقاعد

الثغرة الصادقة

Astra مقتضب بطبعه. أسلوب السرعة هذا يكسب تقييمات البرمجة ويخسر سلالم القانون والمالية والضرائب التي تكافئ سرد كل خطوة؛ وتراجع إتقان العروض مقارنة بـ Sol حتى مع قفزة جودة التحليل. وكان إطلاق اليوم الأول فوضويًا — لعب الدافعون لعبة حظ للوصول، ووصلت حسابات Enterprise مع Astra معطلًا افتراضيًا. لا توليد صور أصليًا ولا إخراج صوت أو فيديو. وقدراته السيبرانية الأقوى بكثير (100% على ExploitBench، مع اكتشاف ثغرات صفرية غير معروفة أثناء التقييم) تأتي مع ضمانات أكثر صرامة قد تبطئ العمل المشروع المجاور للأمن.

فالعادة الرابحة: Astra لمقعد السائق، وOpus للحكم، وFable للتفكير الصعب، وSol لحزام النقل. لم تبنِ OpenAI دماغًا أكبر؛ بل بنت يدين أفضل. ولكثير من العمل الحقيقي، هذه هي الترقية المهمة.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • استخدام حاسوب يُنهي المهمة: يسجّل Astra 72.6% على OSWorld 2.0 مقابل 65.7% لـ Sol و70.2% لـ Opus 5، ويُكمل مجموعة المهام في نحو 40 دقيقة حيث احتاج Sol نحو 75. في ChatGPT Work يتحول ذلك إلى وكيل يتصفح وينقر ويكتب وينقل الملفات حتى إنجاز العمل — وأنت من يوافق.
  • نحو نصف الهلوسات: يُظهر تتبع Artificial Analysis للدقة أن معدل هلوسات Astra انخفض إلى نحو نصف معدل Sol بينما ارتفعت الدقة نحو أربع نقاط. في العمل المهني، أخطاء واثقة أقل تساوي أكثر من نقطة امتحان إضافية.
  • زميل علمي جاد: يسجّل Astra 64.6% على Terminal-Bench Science — مقابل 52.6% لـ Fable 5.1 و22.4% لـ Sol — ونحو 97.6% على FrontierMath Tier 4، بل قدّم براهين لمسألتين من مسائل Erdős الـ 68 المفتوحة أثناء التقييم: وهي لمحة بحثية تجريبية لا وعد تجاري.
  • قدرات استثنائية للمسائل المستجدة: على منصة ARC-AGI-3 القياسية يبلغ Astra 62.7%، نحو ضعف الـ 30.2% لـ Opus 5. أما رقم 99.9% الذي ربما رأيته فيتطلب محوّل OpenAI مع الضغط؛ فاعتبر 62.7% الرقم الصادق القابل للمقارنة.
  • استمرارية المنظومة: يدخل Astra من اليوم الأول إلى ChatGPT Work وCodex وتطبيق سطح المكتب وSites، بمعرّف API ‏gpt-6-astra، وإدراج في Azure وBedrock، وخيار الاحتفاظ الصفري بالبيانات لأعمال API المؤهلة، وسياق يقارب 1.05 مليون رمز، ودعم من اليوم الأول في أدوات مثل Devin.

قيود صادقة

  • ليس قفزة في الذكاء العام: يضع Artificial Analysis طراز Astra عند 61.2 مقابل 60.9 لـ Sol — تعادل — بينما يتصدر Claude Fable 5.1 بـ 65.7. وفي العمل المعرفي GDPval-AA v2 يقع نحو 1629 لـ Astra خلف Opus 5 (1824) وFable 5.1 (1853) — وخلف Sol. إن كان يومك مذكرات وتدقيقًا وحكمًا، فليس Astra تلقائيًا الشراء الأفضل.
  • اقتصاديات مميزة باهظة: يُدرج API بسعر 10/50 دولارًا لكل مليون رمز إدخال/إخراج — 2.5 ضعف Sol — مع قراءة ذاكرة مؤقتة بـ 1 دولار (Fable 5.1 يتقاضى 0.25)، وكتابة بـ 12.50 دولارًا، ومضاعفة سعر الإدخال للأوامر فوق 272 ألف رمز، وضعف السعر في الوضع السريع. يحسب Artificial Analysis أن Astra أغلى بنحو 75% لكل مهمة مؤشر ذكاء مقارنة بـ Sol رغم استهلاكه نحو 10% رموزًا أقل.
  • تحفظات حول الأسلوب وقيود الوصول: Astra مقتضب، فيخسر بنود سلم التقييم في امتحانات القانون والمالية والضرائب، وتراجع إتقان العروض لديه مقارنة بـ Sol حتى مع قفزة جودة التحليل. كان إطلاق اليوم الأول فوضويًا — وصول Enterprise شارك معطلًا افتراضيًا — ولا يوجد توليد صور أصلي ولا إخراج صوت/فيديو. والضمانات السيبرانية الأقوى تبطئ بعض الأعمال المشروعة القريبة من الأمن، وجداول OpenAI نفسها تحركت قليلًا بعد النشر: تعامل مع كل خانة بهامش ±1–2 نقطة.
03

لمحة عن المعايير

OSWorld 2.0 — Astra 72.6% في ~40 دقيقة

جدول استخدام الحاسوب من OpenAI، مقابل 65.7% لـ Sol (~75 دقيقة) و70.2% لـ Opus 5. قياس على مجموعة مهام جزئية دون اتصال — إشارة اتجاهية قوية لا ضمانة لتطبيقاتك بعينها.

Artificial Analysis Intelligence Index — 61.2

مؤشر مركب مستقل: متعادل مع GPT-5.6 Sol عند 60.9 وخلف Claude Fable 5.1 عند 65.7. العنوان الصادق هو «أكثر قدرة على العمل المستقل» لا «أذكى».

تتبع الدقة من AA — هلوسات تنخفض إلى نحو النصف

قياس مستقل يُظهر نحو نصف معدل هلوسات Sol مع دقة أعلى بنحو أربع نقاط — تغيّر الموثوقية الذي يلمسه المحترفون فعلًا.

ARC-AGI-3 — 62.7% قياسي / 99.9% مع محوّل المزود

حل مسائل تفاعلية جديدة. 62.7% هي القيمة القابلة للمقارنة على المنصة القياسية (Opus 5: 30.2%)؛ أما 99.9% فتتضمن منصة Responses والضغط من OpenAI وتلزمها هذه الحاشية دائمًا.

أسعار API — 10/50 دولار · قراءة الذاكرة 1 دولار · الكتابة 12.50 دولار

لكل مليون رمز إدخال/إخراج، مع 2x إدخال / 1.5x إخراج للأوامر فوق 272 ألف رمز و2x في الوضع السريع. قارن كلفة المهمة المنجزة وسلوك الذاكرة المؤقتة، لا الأسعار المعلنة.

04

الحكم

يأخذ GPT-6 Astra المقعد اليومي الثاني من GPT-5.6 لأنه أقوى وكيل لاستخدام الحاسوب والعمل العلمي داخل أوسع منصة استهلاكية — ChatGPT Work وCodex وسطح المكتب وSites وAPI. ويحتفظ Opus 5 بالمركز الأول في الحكم لكل دولار للعمل المعرفي الصرف، ويبقى Fable 5 أخصائي الذكاء. اختر Astra حين تكون المهمة «نفّذها على جهازي وأنجزها»؛ واختر Opus 5 حين يكون المخرَج حكمًا؛ وأبقِ Sol وTerra وLuna للحجم الكبير بالأسعار القديمة.

05

الأسئلة الشائعة