كل إطلاق لطراز رائد يصل بالملصق نفسه: أذكى نموذج بُني على الإطلاق. ملصق GPT-6 Astra مختلف، وأكثر فائدة. إنه يقول: هذا يستلم لوحة المفاتيح. فـ Astra هو الرائد الجديد من OpenAI للعمل خارج مربع المحادثة — تشغيل متصفح، والنقر عبر تطبيقات سطح المكتب، وحمل مسار مهني متعدد الخطوات إلى نهايته — ويتحقق من حقائقه أفضل بكثير وهو يفعل ذلك.
القصة المقيسة تطابق العرض. على OSWorld 2.0، اختبار عمليات سطح المكتب، يسجّل Astra 72.6% وينتهي في نحو 40 دقيقة حيث احتاج GPT-5.6 Sol نحو 75؛ ويقع Opus 5 عند 70.2%. وعلى Agents’ Last Exam، تقييم مسارات عمل مهنية طويلة الأمد عبر 55 مجالًا، يبلغ 59.3%. ويُظهر تتبع الدقة من Artificial Analysis انخفاض معدل الهلوسات إلى نحو النصف مقارنة بـ Sol مع دقة أعلى. أخطاء واثقة أقل وعمل منجز أسرع: هذه هي الترقية التي تشعر بها من الأسبوع الأول.
وها هو القول الصادق. على مؤشر الذكاء من Artificial Analysis يسجّل Astra 61.2 — تعادل إحصائي مع 60.9 لـ Sol — بينما يتصدر Claude Fable 5.1 بـ 65.7. وفي العمل المعرفي GDPval-AA v2 يقع نحو 1629 لـ Astra خلف Opus 5 (1824) وFable 5.1 (1853) — وخلف Sol. إن كان يومك تدقيقًا ومذكرات وحكمًا، فالرائد الجديد ليس تلقائيًا الأداة الأفضل؛ إنه أداة مختلفة. وسعر API — 10/50 دولارًا لكل مليون رمز، 2.5 ضعف Sol، مع قراءة ذاكرة مؤقتة بدولار — يعرض هذا الفرق بوضوح تام.
وجّه العمل
| المهمة | وجّهها إلى | لماذا |
|---|---|---|
| «نفّذها على جهازي»: متصفح وملفات وتطبيقات حتى النهاية | Astra | أفضل استخدام حاسوب مقيس، أسرع نحو الضعف لكل مهمة |
| عمل معرفي كثيف الحكم، تدقيق، مستندات طويلة | Opus 5 | GDPval أعلى بربع سعر API |
| أصعب الاستدلال الصافي والسياق الطويل المشوّش | Fable 5 / Fable 5.1 | يتصدر المؤشرات المستقلة المركبة |
| الحجم والمسودات الروتينية وحزام النقل اليومي | Sol / Terra / Luna | ما زالت متاحة، وما زالت أرخص المقاعد |
الثغرة الصادقة
Astra مقتضب بطبعه. أسلوب السرعة هذا يكسب تقييمات البرمجة ويخسر سلالم القانون والمالية والضرائب التي تكافئ سرد كل خطوة؛ وتراجع إتقان العروض مقارنة بـ Sol حتى مع قفزة جودة التحليل. وكان إطلاق اليوم الأول فوضويًا — لعب الدافعون لعبة حظ للوصول، ووصلت حسابات Enterprise مع Astra معطلًا افتراضيًا. لا توليد صور أصليًا ولا إخراج صوت أو فيديو. وقدراته السيبرانية الأقوى بكثير (100% على ExploitBench، مع اكتشاف ثغرات صفرية غير معروفة أثناء التقييم) تأتي مع ضمانات أكثر صرامة قد تبطئ العمل المشروع المجاور للأمن.
فالعادة الرابحة: Astra لمقعد السائق، وOpus للحكم، وFable للتفكير الصعب، وSol لحزام النقل. لم تبنِ OpenAI دماغًا أكبر؛ بل بنت يدين أفضل. ولكثير من العمل الحقيقي، هذه هي الترقية المهمة.