الترتيب #3 البرمجة — ذكاء اصطناعي يكتب شيفرة جاهزة للإنتاج
Anthropic

Claude Sonnet 5.5

Claude Sonnet 5.5 هو نموذج البرمجة الذي يمكنك تركه يعمل طوال اليوم: سريع، وسعر رمزه نصف سعر Opus 5.5، وجيد بما يكفي لكي لا تحتاج معظم إصلاحات الأخطاء والميزات الجديدة وإعادة الهيكلة إلى النموذج الرائد أبدًا. لكن لا تدفع مؤشر الجهد إلى أقصاه: فعند أعلى مستوى يكتب أكثر من أي نموذج قاسته Artificial Analysis، بل تسوء بعض نتائجه.

تم التحديث 29 سبتمبر 2026 Agentic CodingTerminal-Bench 4.0 64%Claude Code
الأفضل لـ

Claude Sonnet 5.5 هو نموذج البرمجة الذي يمكنك تركه يعمل طوال اليوم: سريع، وسعر رمزه نصف سعر Opus 5.5، وجيد بما يكفي لكي لا تحتاج معظم إصلاحات الأخطاء والميزات الجديدة وإعادة الهيكلة إلى النموذج الرائد أبدًا. لكن لا تدفع مؤشر الجهد إلى أقصاه: فعند أعلى مستوى يكتب أكثر من أي نموذج قاسته Artificial Analysis، بل تسوء بعض نتائجه.

لماذا تفوز

تمنحه اختبارات Artificial Analysis المستقلة 64% في Terminal-Bench 4.0، أعلى قليلًا من Opus 5.5 وGPT-6 Astra (نحو 60% لكل منهما). وتعلن Anthropic عن 52.1% في FrontierCode عند مستوى الجهد xhigh و55.5% في CursorBench 4.0، أي على بعد نقطتين تقريبًا من Opus 5.5. وتضعه Vals AI في المركز الثاني من 66 نموذجًا في مؤشرها، والأول في Vibe Code Bench وCode Migration. سعر الرموز $2/$10، ويصل الإخراج أسرع من Sonnet 5 بأكثر من 30%.

انتبه إلى

عند مستوى max استهلك نحو 193,000 رمز إخراج لكل مهمة في اختبارات Artificial Analysis، وهو أعلى رقم قاسته على الإطلاق، وتنخفض نتيجته في FrontierCode من 52.1% عند xhigh إلى 46.2% عند max. وتقول Anthropic نفسها إن Opus 5.5 يبقى أقوى بوضوح في العمل المعقد المفتوح. تُحال مهام الأمن الأعلى خطورة إلى Sonnet 5، ويواجه مستخدمو الواجهة البرمجية خمسة تغييرات غير متوافقة عند الانتقال.

01

ما هو في الواقع

تخيّل نجّارين. الأول هو المعلّم الذي تستدعيه حين يحتاج البيت إلى درج جديد ولم يرسم أحد مخططاته بعد. والثاني هو الحرفي المثابر الذي يركّب أربعين بابًا في أسبوع، وكل باب منها مستقيم تمامًا.

معظم أسبوع أي فريق برمجي أبواب لا أدراج: اختبار يفشل، ونموذج إدخال يحتاج إلى حقل جديد، وواجهة برمجية غيّرت اسمها. صُمّم Claude Sonnet 5.5 للأبواب.

أطلقته Anthropic في 28 سبتمبر 2026 بوصفه النموذج الثاني في عائلة Claude 5.5، بعد أسبوع من Opus 5.5. وحافظ على سعر Sonnet 5: دولاران لكل مليون رمز إدخال و10 دولارات لكل مليون رمز إخراج، أي نصف سعر Opus 5.5. وتقول Anthropic إنه أسرع من Sonnet 5 بأكثر من 30%، وتقل تكلفة المهمة الواحدة معه بما يصل إلى 30% لأنه ينجز العمل بخطوات أقل.

الأرقام المستقلة

في وكلاء البرمجة، الاختبار الذي نثق به أكثر من غيره هو Terminal-Bench 4.0: مهام طويلة متعددة الخطوات في سطر أوامر حقيقي، يتعيّن فيها على النموذج أن يثبّت الأدوات ويشغّلها ويقرأ الأخطاء ثم يحاول مجددًا.

أجرت Artificial Analysis هذا الاختبار باستقلالية في سبتمبر 2026. حصل Sonnet 5.5 على 64%، متقدمًا قليلًا على Opus 5.5 وGPT-6 Astra اللذين سجّل كل منهما نحو 60%. أما تشغيل Anthropic الخاص فأعلى، عند 70.6%، لكن بيئات الاختبار التي تديرها الشركات تميل إلى مجاملة نماذجها، لذا فالرقم المستقل 64% هو الجدير بالتذكّر. وفي الحالتين هي قفزة هائلة مقارنة بـ Sonnet 5 الذي سجّل 10.3% في جدول Anthropic.

ويتفق مصدر مستقل ثانٍ مع الصورة العامة. تضع Vals AI نموذج Sonnet 5.5 في المركز الثاني من 66 نموذجًا في مؤشرها بنسبة 69.22%، على بعد أقل من نصف نقطة من Opus 5.5، وبنحو ثلثي تكلفة الاختبار الواحد. ويحتل المركز الأول في تصنيفين برمجيين: Vibe Code Bench (بناء تطبيقات صغيرة انطلاقًا من وصف) بنسبة 92.39%، وCode Migration بنسبة 69.83%.

ما تضيفه اختبارات Anthropic نفسها

يستكمل جدول الإطلاق لدى Anthropic التفاصيل:

  • FrontierCode v1.1، الذي يسأل هل يمكن دمج تغيير في الشيفرة دون أن يلمسه إنسان: 52.1% عند مستوى xhigh. ويسجّل Opus 5.5 نسبة 54.4% وGPT-6 Sol نسبة 49.3%.
  • CursorBench 4.0، المبني على جلسات حقيقية في محرر Cursor: 55.5%، أي خلف Opus 5.5 بنحو نقطتين ومتقدمًا كثيرًا على 34.1% لـ Sonnet 5.

والأكثر فائدة هي الرسوم البيانية للتكلفة، التي تضع نتيجة كل نموذج مقابل تكلفة المهمة عند كل مستوى جهد. تبرز منها نتيجتان. عند مستوى High، وهو الافتراضي في الواجهة البرمجية، يعادل Sonnet 5.5 أفضل نتيجة لـ GPT-6 Sol في FrontierCode بنحو خُمس تكلفة المهمة. وعند مستوى Medium، وهو الافتراضي في Claude Code، يتجاوز أفضل نتيجة لـ Sonnet 5 في Terminal-Bench بأقل من عُشر التكلفة.

ويصف المختبرون الأوائل الشيء نفسه بكلمات أبسط. رأت Lovable نحو نصف عدد أوامر الطرفية لكل مهمة. وقاست Slack نحو 14% رموز إخراج أقل مقارنة بـ Sonnet 5. أما Unity، التي لا تعدّ المهمة منجزة إلا إذا عمل التغيير فعلًا أثناء التشغيل، فتقول إن معظم عمل Sonnet 5.5 اجتاز هذا الفحص.

مؤشر الجهد، ولماذا يأتي أعلى مستوى بنتيجة عكسية

مثل Opus 5.5، يملك Sonnet 5.5 مؤشر جهد بخمسة مستويات: low وmedium وhigh وxhigh وmax. تتيح المستويات الأعلى للنموذج أن يفكر مدة أطول ويراجع عمله بعناية أكبر. قد تتوقع أن يكون max الأفضل، لكنه مع Sonnet 5.5 كثيرًا ما لا يكون كذلك.

قاست Artificial Analysis المدى كله على مؤشر الذكاء الخاص بها:

مستوى الجهد مؤشر الذكاء تكلفة المهمة
Low 36 $0.41
Medium 41 $0.59
High 47 $1.08
Xhigh 52 $2.74
Max 56 $7.60

الانتقال من xhigh إلى max يضيف أربع نقاط مقابل ما يقارب ثلاثة أضعاف التكلفة. وعند max كتب Sonnet 5.5 نحو 193,000 رمز إخراج لكل مهمة. هذا أعلى رقم قاسته Artificial Analysis على الإطلاق: أكثر بنحو 60% من Opus 5.5 عند max، ونحو سبعة أضعاف GPT-6 Astra.

والأسوأ أن الجهد الأكبر لا يعني دائمًا شيفرة أفضل. ففي FrontierCode يسجّل Sonnet 5.5 52.1% عند xhigh لكن 46.2% فقط عند max. وتشرح Anthropic السبب في حاشية: عند max كان النموذج يطلق أكثر من غيره روتين مراجعة الشيفرة في Claude Code، الذي يوزّع المراجعة على وكلاء مساعدين كثيرين. وفي بعض الحالات انتهى ذلك بنفاد المهلة أو بتعديلات إضافية خارج المهمة، وFrontierCode يعاقب على التغييرات التي لم يطلبها أحد.

الدرس بسيط: اعتبر xhigh هو السقف. إذا ظلت المهمة تفشل عند xhigh، فالخطوة التالية الأفضل عادةً هي Opus 5.5 لا max.

العيب بصراحة

يبقى Opus هو المهندس المعماري. تقولها Anthropic بوضوح: في عدة اختبارات يقترب Sonnet 5.5 عند max من Opus 5.5، لكن في اختبارات Anthropic نفسها واختبارات المختبرين الخارجيين يبقى Opus 5.5 أقوى بوضوح في العمل المعقد المفتوح الذي يتطلب حكمًا متواصلًا. كما يحتفظ Opus بالصدارة في FrontierCode وCursorBench.

لن تنخفض فاتورة Claude Code إلى النصف. يعيد وكلاء البرمجة قراءة مشروعك باستمرار، وتُحتسب هذه القراءات على أنها قراءات من الذاكرة المؤقتة بسعر $0.20 لكل مليون رمز في Sonnet 5.5 وOpus 5.5 على حد سواء. ستوفّر في الإدخال والإخراج الجديدين، لكن الجلسة الطويلة المعتمدة بكثافة على الذاكرة المؤقتة توفّر أقل مما يوحي به عنوان «نصف السعر».

تُحال مهام الأمن. Sonnet 5.5 هو أول نموذج Sonnet يُطرح بضوابط الأمن السيبراني التي تطبقها Anthropic على أقوى نماذجها. لا يتأثر إصلاح الأخطاء المعتاد، لكن مهام الأمن الأعلى خطورة تُحال بشكل ظاهر إلى Sonnet 5، ما لم يحصل فريقك على الموافقة عبر برنامج Cyber Verification Program من Anthropic.

الانتقال يتطلب بعض العمل. تذكر Anthropic خمسة تغييرات غير متوافقة مقارنة بـ Sonnet 5. ففرض استخدام أداة يعيد الآن خطأ، وتُرفض قيم temperature غير الافتراضية، ويعود النص الواقع بين استدعاءات الأدوات بصيغة مختلفة. إصلاح ذلك ليس صعبًا، لكنه ليس تبديلًا في سطر واحد.

أين يناسب

إن كانت المهمة… استخدم لماذا
خطأً أو ميزة أو ترحيلًا محدد النطاق Claude Sonnet 5.5 سريع ورخيص عند medium أو high
بنية مفتوحة أو مشكلة لم يحدد أحد نطاقها Claude Opus 5.5 حكم أقوى بوضوح بحسب Anthropic والمختبرين
عملًا طويلًا في الطرفية دون إشراف بأقل تكلفة للمهمة GPT-6 Astra يستهلك جزءًا صغيرًا من الرموز عند ذروة أدائه
صقل الواجهات الأمامية والشرائح والمشاريع المرئية الصغيرة Claude Sonnet 5.5 حس مرهف بالتصميم وتكرار سريع

الحكم النهائي

Claude Sonnet 5.5 هو النموذج الذي ينبغي لمعظم المطورين أن يتركوه يعمل. يتولى الأبواب، الأربعين كلها، بسرعة وبنصف سعر رمز النموذج الرائد. أبقِه عند medium أو high، واستخدم xhigh للحالات الصعبة، وحين يتبيّن أن المهمة درج لا باب، استدعِ Opus.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • نتائج مستقلة في الطرفية: قاست Artificial Analysis في سبتمبر 2026 نسبة 64% في Terminal-Bench 4.0، أعلى قليلًا من Opus 5.5 وGPT-6 Astra اللذين سجّلا نحو 60%. هذا هو الاختبار المستقل الذي يحسم معظم المقارنات بين وكلاء البرمجة، وقد أبلى فيه Sonnet 5.5 بلاءً حسنًا بنصف سعر رمز Opus.
  • رخيص عند الإعدادات المعقولة: تُظهر رسوم Anthropic البيانية أن Sonnet 5.5 عند مستوى High، وهو الافتراضي في الواجهة البرمجية، يعادل أفضل نتيجة لـ GPT-6 Sol في FrontierCode بنحو خُمس تكلفة المهمة. وفي Terminal-Bench يتجاوز مستوى Medium وحده أفضل نتيجة لـ Sonnet 5 بأقل من عُشر التكلفة.
  • ينجز بخطوات أقل: يصف المختبرون الأوائل النمط نفسه. قاست Slack نحو 14% رموز إخراج أقل مقارنة بـ Sonnet 5، ورأت Lovable نحو نصف عدد أوامر الطرفية لكل مهمة، وفي اختبار لدى Balyasny استخدم نحو 121,000 رمز لكل إجابة حيث استخدم Sonnet 5 نحو 497,000.
  • قوي في الترحيل والبناء السريع: تضع Vals AI نموذج Sonnet 5.5 في المركز الأول في Vibe Code Bench (92.39%) وCode Migration (69.83%)، والثاني في مؤشر Vals الإجمالي، بنحو ثلثي تكلفة الاختبار الواحد لدى Opus 5.5.
  • عين جيدة للواجهات: تقول Anthropic إن لدى Sonnet 5.5 حسًّا مرهفًا بالتصميم: يستطيع صقل واجهات المستخدم واتباع قوالب الشرائح بدقة تجعل التعديل اللاحق قليلًا جدًا. كما يصل إخراجه أسرع من Sonnet 5 بأكثر من 30%، ما يجعل التعديل السريع ذهابًا وإيابًا مريحًا.

قيود صادقة

  • مستوى max فخ: قاست Artificial Analysis نحو 193,000 رمز إخراج لكل مهمة عند max، أي أكثر بنحو 60% من Opus 5.5 عند max ونحو سبعة أضعاف GPT-6 Astra. عند هذا المستوى تختفي معظم ميزة السعر مقارنة بـ Opus.
  • جهد أكثر ودمج أسوأ: في FrontierCode، الذي يتحقق مما إذا كانت التغييرات قابلة للدمج دون تعديل بشري، تعلن Anthropic عن 52.1% عند xhigh لكن 46.2% فقط عند max. فعند max كان النموذج يطلق أكثر من غيره روتين مراجعة شيفرة موزعًا على وكلاء مساعدين كثيرين، وهو ما انتهى أحيانًا بنفاد المهلة أو بتعديلات خارج نطاق المهمة.
  • ليس المهندس المعماري: تقول Anthropic إن Opus 5.5 يبقى أقوى بوضوح في العمل المعقد المفتوح الذي يتطلب حكمًا متواصلًا. كما يتصدر Opus في FrontierCode (54.4%) وCursorBench (57.8%).
  • تُحال مهام الأمن: تُحال مهام الأمن السيبراني الأعلى خطورة إلى Sonnet 5 بشكل ظاهر للمستخدم. لا يتأثر إصلاح الأخطاء المعتاد، ويمكن لفرق الأمن الموثّقة طلب وصول أوسع.
  • ليس مجرد تبديل اسم في الواجهة البرمجية: تذكر Anthropic خمسة تغييرات غير متوافقة مقارنة بـ Sonnet 5، منها أخطاء عند فرض استخدام الأدوات وعند ضبط قيم temperature غير الافتراضية. اقرأ دليل الترحيل قبل نقل شيفرة الإنتاج.
03

لمحة عن المعايير

Terminal-Bench 4.0 — 64% مستقل (70.6% وفق الشركة)

عمل متعدد الخطوات في طرفية سطر الأوامر. قاست Artificial Analysis نسبة 64% مقابل نحو 60% لكل من Opus 5.5 وGPT-6 Astra (xhigh). وأفضل تشغيل لدى Anthropic نفسها يبلغ 70.6%، مقابل 66.4% لـ Opus 5.5 عند xhigh و10.3% لـ Sonnet 5.

FrontierCode v1.1 — 52.1% عند xhigh و46.2% عند max

مدى جاهزية تغييرات الشيفرة للدمج. جدول Anthropic: Opus 5.5 بنسبة 54.4%، وGPT-6 Sol بنسبة 49.3%، وSonnet 5 بنسبة 42.4%. ويسجّل Sonnet 5.5 عند max أقل مما يسجّله عند xhigh.

CursorBench 4.0 — 55.5%

مهام غامضة تمتد عبر ملفات متعددة، مأخوذة من جلسات Cursor حقيقية. تعلن Anthropic عن 57.8% لـ Opus 5.5 و34.1% لـ Sonnet 5.

مؤشر Vals — 69.22% (الثاني من 66)

مؤشر مستقل من Vals AI، يتأخر 0.47 نقطة عن Opus 5.5 ويتقدم على Fable 5.1، بتكلفة $20.80 للاختبار مقابل $32.77 لـ Opus 5.5. الأول في Vibe Code Bench وCode Migration.

رموز الإخراج لكل مهمة — نحو 193,000 عند max

قياس Artificial Analysis عبر مؤشر الذكاء الخاص بها، وهو أعلى رقم سجّلته: أكثر بنحو 60% من Opus 5.5 (max) ونحو سبعة أضعاف GPT-6 Astra (max).

السعر — $2 / $10 لكل مليون رمز، و$0.20 لقراءة الذاكرة المؤقتة

دون تغيير عن Sonnet 5، ونصف سعر Opus 5.5 البالغ $4/$20. تكلف قراءة الذاكرة المؤقتة $0.20 نفسها كما في Opus، لذا توفّر جلسات البرمجة المعتمدة بكثافة على الذاكرة المؤقتة أقل مما يوحي به السعر المعلن. وتحصل الطلبات المجمّعة على خصم 50%.

04

الحكم

Claude Sonnet 5.5 هو النموذج الذي يستحق أن يبقى يعمل لهندسة البرمجيات اليومية: أخطاء محددة النطاق، وميزات، وعمليات ترحيل، وعمل الواجهات الأمامية، عند مستوى medium أو high حيث يكون سريعًا ورخيصًا. يأتي مباشرة خلف GPT-6 Astra وOpus 5.5 لأن أفضل نتيجة مستقلة له في الطرفية تأتي عند مستوى max، وهو بالضبط المستوى الذي يحرق فيه أكبر عدد من الرموز وتنخفض فيه جودة تغييراته القابلة للدمج. أبقِه دون max، واترك أسئلة البنية المفتوحة لـ Opus 5.5.

05

الأسئلة الشائعة