الترتيب #2 الموسيقى والصوت — صوتٌ من العدم
ElevenLabs

ElevenLabs v4

كان ElevenLabs v3 قادرًا على أداء الجملة إذا أخبرته كيف. أما Eleven v4 فيقرأ المشهد كله: من يتكلم، وما الذي حدث للتو، وإلى أي حد توتر الحوار، ثم يؤديه على هذا الأساس. والمستمعون في ساحة الأصوات العمياء لدى Artificial Analysis يضعونه الآن في المركز الأول، بينما تنقل نسخة Turbo الأسرع الأصوات نفسها إلى المحادثة الحية.

تم التحديث 29 سبتمبر 2026 VoiceTTS90+ Languages
الأفضل لـ

كان ElevenLabs v3 قادرًا على أداء الجملة إذا أخبرته كيف. أما Eleven v4 فيقرأ المشهد كله: من يتكلم، وما الذي حدث للتو، وإلى أي حد توتر الحوار، ثم يؤديه على هذا الأساس. والمستمعون في ساحة الأصوات العمياء لدى Artificial Analysis يضعونه الآن في المركز الأول، بينما تنقل نسخة Turbo الأسرع الأصوات نفسها إلى المحادثة الحية.

لماذا تفوز

المركز الأول في ساحة Provider Voice لدى Artificial Analysis في سبتمبر 2026 (1319 Elo، متقدمًا على Cartesia Sonic 3.6 بـ 1276 وGemini 3.8 Flash TTS بـ 1267). أكثر من 90 لغة، وحتى 10,000 حرف في الطلب الواحد، ووسوم صوتية قابلة للدمج، ونطق بالأبجدية الصوتية الدولية (IPA)، واستنساخ فوري للصوت من نحو 10 ثوانٍ من التسجيل. ويبدأ نموذج Turbo الرد في نحو 150 مللي ثانية بحسب ElevenLabs.

انتبه إلى

بسعره المعلن البالغ $0.08 لكل 1,000 حرف ($80 للمليون)، يكلف أكثر من Cartesia ($49) وأكثر بكثير من Gemini 3.8 Flash TTS ($16.49). ويسري خصم إطلاق بنسبة 72% حتى 12 أكتوبر 2026. ولا يدعم وسوم التوقف في SSML، وأصوات بهذه الواقعية تُبقي أسئلة الموافقة وسوء الاستخدام في الواجهة.

01

ما هو في الواقع

قراءة النص شيء، وأداؤه شيء آخر.

أعطِ برنامج قراءة عبارة «آه، رائع، ها أنت هنا» فسينطق الكلمات. وأعطها لممثلة فستسأل عما حدث قبلها مباشرة. هل الشخصية مرتاحة؟ أم ساخرة؟ هل وصل أحدهم للتو متأخرًا إلى اجتماع؟

كانت الإصدارات السابقة من ElevenLabs قادرة على أداء الجملة إذا أخبرتها كيف. أما Eleven v4 فيحاول أن يستنتج ذلك بنفسه. تقول ElevenLabs إنه يقرأ الحوار المحيط، أي من يتكلم وكيف تصاعد التبادل وما الذي قيل للتو، ثم يؤدي كل جملة بما يناسبها.

أطلقت ElevenLabs نموذج Eleven v4 في 28 سبتمبر 2026، ومعه Eleven v4 Turbo، وهو نسخة أسرع لوكلاء الصوت في الوقت الفعلي. وكلاهما متاح في تطبيقات ElevenLabs وواجهتها البرمجية، بما في ذلك الخطة المجانية.

ماذا يقول المستمعون

الرقم الأهم لأي نموذج صوتي بسيط: أيها يفضّل الناس حين لا يرون الاسم؟

تدير Artificial Analysis ساحة Provider Voice التي تجيب عن هذا السؤال تحديدًا. يستمع الناس إلى مقطعين مجهولي المصدر للنص نفسه ويختارون الأكثر طبيعية، ثم تتحول الأصوات إلى تقييمات Elo كما في الشطرنج. في سبتمبر 2026 احتل Eleven v4 المركز الأول بـ 1319 Elo، متقدمًا على Cartesia Sonic 3.6 بـ 1276 وعلى Gemini 3.8 Flash TTS من Google بـ 1267. وتضعه Artificial Analysis أيضًا في المركز الأول في متانة النطق، أي نطق الكلمات الصعبة بشكل صحيح، وفي المركز الثاني في الصوت المتحكَّم به.

وتضيف ElevenLabs اختبارًا أعمى خاصًا بها فضّل فيه نحو 75% من المستمعين النموذج v4. هذا رقم صادر عن الشركة، لذا فترتيب الساحة هو ما يُعتمد عليه.

ما الجديد منذ v3

قدّم v3 الوسوم الصوتية: توجيهات قصيرة بين قوسين معقوفين مثل [whispers] أو [laughs] تغيّر طريقة نطق الجملة. ويبني v4 على هذه الفكرة:

  • يمكن دمج الوسوم وتسلسلها. تستطيع الجمع بين عدة توجيهات، ويتبعها النموذج بالترتيب على امتداد المقطع.
  • يصغي إلى السياق. تأخذ الردود في الحوار نبرتها مما سبقها، وهذا مهم في الخلافات وتصاعد التوتر ولحظات «يرجى الانتظار» في خدمة العملاء.
  • نطق يمكنك تهجئته. اكتب الكلمة بالأبجدية الصوتية الدولية (IPA) بين شرطتين مائلتين، وسينطقها v4 كما كتبتها. وتقول ElevenLabs إن ذلك صار أكثر موثوقية بكثير.
  • طلبات أطول. حتى 10,000 حرف في الطلب الواحد، أي نحو عشر دقائق من الصوت، مع وصل أفضل حين تربط عدة طلبات ببعضها.
  • أصوات أكثر ثباتًا. تحافظ طريقة جديدة على هوية الصوت عبر السرد الطويل وإعادة التسجيل المتكررة، وكان ذلك نقطة ضعف في المشاريع الطويلة.

تتسع اللغات من نحو 70 إلى أكثر من 90، وأكبر قفزات الجودة في اليابانية والبرتغالية البرازيلية والماندرين والكانتونية. ويستطيع الصوت الواحد الآن التحدث بأي لغة مدعومة مع الاحتفاظ بهويته.

وصار استنساخ الأصوات أسرع أيضًا. فـ Instant Voice Clone يحتاج الآن إلى نحو 10 ثوانٍ فقط من التسجيل. ولأعلى دقة ممكنة، يدعم النموذج أيضًا Professional Voice Clones.

Turbo: أصوات يمكنك التحدث إليها

يعيش وكيل الصوت أو يموت بالتوقيت. فإن بدأ الرد بعد ثانية كاملة من صمتك، بدت المحادثة كخط هاتفي رديء.

صُمم Eleven v4 Turbo لهذه المهمة بالذات. تعلن ElevenLabs عن زمن استدلال وسيط يبلغ نحو 100 مللي ثانية ونحو 150 مللي ثانية حتى أول كلمة، مقابل 262–814 مللي ثانية لدى المنافسين الذين اختبرتهم. هذه قياسات الشركة نفسها ولا تشمل تأخير الشبكة، لكنها تضع Turbo ضمن مدة الوقفة الطبيعية بين شخصين يتحدثان. وسعره نصف سعر النموذج الكامل.

العيب بصراحة

إنه الخيار المرتفع السعر. بالسعر المعلن يكلف Eleven v4 مبلغ $0.08 لكل 1,000 حرف، وهو ما تسجله Artificial Analysis بـ $80 لكل مليون حرف. ويكلف Cartesia Sonic 3.6 مبلغ $49 وGemini 3.8 Flash TTS مبلغ $16.49 للكمية نفسها. وفي السرد بالجملة حيث يكفي أن يكون الصوت «واضحًا ولطيفًا»، فهذان أرخص بكثير. وتقدم ElevenLabs خصم إطلاق بنسبة 72% حتى 12 أكتوبر 2026 يجعل سعر v4 نحو $0.022 لكل 1,000 حرف، لكن ضع ميزانيتك على أساس السعر المعلن.

أدوات التحكم مختلفة. مثل v3، لا يدعم v4 وسوم التوقف في SSML، وهي الترميز الذي تستخدمه كثير من نصوص تحويل النص إلى كلام القديمة لتحديد الوقفات. يأتي التوجيه بدلًا من ذلك من علامات الترقيم والوسوم الصوتية والأبجدية الصوتية. إن كان لديك مسار إنتاج قائم، فأعد كتابة بعض النصوص واستمع مجددًا إلى أصواتك على v4 قبل نقل كل شيء.

الاستنساخ الجيد سلاح ذو حدين. نسخة مقنعة من صوت شخص انطلاقًا من عشر ثوانٍ من التسجيل مفيدة للمبدعين وخطيرة في الأيدي الخطأ. تطبق ElevenLabs التحقق والضوابط، لكن الموافقة والحقوق التجارية تبقى مسؤوليتك.

لمن يناسب

إن كنت تحتاج إلى… استخدم لماذا
كتب صوتية أو شخصيات أو دبلجة يهمّ فيها الأداء Eleven v4 في صدارة ساحة الاستماع المستقلة، مع تحكم دقيق
وكيل صوتي أو مساعد مباشر Eleven v4 Turbo نحو 150 مللي ثانية حتى أول كلمة، بنصف السعر
كميات هائلة من السرد البسيط بميزانية محدودة Gemini 3.8 Flash TTS أو Cartesia Sonic 3.6 جزء صغير من السعر لكل حرف
أغانٍ بغناء وآلات موسيقية Suno v6 مولّد موسيقى لا أداة صوتية

الحكم النهائي

Eleven v4 هو نموذج الصوت الذي تختاره حين يجب أن تبدو التسجيلة موجَّهة لا مقروءة. يتصدر الساحة المستقلة، ويتحدث أكثر من 90 لغة، ويمنحك أدوات حقيقية لتشكيل الأداء. ليس أرخص وسيلة لتحويل النص إلى كلام، ولا يحتاج إلى أن يكون كذلك: فحين يكون الصوت هو المنتج، فهو الصوت الذي يختاره المستمعون.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • الصوت الذي يفضله المستمعون: في ساحة Provider Voice لدى Artificial Analysis، حيث يختار الناس الأكثر طبيعية بين مقطعين مجهولي المصدر، احتل Eleven v4 المركز الأول في سبتمبر 2026 بـ 1319 Elo. وحصل Cartesia Sonic 3.6 على 1276 وGemini 3.8 Flash TTS على 1267. وتضعه Artificial Analysis أيضًا في المركز الأول في متانة النطق.
  • إخراج لا مجرد إملاء: يمكن الآن دمج الوسوم الصوتية مثل [whispers] و[laughs] و[said angrily] واتباعها بالتتابع، ويأخذ النموذج الحوار المحيط في الحسبان، فيبدو الرد ردًّا حقيقيًا لا جملة معزولة.
  • مصمم للأعمال الطويلة: يتسع الطلب الواحد لما يصل إلى 10,000 حرف (نحو عشر دقائق من الصوت)، وتقول ElevenLabs إن طريقة جديدة تُبقي هوية الصوت ثابتة عبر السرد الطويل وإعادة التسجيل.
  • أكثر من 90 لغة بصوت واحد: تتسع التغطية من نحو 70 إلى أكثر من 90 لغة، وأكبر التحسينات في اليابانية والبرتغالية البرازيلية والماندرين والكانتونية. ويستطيع الصوت الواحد التحدث بأي لغة مدعومة مع الاحتفاظ بهويته.
  • سريع بما يكفي للمحادثة: صُمم Eleven v4 Turbo لوكلاء الصوت. وتعلن ElevenLabs عن زمن استدلال وسيط يبلغ نحو 100 مللي ثانية ونحو 150 مللي ثانية حتى أول كلمة، مقابل 262–814 مللي ثانية لدى المنافسين الذين اختبرتهم.

قيود صادقة

  • سعر مرتفع: بالسعر المعلن، تبلغ $80 لكل مليون حرف 1.6 ضعف Cartesia Sonic 3.6 ونحو خمسة أضعاف Gemini 3.8 Flash TTS. وينتهي خصم الإطلاق البالغ 72% ($0.022 لكل 1,000 حرف) في 12 أكتوبر 2026.
  • أرقام الشركة في بعض الادعاءات: نسبة التفضيل البالغة 75% في الاختبار الأعمى ومقارنة زمن الاستجابة مصدرهما اختبارات ElevenLabs نفسها. أما ترتيب الساحة فهو الرقم المستقل الجدير بالثقة.
  • أدوات تحكم جديدة تحتاج إلى تعلّم: مثل v3، يتجاهل v4 وسوم التوقف في SSML. تأتي الوقفات والتشديد من علامات الترقيم والوسوم الصوتية والكتابة بالأبجدية الصوتية، لذا قد تحتاج النصوص القديمة إلى إعادة كتابة، ومن المفيد الاستماع مجددًا إلى أصواتك الحالية على v4 قبل نقل الإنتاج إليه.
  • الاستنساخ يطرح أسئلة حقيقية: نسخة مقنعة من صوت انطلاقًا من عشر ثوانٍ من التسجيل أداة قوية وسهلة الإساءة. تطبق ElevenLabs التحقق والضوابط، لكن الموافقة والحقوق التجارية تبقى مسؤوليتك.
03

لمحة عن المعايير

ساحة Provider Voice لدى Artificial Analysis — المركز الأول، 1319 Elo

ساحة استماع عمياء مستقلة، سبتمبر 2026. Cartesia Sonic 3.6 بـ 1276، وGemini 3.8 Flash TTS بـ 1267. ويحتل Eleven v4 أيضًا المركز الأول في اختبار متانة النطق لدى Artificial Analysis والثاني في الصوت المتحكَّم به.

التفضيل الأعمى — نحو 75% (وفق الشركة)

تقول ElevenLabs إن نحو 75% من المستمعين فضّلوا v4 في مقارنات مباشرة عمياء. أجرت ElevenLabs هذا الاختبار بنفسها.

زمن الاستجابة — نحو 150 مللي ثانية حتى أول كلمة (Turbo، وفق الشركة)

قيم وسيطة أعلنتها ElevenLabs لنموذج Eleven v4 Turbo: نحو 100 مللي ثانية للاستدلال ونحو 150 مللي ثانية حتى أول كلمة، دون احتساب زمن الشبكة والتطبيق.

السعر — $0.08 لكل 1,000 حرف (Turbo بـ $0.04)

أسعار الواجهة البرمجية المعلنة؛ مع خصم 72% حتى 12 أكتوبر 2026. تذكر Artificial Analysis سعر $80 لكل مليون حرف، مقابل $49 لـ Cartesia Sonic 3.6 و$16.49 لـ Gemini 3.8 Flash TTS. وتشمل الخطة المجانية 10,000 حرف من v4، وتبدأ الخطط المدفوعة من $6 شهريًا.

04

الحكم

Eleven v4 هو نموذج الصوت الذي تختاره حين يجب أن يبدو الأداء موجَّهًا: الكتب الصوتية، وشخصيات الألعاب، والدبلجة، ووكلاء الصوت الذين ينبغي أن يبدوا كبشر لا كقوائم هاتفية. يتصدر ساحة الاستماع المستقلة ويمنح تحكمًا حقيقيًا عبر الوسوم القابلة للدمج والأبجدية الصوتية. ليس أرخص وسيلة لتحويل النص إلى كلام، إذ يكلف Gemini وCartesia أقل بكثير في السرد بالجملة حيث يكفي «الجيد بما يكفي»، لكن حين تهمّ التسجيلة، فهو الصوت الذي يختاره المستمعون.

05

الأسئلة الشائعة