مراجعة ElevenLabs Multilingual v2 (2026): اللغات وجودة الصوت وواجهة برمجة التطبيقات (API)

مراجعة «Eleven Multilingual v2»: اللغات والجودة وواجهة برمجة التطبيقات (API)

لا يُعد «Eleven Multilingual v2» إصدارًا جديدًا لعام 2026، لكنه لا يزال نموذجًا نشطًا لتحويل النص إلى كلام من نوع ElevenLabs يستحق الاهتمام. تم إطلاقه في أغسطس 2023، ولا يزال ضمن مجموعة المنتجات الرائدة للشركة، حيث يدعم 29 لغة، ويبلغ الحد الأقصى لعدد الأحرف في الطلب 10,000 حرف، مع تركيز رسمي على إنتاج نصوص طويلة ومستقرة.

المشكلة هي أن مصطلحي “الأحدث” و“الأفضل لعملك” ليسا متطابقين. يقدم Eleven v3 أداءً أكثر تعبيرًا وتغطية لغوية أوسع، بينما يركز Flash v2.5 على السرعة وقابلية التوسع وتكلفة واجهة برمجة التطبيقات (API) الأقل. ويقع Multilingual v2 بينهما باعتباره الخيار الراسخ للتعليق الصوتي والدورات التدريبية والتوطين وغيرها من الأعمال التي يتولى تقديمها متحدث واحد، حيث تكون الاتساق أكثر أهمية من الأداء الدرامي.

هل ترغب في تجربة النموذج قبل إعداد طلب واجهة برمجة التطبيقات (API)؟ مولد الصوت في GlobalGPT يضع «Eleven Multilingual v2» في مساحة عمل المتصفح: اختر النموذج، والصق النص، واختر صوتًا، ثم قم بإنشاء الملف الصوتي.

ما هو برنامج «Eleven Multilingual v2»؟

Eleven Multilingual v2 هو نموذج متعدد اللغات لتحويل النص إلى كلام من شركة ElevenLabs. معرّف النموذج الأصلي في واجهة برمجة التطبيقات (API) هو eleven_multilingual_v2. تقوم بإرسال رسالة نصية وتسجيل صوتي للتعريف إلى نقطة نهاية تحويل النص إلى كلام, ، وتقوم الخدمة بإرجاع صوت مُركَّب بالصوت المحدد.

تكمن جاذبيته العملية في بساطته: فطراز واحد يغطي 29 لغة ويستوعب ما يصل إلى 10,000 حرف في طلب واحد. وتصفه شركة ElevenLabs بأنه الخيار الأكثر استقرارًا لتوليد النصوص الطويلة، على الرغم من أن هذا التصريح يمثل موقف الشركة وليس ضمانًا مستقلًا لكل صوت أو نظام كتابة أو لغة.

تم تصميم «Multilingual v2» لأعمال مثل السرد الصوتي، والكتب الصوتية، والتعلم الإلكتروني، والتعليقات الصوتية للشركات، والوسائط المُترجمة. وإذا كان منتجك النهائي عبارة عن فيديو يتضمن شخصيات ناطقة، فيمكن استخدام نفس التعليق الصوتي أيضًا في نطاق أوسع سير عمل الحوار ومزامنة الشفاه.

هل لا يزال برنامج «Eleven Multilingual v2» قيد الاستخدام في عام 2026؟

نعم. اعتبارًا من 11 أغسطس 2026، تُدرج ElevenLabs نموذج «Multilingual v2» ضمن نماذج تحويل النص إلى كلام الرئيسية الخاصة بها. ولا يظهر هذا النموذج في جدول النماذج التي تم إيقاف استخدامها الوارد في الوثائق. وهذا هو الوضع الحالي الأكثر وضوحًا: النموذج نشط وموثق، لكنه لم يعد أحدث نموذج تحويل النص إلى كلام لدى ElevenLabs.

تاريخ الإصدار لا علاقة له بحالته الحالية. ElevenLabs تم الإعلان عن الإصدار المتعدد اللغات v2 في 22 أغسطس 2023. يجب أن يشير عنوان الصفحة الذي يتضمن كلمة “2026” إلى تاريخ المراجعة، لا أن يوحي بأن الطراز قد تم إطلاقه هذا العام.

هذا التموضع يجعل من «Multilingual v2» خيارًا راسخًا للإنتاج، وليس برنامجًا تم التخلي عنه. كما يعني أيضًا أن قرار الشراء يجب أن يوازن بين ميزاته الأكثر ثباتًا وطولًا من حيث مدة السيناريو، والمزايا المحددة التي تتمتع بها الإصدارات «v3» و«Flash v2.5».

ما هي اللغات التي يدعمها برنامج «Eleven Multilingual v2»؟

تدرج ElevenLabs رسميًا 29 لغة في إصدار «Multilingual v2»:

  • الإنجليزية، اليابانية، الصينية، الألمانية، الهندية، والفرنسية
  • الكورية، والبرتغالية، والإيطالية، والإسبانية، والإندونيسية، والهولندية
  • التركية، والفلبينية، والبولندية، والسويدية، والبلغارية، والرومانية
  • العربية، والتشيكية، واليونانية، والفنلندية، والكرواتية، والماليزية، والسلوفاكية
  • الدنماركية، والتاميلية، والأوكرانية، والروسية

الدعم اللغوي لا يعني أن كل صوت سيبدو مقنعًا بنفس الدرجة في كل منطقة. توصي ElevenLabs باختيار صوت تتوافق لهجته مع اللغة والمنطقة المستهدفتين. وهذا أمر مهم بالنسبة للإسبانية والبرتغالية والإنجليزية وغيرها من اللغات التي تتسم بتباين إقليمي كبير. اختبر الصوت والنص المحددين اللذين تخطط لنشرهما، بدلاً من اعتبار قائمة اللغات الخاصة بالنموذج ضمانةً لللهجة.

جودة الصوت: الطابع الطبيعي، والاتساق، والأدلة

تصف شركة ElevenLabs نموذج «Multilingual v2» بأنه واقعي، وواعي عاطفيًّا، ومتسق عبر اللغات. هذه ادعاءات من جانب المزود. وهي مفيدة لفهم المكانة المقصودة للنموذج، لكن لا ينبغي الخلط بينها وبين الاختبارات المحايدة.

أما الأدلة المستقلة فهي أضيق نطاقًا. فقد سجلت «Artificial Analysis» تصنيف «Multilingual v2» عند حوالي 1100.07 نقطة إيلو في «Provider Voice Arena» عند التحقق منها في 11 أغسطس 2026. تستخدم هذه المنصة تفضيلات المستمعين المقترنة وثمانية أصوات لمقدمي الخدمة باللغتين الإنجليزية الأمريكية والبريطانية، مقسمة بين الأصوات الرجالية والنسائية. وهذا دليل شفاف ومحدد للنموذج فيما يتعلق بتفضيلات الصوت باللغة الإنجليزية؛ ولا يثبت أداءً مكافئًا عبر جميع اللغات الـ29، أو اللهجات الإقليمية، أو النصوص الطويلة.

ردود فعل الجمهور متباينة، لكن العينة صغيرة جدًّا بحيث لا يمكنها تمثيل قاعدة المستخدمين ككل. في إحدى المناقشات التي جرت عام 2024، وصف المعلقون الإصدار v2 بأنه أكثر واقعية من الإصدار v1، بينما أشاروا أيضًا إلى وجود مشكلات عرضية تتعلق باتساق اللهجات. وأبلغ مستخدم آخر عن حدوث مشاكل قصيرة الأمد تتعلق بالسرعة والاتساق. وأوصت إجابة لاحقة مرتبطة بـ ElevenLabs باستخدام الإصدار Multilingual v2 أو Turbo v2 للحصول على نتائج أكثر اتساقًا في الأعمال الطويلة. وتعد هذه المنشورات إشارات تحذيرية مفيدة، وليست بيانات انتشار أو معايير قياس خاضعة للرقابة.

ما الذي يمكن قوله بثقة؟

  • لا يزال هذا النموذج يحظى بالدعم الرسمي، وهو مصمم لتوليد خطابات طويلة ومستمرة وعالية الجودة.
  • تمنح البيانات المستقلة المتعلقة بتفضيلات اللغة الإنجليزية هذه اللغة مؤشراً خارجياً موثوقاً به، ضمن مجموعة محدودة من الأصوات الناطقة باللغة الإنجليزية.
  • تعتمد جودة النطق على اللغة والمنطقة واختيار الصوت ونظام الكتابة — وليس فقط على معرّف النموذج.
  • يمكن لفحوصات الصوت الموضوعية أن تكشف عن حالات الاقتطاع، والقطع، ومشاكل التنسيق، والانحرافات الزمنية، لكنها لا يمكن أن تحل محل الاستماع المتخصص.
حالة صوتية عملية رقم 01

الاتساق عبر اللغات

تم إنشاء السيناريو نفسه باللغات الإنجليزية والإسبانية والماندرين باستخدام الصوت الافتراضي «route-default». ويحتوي كل مشغل على أول ناتج صالح تم الاحتفاظ به بموجب قاعدة الاختبار المجمدة.

اللغة الإنجليزية T02
الإسبانية T02
اللغة الماندرين T02
0.8232التشابه في تضمين المتحدثين بين اللغتين الإنجليزية والإسبانية
0.8867التشابه في تضمين المتحدثين باللغتين الإنجليزية والماندرين
0.8822التشابه في تضمين المتحدثين باللغتين الإسبانية والماندرين

استمع إلى: استمرارية هوية المتحدث والمشكلات الواضحة في النطق. وينبغي أن يقوم مستمع إسباني متمرس بتقييم أصالة اللهجة بشكل منفصل.

تُعد هذه التضمينات إشارة هوية مساعدة؛ فهي لا تُقيّم الطبيعة أو النطق أو اللهجة أو الإيقاع اللغوي أو الأداء العاطفي. ولم تكن هناك مجموعة معايرة لمتحدثين مختلفين متاحة.

اختبار عملي: خمسة مخرجات صالحة لأول مرة عبر مسار واجهة برمجة التطبيقات (API) لـ Anywhere

لقد قمنا باختبار مسار HTTPS المباشر عبر «Anywhere» المؤدي إلى معرّف النموذج eleven-multilingual-v2. وهذا التنسيق للمعرّف يختلف عن تنسيق واجهة برمجة التطبيقات الأصلية ElevenLabs، التي تستخدم eleven_multilingual_v2. وقد أتاح هذا المسار واجهة مهام تتضمن النموذج والموجه، لكنه لم يوفر عناصر تحكم موثوقة لاختيار الصوت أو الاستقرار أو التشابه أو الأسلوب أو السرعة أو تنسيق الإخراج. ولذلك، استخدمت كل عملية التشغيل الإعدادات الافتراضية لهذا المسار.

تضمنت الدفعة المسجلة مسبقًا خمسة نصوص: نصًا واحدًا بالشرح الصوتي باللغة الإنجليزية مكونًا من 1,399 حرفًا، ونفس السيناريو باللغات الإنجليزية والإسبانية والماندرين، واختبارًا واحدًا للتشديد الصوتي شمل الأسماء والتواريخ والعملات ورقم هاتف وعنوان URL والاختصارات. احتفظنا بأول ناتج صالح وقابل للتشغيل ولم نعد تشغيل الاختبار مرة أخرى للتحقق من الجودة.

نتائج المسار الموضوعي

ملخص موثوقية المسار

استخدمت جميع النصوص الخمسة المسجلة مسبقًا أول ناتج صالح قابل للتشغيل. ولم يتضمن المسار أي عناصر تحكم في الصوت أو عملية التوليد، لذا استخدمت كل عملية التشغيل الإعدادات الافتراضية الخاصة بها.

5/5المهام التي تم إنجازها بنجاح من المحاولة الأولى
172.486 ثانيةتم تسليم التسجيل الصوتي الرسمي
$0.2505تكلفة المسار الرسمي المُرجعة
5 ملفات MP3 صالحةأحادي الصوت، 44.1 كيلوهرتز، بدون تشويه

النطاق: تصف هذه الأرقام مسار «Anywhere»، وليس زمن الوصول الأصلي لـ ElevenLabs أو تجربة المتصفح لـ GlobalGPT. ولا تُقيّم عمليات فحص الملفات مدى الطبيعة أو العاطفة أو اللهجة أو وتيرة الكلام المحلية.

نجحت جميع المهام الرسمية الخمس في المحاولة الأولى وأسفرت عن ملفات MP3 أحادية القناة قابلة للفك بترتيب 44.1 كيلوهرتز. ولم تحتوِ الملفات على أي عينات مقطوعة ولا أي قفزات بين العينات المتجاورة تزيد عن 0.8 في المسح المحلي لشكل الموجة. وتُثبت هذه الفحوصات سلامة الملفات؛ لكنها لا تُقيّم مدى طبيعية الصوت.

المفاضلات بين الاستقرار في النصوص الطويلة، والعاطفة، والنطق، وزمن الاستجابة

النصوص الطويلة

يُعد الحد الأقصى البالغ 10,000 حرف كافياً لتغطية ما يقارب عشر دقائق من التسجيل الصوتي وفقاً لجدول حدود عدد الأحرف الخاص بـ ElevenLabs. أما بالنسبة للفصول الأطول، فيُفضل تقسيمها عند حدود الفقرات أو المشاهد الطبيعية بدلاً من قطعها عند عدد أحرف عشوائي. توفر واجهة برمجة التطبيقات (API) النص السابق, النص التالي, ، وحقول استمرارية معرّف الطلب للمساعدة في انسياب المجموعات المتجاورة معًا.

يثبت اختبارنا أن نصًا واحدًا مكونًا من 1,399 حرفًا تم إنجازه كملف صالح في المحاولة الأولى عبر مسار «Anywhere». ولا يثبت ذلك الاستقرار عند الحد الأقصى البالغ 10,000 حرف أو على مدار كتاب صوتي كامل.

حالة صوتية عملية رقم 02

استقرار الشكل الطويل

T01 — تعليق باللغة الإنجليزيةأول إخراج صالح · route-default voice
1,399 حرفًاإدخال التعليق الصوتي
85.081 ثانيةالصوت المُقدَّم
أول تاريخ صالحإعادة بث دون جودة
$0.1399تكلفة المسار المرتجع

استمع إلى: تباين في الإيقاع بين المقاطع الافتتاحية والختامية، أو فترات توقف غير ملائمة، أو أصوات طقطقة، أو انقطاع الصوت، أو تشوهات صوتية مسموعة.

النتيجة الموضوعية: تم فك تشفير الملف بشكل سليم دون أي عينات مقطوعة أو قفزات بين العينات المجاورة تتجاوز 0.8. وقدر التوقيت الآلي السرعة بـ 2.858 كلمة/ثانية في النصف الأول و2.670 في النصف الثاني، دون وجود ما يشير إلى زيادة عامة في السرعة خلال النصف الثاني.

لا يُثبت إجراء اختبار واحد الاستقرار عند الحد الأقصى البالغ 10,000 حرف، ولا يستبعد وجود مشكلات محلية في وتيرة التشغيل تتطلب الاستماع البشري.

إعدادات العاطفة والاستقرار

في واجهة برمجة التطبيقات الأصلية ElevenLabs، يتيح انخفاض مستوى الثبات مزيدًا من التنوع، بينما قد يؤدي ارتفاع مستوى الثبات إلى جعل العرض أكثر اتساقًا، وربما أكثر رتابة. ويمكن أن يضفي المبالغة في الأسلوب مزيدًا من التعبير، لكنه قد يقلل أيضًا من قابلية التنبؤ ويزيد من الحمل الحسابي. تعامل مع عناصر التحكم هذه على أنها مقايضات إبداعية، وليس تحسينات عامة للجودة.

النطق

لا يدعم الإصدار v2 من Multilingual علامات الفونيمات. توصي ElevenLabs باستخدام قواميس النطق التي تحتوي على أسماء مستعارة كحل بديل. قم بتوحيد الأرقام الغامضة والاختصارات والتواريخ وعناوين URL قبل عملية الإنشاء، ثم احتفظ ببرنامج نصي صغير لاختبار التراجع (regression) للأسماء أو المصطلحات التي تهم علامتك التجارية.

حالة صوتية عملية رقم 03

اختبار الضغط الصوتي

T03 — الأسماء والأرقام والمختصراتأول ناتج صالح · تكلفة المسار $0.0382
4 يوليو 2026الدكتورة آنا مارتينيزGLB-2048$1,250.75ساو باولوكيوتوالساعة 8:30 صباحًا.12 سبتمبر1-800-555-0199glbgpt.comAPI / TTS / اليونسكوالإصدار 2.5 / 10 في المائة

نقطة تقييم الاستماع: أظهر نظام التعرف على الكلام دون اتصال بالإنترنت رقم الهاتف على النحو التالي: “1-800-5555-0199”. يرجى الاستماع بعناية إلى الرقم الأصلي وعنوان URL قبل النشر.

الرقم الإضافي ليس خطأً مؤكدًا في نظام تحويل النص إلى كلام (TTS). قد تحدث أخطاء في نظام التعرف على الكلام، لذا فإن هذه نقطة مراجعة وليست حكمًا نهائيًا بشأن النطق.

الكمون

الإصدار ’Multilingual v2» ليس الخيار ذو زمن الاستجابة المنخفض من «ElevenLabs». وتقول «ElevenLabs» إن زمن الاستجابة فيه أعلى من طرازات «Flash». تراوحت أوقات المسار التي قمنا بقياسها بين 10.161 و31.489 ثانية للمهام الخمس الرسمية، لكن هذه الأرقام تشمل مسار مهمة Anywhere والشبكة وقائمة الانتظار وتسليم الملفات. ولا يجب اعتبارها زمن انتقال أصلي لطراز ElevenLabs.

كيفية استخدام واجهة برمجة التطبيقات (API) Eleven Multilingual v2

إعدادات المطور

طلب واجهة برمجة التطبيقات (API) ElevenLabs الأصلي

استخدم معرّف النموذج الأصلي eleven_multilingual_v2 في نص JSON، وقم بإدراج معرّف الصوت المحدد في نقطة النهاية.

منشورhttps://api.elevenlabs.io/v1/text-to-speech/{voice_id}
طلب cURL بسيطاستبدل «YOUR_VOICE_ID» واستخدم متغير بيئة كمفتاح
curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/YOUR_VOICE_ID" \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "ضع هنا النص الذي تريد قراءته بعدة لغات.",
    "model_id": "eleven_multilingual_v2",
    "voice_settings": {
 "stability": 0.5,
      "similarity_boost": 0.75,
 "style": 0,
 "use_speaker_boost": true,
 "speed": 1.0
    }
  }' \
  --output narration.mp3

المعلمات والحدود الرئيسية

المعلمةما الذي يتحكم فيهملاحظة عملية
voice_idصوت ElevenLabs المختاراختر صوتًا تتناسب لهجته مع اللغة المستهدفة والمنطقة.
معرّف النموذجنموذج التوليفالاستخدام eleven_multilingual_v2.
الاستقرارالتنوع مقابل الاتساققد يكون النطاق السفلي أكثر تقلبًا؛ أما النطاق العلوي فقد يصبح أكثر تقييدًا.
تعزيز التشابهالتشابه بين الصوت المرجعي والصوتقد تساعد القيم العالية في تحديد الهوية، لكنها لا تضمن ذلك عبر اللغات المختلفة.
أسلوبالمبالغة في الأسلوباستخدمها بحذر عندما تكون قابلية التكرار أمرًا مهمًا.
تفعيل تعزيز صوت السماعةمعالجة إضافية لتشابه السماعاتقد يؤدي ذلك إلى زيادة زمن الاستجابة.
السرعةسرعة التشغيلأعد فحص الأرقام وعلامات الترقيم بعد تغييرها.
النص السابق / النص التاليالسياق المحيط بجزء معينمفيد عند تقسيم النصوص الطويلة.
رمز_اللغةتطبيق القواعد اللغويةغير مدعوم في نماذج multilingual_v2 في مرجع واجهة برمجة التطبيقات (API) الحالي.

مهم: احتفظ بمفاتيح واجهة برمجة التطبيقات (API) في متغير بيئة آمن. لا تقم أبدًا بلصق مفتاح حقيقي في كود مقال منشور للجمهور.

أسعار واجهة برمجة التطبيقات (API) لـ «Eleven Multilingual v2»

’ElevenLabs» صفحة أسعار واجهة برمجة التطبيقات (API) أدرجت «Multilingual v2» و«v3» في $0.10 لكل 1,000 حرف عند التحقق من ذلك في 11 أغسطس 2026. لا تشمل الضرائب والرسوم والرسوم الجمركية.

التكلفة وإمكانية الوصول

التسعير المباشر عبر واجهة برمجة التطبيقات (API)

بمعدل رسمي يبلغ $0.10 لكل 1,000 حرف بالنسبة إلى Multilingual v2 وv3:

1000 حرف
$0.10
5 آلاف حرف
$0.50
10 آلاف حرف
$1.00
تم التحقق من أسعار واجهة برمجة التطبيقات (API) لـ ElevenLabs في 11 أغسطس 2026. لا تشمل الأسعار الضرائب والرسوم والرسوم الجمركية.

واجهة برمجة التطبيقات المباشرة أم GlobalGPT؟

المسارمرجع الأسعارطريقة عملكأفضل قيمة عندما
واجهة برمجة التطبيقات ElevenLabs$0.10 / 1K حرفالطلبات الأصلية، والأصوات، والإعدادات، والاستخدام المقيسأنت بحاجة إلى عناصر تحكم للمطورين وتكامل المنتجات
يستخدم GlobalGPT نظام «الرصيد» الخاص به، لذا فإن هذه الاشتراكات لا تمثل تحويلاً لسعر واجهة برمجة التطبيقات (API) الخاصة بـ ElevenLabs على أساس كل شخصية على حدة. قارن بين باقات GlobalGPT.

وبهذا السعر، تبلغ تكلفة الطلب الذي يبلغ حجمه الأقصى 10,000 حرف $1.00 قبل الضرائب. وتعتمد التكلفة الفعلية للمشروع على حجم النص الذي تقوم بإنشائه، ومدى تكرار إعادة إنشائه، وما إذا كنت تحتفظ بالتسجيلات غير الناجحة أم لا. قم بوضع ميزانيتك بناءً على عدد أحرف الإدخال بدلاً من دقائق الصوت.

بالنسبة للمبدعين الذين لا يحتاجون إلى إنشاء سير عمل قائم على واجهة برمجة تطبيقات أصلية، تقدم GlobalGPT عرضًا ذا قيمة عملية أكبر. وعند التحقق من الأسعار في 11 أغسطس 2026، بلغت تكلفة خطط الاشتراك السنوية $5.80 شهريًّا للخطة الأساسية (Basic)، و$10.80 للخطة الاحترافية (Pro)، و$25 للخطة غير المحدودة (Unlimited)، حيث تجمع هذه الخطط بين عدة نماذج ذكاء اصطناعي وأدوات إبداعية في اشتراك واحد. و مولد الصوت GlobalGPT يتضمن هذا الإصدار كل من «Eleven Multilingual v2» و«Eleven v3» في بيئة عمل المتصفح، مما يتيح لك إنشاء تعليق صوتي ومقارنة كلا النموذجين دون الحاجة إلى إعداد طلب واجهة برمجة التطبيقات (API) مسبقًا.

يستخدم GlobalGPT نظام «الائتمانات» الخاص به، لذا فإن هذه المقارنة لا تمثل مقارنة مباشرة للأسعار لكل حرف مع واجهة برمجة التطبيقات (API) الخاصة بـ ElevenLabs. ولكن عندما يكون الصوت جزءًا من سير عمل أوسع نطاقًا يشمل الكتابة أو البحث أو الصور أو الفيديو أو نماذج متعددة للذكاء الاصطناعي،, يُعد طراز GlobalGPT الخيار الأفضل من حيث القيمة الإجمالية. يمكنك قارن بين باقات GlobalGPT هنا.

Eleven Multilingual v2 مقابل Eleven v3 مقابل Flash v2.5

دليل اتخاذ القرار

ما هو طراز ElevenLabs الذي ينبغي عليك اختياره؟

اختر العارضة المناسبة للعمل بدلاً من الاختيار بناءً على تاريخ الإصدار وحده.

اختيار مقال طويل

متعدد اللغات الإصدار 2

اختر: سرد سلس، وسير عمل راسخ، وتغطية بـ 29 لغة، ونصوص تصل إلى 10,000 حرف.

اختيار التعبير

أحد عشر v3

اختر: أسلوب إلقاء درامي، وأعمال متعددة المتحدثين، وتغطية أوسع تشمل أكثر من 70 لغة.

الاختيار السريع

فلاش الإصدار 2.5

اختر: منتجات سريعة الاستجابة، وإنتاجية عالية، وطلبات تضم 40,000 حرف، وتكلفة أقل لواجهة برمجة التطبيقات (API).

نموذجاللغاتالحد الأقصى لعدد الأحرفالتأكيد الرسميأفضل ملاءمة
متعدد اللغات الإصدار 22910,000استقرار المنتج على المدى الطويل وجودة ثابتةالتعليق الصوتي، الدورات التدريبية، التوطين، إجراءات العمل الراسخة في مجال الصوت
أحد عشر v370+5,000الكلام التعبيري والحوار بين عدة متحدثينالأداء، الشخصيات، الأداء الدرامي، تغطية لغوية أوسع نطاقاً
فلاش الإصدار 2.53240,000زمن استجابة النموذج يبلغ حوالي 75 مللي ثانية وتكلفة واجهة برمجة التطبيقات (API) أقلالمنتجات التفاعلية، معدل الإنتاجية، الطلبات الأطول، التوسع المراعي للتكلفة

يتضمن GlobalGPT أيضًا نسخة Eleven v3 ضمن نفس مولد الصوت. قم بتشغيل نفس النص القصير عبر كلا النموذجين: استخدم Multilingual v2 كأساس للسرد الثابت، ثم قارن مع v3 عندما ترغب في أسلوب إلقاء أكثر تعبيرًا. يُعد النص الخاص بك أداة اتخاذ قرار أفضل من العرض التوضيحي العام، لأنه يكشف عن الأسماء وعلامات الترقيم ووتيرة الكلام والتحولات اللغوية التي تهم مشروعك.

من ينبغي له — ومن لا ينبغي له — استخدام Multilingual v2؟

مقاس مناسب

  • مُروِّيو الصوت الذين يُنتجون الدورات التدريبية، ومقاطع الفيديو التوضيحية، ومقاطع الفيديو المؤسسية، أو التعليقات الصوتية المُترجمة.
  • الفرق التي تمتلك بالفعل نموذجًا صوتيًا ElevenLabs تم التحقق من صحته وترغب في الحصول على معرّف نموذج ثابت.
  • المشاريع التي تتطلب إحدى اللغات أو أنظمة الكتابة الـ29 المدعومة، والتي يتجاوز طولها الحد الأقصى المسموح به في الإصدار 3 البالغ 5,000 حرف.
  • المطورون الذين يفضلون أوامر التحكم الصوتية الأصلية وحقول استمرارية المقاطع على تحقيق أقل زمن انتقال ممكن.

انظر في اتجاه آخر عندما

  • إذا كنت بحاجة إلى تمثيل غني بالتعبيرات، أو حوار طبيعي بين عدة متحدثين، أو لغة غير مدرجة في قائمة الـ29 لغة؛ فابدأ باستخدام Eleven v3.
  • إذا كنت تعمل على تطوير وكيل صوتي متجاوب أو خدمة ذات إنتاجية عالية، فقم بتقييم Flash v2.5.
  • أنت بحاجة إلى ترميز على مستوى الفونيمات؛ ولا يدعم «Multilingual v2» علامات الفونيمات.
  • أنت بحاجة إلى لهجة إقليمية مضمونة دون اختبار الصوت المناسب والنص الفعلي.
  • تحتاج إلى تقييم نهائي وذاتي للجودة قبل أن يقوم مستمع مؤهل بمراجعة اللغات المستهدفة.

الأسئلة الشائعة

هل لا يزال برنامج «Eleven Multilingual v2» متاحًا في عام 2026؟

نعم. فقد أدرجته ElevenLabs كنموذج رائد لتحويل النص إلى كلام، ولم تدرجه في جدول النماذج التي تم إيقاف دعمها عند التحقق من ذلك في 11 أغسطس 2026.

متى تم إصدار الإصدار الثاني من برنامج «Eleven Multilingual»؟

أعلنت شركة ElevenLabs عن إصدار “Multilingual v2” في 22 أغسطس 2023. ويشير الرقم «2026» الوارد في هذه المراجعة إلى تاريخ المراجعة، وليس إلى سنة الإطلاق.

كم عدد اللغات التي يدعمها برنامج «Eleven Multilingual v2»؟

وهي تدعم رسميًا 29 لغة، بما في ذلك الإنجليزية والإسبانية والصينية واليابانية والألمانية والفرنسية والهندية والكورية والبرتغالية والعربية والروسية.

ما هو معرّف نموذج «Eleven Multilingual v2»؟

معرّف نموذج واجهة برمجة التطبيقات (API) الأصلي ElevenLabs هو eleven_multilingual_v2. استخدم مسار الاختبار «Anywhere» المعرّف المنفصل الذي يتضمن واصلة eleven-multilingual-v2.

ما هو الحد الأقصى لعدد الأحرف؟

يبلغ الحد الأقصى الرسمي لعدد الأحرف في الطلب الواحد 10,000 حرف، وهو ما تقدره ElevenLabs بنحو عشر دقائق من التسجيل الصوتي.

هل يُعد Multilingual v2 أفضل من Eleven v3؟

ولا يُعتبر أي منهما أفضل بشكل عام. تُعد النسخة v2 متعددة اللغات الخيار الأكثر استقرارًا والأطول أمدًا؛ بينما توفر النسخة v3 تغطية لغوية أوسع، وأداءً أكثر تعبيرًا، وإمكانيات متعددة المتحدثين.

هل يُعد «Multilingual v2» خيارًا جيدًا للسرد الطويل؟

يُعد ElevenLabs النموذج الأطول والأكثر استقرارًا لدى الشركة. وقد اكتمل اختبار المسار الذي شمل 1,399 حرفًا بنجاح، لكن هذه التجربة الفردية لا تثبت استقرار النموذج عند معالجة كتاب كامل أو 10,000 حرف.

هل يمكنني تعيين رمز لغة في واجهة برمجة التطبيقات (API)؟

تنص المرجع الحالي لواجهة برمجة التطبيقات (API) «Create speech» على ما يلي: رمز_اللغة لا يُدعم هذا الخيار في نماذج multilingual_v2.

هل يدعم برنامج «Multilingual v2» علامات الفونيمات؟

توصي ElevenLabs باستخدام قواميس النطق التي تتضمن أسماء مستعارة عندما تحتاج إلى التحكم في نطق الأسماء أو المصطلحات المتخصصة.

كم تبلغ تكلفة واجهة برمجة التطبيقات (API)؟

أدرجت شركة ElevenLabs سعر «Multilingual v2» بمعدل $0.10 لكل 1,000 حرف في 11 أغسطس 2026، باستثناء الضرائب والرسوم والرسوم الجمركية.

الحكم النهائي

يحتل «Eleven Multilingual v2» مكانة واضحة في مجموعة منتجات ElevenLabs لعام 2026: فهو الخيار المثبت للسرد متعدد اللغات السلس، وسير عمل صوتي مجرب، وطلبات تصل إلى 10,000 حرف. لكنه ليس الخيار الفائز تلقائيًّا لكل مشروع تحويل النص إلى كلام (TTS). يُعد Eleven v3 نقطة انطلاق أقوى للأداء التمثيلي التعبيري ومجموعة لغات أوسع، بينما صُمم Flash v2.5 من أجل السرعة والتوسع.

يضفي اختبارنا الموضوعي ثقة مفيدة بشأن موثوقية المسار وسلامة الملفات: فقد تم إنجاز جميع المهام الرسمية الخمس لـ «Anywhere» في المحاولة الأولى، وأنتجت ملفات MP3 أحادية الصوت صالحة بتردد 44.1 كيلوهرتز، وظلت ضمن حدود التكلفة المسجلة مسبقًا. ولا يحل هذا الاختبار محل الاستماع البشري، لذا فإننا لا نمنح درجات ذاتية تتعلق بالطبيعية أو العاطفة أو اللهجة بناءً على الفحوصات الآلية وحدها.

أحضر فقرة من السرد أو الدورة التدريبية أو الفيديو المُترجم الذي ستقدمه قريبًا إلى مولد الصوت في GlobalGPT. ابدأ باستخدام «Eleven Multilingual v2»، وحافظ على اتساق الصوت والنص، وقارنه بـ«Eleven v3» عندما يكون الأداء التعبيري مهمًا. إنها طريقة مباشرة وعملية لاختيار النموذج الذي يناسب عملك.

شارك المنشور:

منشورات ذات صلة