لا يُعد «Eleven Multilingual v2» إصدارًا جديدًا لعام 2026، لكنه لا يزال نموذجًا نشطًا لتحويل النص إلى كلام من نوع ElevenLabs يستحق الاهتمام. تم إطلاقه في أغسطس 2023، ولا يزال ضمن مجموعة المنتجات الرائدة للشركة، حيث يدعم 29 لغة، ويبلغ الحد الأقصى لعدد الأحرف في الطلب 10,000 حرف، مع تركيز رسمي على إنتاج نصوص طويلة ومستقرة.
المشكلة هي أن مصطلحي “الأحدث” و“الأفضل لعملك” ليسا متطابقين. يقدم Eleven v3 أداءً أكثر تعبيرًا وتغطية لغوية أوسع، بينما يركز Flash v2.5 على السرعة وقابلية التوسع وتكلفة واجهة برمجة التطبيقات (API) الأقل. ويقع Multilingual v2 بينهما باعتباره الخيار الراسخ للتعليق الصوتي والدورات التدريبية والتوطين وغيرها من الأعمال التي يتولى تقديمها متحدث واحد، حيث تكون الاتساق أكثر أهمية من الأداء الدرامي.
هل ترغب في تجربة النموذج قبل إعداد طلب واجهة برمجة التطبيقات (API)؟ مولد الصوت في GlobalGPT يضع «Eleven Multilingual v2» في مساحة عمل المتصفح: اختر النموذج، والصق النص، واختر صوتًا، ثم قم بإنشاء الملف الصوتي.

ما هو برنامج «Eleven Multilingual v2»؟
Eleven Multilingual v2 هو نموذج متعدد اللغات لتحويل النص إلى كلام من شركة ElevenLabs. معرّف النموذج الأصلي في واجهة برمجة التطبيقات (API) هو eleven_multilingual_v2. تقوم بإرسال رسالة نصية وتسجيل صوتي للتعريف إلى نقطة نهاية تحويل النص إلى كلام, ، وتقوم الخدمة بإرجاع صوت مُركَّب بالصوت المحدد.
تكمن جاذبيته العملية في بساطته: فطراز واحد يغطي 29 لغة ويستوعب ما يصل إلى 10,000 حرف في طلب واحد. وتصفه شركة ElevenLabs بأنه الخيار الأكثر استقرارًا لتوليد النصوص الطويلة، على الرغم من أن هذا التصريح يمثل موقف الشركة وليس ضمانًا مستقلًا لكل صوت أو نظام كتابة أو لغة.
تم تصميم «Multilingual v2» لأعمال مثل السرد الصوتي، والكتب الصوتية، والتعلم الإلكتروني، والتعليقات الصوتية للشركات، والوسائط المُترجمة. وإذا كان منتجك النهائي عبارة عن فيديو يتضمن شخصيات ناطقة، فيمكن استخدام نفس التعليق الصوتي أيضًا في نطاق أوسع سير عمل الحوار ومزامنة الشفاه.
هل لا يزال برنامج «Eleven Multilingual v2» قيد الاستخدام في عام 2026؟
نعم. اعتبارًا من 11 أغسطس 2026، تُدرج ElevenLabs نموذج «Multilingual v2» ضمن نماذج تحويل النص إلى كلام الرئيسية الخاصة بها. ولا يظهر هذا النموذج في جدول النماذج التي تم إيقاف استخدامها الوارد في الوثائق. وهذا هو الوضع الحالي الأكثر وضوحًا: النموذج نشط وموثق، لكنه لم يعد أحدث نموذج تحويل النص إلى كلام لدى ElevenLabs.
تاريخ الإصدار لا علاقة له بحالته الحالية. ElevenLabs تم الإعلان عن الإصدار المتعدد اللغات v2 في 22 أغسطس 2023. يجب أن يشير عنوان الصفحة الذي يتضمن كلمة “2026” إلى تاريخ المراجعة، لا أن يوحي بأن الطراز قد تم إطلاقه هذا العام.
هذا التموضع يجعل من «Multilingual v2» خيارًا راسخًا للإنتاج، وليس برنامجًا تم التخلي عنه. كما يعني أيضًا أن قرار الشراء يجب أن يوازن بين ميزاته الأكثر ثباتًا وطولًا من حيث مدة السيناريو، والمزايا المحددة التي تتمتع بها الإصدارات «v3» و«Flash v2.5».
ما هي اللغات التي يدعمها برنامج «Eleven Multilingual v2»؟
تدرج ElevenLabs رسميًا 29 لغة في إصدار «Multilingual v2»:
- الإنجليزية، اليابانية، الصينية، الألمانية، الهندية، والفرنسية
- الكورية، والبرتغالية، والإيطالية، والإسبانية، والإندونيسية، والهولندية
- التركية، والفلبينية، والبولندية، والسويدية، والبلغارية، والرومانية
- العربية، والتشيكية، واليونانية، والفنلندية، والكرواتية، والماليزية، والسلوفاكية
- الدنماركية، والتاميلية، والأوكرانية، والروسية
الدعم اللغوي لا يعني أن كل صوت سيبدو مقنعًا بنفس الدرجة في كل منطقة. توصي ElevenLabs باختيار صوت تتوافق لهجته مع اللغة والمنطقة المستهدفتين. وهذا أمر مهم بالنسبة للإسبانية والبرتغالية والإنجليزية وغيرها من اللغات التي تتسم بتباين إقليمي كبير. اختبر الصوت والنص المحددين اللذين تخطط لنشرهما، بدلاً من اعتبار قائمة اللغات الخاصة بالنموذج ضمانةً لللهجة.
جودة الصوت: الطابع الطبيعي، والاتساق، والأدلة
تصف شركة ElevenLabs نموذج «Multilingual v2» بأنه واقعي، وواعي عاطفيًّا، ومتسق عبر اللغات. هذه ادعاءات من جانب المزود. وهي مفيدة لفهم المكانة المقصودة للنموذج، لكن لا ينبغي الخلط بينها وبين الاختبارات المحايدة.
أما الأدلة المستقلة فهي أضيق نطاقًا. فقد سجلت «Artificial Analysis» تصنيف «Multilingual v2» عند حوالي 1100.07 نقطة إيلو في «Provider Voice Arena» عند التحقق منها في 11 أغسطس 2026. تستخدم هذه المنصة تفضيلات المستمعين المقترنة وثمانية أصوات لمقدمي الخدمة باللغتين الإنجليزية الأمريكية والبريطانية، مقسمة بين الأصوات الرجالية والنسائية. وهذا دليل شفاف ومحدد للنموذج فيما يتعلق بتفضيلات الصوت باللغة الإنجليزية؛ ولا يثبت أداءً مكافئًا عبر جميع اللغات الـ29، أو اللهجات الإقليمية، أو النصوص الطويلة.
ردود فعل الجمهور متباينة، لكن العينة صغيرة جدًّا بحيث لا يمكنها تمثيل قاعدة المستخدمين ككل. في إحدى المناقشات التي جرت عام 2024، وصف المعلقون الإصدار v2 بأنه أكثر واقعية من الإصدار v1، بينما أشاروا أيضًا إلى وجود مشكلات عرضية تتعلق باتساق اللهجات. وأبلغ مستخدم آخر عن حدوث مشاكل قصيرة الأمد تتعلق بالسرعة والاتساق. وأوصت إجابة لاحقة مرتبطة بـ ElevenLabs باستخدام الإصدار Multilingual v2 أو Turbo v2 للحصول على نتائج أكثر اتساقًا في الأعمال الطويلة. وتعد هذه المنشورات إشارات تحذيرية مفيدة، وليست بيانات انتشار أو معايير قياس خاضعة للرقابة.
ما الذي يمكن قوله بثقة؟
- لا يزال هذا النموذج يحظى بالدعم الرسمي، وهو مصمم لتوليد خطابات طويلة ومستمرة وعالية الجودة.
- تمنح البيانات المستقلة المتعلقة بتفضيلات اللغة الإنجليزية هذه اللغة مؤشراً خارجياً موثوقاً به، ضمن مجموعة محدودة من الأصوات الناطقة باللغة الإنجليزية.
- تعتمد جودة النطق على اللغة والمنطقة واختيار الصوت ونظام الكتابة — وليس فقط على معرّف النموذج.
- يمكن لفحوصات الصوت الموضوعية أن تكشف عن حالات الاقتطاع، والقطع، ومشاكل التنسيق، والانحرافات الزمنية، لكنها لا يمكن أن تحل محل الاستماع المتخصص.
الاتساق عبر اللغات
تم إنشاء السيناريو نفسه باللغات الإنجليزية والإسبانية والماندرين باستخدام الصوت الافتراضي «route-default». ويحتوي كل مشغل على أول ناتج صالح تم الاحتفاظ به بموجب قاعدة الاختبار المجمدة.
استمع إلى: استمرارية هوية المتحدث والمشكلات الواضحة في النطق. وينبغي أن يقوم مستمع إسباني متمرس بتقييم أصالة اللهجة بشكل منفصل.
تُعد هذه التضمينات إشارة هوية مساعدة؛ فهي لا تُقيّم الطبيعة أو النطق أو اللهجة أو الإيقاع اللغوي أو الأداء العاطفي. ولم تكن هناك مجموعة معايرة لمتحدثين مختلفين متاحة.
اختبار عملي: خمسة مخرجات صالحة لأول مرة عبر مسار واجهة برمجة التطبيقات (API) لـ Anywhere
لقد قمنا باختبار مسار HTTPS المباشر عبر «Anywhere» المؤدي إلى معرّف النموذج eleven-multilingual-v2. وهذا التنسيق للمعرّف يختلف عن تنسيق واجهة برمجة التطبيقات الأصلية ElevenLabs، التي تستخدم eleven_multilingual_v2. وقد أتاح هذا المسار واجهة مهام تتضمن النموذج والموجه، لكنه لم يوفر عناصر تحكم موثوقة لاختيار الصوت أو الاستقرار أو التشابه أو الأسلوب أو السرعة أو تنسيق الإخراج. ولذلك، استخدمت كل عملية التشغيل الإعدادات الافتراضية لهذا المسار.
تضمنت الدفعة المسجلة مسبقًا خمسة نصوص: نصًا واحدًا بالشرح الصوتي باللغة الإنجليزية مكونًا من 1,399 حرفًا، ونفس السيناريو باللغات الإنجليزية والإسبانية والماندرين، واختبارًا واحدًا للتشديد الصوتي شمل الأسماء والتواريخ والعملات ورقم هاتف وعنوان URL والاختصارات. احتفظنا بأول ناتج صالح وقابل للتشغيل ولم نعد تشغيل الاختبار مرة أخرى للتحقق من الجودة.
ملخص موثوقية المسار
استخدمت جميع النصوص الخمسة المسجلة مسبقًا أول ناتج صالح قابل للتشغيل. ولم يتضمن المسار أي عناصر تحكم في الصوت أو عملية التوليد، لذا استخدمت كل عملية التشغيل الإعدادات الافتراضية الخاصة بها.
النطاق: تصف هذه الأرقام مسار «Anywhere»، وليس زمن الوصول الأصلي لـ ElevenLabs أو تجربة المتصفح لـ GlobalGPT. ولا تُقيّم عمليات فحص الملفات مدى الطبيعة أو العاطفة أو اللهجة أو وتيرة الكلام المحلية.
نجحت جميع المهام الرسمية الخمس في المحاولة الأولى وأسفرت عن ملفات MP3 أحادية القناة قابلة للفك بترتيب 44.1 كيلوهرتز. ولم تحتوِ الملفات على أي عينات مقطوعة ولا أي قفزات بين العينات المتجاورة تزيد عن 0.8 في المسح المحلي لشكل الموجة. وتُثبت هذه الفحوصات سلامة الملفات؛ لكنها لا تُقيّم مدى طبيعية الصوت.
المفاضلات بين الاستقرار في النصوص الطويلة، والعاطفة، والنطق، وزمن الاستجابة
النصوص الطويلة
يُعد الحد الأقصى البالغ 10,000 حرف كافياً لتغطية ما يقارب عشر دقائق من التسجيل الصوتي وفقاً لجدول حدود عدد الأحرف الخاص بـ ElevenLabs. أما بالنسبة للفصول الأطول، فيُفضل تقسيمها عند حدود الفقرات أو المشاهد الطبيعية بدلاً من قطعها عند عدد أحرف عشوائي. توفر واجهة برمجة التطبيقات (API) النص السابق, النص التالي, ، وحقول استمرارية معرّف الطلب للمساعدة في انسياب المجموعات المتجاورة معًا.
يثبت اختبارنا أن نصًا واحدًا مكونًا من 1,399 حرفًا تم إنجازه كملف صالح في المحاولة الأولى عبر مسار «Anywhere». ولا يثبت ذلك الاستقرار عند الحد الأقصى البالغ 10,000 حرف أو على مدار كتاب صوتي كامل.
استقرار الشكل الطويل
استمع إلى: تباين في الإيقاع بين المقاطع الافتتاحية والختامية، أو فترات توقف غير ملائمة، أو أصوات طقطقة، أو انقطاع الصوت، أو تشوهات صوتية مسموعة.
النتيجة الموضوعية: تم فك تشفير الملف بشكل سليم دون أي عينات مقطوعة أو قفزات بين العينات المجاورة تتجاوز 0.8. وقدر التوقيت الآلي السرعة بـ 2.858 كلمة/ثانية في النصف الأول و2.670 في النصف الثاني، دون وجود ما يشير إلى زيادة عامة في السرعة خلال النصف الثاني.
لا يُثبت إجراء اختبار واحد الاستقرار عند الحد الأقصى البالغ 10,000 حرف، ولا يستبعد وجود مشكلات محلية في وتيرة التشغيل تتطلب الاستماع البشري.
إعدادات العاطفة والاستقرار
في واجهة برمجة التطبيقات الأصلية ElevenLabs، يتيح انخفاض مستوى الثبات مزيدًا من التنوع، بينما قد يؤدي ارتفاع مستوى الثبات إلى جعل العرض أكثر اتساقًا، وربما أكثر رتابة. ويمكن أن يضفي المبالغة في الأسلوب مزيدًا من التعبير، لكنه قد يقلل أيضًا من قابلية التنبؤ ويزيد من الحمل الحسابي. تعامل مع عناصر التحكم هذه على أنها مقايضات إبداعية، وليس تحسينات عامة للجودة.
النطق
لا يدعم الإصدار v2 من Multilingual علامات الفونيمات. توصي ElevenLabs باستخدام قواميس النطق التي تحتوي على أسماء مستعارة كحل بديل. قم بتوحيد الأرقام الغامضة والاختصارات والتواريخ وعناوين URL قبل عملية الإنشاء، ثم احتفظ ببرنامج نصي صغير لاختبار التراجع (regression) للأسماء أو المصطلحات التي تهم علامتك التجارية.
اختبار الضغط الصوتي
نقطة تقييم الاستماع: أظهر نظام التعرف على الكلام دون اتصال بالإنترنت رقم الهاتف على النحو التالي: “1-800-5555-0199”. يرجى الاستماع بعناية إلى الرقم الأصلي وعنوان URL قبل النشر.
الرقم الإضافي ليس خطأً مؤكدًا في نظام تحويل النص إلى كلام (TTS). قد تحدث أخطاء في نظام التعرف على الكلام، لذا فإن هذه نقطة مراجعة وليست حكمًا نهائيًا بشأن النطق.
الكمون
الإصدار ’Multilingual v2» ليس الخيار ذو زمن الاستجابة المنخفض من «ElevenLabs». وتقول «ElevenLabs» إن زمن الاستجابة فيه أعلى من طرازات «Flash». تراوحت أوقات المسار التي قمنا بقياسها بين 10.161 و31.489 ثانية للمهام الخمس الرسمية، لكن هذه الأرقام تشمل مسار مهمة Anywhere والشبكة وقائمة الانتظار وتسليم الملفات. ولا يجب اعتبارها زمن انتقال أصلي لطراز ElevenLabs.
كيفية استخدام واجهة برمجة التطبيقات (API) Eleven Multilingual v2
طلب واجهة برمجة التطبيقات (API) ElevenLabs الأصلي
استخدم معرّف النموذج الأصلي eleven_multilingual_v2 في نص JSON، وقم بإدراج معرّف الصوت المحدد في نقطة النهاية.
https://api.elevenlabs.io/v1/text-to-speech/{voice_id}curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/YOUR_VOICE_ID" \
-H "xi-api-key: $ELEVENLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"text": "ضع هنا النص الذي تريد قراءته بعدة لغات.",
"model_id": "eleven_multilingual_v2",
"voice_settings": {
"stability": 0.5,
"similarity_boost": 0.75,
"style": 0,
"use_speaker_boost": true,
"speed": 1.0
}
}' \
--output narration.mp3المعلمات والحدود الرئيسية
| المعلمة | ما الذي يتحكم فيه | ملاحظة عملية |
|---|---|---|
voice_id | صوت ElevenLabs المختار | اختر صوتًا تتناسب لهجته مع اللغة المستهدفة والمنطقة. |
معرّف النموذج | نموذج التوليف | الاستخدام eleven_multilingual_v2. |
الاستقرار | التنوع مقابل الاتساق | قد يكون النطاق السفلي أكثر تقلبًا؛ أما النطاق العلوي فقد يصبح أكثر تقييدًا. |
تعزيز التشابه | التشابه بين الصوت المرجعي والصوت | قد تساعد القيم العالية في تحديد الهوية، لكنها لا تضمن ذلك عبر اللغات المختلفة. |
أسلوب | المبالغة في الأسلوب | استخدمها بحذر عندما تكون قابلية التكرار أمرًا مهمًا. |
تفعيل تعزيز صوت السماعة | معالجة إضافية لتشابه السماعات | قد يؤدي ذلك إلى زيادة زمن الاستجابة. |
السرعة | سرعة التشغيل | أعد فحص الأرقام وعلامات الترقيم بعد تغييرها. |
النص السابق / النص التالي | السياق المحيط بجزء معين | مفيد عند تقسيم النصوص الطويلة. |
رمز_اللغة | تطبيق القواعد اللغوية | غير مدعوم في نماذج multilingual_v2 في مرجع واجهة برمجة التطبيقات (API) الحالي. |
مهم: احتفظ بمفاتيح واجهة برمجة التطبيقات (API) في متغير بيئة آمن. لا تقم أبدًا بلصق مفتاح حقيقي في كود مقال منشور للجمهور.
أسعار واجهة برمجة التطبيقات (API) لـ «Eleven Multilingual v2»
’ElevenLabs» صفحة أسعار واجهة برمجة التطبيقات (API) أدرجت «Multilingual v2» و«v3» في $0.10 لكل 1,000 حرف عند التحقق من ذلك في 11 أغسطس 2026. لا تشمل الضرائب والرسوم والرسوم الجمركية.
التسعير المباشر عبر واجهة برمجة التطبيقات (API)
بمعدل رسمي يبلغ $0.10 لكل 1,000 حرف بالنسبة إلى Multilingual v2 وv3:
تم التحقق من أسعار واجهة برمجة التطبيقات (API) لـ ElevenLabs في 11 أغسطس 2026. لا تشمل الأسعار الضرائب والرسوم والرسوم الجمركية.واجهة برمجة التطبيقات المباشرة أم GlobalGPT؟
| المسار | مرجع الأسعار | طريقة عملك | أفضل قيمة عندما |
|---|---|---|---|
| واجهة برمجة التطبيقات ElevenLabs | $0.10 / 1K حرف | الطلبات الأصلية، والأصوات، والإعدادات، والاستخدام المقيس | أنت بحاجة إلى عناصر تحكم للمطورين وتكامل المنتجات |
| جلوبال جي بي تي تي الخيار الأفضل من حيث القيمة الإجمالية | الأساسي $5.80/شهر Pro $10.80/شهر عدد غير محدود من $25 شهريًّا | العديد من نماذج الذكاء الاصطناعي والأدوات الإبداعية في منصة متصفح واحدة، بما في ذلك إمكانية الوصول إلى «Audio Generator» | يُعد الصوت جزءًا من مسار عمل أوسع نطاقًا يشمل الكتابة أو البحث أو الصور أو الفيديو أو مقارنة النماذج |
وبهذا السعر، تبلغ تكلفة الطلب الذي يبلغ حجمه الأقصى 10,000 حرف $1.00 قبل الضرائب. وتعتمد التكلفة الفعلية للمشروع على حجم النص الذي تقوم بإنشائه، ومدى تكرار إعادة إنشائه، وما إذا كنت تحتفظ بالتسجيلات غير الناجحة أم لا. قم بوضع ميزانيتك بناءً على عدد أحرف الإدخال بدلاً من دقائق الصوت.
بالنسبة للمبدعين الذين لا يحتاجون إلى إنشاء سير عمل قائم على واجهة برمجة تطبيقات أصلية، تقدم GlobalGPT عرضًا ذا قيمة عملية أكبر. وعند التحقق من الأسعار في 11 أغسطس 2026، بلغت تكلفة خطط الاشتراك السنوية $5.80 شهريًّا للخطة الأساسية (Basic)، و$10.80 للخطة الاحترافية (Pro)، و$25 للخطة غير المحدودة (Unlimited)، حيث تجمع هذه الخطط بين عدة نماذج ذكاء اصطناعي وأدوات إبداعية في اشتراك واحد. و مولد الصوت GlobalGPT يتضمن هذا الإصدار كل من «Eleven Multilingual v2» و«Eleven v3» في بيئة عمل المتصفح، مما يتيح لك إنشاء تعليق صوتي ومقارنة كلا النموذجين دون الحاجة إلى إعداد طلب واجهة برمجة التطبيقات (API) مسبقًا.

يستخدم GlobalGPT نظام «الائتمانات» الخاص به، لذا فإن هذه المقارنة لا تمثل مقارنة مباشرة للأسعار لكل حرف مع واجهة برمجة التطبيقات (API) الخاصة بـ ElevenLabs. ولكن عندما يكون الصوت جزءًا من سير عمل أوسع نطاقًا يشمل الكتابة أو البحث أو الصور أو الفيديو أو نماذج متعددة للذكاء الاصطناعي،, يُعد طراز GlobalGPT الخيار الأفضل من حيث القيمة الإجمالية. يمكنك قارن بين باقات GlobalGPT هنا.
Eleven Multilingual v2 مقابل Eleven v3 مقابل Flash v2.5
ما هو طراز ElevenLabs الذي ينبغي عليك اختياره؟
اختر العارضة المناسبة للعمل بدلاً من الاختيار بناءً على تاريخ الإصدار وحده.
متعدد اللغات الإصدار 2
اختر: سرد سلس، وسير عمل راسخ، وتغطية بـ 29 لغة، ونصوص تصل إلى 10,000 حرف.
أحد عشر v3
اختر: أسلوب إلقاء درامي، وأعمال متعددة المتحدثين، وتغطية أوسع تشمل أكثر من 70 لغة.
فلاش الإصدار 2.5
اختر: منتجات سريعة الاستجابة، وإنتاجية عالية، وطلبات تضم 40,000 حرف، وتكلفة أقل لواجهة برمجة التطبيقات (API).
| نموذج | اللغات | الحد الأقصى لعدد الأحرف | التأكيد الرسمي | أفضل ملاءمة |
|---|---|---|---|---|
| متعدد اللغات الإصدار 2 | 29 | 10,000 | استقرار المنتج على المدى الطويل وجودة ثابتة | التعليق الصوتي، الدورات التدريبية، التوطين، إجراءات العمل الراسخة في مجال الصوت |
| أحد عشر v3 | 70+ | 5,000 | الكلام التعبيري والحوار بين عدة متحدثين | الأداء، الشخصيات، الأداء الدرامي، تغطية لغوية أوسع نطاقاً |
| فلاش الإصدار 2.5 | 32 | 40,000 | زمن استجابة النموذج يبلغ حوالي 75 مللي ثانية وتكلفة واجهة برمجة التطبيقات (API) أقل | المنتجات التفاعلية، معدل الإنتاجية، الطلبات الأطول، التوسع المراعي للتكلفة |
يتضمن GlobalGPT أيضًا نسخة Eleven v3 ضمن نفس مولد الصوت. قم بتشغيل نفس النص القصير عبر كلا النموذجين: استخدم Multilingual v2 كأساس للسرد الثابت، ثم قارن مع v3 عندما ترغب في أسلوب إلقاء أكثر تعبيرًا. يُعد النص الخاص بك أداة اتخاذ قرار أفضل من العرض التوضيحي العام، لأنه يكشف عن الأسماء وعلامات الترقيم ووتيرة الكلام والتحولات اللغوية التي تهم مشروعك.
من ينبغي له — ومن لا ينبغي له — استخدام Multilingual v2؟
مقاس مناسب
- مُروِّيو الصوت الذين يُنتجون الدورات التدريبية، ومقاطع الفيديو التوضيحية، ومقاطع الفيديو المؤسسية، أو التعليقات الصوتية المُترجمة.
- الفرق التي تمتلك بالفعل نموذجًا صوتيًا ElevenLabs تم التحقق من صحته وترغب في الحصول على معرّف نموذج ثابت.
- المشاريع التي تتطلب إحدى اللغات أو أنظمة الكتابة الـ29 المدعومة، والتي يتجاوز طولها الحد الأقصى المسموح به في الإصدار 3 البالغ 5,000 حرف.
- المطورون الذين يفضلون أوامر التحكم الصوتية الأصلية وحقول استمرارية المقاطع على تحقيق أقل زمن انتقال ممكن.
انظر في اتجاه آخر عندما
- إذا كنت بحاجة إلى تمثيل غني بالتعبيرات، أو حوار طبيعي بين عدة متحدثين، أو لغة غير مدرجة في قائمة الـ29 لغة؛ فابدأ باستخدام Eleven v3.
- إذا كنت تعمل على تطوير وكيل صوتي متجاوب أو خدمة ذات إنتاجية عالية، فقم بتقييم Flash v2.5.
- أنت بحاجة إلى ترميز على مستوى الفونيمات؛ ولا يدعم «Multilingual v2» علامات الفونيمات.
- أنت بحاجة إلى لهجة إقليمية مضمونة دون اختبار الصوت المناسب والنص الفعلي.
- تحتاج إلى تقييم نهائي وذاتي للجودة قبل أن يقوم مستمع مؤهل بمراجعة اللغات المستهدفة.
الأسئلة الشائعة
هل لا يزال برنامج «Eleven Multilingual v2» متاحًا في عام 2026؟
نعم. فقد أدرجته ElevenLabs كنموذج رائد لتحويل النص إلى كلام، ولم تدرجه في جدول النماذج التي تم إيقاف دعمها عند التحقق من ذلك في 11 أغسطس 2026.
متى تم إصدار الإصدار الثاني من برنامج «Eleven Multilingual»؟
أعلنت شركة ElevenLabs عن إصدار “Multilingual v2” في 22 أغسطس 2023. ويشير الرقم «2026» الوارد في هذه المراجعة إلى تاريخ المراجعة، وليس إلى سنة الإطلاق.
كم عدد اللغات التي يدعمها برنامج «Eleven Multilingual v2»؟
وهي تدعم رسميًا 29 لغة، بما في ذلك الإنجليزية والإسبانية والصينية واليابانية والألمانية والفرنسية والهندية والكورية والبرتغالية والعربية والروسية.
ما هو معرّف نموذج «Eleven Multilingual v2»؟
معرّف نموذج واجهة برمجة التطبيقات (API) الأصلي ElevenLabs هو eleven_multilingual_v2. استخدم مسار الاختبار «Anywhere» المعرّف المنفصل الذي يتضمن واصلة eleven-multilingual-v2.
ما هو الحد الأقصى لعدد الأحرف؟
يبلغ الحد الأقصى الرسمي لعدد الأحرف في الطلب الواحد 10,000 حرف، وهو ما تقدره ElevenLabs بنحو عشر دقائق من التسجيل الصوتي.
هل يُعد Multilingual v2 أفضل من Eleven v3؟
ولا يُعتبر أي منهما أفضل بشكل عام. تُعد النسخة v2 متعددة اللغات الخيار الأكثر استقرارًا والأطول أمدًا؛ بينما توفر النسخة v3 تغطية لغوية أوسع، وأداءً أكثر تعبيرًا، وإمكانيات متعددة المتحدثين.
هل يُعد «Multilingual v2» خيارًا جيدًا للسرد الطويل؟
يُعد ElevenLabs النموذج الأطول والأكثر استقرارًا لدى الشركة. وقد اكتمل اختبار المسار الذي شمل 1,399 حرفًا بنجاح، لكن هذه التجربة الفردية لا تثبت استقرار النموذج عند معالجة كتاب كامل أو 10,000 حرف.
هل يمكنني تعيين رمز لغة في واجهة برمجة التطبيقات (API)؟
تنص المرجع الحالي لواجهة برمجة التطبيقات (API) «Create speech» على ما يلي: رمز_اللغة لا يُدعم هذا الخيار في نماذج multilingual_v2.
هل يدعم برنامج «Multilingual v2» علامات الفونيمات؟
توصي ElevenLabs باستخدام قواميس النطق التي تتضمن أسماء مستعارة عندما تحتاج إلى التحكم في نطق الأسماء أو المصطلحات المتخصصة.
كم تبلغ تكلفة واجهة برمجة التطبيقات (API)؟
أدرجت شركة ElevenLabs سعر «Multilingual v2» بمعدل $0.10 لكل 1,000 حرف في 11 أغسطس 2026، باستثناء الضرائب والرسوم والرسوم الجمركية.
الحكم النهائي
يحتل «Eleven Multilingual v2» مكانة واضحة في مجموعة منتجات ElevenLabs لعام 2026: فهو الخيار المثبت للسرد متعدد اللغات السلس، وسير عمل صوتي مجرب، وطلبات تصل إلى 10,000 حرف. لكنه ليس الخيار الفائز تلقائيًّا لكل مشروع تحويل النص إلى كلام (TTS). يُعد Eleven v3 نقطة انطلاق أقوى للأداء التمثيلي التعبيري ومجموعة لغات أوسع، بينما صُمم Flash v2.5 من أجل السرعة والتوسع.
يضفي اختبارنا الموضوعي ثقة مفيدة بشأن موثوقية المسار وسلامة الملفات: فقد تم إنجاز جميع المهام الرسمية الخمس لـ «Anywhere» في المحاولة الأولى، وأنتجت ملفات MP3 أحادية الصوت صالحة بتردد 44.1 كيلوهرتز، وظلت ضمن حدود التكلفة المسجلة مسبقًا. ولا يحل هذا الاختبار محل الاستماع البشري، لذا فإننا لا نمنح درجات ذاتية تتعلق بالطبيعية أو العاطفة أو اللهجة بناءً على الفحوصات الآلية وحدها.
أحضر فقرة من السرد أو الدورة التدريبية أو الفيديو المُترجم الذي ستقدمه قريبًا إلى مولد الصوت في GlobalGPT. ابدأ باستخدام «Eleven Multilingual v2»، وحافظ على اتساق الصوت والنص، وقارنه بـ«Eleven v3» عندما يكون الأداء التعبيري مهمًا. إنها طريقة مباشرة وعملية لاختيار النموذج الذي يناسب عملك.



