Eleven Multilingual v2 n'est pas une nouvelle version sortie en 2026, mais il s'agit tout de même d'un modèle de synthèse vocale ElevenLabs toujours actif qui mérite d'être pris en considération. Lancé en août 2023, il fait toujours partie de la gamme phare de l'entreprise, avec 29 langues prises en charge, une limite de 10 000 caractères par requête et un accent mis officiellement sur la génération stable de textes longs.
Le problème, c’est que “ plus récent ” et “ mieux adapté à votre usage ” ne sont pas synonymes. Eleven v3 offre une interprétation plus expressive et une couverture linguistique plus étendue, tandis que Flash v2.5 privilégie la vitesse, l’évolutivité et un coût d’API réduit. Multilingual v2 se situe entre les deux : c’est la solution éprouvée pour les narrations, les cours, la localisation et tout autre travail impliquant un seul locuteur, où la cohérence prime sur la performance dramatique.
Vous souhaitez tester le modèle avant d'envoyer une requête API ? Générateur audio du GlobalGPT intègre Eleven Multilingual v2 dans un espace de travail de navigateur : choisissez le modèle, collez votre script, sélectionnez une voix, puis générez le fichier audio.

Qu'est-ce qu'Eleven Multilingual v2 ?
Eleven Multilingual v2 est un modèle multilingue de synthèse vocale développé par ElevenLabs. L'identifiant natif du modèle dans l'API est eleven_multilingual_v2. Vous envoyez un texte et un identifiant vocal au point de terminaison « Text to Speech », et le service renvoie un fichier audio synthétisé dans la voix sélectionnée.
Son intérêt pratique est simple : un seul modèle couvre 29 langues et accepte jusqu’à 10 000 caractères par requête. ElevenLabs le présente comme son option la plus stable pour la génération de textes longs, même si cette affirmation relève davantage du positionnement de l’entreprise que d’une garantie indépendante valable pour chaque voix, chaque écriture ou chaque langue.
Multilingual v2 est conçu pour des applications telles que la narration, les livres audio, l'apprentissage en ligne, les voix off d'entreprise et les contenus multimédias localisés. Si votre produit final est une vidéo mettant en scène un personnage parlant, la même voix off peut également servir à un public plus large flux de travail pour les dialogues et la synchronisation labiale.
Le projet « Eleven Multilingual v2 » est-il toujours actif en 2026 ?
Oui. Au 11 août 2026, ElevenLabs répertorie « Multilingual v2 » parmi ses principaux modèles de synthèse vocale. Il n'apparaît pas dans le tableau des modèles obsolètes de la documentation. C'est là le statut actuel le plus clair : actif et documenté, mais ce n'est plus le modèle de synthèse vocale le plus récent de ElevenLabs.
La date de sortie est distincte de son statut actuel. ElevenLabs a annoncé la version Multilingual v2 le 22 août 2023. Un titre de page contenant “ 2026 ” devrait faire référence à la date de révision, et non laisser entendre que le modèle a été lancé cette année.
Ce positionnement fait de Multilingual v2 une option de production bien établie, et non un logiciel abandonné. Cela signifie également que, lors de la décision d'achat, il convient de comparer son profil plus stable et son cycle de vie plus long aux avantages spécifiques de la v3 et de Flash v2.5.
Quelles langues sont prises en charge par Eleven Multilingual v2 ?
ElevenLabs répertorie officiellement 29 langues pour Multilingual v2 :
- anglais, japonais, chinois, allemand, hindi et français
- coréen, portugais, italien, espagnol, indonésien et néerlandais
- turc, philippin, polonais, suédois, bulgare et roumain
- arabe, tchèque, grec, finnois, croate, malais et slovaque
- danois, tamoul, ukrainien et russe
La prise en charge linguistique ne signifie pas que toutes les voix auront le même niveau de crédibilité dans toutes les régions. ElevenLabs recommande de choisir une voix dont l'accent correspond à la langue et à la région cibles. Cela est particulièrement important pour l'espagnol, le portugais, l'anglais et d'autres langues présentant de fortes variations régionales. Testez la voix et le script exacts que vous prévoyez de publier, plutôt que de considérer la liste des langues du modèle comme une garantie quant à l'accent.
Qualité vocale : naturel, cohérence et preuves
ElevenLabs décrit Multilingual v2 comme un modèle réaliste, capable de percevoir les émotions et cohérent d'une langue à l'autre. Il s'agit là d'affirmations du fournisseur. Elles sont utiles pour comprendre la position visée par le modèle, mais ne doivent pas être confondues avec des tests neutres.
Les données indépendantes sont plus limitées. Selon Artificial Analysis, Multilingual v2 affichait un score Elo d’environ 1 100,07 dans sa rubrique « Provider Voice Arena » lors d’une consultation le 11 août 2026. Cette arène s'appuie sur les préférences d'auditeurs appariés et sur huit voix de fournisseurs couvrant l'anglais américain et britannique, réparties entre des voix masculines et féminines. Il s'agit là de données transparentes et spécifiques à ce modèle concernant les préférences vocales en anglais ; elles ne prouvent pas des performances équivalentes pour l'ensemble des 29 langues, des accents régionaux ou des scripts longs.
Les avis du public sont mitigés, mais l’échantillon est trop restreint pour refléter l’ensemble de la base d’utilisateurs. Lors d’une discussion en 2024, les intervenants ont décrit la v2 comme plus réaliste que la v1, tout en signalant des problèmes occasionnels de cohérence des accents. Un autre utilisateur a signalé une brève période de problèmes de vitesse et de cohérence. Une réponse ultérieure associée à ElevenLabs recommandait d’utiliser Multilingual v2 ou Turbo v2 pour obtenir des résultats plus cohérents sur des textes longs. Ces messages constituent des signaux d’alerte utiles, et non des données de prévalence ni des tests de performance contrôlés.
Qu'est-ce qu'on peut affirmer avec certitude ?
- Ce modèle bénéficie toujours d'un soutien officiel et est conçu pour générer des discours longs, stables et de grande qualité.
- Les données indépendantes sur les préférences en matière d'anglais lui confèrent un indicateur externe fiable, au sein d'un ensemble limité de voix anglophones.
- La qualité de l'accent dépend de la langue, de la région, du choix de la voix et du script, et pas uniquement de l'identifiant du modèle.
- Les contrôles audio objectifs permettent de détecter les troncatures, les écrêtages, les problèmes de format et les anomalies de synchronisation, mais ils ne peuvent se substituer à une écoute attentive.
Cohérence entre les langues
Le même scénario a été généré en anglais, en espagnol et en mandarin avec la voix « route-default ». Chaque lecteur contient la première sortie valide conservée conformément à la règle de test figée.
À écouter : la cohérence de l'identité du locuteur et les problèmes de prononciation manifestes. Un auditeur espagnol qualifié devrait évaluer séparément l'authenticité de l'accent.
Ces représentations constituent un signal d'identité auxiliaire ; elles ne permettent pas d'évaluer le naturel, la prononciation, l'accent, la prosodie ou l'expression émotionnelle. Aucun groupe de calibrage composé de locuteurs différents n'était disponible.
Test pratique : cinq premiers résultats valides via l'API Anywhere
Nous avons testé la route HTTPS directe « Anywhere » vers l'ID du modèle eleven-multilingue-v2. Ce format d'identifiant diffère de celui de l'API native ElevenLabs, qui utilise eleven_multilingual_v2. Cette méthode proposait une interface permettant de définir la tâche, le modèle et la consigne, mais ne disposait pas de commandes fiables pour le choix de la voix, la stabilité, la similarité, le style, la vitesse ou le format de sortie. Chaque exécution a donc utilisé les paramètres par défaut de cette méthode.
Le lot préenregistré comprenait cinq scripts : une narration en anglais de 1 399 caractères, le même scénario en anglais, en espagnol et en mandarin, ainsi qu’un test d’accentuation portant sur des noms, des dates, des devises, un numéro de téléphone, une URL et des acronymes. Nous avons conservé la première sortie valide et exploitable et n’avons pas relancé le test pour des raisons de qualité.
Résumé de la fiabilité des itinéraires
Les cinq scripts préenregistrés ont tous utilisé la première sortie valide et jouable. Le parcours ne proposait pas de commandes vocales ni de réglages de génération ; chaque exécution a donc utilisé les paramètres par défaut.
Champ d'application : Ces chiffres concernent l'itinéraire « Anywhere » et ne reflètent pas la latence native du ElevenLabs ni l'expérience offerte par le navigateur GlobalGPT. Les analyses de fichiers ne prennent pas en compte le naturel, l'émotion, l'accent ou le rythme local.
Les cinq tâches formelles ont toutes abouti dès le premier essai et ont généré des fichiers MP3 mono décodables à 44,1 kHz. Les fichiers ne contenaient aucun échantillon écrêté ni aucun saut entre échantillons adjacents supérieur à 0,8 lors de l'analyse locale de la forme d'onde. Ces vérifications permettent de s'assurer de l'intégrité des fichiers ; elles ne permettent pas d'évaluer leur naturel.
Stabilité à long terme, émotion, prononciation et compromis liés à la latence
Scripts longs
La limite de 10 000 caractères est suffisamment généreuse pour couvrir environ dix minutes d'audio, selon le tableau des limites de caractères de ElevenLabs. Pour les chapitres plus longs, effectuez la coupure au niveau des limites naturelles des paragraphes ou des scènes plutôt que de vous baser sur un nombre arbitraire de caractères. L'API fournit texte_précédent, text_suivant, ainsi que des champs de continuité d'ID de requête pour faciliter l'enchaînement des blocs adjacents.
Notre test démontre qu'un script de 1 399 caractères a été généré en tant que fichier valide dès la première tentative via la méthode « Anywhere ». Il ne prouve toutefois pas la stabilité à la limite maximale de 10 000 caractères ni sur l'ensemble d'un livre audio.
Stabilité à long terme
À écouter : des variations de rythme entre le début et la fin du morceau, des pauses gênantes, des cliquetis, des coupures ou des artefacts audibles.
Résultat objectif : Le fichier a été décodé sans problème, sans échantillons tronqués ni sauts entre échantillons adjacents supérieurs à 0,8. La mesure de la vitesse effectuée par la machine a donné 2,858 mots/s pour la première moitié et 2,670 pour la seconde, sans qu'aucune accélération globale ne soit constatée dans la seconde moitié.
Un seul test ne suffit pas à prouver la stabilité à la limite des 10 000 caractères ni à exclure d'éventuels problèmes de synchronisation locaux nécessitant une écoute humaine.
Paramètres d'émotion et de stabilité
Dans l'API native ElevenLabs, une stabilité plus faible permet davantage de variations, tandis qu'une stabilité plus élevée peut rendre le rendu plus homogène, mais aussi potentiellement plus monotone. L'exagération stylistique peut apporter de l'expression, mais peut également réduire la prévisibilité et augmenter la charge de calcul. Considérez ces paramètres comme des compromis créatifs, et non comme des améliorations universelles de la qualité.
Prononciation
La version 2 multilingue ne prend pas en charge les balises de phonèmes. ElevenLabs recommande d'utiliser des dictionnaires de prononciation comportant des alias comme solution de contournement. Normalisez les nombres, abréviations, dates et URL ambigus avant la génération, puis conservez un petit script de régression pour les noms ou termes importants pour votre marque.
Test d'accentuation phonétique
Point de contrôle d'écoute : La reconnaissance vocale hors ligne a interprété le numéro de téléphone comme “ 1-800-5555-0199 ”. Écoutez attentivement le numéro et l'URL d'origine avant publication.
Ce chiffre supplémentaire ne constitue pas une erreur avérée du système de synthèse vocale. La reconnaissance vocale pouvant entraîner des erreurs, il s'agit ici d'un point de contrôle à vérifier plutôt que d'un verdict définitif sur la prononciation.
Latence
La version Multilingual v2 n’est pas l’option à faible latence proposée par ElevenLabs. Selon ElevenLabs, sa latence est supérieure à celle des modèles Flash. Les temps de routage que nous avons mesurés variaient entre 10,161 et 31,489 secondes pour les cinq tâches formelles, mais ces chiffres incluent le routage de la tâche ’ Anywhere », le réseau, la mise en file d’attente et la livraison de fichiers. Ils ne doivent pas être considérés comme la latence native du modèle ElevenLabs.
Comment utiliser l'API Eleven Multilingual v2
Requête API native ElevenLabs
Utilisez l'identifiant natif du modèle eleven_multilingual_v2 dans le corps JSON et indiquez l'identifiant de la voix sélectionnée dans le point de terminaison.
https://api.elevenlabs.io/v1/text-to-speech/{voice_id}curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/YOUR_VOICE_ID" \
-H "xi-api-key: $ELEVENLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"text": "Votre narration multilingue va ici.",
"model_id": "eleven_multilingual_v2",
"voice_settings": {
"stability": 0.5,
"similarity_boost": 0,75,
"style": 0,
"use_speaker_boost": true,
"speed": 1,0
}
}' \
--output narration.mp3Paramètres clés et limites
| Paramètres | Ce qu'il contrôle | Remarque pratique |
|---|---|---|
voice_id | Sélection de la voix ElevenLabs | Choisissez une voix dont l'accent correspond à la langue et à la région cibles. |
model_id | Modèle de synthèse | Utilisation eleven_multilingual_v2. |
stabilité | Variation contre cohérence | Les valeurs basses peuvent présenter davantage de variations ; les valeurs élevées peuvent devenir plus modérées. |
similarity_boost | Similitude vocale de référence | Des valeurs élevées peuvent faciliter l'identification, mais ne la garantissent pas dans toutes les langues. |
style | Exagération stylistique | À utiliser avec précaution lorsque la répétabilité est essentielle. |
use_speaker_boost | Traitement supplémentaire de la similarité entre locuteurs | Peut augmenter la latence. |
vitesse | Vitesse de lecture | Vérifie à nouveau les chiffres et la ponctuation après les avoir modifiés. |
texte_précédent / text_suivant | Contexte entourant un segment | Utile pour diviser des scripts volumineux. |
code_langue | Application de la législation linguistique | Non pris en charge pour les modèles multilingual_v2 dans la référence API actuelle. |
Important : Conservez les clés API dans une variable d'environnement sécurisée. Ne collez jamais une clé réelle dans le code d'un article accessible au public.
Tarifs de l'API Eleven Multilingual v2
La page de tarification de l'API ’ ElevenLabs » indiquait les versions Multilingual v2 et v3 à $0,10 pour 1 000 caractères selon les informations vérifiées le 11 août 2026. Les taxes, prélèvements et droits sont exclus.
Tarification directe via l'API
Au tarif officiel de $0,10 pour 1 000 caractères pour les versions Multilingual v2 et v3 :
Tarifs de l'API ElevenLabs vérifiés le 11 août 2026. Les taxes, prélèvements et droits de douane ne sont pas inclus.API directe ou GlobalGPT ?
| Itinéraire | Barème des tarifs | Votre façon de travailler | Le meilleur rapport qualité-prix lorsque |
|---|---|---|---|
| API ElevenLabs | $0.10 / 1 000 caractères | Demandes natives, voix, paramètres et consommation mesurée | Vous avez besoin de contrôles de développement et d'une intégration des produits |
| GlobalGPT Le meilleur rapport qualité-prix | Forfait de base $5,80/mois Pro $10,80/mois Illimité $25/mois | Plusieurs modèles d'IA et outils créatifs réunis sur une seule plateforme web, avec notamment l'accès à Audio Generator | L'audio s'inscrit dans un processus plus large de rédaction, de recherche, de traitement d'images, de vidéo ou de comparaison de modèles |
À ce tarif, une demande d’une taille maximale de 10 000 caractères revient à $1,00 hors taxes. Le coût réel du projet dépend de la quantité de texte générée, de la fréquence de régénération et de la conservation ou non des prises non retenues. Établissez votre budget en fonction du nombre de caractères saisis plutôt que du nombre de minutes d’audio.
Pour les créateurs qui n’ont pas besoin de mettre en place un workflow API natif, GlobalGPT offre une proposition de valeur plus pratique. Selon les informations disponibles au 11 août 2026, ses formules annuelles s'élevaient à $5,80 par mois pour la formule Basic, $10,80 pour la formule Pro et $25 pour la formule Unlimited, combinant plusieurs modèles d'IA et outils créatifs en un seul abonnement. Le Générateur audio GlobalGPT Intègre Eleven Multilingual v2 et Eleven v3 dans un espace de travail de navigateur, ce qui vous permet de générer une narration et de comparer les deux modèles sans avoir à configurer au préalable une requête API.
GlobalGPT utilise son propre système de crédits ; il ne s'agit donc pas d'une comparaison directe des prix par caractère avec l'API ElevenLabs. Cependant, lorsque l'audio s'inscrit dans un flux de travail plus large impliquant la rédaction, la recherche, des images, de la vidéo ou plusieurs modèles d'IA, Le modèle GlobalGPT est le choix offrant le meilleur rapport qualité-prix global. Vous pouvez Comparez ici les formules GlobalGPT.
Eleven Multilingual v2 vs Eleven v3 vs Flash v2.5
Quel modèle ElevenLabs choisir ?
Choisissez le modèle en fonction du poste à pourvoir plutôt que de vous baser uniquement sur la date de sortie.
Multilingue v2
Choisissez : une narration fluide, des processus de travail bien rodés, une prise en charge de 29 langues et des scripts pouvant compter jusqu'à 10 000 caractères.
Onze v3
Choisissez : une interprétation théâtrale, des œuvres faisant intervenir plusieurs locuteurs et une couverture linguistique élargie à plus de 70 langues.
Flash v2.5
Choisissez : des produits adaptés, un débit élevé, des requêtes de 40 000 caractères et un coût d'API réduit.
| Modèle | Langues | Limite de caractères | Accent mis par les autorités | Meilleure adéquation |
|---|---|---|---|---|
| Multilingue v2 | 29 | 10,000 | Stabilité à long terme et qualité constante | Narration, formations, localisation, processus de production audio bien rodés |
| Onze v3 | 70+ | 5,000 | Discours expressif et dialogue entre plusieurs locuteurs | Interprétation, personnages, jeu d'acteur, plus grande diversité linguistique |
| Flash v2.5 | 32 | 40,000 | Une latence du modèle d'environ 75 ms et un coût d'API réduit | Produits interactifs, débit, requêtes plus longues, évolutivité tenant compte des coûts |
GlobalGPT intègre également Eleven v3 dans le même générateur audio. Exécutez le même script court sur les deux modèles : utilisez Multilingual v2 pour obtenir une narration de base régulière, puis comparez avec la version v3 lorsque vous souhaitez une interprétation plus expressive. Votre propre script constitue un meilleur outil d'aide à la décision qu'une démo générique, car il met en évidence les noms, la ponctuation, le rythme et les changements de langue qui importent pour votre projet.
Qui devrait — et qui ne devrait pas — utiliser Multilingual v2 ?
Bien ajusté
- Des narrateurs spécialisés dans la production de formations, de vidéos explicatives, de vidéos d'entreprise ou de doublages localisés.
- Les équipes qui disposent déjà d'un modèle vocal ElevenLabs validé et qui souhaitent obtenir un identifiant de modèle stable.
- Projets nécessitant l'une des 29 langues et écritures prises en charge et dont la longueur dépasse la limite de 5 000 caractères imposée par la version 3.
- Les développeurs qui privilégient les commandes vocales natives et les champs de continuité des blocs plutôt qu'une latence aussi faible que possible.
Cherchez ailleurs lorsque
- Si vous avez besoin d'un jeu d'acteur très expressif, de dialogues naturels entre plusieurs interlocuteurs ou d'une langue ne figurant pas dans la liste des 29 langues, commencez par Eleven v3.
- Vous développez un agent vocal adaptatif ou un service à haut débit ; évaluez Flash v2.5.
- Vous avez besoin d'un balisage au niveau des phonèmes ; Multilingual v2 ne prend pas en charge les balises de phonèmes.
- Vous souhaitez vous assurer d'un accent régional sans avoir à tester la voix correspondante ni le script réel.
- Il vous faut un avis subjectif définitif sur la qualité avant qu'un auditeur qualifié n'ait examiné vos langues cibles.
Foire aux questions
La version 2 d'Eleven Multilingual sera-t-elle toujours disponible en 2026 ?
Oui. ElevenLabs l'a répertorié comme modèle phare de synthèse vocale et ne l'a pas inclus dans le tableau des modèles obsolètes lors d'une vérification effectuée le 11 août 2026.
Quand la version 2 d'Eleven Multilingual est-elle sortie ?
ElevenLabs a annoncé la version Multilingual v2 le 22 août 2023. Le “ 2026 ” mentionné dans cette critique fait référence à la date de publication de celle-ci, et non à l'année de lancement.
Combien de langues prend en charge Eleven Multilingual v2 ?
Il prend officiellement en charge 29 langues, dont l'anglais, l'espagnol, le chinois, le japonais, l'allemand, le français, l'hindi, le coréen, le portugais, l'arabe et le russe.
Quel est l'identifiant du modèle Eleven Multilingual v2 ?
L'identifiant natif du modèle d'API ElevenLabs est eleven_multilingual_v2. Le parcours de test « Anywhere » utilisait l'identifiant distinct, composé d'un trait d'union eleven-multilingue-v2.
Quelle est la limite de caractères ?
La limite officielle par requête est de 10 000 caractères, ce qui, selon ElevenLabs, correspond à environ dix minutes d'enregistrement audio.
La version 2 de Multilingual est-elle meilleure que la version 3 d'Eleven ?
Aucune des deux n'est meilleure dans tous les cas. La version multilingue v2 est le choix le plus stable et le plus durable ; la v3 offre une couverture linguistique plus large, un rendu plus expressif et des fonctionnalités multi-locuteurs.
La version 2 de Multilingual est-elle adaptée à la narration de longue durée ?
ElevenLabs se présente comme son modèle de format long le plus stable. Notre test sur un parcours de 1 399 caractères s'est déroulé avec succès, mais ce seul essai ne suffit pas à prouver la stabilité sur l'ensemble d'un livre ou pour 10 000 caractères.
Puis-je définir un code de langue dans l'API ?
La documentation actuelle de l'API Create Speech indique : code_langue n'est pas pris en charge pour les modèles multilingual_v2.
La version 2 de Multilingual prend-elle en charge les balises de phonèmes ?
N° 1 : Le guide TP9T recommande l'utilisation de dictionnaires de prononciation proposant des variantes lorsque vous devez contrôler la transcription des noms ou des termes spécialisés.
Combien coûte l'API ?
Le 11 août 2026, ElevenLabs a fixé le prix de Multilingual v2 à $0,10 pour 1 000 caractères, hors taxes, prélèvements et droits.
Verdict final
Eleven Multilingual v2 occupe une place incontestable dans la gamme ElevenLabs 2026 : c’est le choix incontournable pour une narration multilingue fluide, un flux de travail vocal éprouvé et des demandes pouvant atteindre 10 000 caractères. Il ne s’agit toutefois pas du choix automatique pour tous les projets de synthèse vocale. Eleven v3 constitue le meilleur point de départ pour un jeu vocal expressif et un plus grand nombre de langues, tandis que Flash v2.5 est conçu pour la rapidité et la scalabilité.
Notre test objectif apporte une assurance utile quant à la fiabilité du parcours et à l'intégrité des fichiers : les cinq tâches formelles « Anywhere » ont toutes été menées à bien dès la première tentative, ont généré des fichiers MP3 mono valides à 44,1 kHz et sont restées dans les limites de coût prédéfinies. Cela ne remplace pas l'écoute humaine ; nous n'attribuons donc pas de note subjective concernant le naturel, l'émotion ou l'accent sur la seule base des vérifications automatiques.
Apportez un paragraphe tiré de votre prochaine narration, de votre prochain cours ou d'une vidéo localisée pour Générateur audio du GlobalGPT. Commencez par Eleven Multilingual v2, veillez à la cohérence de la voix et du script, puis comparez-le à Eleven v3 lorsque l'expressivité de la lecture est importante. C'est un moyen simple et concret de choisir le modèle le mieux adapté à votre travail.




