Eleven Multilingual v2 non è una nuova versione del 2026, ma è comunque un modello di sintesi vocale ElevenLabs ancora attivo che vale la pena prendere in considerazione. Lanciato nell'agosto 2023, rimane nella gamma di prodotti di punta dell'azienda con 29 lingue supportate, un limite di 10.000 caratteri per richiesta e un'attenzione particolare alla generazione stabile di testi di lunga durata.
Il problema è che “più recente” e “più adatto alle tue esigenze lavorative” non sono la stessa cosa. Eleven v3 offre una resa più espressiva e una copertura linguistica più ampia, mentre Flash v2.5 privilegia la velocità, la scalabilità e un costo dell’API inferiore. Multilingual v2 si colloca a metà strada tra le due, rappresentando la scelta consolidata per narrazioni, corsi, localizzazione e altri lavori con un unico speaker in cui la coerenza è più importante della resa drammatica.
Vuoi provare il modello prima di inviare una richiesta API? Generatore audio di GlobalGPT inserisce Eleven Multilingual v2 nell'area di lavoro del browser: scegli il modello, incolla il tuo script, seleziona una voce e genera l'audio.

Che cos’è Eleven Multilingual v2?
Eleven Multilingual v2 è un modello multilingue di sintesi vocale sviluppato da ElevenLabs. L'ID del modello nell'API nativa è eleven_multilingual_v2. Si inviano un testo e un identificativo vocale all'endpoint "Text to Speech" e il servizio restituisce l'audio sintetizzato con la voce selezionata.
Il suo fascino pratico è semplice: un unico modello copre 29 lingue e accetta fino a 10.000 caratteri in una singola richiesta. ElevenLabs lo descrive come la sua opzione più stabile per la generazione di testi lunghi, anche se tale affermazione riflette il posizionamento dell’azienda piuttosto che una garanzia indipendente per ogni voce, scrittura o lingua.
Multilingual v2 è pensato per attività quali narrazioni, audiolibri, e-learning, voci fuori campo aziendali e contenuti multimediali localizzati. Se il vostro prodotto finale è un video con personaggi parlanti, la stessa voce fuori campo può essere utilizzata anche per un pubblico più ampio flusso di lavoro relativo al dialogo e alla sincronizzazione labiale.
Eleven Multilingual v2 sarà ancora attivo nel 2026?
Sì. A partire dall'11 agosto 2026, ElevenLabs include Multilingual v2 tra i suoi modelli di sintesi vocale di punta. Non compare nella tabella dei modelli obsoleti della documentazione. Questo è lo stato attuale più chiaro: attivo e documentato, ma non è più il modello di sintesi vocale più recente di ElevenLabs.
La data di rilascio è indipendente dallo stato attuale del prodotto. ElevenLabs ha annunciato Multilingual v2 il 22 agosto 2023. Il titolo di una pagina che include “2026” dovrebbe indicare la data della recensione, senza sottintendere che il modello sia stato lanciato quest’anno.
Questo posizionamento rende Multilingual v2 un'opzione consolidata per la produzione, non un software abbandonato. Significa inoltre che, al momento della decisione di acquisto, occorre confrontare il suo profilo più stabile e con script più lunghi con i vantaggi specifici della v3 e di Flash v2.5.
Quali lingue supporta Eleven Multilingual v2?
ElevenLabs elenca ufficialmente 29 lingue per Multilingual v2:
- Inglese, giapponese, cinese, tedesco, hindi e francese
- coreano, portoghese, italiano, spagnolo, indonesiano e olandese
- turco, filippino, polacco, svedese, bulgaro e rumeno
- Arabo, ceco, greco, finlandese, croato, malese e slovacco
- danese, tamil, ucraino e russo
Il supporto linguistico non significa che ogni voce risulterà ugualmente convincente in ogni regione. ElevenLabs consiglia di scegliere una voce il cui accento corrisponda alla lingua e alla regione di destinazione. Questo è importante per lo spagnolo, il portoghese, l’inglese e altre lingue caratterizzate da forti variazioni regionali. È consigliabile testare la voce e il copione esatti che si intende pubblicare, piuttosto che considerare l’elenco delle lingue supportate dal modello come una garanzia dell’accento.
Qualità della voce: naturalezza, uniformità e prove a sostegno
ElevenLabs descrive Multilingual v2 come realistico, sensibile alle emozioni e coerente tra le diverse lingue. Si tratta di affermazioni del fornitore. Sono utili per comprendere la posizione che il modello intende assumere, ma non vanno confuse con una valutazione imparziale.
Le prove indipendenti sono più limitate. Secondo i dati di Artificial Analysis, il modello “Multilingual v2” registrava un punteggio Elo di circa 1100,07 nella sua “Provider Voice Arena” al momento della verifica, l’11 agosto 2026. L'arena utilizza le preferenze degli ascoltatori in coppie e otto voci di fornitori tra l'inglese statunitense e quello britannico, suddivise tra voci maschili e femminili. Si tratta di prove trasparenti e specifiche del modello relative alle preferenze vocali in inglese; non dimostrano prestazioni equivalenti in tutte le 29 lingue, negli accenti regionali o nei testi lunghi.
Il feedback del pubblico è contrastante, ma il campione è troppo esiguo per descrivere la base di utenti nel suo complesso. In una discussione del 2024, i commentatori hanno descritto la v2 come più realistica rispetto alla v1, segnalando al contempo occasionali problemi di coerenza nell’accento. Un altro utente ha segnalato un breve periodo caratterizzato da problemi di velocità e coerenza. Una risposta successiva associata a ElevenLabs ha raccomandato Multilingual v2 o Turbo v2 per lavori di lunga durata più coerenti. Questi post sono utili segnali di allarme, non dati di prevalenza né benchmark controllati.
Cosa si può affermare con certezza?
- Il modello continua a essere ufficialmente supportato ed è ottimizzato per il riconoscimento di discorsi lunghi, costanti e di alta qualità.
- I dati indipendenti relativi alle preferenze per l'inglese forniscono un segnale esterno attendibile, pur nell'ambito di un insieme limitato di voci in inglese.
- La qualità dell'accento dipende dalla lingua, dalla regione, dalla selezione della voce e dalla scrittura, non solo dall'ID del modello.
- I controlli audio oggettivi consentono di individuare troncamenti, clipping, problemi di formato e anomalie temporali, ma non possono sostituire un ascolto attento da parte di un esperto.
Coerenza tra le lingue
Lo stesso scenario è stato generato in inglese, spagnolo e mandarino utilizzando la voce predefinita “route-default”. Ciascun player contiene il primo output valido conservato in base alla regola di test “frozen”.
Da ascoltare: la continuità dell'identità del parlante e evidenti problemi di pronuncia. Un ascoltatore spagnolo esperto dovrebbe valutare separatamente l'autenticità dell'accento.
Queste rappresentazioni costituiscono un segnale di identità ausiliario; non valutano la naturalezza, la pronuncia, l’accento, la prosodia né l’espressività emotiva. Non era disponibile alcun gruppo di calibrazione con parlanti diversi.
Prova pratica: cinque primi risultati validi ottenuti tramite l’API Anywhere
Abbiamo testato il percorso HTTPS diretto Anywhere verso l'ID del modello undici-multilingue-v2. Questo formato di identificatore non è lo stesso di quello dell'API nativa ElevenLabs, che utilizza eleven_multilingual_v2. Il percorso metteva a disposizione un'interfaccia per l'invio di comandi con il modello e il prompt, ma non forniva controlli affidabili per la selezione della voce, la stabilità, la somiglianza, lo stile, la velocità o il formato di output. Ogni esecuzione ha quindi utilizzato le impostazioni predefinite del percorso.
Il lotto pre-registrato conteneva cinque script: una narrazione in inglese di 1.399 caratteri, lo stesso scenario in inglese, spagnolo e mandarino, e un test di pronuncia e accentazione che includeva nomi, date, valute, un numero di telefono, un URL e acronimi. Abbiamo conservato il primo risultato valido riproducibile e non abbiamo ripetuto l’esecuzione per motivi di qualità.
Riepilogo dell'affidabilità del percorso
Tutte e cinque le script pre-registrate hanno utilizzato il primo output valido riproducibile. Il percorso non esponeva controlli vocali o di generazione, quindi ogni esecuzione ha utilizzato le impostazioni predefinite.
Ambito di applicazione: Questi dati si riferiscono al percorso "Anywhere", non alla latenza nativa ElevenLabs né all'esperienza di navigazione GlobalGPT. I controlli sui file non valutano la naturalezza, l'emozione, l'accento o il ritmo locale.
Tutte e cinque le operazioni formali sono state completate con successo al primo tentativo e hanno restituito file MP3 mono decodificabili a 44,1 kHz. I file non presentavano campioni troncati né salti tra campioni adiacenti superiori a 0,8 nella scansione locale della forma d'onda. Tali controlli attestano l'integrità dei file, ma non ne valutano la naturalezza.
Stabilità a lungo termine, emozione, pronuncia e compromessi in termini di latenza
Sceneggiature lunghe
Il limite massimo di 10.000 caratteri è sufficientemente ampio da coprire circa dieci minuti di audio, secondo la tabella dei limiti di caratteri di ElevenLabs. Per i capitoli più lunghi, è consigliabile suddividere il testo in base ai confini naturali dei paragrafi o delle scene, piuttosto che a un numero arbitrario di caratteri. L'API fornisce testo_precedente, testo_successivo, e i campi di continuità dell'ID della richiesta per facilitare il flusso tra i blocchi adiacenti.
Il nostro test dimostra che uno script di 1.399 caratteri è stato generato come file valido al primo tentativo tramite il percorso Anywhere. Ciò non dimostra tuttavia la stabilità al limite massimo di 10.000 caratteri né per l'intera durata di un audiolibro.
Stabilità a lungo termine
Da ascoltare: variazioni di ritmo tra i passaggi iniziali e finali, pause imbarazzanti, clic, distorsioni o artefatti udibili.
Risultato oggettivo: Il file è stato decodificato correttamente, senza campioni troncati né salti tra campioni adiacenti superiori a 0,8. La misurazione della velocità effettuata dal sistema ha stimato 2,858 parole/s nella prima metà e 2,670 nella seconda, senza che si riscontrasse un aumento complessivo della velocità nella seconda metà.
Un singolo ciclo di test non è sufficiente a dimostrare la stabilità al limite dei 10.000 caratteri né a escludere eventuali problemi di sincronizzazione locali che richiedono l'intervento umano.
Impostazioni relative alle emozioni e alla stabilità
Nell'API nativa ElevenLabs, una stabilità inferiore consente una maggiore varietà, mentre una stabilità più elevata può rendere il risultato più coerente e potenzialmente più monotono. L'esagerazione dello stile può aggiungere espressività, ma può anche ridurre la prevedibilità e aumentare il carico di calcolo. Considerate questi controlli come compromessi creativi, non come miglioramenti universali della qualità.
Pronuncia
Multilingual v2 non supporta i tag fonemici. ElevenLabs consiglia di utilizzare dizionari di pronuncia con alias come soluzione alternativa. Normalizza numeri ambigui, abbreviazioni, date e URL prima della generazione, quindi mantieni un piccolo script di regressione per i nomi o i termini rilevanti per il tuo marchio.
Test di pronuncia
Punto di controllo dell'ascolto: Il riconoscimento vocale offline ha interpretato il numero di telefono come “1-800-5555-0199”. Ascoltate attentamente il numero originale e l’URL prima della pubblicazione.
La cifra in più non costituisce un errore confermato del sistema di sintesi vocale (TTS). Il riconoscimento vocale può comportare errori, pertanto si tratta di un punto di controllo per la revisione piuttosto che di un giudizio definitivo sulla pronuncia.
Latenza
Multilingual v2 non è l’opzione a bassa latenza di ElevenLabs. Secondo ElevenLabs, presenta una latenza superiore rispetto ai modelli Flash. I tempi di percorso da noi misurati variavano da 10,161 a 31,489 secondi per le cinque attività formali, ma tali cifre includono il percorso dell’attività Anywhere, la rete, l’accodamento e la consegna dei file. Non devono essere considerati come la latenza nativa del modello ElevenLabs.
Come utilizzare l'API Eleven Multilingual v2
Richiesta API nativa ElevenLabs
Utilizza l'ID del modello nativo eleven_multilingual_v2 nel corpo JSON e inserire l'ID della voce selezionata nell'endpoint.
https://api.elevenlabs.io/v1/text-to-speech/{voice_id}curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/YOUR_VOICE_ID" \
-H "xi-api-key: $ELEVENLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"text": "Inserisci qui la tua narrazione multilingue.",
"model_id": "eleven_multilingual_v2",
"voice_settings": {
"stability": 0.5,
"similarity_boost": 0.75,
"style": 0,
"use_speaker_boost": true,
"speed": 1.0
}
}' \
--output narration.mp3Parametri chiave e limiti
| Parametro | Cosa controlla | Nota pratica |
|---|---|---|
voice_id | Voce ElevenLabs selezionata | Scegli una voce il cui accento sia adeguato alla lingua e alla regione di destinazione. |
model_id | Modello di sintesi | Utilizzo eleven_multilingual_v2. |
stabilità | Variazione contro coerenza | I valori più bassi possono variare maggiormente; quelli più alti possono risultare più contenuti. |
similarity_boost | Somiglianza tra voce di riferimento e voce | Valori elevati possono aiutare a identificare un elemento, ma non ne garantiscono l'identificazione in tutte le lingue. |
stile | Esagerazione stilistica | Da utilizzare con cautela quando la ripetibilità è fondamentale. |
use_speaker_boost | Elaborazione aggiuntiva della somiglianza tra altoparlanti | Potrebbe aumentare la latenza. |
velocità | Velocità di riproduzione | Controlla nuovamente i numeri e la punteggiatura dopo averli modificati. |
testo_precedente / testo_successivo | Contesto relativo a un blocco | Utile quando si suddividono script lunghi. |
codice_lingua | Applicazione delle norme linguistiche | Non supportato per i modelli multilingual_v2 nell'attuale documentazione di riferimento dell'API. |
Importante: Conserva le chiavi API in una variabile d'ambiente sicura. Non inserire mai una chiave reale nel codice di un articolo pubblico.
Prezzi dell'API Eleven Multilingual v2
La pagina dei prezzi dell'API ’ElevenLabs" riportava i prezzi delle versioni Multilingual v2 e v3 a $0,10 per 1.000 caratteri al momento della verifica, l'11 agosto 2026. Sono escluse tasse, imposte e dazi.
Prezzi API diretti
Al tasso ufficiale di $0,10 per 1.000 caratteri per Multilingual v2 e v3:
Prezzi dell'API ElevenLabs verificati l'11 agosto 2026. Sono escluse tasse, imposte e dazi.API diretta o GlobalGPT?
| Percorso | Riferimenti sui prezzi | Come lavori | Il miglior rapporto qualità-prezzo quando |
|---|---|---|---|
| API ElevenLabs | $0.10 / 1.000 caratteri | Richieste native, voci, impostazioni e consumo a consumo | Sono necessari controlli per gli sviluppatori e l'integrazione del prodotto |
| GlobalGPT La scelta migliore in termini di rapporto qualità-prezzo | Base $5,80/mese Pro $10,80/mese Illimitato $25/mese | Diversi modelli di intelligenza artificiale e strumenti creativi in un'unica piattaforma browser, compreso l'accesso ad Audio Generator | L'audio fa parte di un flusso di lavoro più ampio che comprende la scrittura, la ricerca, le immagini, i video o il confronto tra modelli |
A quella tariffa, una richiesta con una dimensione massima di 10.000 caratteri costa $1.00 al netto delle imposte. Il costo effettivo del progetto dipende dalla quantità di testo generato, dalla frequenza con cui lo si rigenera e dall’eventuale conservazione delle registrazioni non riuscite. Calcolate il vostro budget in base ai caratteri inseriti piuttosto che ai minuti di audio.
Per i creatori che non hanno bisogno di sviluppare un flusso di lavoro basato su API native, GlobalGPT offre una proposta di valore più concreta. Al 11 agosto 2026, i suoi piani annuali ammontavano a $5,80 al mese per il piano Basic, $10,80 per il piano Pro e $25 per il piano Unlimited, combinando diversi modelli di IA e strumenti creativi in un unico abbonamento. Il Generatore audio GlobalGPT include Eleven Multilingual v2 ed Eleven v3 in un ambiente di lavoro basato su browser, consentendoti così di generare narrazioni e confrontare entrambi i modelli senza dover prima configurare una richiesta API.
GlobalGPT utilizza un proprio sistema di crediti, quindi non si tratta di un confronto diretto dei prezzi per singolo personaggio con l'API di ElevenLabs. Tuttavia, quando l'audio fa parte di un flusso di lavoro più ampio che comprende scrittura, ricerca, immagini, video o più modelli di IA, GlobalGPT è la scelta più vantaggiosa in termini di rapporto qualità-prezzo complessivo. È possibile Confronta qui i piani GlobalGPT.
Eleven Multilingual v2 vs Eleven v3 vs Flash v2.5
Quale modello ElevenLabs dovresti scegliere?
Scegli il modello in base al lavoro da svolgere, anziché basarti esclusivamente sulla data di uscita.
Multilingue v2
Scegli tra: narrazione fluida, flussi di lavoro consolidati, copertura in 29 lingue e copioni fino a 10.000 caratteri.
Undici v3
Scegli tra: recitazione drammatica, opere con più interpreti e una copertura linguistica più ampia, con oltre 70 lingue.
Flash v2.5
Scegli tra: prodotti reattivi, elevata produttività, richieste da 40.000 caratteri e costi API ridotti.
| Modello | Lingue | Limite di caratteri | Enfasi ufficiale | La migliore vestibilità |
|---|---|---|---|---|
| Multilingue v2 | 29 | 10,000 | Stabilità a lungo termine e qualità costante | Narrazione, corsi, localizzazione, flussi di lavoro consolidati per la registrazione vocale |
| Undici v3 | 70+ | 5,000 | Discorso espressivo e dialogo tra più interlocutori | Recitazione, personaggi, interpretazione drammatica, maggiore varietà linguistica |
| Flash v2.5 | 32 | 40,000 | Latenza del modello di circa 75 ms e costo dell'API inferiore | Prodotti interattivi, throughput, richieste più lunghe, scalabilità sensibile ai costi |
GlobalGPT include anche Eleven v3 nello stesso generatore audio. Esegui lo stesso breve script su entrambi i modelli: usa Multilingual v2 come base per una narrazione costante, poi confronta con la versione v3 quando desideri una resa più espressiva. Il tuo script personalizzato è uno strumento decisionale più efficace di una demo generica, poiché mette in evidenza i nomi, la punteggiatura, il ritmo e i cambiamenti di lingua che sono rilevanti per il tuo progetto.
Chi dovrebbe — e chi non dovrebbe — utilizzare Multilingual v2?
Ottima vestibilità
- Narratori che realizzano corsi, video esplicativi, video aziendali o doppiaggi localizzati.
- Team che dispongono già di un modello vocale ElevenLabs convalidato e desiderano un ID modello stabile.
- Progetti che richiedono una delle 29 lingue e scritture supportate e che superano il limite di 5.000 caratteri della versione 3.
- Sviluppatori che danno maggiore importanza ai comandi vocali nativi e ai campi di continuità dei blocchi rispetto alla latenza più bassa possibile.
Cerca altrove quando
- Se hai bisogno di una recitazione molto espressiva, di dialoghi naturali tra più personaggi o di una lingua che non figura nell’elenco delle 29 lingue disponibili, inizia con Eleven v3.
- Se state sviluppando un agente vocale responsive o un servizio ad alta produttività, valutate Flash v2.5.
- È necessario un markup a livello di fonema; Multilingual v2 non supporta i tag fonemici.
- È necessario un accento regionale garantito senza dover testare una voce corrispondente e un copione vero e proprio.
- È necessario un giudizio soggettivo definitivo sulla qualità prima che un ascoltatore qualificato abbia esaminato le lingue di destinazione.
Domande frequenti
Eleven Multilingual v2 sarà ancora disponibile nel 2026?
Sì. ElevenLabs lo ha indicato come modello di punta per la sintesi vocale e, al momento della verifica effettuata l'11 agosto 2026, non lo ha incluso nella tabella dei modelli obsoleti.
Quando è stata rilasciata la versione 2 di Eleven Multilingual?
ElevenLabs ha annunciato Multilingual v2 il 22 agosto 2023. Il “2026” riportato in questa recensione si riferisce alla data della recensione, non all’anno di lancio.
Quante lingue supporta Eleven Multilingual v2?
Supporta ufficialmente 29 lingue, tra cui inglese, spagnolo, cinese, giapponese, tedesco, francese, hindi, coreano, portoghese, arabo e russo.
Qual è l'ID del modello Eleven Multilingual v2?
L'ID del modello API nativo ElevenLabs è eleven_multilingual_v2. Il percorso di prova Anywhere utilizzava l'identificatore separato con trattino undici-multilingue-v2.
Qual è il limite di caratteri?
Il limite ufficiale per ogni singola richiesta è di 10.000 caratteri, che secondo le stime di ElevenLabs corrispondono a circa dieci minuti di audio.
Multilingual v2 è migliore di Eleven v3?
Nessuna delle due è universalmente migliore. La versione multilingue v2 è la scelta più stabile e a lungo termine; la v3 offre una copertura linguistica più ampia, una resa più espressiva e funzionalità multi-voce.
Multilingual v2 è adatto alla narrazione di testi lunghi?
ElevenLabs lo definisce il suo modello per testi lunghi più stabile. Il nostro test su un percorso di 1.399 caratteri si è concluso con esito positivo, ma quella singola esecuzione non dimostra la stabilità su un libro intero o su 10.000 caratteri.
È possibile impostare un codice lingua nell'API?
L'attuale documentazione di riferimento dell'API Create Speech recita: codice_lingua non è supportato per i modelli multilingual_v2.
Multilingual v2 supporta i tag fonemici?
N. ElevenLabs consiglia l'uso di dizionari di pronuncia che includano i nomi alternativi quando è necessario controllare la pronuncia di nomi o termini specialistici.
Quanto costa l'API?
L'11 agosto 2026, ElevenLabs ha quotato Multilingual v2 a $0,10 per 1.000 caratteri, al netto di imposte, prelievi e dazi.
Il verdetto finale
Eleven Multilingual v2 si guadagna un posto di rilievo nella gamma ElevenLabs del 2026: è la scelta consolidata per una narrazione multilingue fluida, un flusso di lavoro vocale collaudato e richieste fino a 10.000 caratteri. Non è però la soluzione ideale per ogni progetto di sintesi vocale. Eleven v3 rappresenta il punto di partenza più solido per una recitazione espressiva e un ventaglio linguistico più ampio, mentre Flash v2.5 è progettato per garantire velocità e scalabilità.
Il nostro test oggettivo offre un'ulteriore garanzia sull'affidabilità del percorso e sull'integrità dei file: tutte e cinque le attività formali di Anywhere sono state completate al primo tentativo, hanno prodotto file MP3 mono validi a 44,1 kHz e sono rimaste entro il limite di costo prestabilito. Questo test non sostituisce l’ascolto umano, pertanto non assegniamo un punteggio soggettivo relativo a naturalezza, emozione o accento basandoci esclusivamente sui controlli automatici.
Inserisci un paragrafo tratto dalla tua prossima narrazione, lezione o video localizzato in Generatore audio di GlobalGPT. Inizia con Eleven Multilingual v2, mantieni la voce e il testo coerenti e confrontalo con Eleven v3 quando è importante un'interpretazione espressiva. È un modo diretto e pratico per scegliere il modello più adatto al tuo lavoro.




