Análise do ElevenLabs Multilingual v2 (2026): Idiomas, qualidade de voz e API

Análise do Eleven Multilingual v2: Idiomas, qualidade e API

O Eleven Multilingual v2 não é uma versão nova de 2026, mas ainda é um modelo de conversão de texto em fala ElevenLabs ativo que vale a pena considerar. Lançado em agosto de 2023, ele continua fazendo parte da linha principal da empresa, com suporte a 29 idiomas, um limite de 10.000 caracteres por solicitação e um foco oficial na geração estável de textos longos.

O problema é que “mais recente” e “melhor para o seu trabalho” não são a mesma coisa. O Eleven v3 oferece uma narração mais expressiva e uma cobertura linguística mais ampla, enquanto o Flash v2.5 prioriza velocidade, escalabilidade e menor custo de API. O Multilingual v2 fica entre os dois, sendo a opção consolidada para narração, cursos, localização e outros trabalhos com um único locutor, nos quais a consistência é mais importante do que o desempenho dramático.

Quer testar o modelo antes de enviar uma solicitação de API? Gerador de áudio do GlobalGPT coloca o Eleven Multilingual v2 em uma área de trabalho do navegador: escolha o modelo, cole seu roteiro, selecione uma voz e gere o áudio.

O que é o Eleven Multilingual v2?

O Eleven Multilingual v2 é um modelo multilíngue de conversão de texto em fala da ElevenLabs. O ID nativo do modelo na API é eleven_multilingual_v2. Você envia um texto e uma identificação de voz para o endpoint “Text to Speech”, e o serviço retorna um áudio sintetizado na voz selecionada.

Seu apelo prático é simples: um único modelo abrange 29 idiomas e aceita até 10.000 caracteres em uma única solicitação. A ElevenLabs descreve-o como sua opção mais estável para geração de textos longos, embora essa afirmação represente o posicionamento da empresa, e não uma garantia independente para cada voz, escrita ou idioma.

O Multilingual v2 foi desenvolvido para trabalhos como narração, audiolivros, e-learning, dublagens corporativas e mídia localizada. Se o seu produto final for um vídeo com personagens falantes, a mesma dublagem também pode ser utilizada para um público mais amplo fluxo de trabalho de diálogo e sincronização labial.

O Eleven Multilingual v2 ainda estará ativo em 2026?

Sim. A partir de 11 de agosto de 2026, o ElevenLabs inclui o Multilingual v2 entre seus principais modelos de conversão de texto em fala. Ele não consta na tabela de modelos obsoletos da documentação. Esse é o status atual mais claro: ativo e documentado, mas não é mais o modelo de fala mais recente do ElevenLabs.

A data de lançamento é independente do status atual do produto. A ElevenLabs anunciou o Multilingual v2 em 22 de agosto de 2023. Um título de página que inclua “2026” deve se referir à data da análise, e não sugerir que o modelo foi lançado neste ano.

Esse posicionamento faz do Multilingual v2 uma opção de produção consolidada, e não um software abandonado. Isso também significa que, na hora de decidir pela compra, deve-se comparar seu perfil mais estável e de scripts mais longos com as vantagens específicas da v3 e do Flash v2.5.

Quais idiomas o Eleven Multilingual v2 suporta?

O ElevenLabs lista oficialmente 29 idiomas para o Multilingual v2:

  • Inglês, japonês, chinês, alemão, hindi e francês
  • coreano, português, italiano, espanhol, indonésio e holandês
  • turco, filipino, polonês, sueco, búlgaro e romeno
  • Árabe, tcheco, grego, finlandês, croata, malaio e eslovaco
  • dinamarquês, tâmil, ucraniano e russo

O suporte a idiomas não significa que todas as vozes soarão igualmente convincentes em todas as regiões. A ElevenLabs recomenda escolher uma voz cujo sotaque corresponda ao idioma e à região de destino. Isso é importante para o espanhol, o português, o inglês e outros idiomas com forte variação regional. Teste a voz e o roteiro exatos que você planeja publicar, em vez de considerar a lista de idiomas do modelo como uma garantia de sotaque.

Qualidade da voz: naturalidade, consistência e as evidências

O ElevenLabs descreve o Multilingual v2 como realista, sensível às emoções e consistente entre os idiomas. Essas são afirmações do fornecedor. Elas são úteis para compreender a posição pretendida pelo modelo, mas não devem ser confundidas com testes neutros.

As evidências independentes são mais limitadas. A Artificial Analysis listou o Multilingual v2 com cerca de 1.100,07 Elo em sua “Provider Voice Arena” quando verificado em 11 de agosto de 2026. A arena utiliza preferências de ouvintes emparelhadas e oito vozes de provedores em inglês dos EUA e do Reino Unido, divididas entre vozes masculinas e femininas. Trata-se de evidência transparente e específica do modelo para a preferência de voz em inglês; ela não comprova desempenho equivalente em todos os 29 idiomas, sotaques regionais ou roteiros longos.

A opinião do público é mista, mas a amostra é pequena demais para descrever a base de usuários como um todo. Em uma discussão de 2024, os comentaristas descreveram a v2 como mais realista do que a v1, embora também tenham relatado problemas ocasionais de consistência de sotaque. Outro usuário relatou um período breve de problemas de velocidade e consistência. Uma resposta posterior associada ao ElevenLabs recomendou a Multilingual v2 ou a Turbo v2 para trabalhos de formato longo mais consistentes. Essas postagens são sinais de alerta úteis, não dados de prevalência nem benchmarks controlados.

O que se pode afirmar com segurança?

  • O modelo continua a receber suporte oficial e está otimizado para discursos longos, estáveis e de alta qualidade.
  • Os dados independentes sobre a preferência pelo inglês conferem a ele um sinal externo confiável, dentro de um conjunto limitado de vozes em inglês.
  • A qualidade do sotaque depende do idioma, da região, da seleção de voz e do alfabeto — e não apenas do ID do modelo.
  • As verificações objetivas de áudio podem detectar truncamento, distorção, problemas de formato e anomalias de sincronização, mas não podem substituir a audição qualificada.
Caso prático de áudio 01

Consistência entre idiomas

O mesmo cenário foi gerado em inglês, espanhol e mandarim com a voz padrão do sistema. Cada reprodutor contém a primeira saída válida retida de acordo com a regra de teste congelada.

Inglês T02
Espanhol T02
Mandarim T02
0.8232Semelhança na incorporação de falantes entre o inglês e o espanhol
0.8867Semelhança na incorporação de falantes de inglês e mandarim
0.8822Semelhança na incorporação de falantes de espanhol e mandarim

Preste atenção ao seguinte: continuidade da identidade do falante e problemas evidentes de pronúncia. Um ouvinte qualificado de espanhol deve avaliar a autenticidade do sotaque separadamente.

Essas representações constituem um sinal de identidade auxiliar; elas não avaliam a naturalidade, a pronúncia, o sotaque, a prosódia nem a expressão emocional. Não havia nenhum grupo de calibração com falantes diferentes disponível.

Teste prático: cinco primeiras respostas válidas por meio da rota da API Anywhere

Testamos a rota HTTPS direta do Anywhere para o ID do modelo onze-multilíngue-v2. Esse formato de identificador não é o mesmo da API nativa ElevenLabs, que utiliza eleven_multilingual_v2. A rota disponibilizava uma interface de tarefas com o modelo e o prompt, mas não oferecia controles confiáveis para seleção de voz, estabilidade, similaridade, estilo, velocidade ou formato de saída. Por isso, todas as execuções utilizaram as configurações padrão da rota.

O lote pré-registrado continha cinco scripts: uma narração em inglês com 1.399 caracteres, o mesmo roteiro em inglês, espanhol e mandarim, e um teste de ênfase na pronúncia abrangendo nomes, datas, moedas, um número de telefone, um URL e siglas. Retivemos a primeira saída válida e reproduzível e não repetimos a execução para fins de qualidade.

Resultados da rota objetiva

Resumo da confiabilidade da rota

Todos os cinco scripts pré-registrados utilizaram a primeira saída válida e executável. A rota não disponibilizou controles de voz ou de geração; portanto, todas as execuções utilizaram os valores padrão.

5/5tarefas concluídas com sucesso na primeira tentativa
172,486 sáudio formal entregue
$0.2505custo da rota formal de retorno
5 arquivos MP3 válidosmono, 44,1 kHz, sem distorção

Âmbito: Esses números referem-se à rota “Anywhere”, e não à latência nativa do ElevenLabs nem à experiência do navegador GlobalGPT. As verificações de arquivos não avaliam a naturalidade, a emoção, o sotaque ou o ritmo local.

Todas as cinco tarefas formais foram bem-sucedidas na primeira tentativa e geraram arquivos MP3 mono decodificáveis a 44,1 kHz. Os arquivos não continham amostras cortadas nem saltos entre amostras adjacentes superiores a 0,8 na varredura local da forma de onda. Essas verificações confirmam a integridade dos arquivos; elas não avaliam a naturalidade.

Equilíbrio entre estabilidade de forma longa, emoção, pronúncia e latência

Roteiros longos

O limite máximo de 10.000 caracteres é generoso o suficiente para cerca de dez minutos de áudio, de acordo com a tabela de limites de caracteres do ElevenLabs. Para capítulos mais longos, divida-os em pontos naturais de parágrafo ou de cena, em vez de cortar em um número arbitrário de caracteres. A API fornece texto_anterior, próximo_texto, e campos de continuidade de ID de solicitação para ajudar os blocos adjacentes a se encaixarem.

Nosso teste comprova que um roteiro de 1.399 caracteres foi gerado como um arquivo válido na primeira tentativa pela rota “Anywhere”. Isso não comprova a estabilidade no limite máximo de 10.000 caracteres nem ao longo de um audiolivro inteiro.

Caso prático de áudio 02

Estabilidade a longo prazo

T01 — Narração em inglêsPrimeira saída válida · rota-padrão de voz
1.399 caracteresinserir narração
85,081 segundosáudio transmitido
Primeira data válidareprise sem qualidade
$0.1399custo da rota de retorno

Preste atenção ao seguinte: variação de ritmo entre as passagens inicial e final, pausas desajeitadas, cliques, distorções ou artefatos audíveis.

Resultado objetivo: O arquivo foi decodificado corretamente, sem amostras cortadas nem saltos entre amostras adjacentes acima de 0,8. A medição de tempo realizada pelo computador estimou 2,858 palavras/s na primeira metade e 2,670 na segunda, sem indícios de um aumento geral na velocidade na segunda metade.

Uma única execução não comprova a estabilidade no limite de 10.000 caracteres nem descarta problemas de ritmo locais que exijam a intervenção humana.

Configurações de emoção e estabilidade

Na API nativa ElevenLabs, uma estabilidade mais baixa permite maior variação, enquanto uma estabilidade mais alta pode tornar a exibição mais consistente e, potencialmente, mais monótona. O exagero no estilo pode adicionar expressividade, mas também pode reduzir a previsibilidade e aumentar o consumo de recursos computacionais. Trate esses controles como escolhas criativas, e não como melhorias universais de qualidade.

Pronúncia

O Multilingual v2 não oferece suporte a tags de fonemas. A ElevenLabs recomenda o uso de dicionários de pronúncia com aliases como solução alternativa. Normalize números ambíguos, abreviações, datas e URLs antes da geração e, em seguida, mantenha um pequeno script de regressão para nomes ou termos que sejam importantes para a sua marca.

Caso prático de áudio 03

Teste de acentuação na pronúncia

T03 — Nomes, números e siglasPrimeira saída válida · Custo da rota $0.0382
4 de julho de 2026Dra. Ana MartínezGLB-2048$1,250.75São PauloQuioto8h30.12 de setembro1-800-555-0199glbgpt.comAPI / TTS / UNESCOVersão 2.5 / 10 por cento

Ponto de verificação de compreensão auditiva: O reconhecimento de fala offline interpretou o número de telefone como “1-800-5555-0199”. Ouça com atenção o número original e a URL antes da publicação.

O dígito a mais não é um erro confirmado do TTS. O reconhecimento de fala pode apresentar erros; portanto, trata-se de um ponto de verificação para revisão, e não de um veredicto sobre a pronúncia.

Latência

O Multilingual v2 não é a opção de baixa latência do ElevenLabs. A ElevenLabs afirma que ele apresenta maior latência do que os modelos Flash. Os tempos de rota que medimos variaram de 10,161 a 31,489 segundos para as cinco tarefas formais, mas esses números incluem a rota da tarefa Anywhere, a rede, o tempo de fila e a entrega de arquivos. Eles não devem ser considerados como a latência nativa do modelo ElevenLabs.

Como usar a API do Eleven Multilingual v2

Configuração do desenvolvedor

Solicitação nativa da API ElevenLabs

Use o ID do modelo nativo eleven_multilingual_v2 no corpo do JSON e insira o ID da voz selecionada no endpoint.

POSThttps://api.elevenlabs.io/v1/text-to-speech/{voice_id}
Solicitação mínima via cURLSubstitua YOUR_VOICE_ID e use uma variável de ambiente para a chave
curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/YOUR_VOICE_ID" \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "Sua narração multilíngue vai aqui.",
    "model_id": "eleven_multilingual_v2",
    "voice_settings": {
 "stability": 0.5,
      "similarity_boost": 0,75,
 "style": 0,
 "use_speaker_boost": true,
 "speed": 1,0
    }
  }' \
  --output narration.mp3

Parâmetros e limites principais

ParâmetroO que ele controlaNota prática
voice_idVoz ElevenLabs selecionadaEscolha uma voz cujo sotaque seja adequado ao idioma e à região de destino.
model_idModelo de sínteseUso eleven_multilingual_v2.
estabilidadeVariação versus consistênciaOs valores mais baixos podem variar mais; os mais altos podem ficar mais contidos.
similarity_boostSemelhança com a voz de referênciaValores elevados podem ajudar na identificação, mas não a garantem em todas as línguas.
estiloExagero estilísticoUse com cuidado quando a repetibilidade for importante.
use_speaker_boostProcessamento adicional de similaridade entre locutoresPode aumentar a latência.
velocidadeVelocidade de reproduçãoVerifique novamente os números e a pontuação após alterá-los.
texto_anterior / próximo_textoContexto em torno de um trechoÚtil ao dividir scripts longos.
código_do_idiomaAplicação das normas linguísticasNão é compatível com modelos multilingual_v2 na referência atual da API.

Importante: Mantenha as chaves de API em uma variável de ambiente segura. Nunca cole uma chave real no código de um artigo público.

Preços da API Eleven Multilingual v2

A página de preços da API ’ElevenLabs” listava as versões Multilingual v2 e v3 em $0,10 por 1.000 caracteres conforme verificado em 11 de agosto de 2026. Impostos, taxas e direitos aduaneiros não estão incluídos.

Custo e acesso

Preços da API direta

De acordo com a taxa oficial de $0,10 por 1.000 caracteres para o Multilingual v2 e v3:

1 mil caracteres
$0.10
5 mil caracteres
$0.50
10 mil caracteres
$1.00
Preços da API ElevenLabs verificados em 11 de agosto de 2026. Impostos, taxas e direitos aduaneiros não estão incluídos.

API direta ou GlobalGPT?

RotaReferência de preçosComo você trabalhaMelhor custo-benefício quando
API ElevenLabs$0.10 / 1 mil caracteresSolicitações nativas, comandos de voz, configurações e uso medidoVocê precisa de controles para desenvolvedores e integração de produtos
O GlobalGPT utiliza seu próprio sistema de Créditos; portanto, essas assinaturas não representam uma conversão por personagem da tarifa da API do ElevenLabs. Compare os planos GlobalGPT.

Com essa tarifa, uma solicitação com tamanho máximo de 10.000 caracteres custa $1,00 antes dos impostos. O custo real do projeto depende da quantidade de texto gerado, da frequência com que você refaz a gravação e se você mantém as gravações que não deram certo. Elabore seu orçamento com base nos caracteres inseridos, e não nos minutos de áudio.

Para criadores que não precisam desenvolver um fluxo de trabalho com API nativa, o GlobalGPT oferece uma proposta de valor mais prática. Conforme verificado em 11 de agosto de 2026, seus planos anuais custavam $5,80 por mês para o plano Básico, $10,80 para o Pro e $25 para o Ilimitado, combinando vários modelos de IA e ferramentas criativas em uma única assinatura. O Gerador de áudio GlobalGPT inclui o Eleven Multilingual v2 e o Eleven v3 em um ambiente de trabalho no navegador, para que você possa gerar narrações e comparar os dois modelos sem precisar configurar uma solicitação de API primeiro.

O GlobalGPT utiliza seu próprio sistema de Créditos; portanto, esta não é uma comparação direta de preços por personagem com a API do ElevenLabs. No entanto, quando o áudio faz parte de um fluxo de trabalho mais amplo que envolve redação, pesquisa, imagens, vídeo ou vários modelos de IA, O GlobalGPT é a opção com melhor custo-benefício geral. Você pode Compare os planos GlobalGPT aqui.

Eleven Multilingual v2 x Eleven v3 x Flash v2.5

Guia de decisão

Qual modelo ElevenLabs você deve escolher?

Escolha o modelo mais adequado para o trabalho, em vez de se basear apenas na data de lançamento.

Escolha de artigo extenso

Multilíngue v2

Escolha: narração constante, fluxos de trabalho consolidados, cobertura em 29 idiomas e roteiros de até 10.000 caracteres.

Escolha de expressão

Onze v3

Escolha: interpretação dramática, obras com vários locutores e uma cobertura mais ampla, com mais de 70 idiomas.

Escolha rápida

Flash v2.5

Escolha: produtos ágeis, alto rendimento, solicitações de 40.000 caracteres e menor custo de API.

ModeloIdiomasLimite de caracteresÊnfase oficialMelhor ajuste
Multilíngue v22910,000Estabilidade a longo prazo e qualidade consistenteNarração, cursos, localização, fluxos de trabalho de voz já estabelecidos
Onze v370+5,000Fala expressiva e diálogo entre vários interlocutoresInterpretação, personagens, expressão dramática, maior variedade de linguagem
Flash v2.53240,000Latência do modelo de cerca de 75 ms e menor custo da APIProdutos interativos, taxa de processamento, solicitações mais demoradas, escalabilidade com foco no custo

O GlobalGPT também inclui o Eleven v3 no mesmo Gerador de Áudio. Execute o mesmo script curto nos dois modelos: use o Multilingual v2 como base para uma narração constante e, em seguida, compare com o v3 quando desejar uma interpretação mais expressiva. Seu próprio script é uma ferramenta de decisão mais eficaz do que uma demonstração genérica, pois revela os nomes, a pontuação, o ritmo e as mudanças de idioma que são importantes para o seu projeto.

Quem deve — e quem não deve — usar o Multilingual v2?

Bom caimento

  • Narradores que produzem cursos, vídeos explicativos, vídeos corporativos ou dublagens localizadas.
  • Equipes que já possuem um modelo de voz ElevenLabs validado e desejam um ID de modelo estável.
  • Projetos que exijam um dos 29 idiomas e alfabetos suportados e cuja extensão exceda o limite de 5.000 caracteres da versão 3.
  • Desenvolvedores que priorizam controles de voz nativos e campos de continuidade de blocos em detrimento da menor latência possível.

Procure em outro lugar quando

  • Se você precisa de uma atuação altamente expressiva, diálogos naturais entre vários interlocutores ou um idioma que não conste na lista de 29 idiomas, comece com o Eleven v3.
  • Se você está desenvolvendo um agente de voz responsivo ou um serviço de alto rendimento, avalie o Flash v2.5.
  • Você precisa de marcação no nível do fonema; o Multilingual v2 não oferece suporte a tags de fonema.
  • Você precisa de um sotaque regional garantido, sem precisar testar uma voz adequada e um roteiro real.
  • É necessário um julgamento subjetivo definitivo sobre a qualidade antes que um ouvinte qualificado analise suas línguas-alvo.

Perguntas frequentes

O Eleven Multilingual v2 ainda estará disponível em 2026?

Sim. O ElevenLabs o listou como um modelo emblemático de conversão de texto em fala e não o incluiu na tabela de modelos obsoletos quando verificado em 11 de agosto de 2026.

Quando foi lançada a versão 2 do Eleven Multilingual?

A ElevenLabs anunciou o Multilingual v2 em 22 de agosto de 2023. O “2026” nesta resenha refere-se à data da resenha, e não ao ano de lançamento.

Quantos idiomas o Eleven Multilingual v2 suporta?

Ele oferece suporte oficial a 29 idiomas, incluindo inglês, espanhol, chinês, japonês, alemão, francês, hindi, coreano, português, árabe e russo.

Qual é o ID do modelo Eleven Multilingual v2?

O ID do modelo da API ElevenLabs nativa é eleven_multilingual_v2. A rota de teste do Anywhere utilizou o identificador separado por hífen onze-multilíngue-v2.

Qual é o limite de caracteres?

O limite oficial por solicitação é de 10.000 caracteres, o que, segundo a ElevenLabs, equivale a cerca de dez minutos de áudio.

O Multilingual v2 é melhor que o Eleven v3?

Nenhuma das duas é universalmente melhor. A versão multilíngue v2 é a opção mais estável e de uso mais duradouro; a v3 oferece cobertura de idiomas mais ampla, uma reprodução mais expressiva e recursos para múltiplos locutores.

O Multilingual v2 é adequado para narrações longas?

A ElevenLabs o posiciona como seu modelo de formato longo mais estável. Nosso teste de rota com 1.399 caracteres foi concluído com sucesso, mas essa única execução não comprova a estabilidade para um livro inteiro ou para 10.000 caracteres.

Posso definir um código de idioma na API?

A referência atual da API Create Speech diz o seguinte: código_do_idioma não é compatível com modelos multilingual_v2.

O Multilingual v2 oferece suporte a tags de fonemas?

O nº ElevenLabs recomenda dicionários de pronúncia com sinônimos quando for necessário controlar a pronúncia de nomes ou termos especializados.

Quanto custa a API?

A ElevenLabs listou o Multilingual v2 a $0,10 por 1.000 caracteres em 11 de agosto de 2026, excluindo impostos, taxas e direitos aduaneiros.

Veredicto final

O Eleven Multilingual v2 conquista um lugar de destaque na linha ElevenLabs de 2026: é a escolha consolidada para narração multilíngue consistente, um fluxo de trabalho de voz comprovado e solicitações de até 10.000 caracteres. No entanto, não é a escolha automática para todos os projetos de TTS. O Eleven v3 é o ponto de partida mais sólido para interpretações expressivas e um leque mais amplo de idiomas, enquanto o Flash v2.5 foi projetado para oferecer velocidade e escalabilidade.

Nosso teste objetivo proporciona uma confiança útil quanto à confiabilidade da rota e à integridade dos arquivos: todas as cinco tarefas formais do Anywhere foram concluídas na primeira tentativa, produziram arquivos MP3 válidos em mono a 44,1 kHz e permaneceram dentro do limite de custo pré-registrado. Isso não substitui a audição humana; portanto, não atribuímos uma pontuação subjetiva de naturalidade, emoção ou sotaque com base apenas nas verificações automáticas.

Traga um parágrafo da sua próxima narração, aula ou vídeo localizado para Gerador de áudio do GlobalGPT. Comece com o Eleven Multilingual v2, mantenha a voz e o roteiro consistentes e compare-o com o Eleven v3 quando a expressividade for importante. Essa é uma maneira direta e prática de escolher o modelo mais adequado para o seu trabalho.

Compartilhe a postagem:

Publicações relacionadas