Análise do ElevenLabs Music v2: Desempenho real, API e prompt

elevenlabs-music-v2-resenha-hero-3x2-v2

A música gerada por IA está evoluindo rapidamente, e o ElevenLabs Music v2 é um dos modelos mais ambiciosos para a geração de novas músicas. Mas será que ele consegue preservar as letras fornecidas, seguir um arranjo detalhado e produzir uma faixa utilizável sem precisar de muitas edições?

Testamos o serviço com três briefs originais de 90 segundos: uma música vocal de synth-pop, uma faixa instrumental cinematográfica e um arranjo de pop alternativo em oito partes. Esta análise aborda o áudio, a conformidade com as instruções, o tempo de geração, o custo informado pela tarefa, os controles oficiais e o acesso à API.

Resposta rápida: O ElevenLabs Music v2 é bom?

NOSSO VEREDITO RESUMIDO

O ElevenLabs Music v2 se destacou quando o briefing exigia letras explícitas e controle por seções. O programa gerou todos os três arquivos de 90 segundos solicitados, manteve as palavras fornecidas intactas em nosso teste de letra e tornou as oito seções da música solicitadas fáceis de ouvir.

Não foi tão preciso nos detalhes: um impacto instrumental ocorreu antes do solicitado, uma pausa instrumental se prolongou e a música estruturada terminou mais como um fade do que com o acorde final nítido indicado na instrução.

  • Resistência máxima observada: letra e estrutura musical audível.
  • Principal limitação: O sincronismo e as instruções finais nem sempre foram precisos.
  • Escopo do teste: três execuções controladas da API, e não um benchmark do setor.

O ElevenLabs Music v2 também está disponível por meio do gerador de áudio do GlobalGPT. Essa opção reúne vários modelos de áudio e IA em uma única conta, evita a necessidade de configurar uma VPN ou provedor separado e pode reduzir o custo de manutenção de várias assinaturas independentes.

Visão geral do ElevenLabs Music v2

Antes de analisarmos nossos resultados, é importante distinguir o conjunto de características publicado do modelo daquilo que essas três instruções realmente conseguem comprovar.

O que é o ElevenLabs Music v2?

A ElevenLabs lançou o Music v2 em 26 de maio de 2026 como um modelo aprimorado de geração musical para canções e faixas instrumentais. A empresa afirma que esta versão aprimora os vocais, a instrumentação, o arranjo, o suporte multilíngue, a densidade na interpretação das letras, as transições entre gêneros e o preenchimento de lacunas.

O Music v2 é a base do ElevenMusic, do ElevenAPI e do ElevenCreative. Por meio da API, os desenvolvedores podem gerar faixas programaticamente, editar uma região selecionada com a técnica de inpainting e trabalhar com correspondência de referência.

ID DO MODELO
music_v2
DURAÇÃO MÁXIMA
5 minutos
TAXA DE API PUBLICADA
$0,15/minuto
SAÍDA DE ÁUDIO
44,1 kHz
TAXA DE TRANSMISSÃO PUBLICADA
128–192 kbps
ACESSO À API
Usuários pagos
Página oficial de lançamento do “Introducing Music v2” do ElevenLabs
Página oficial de lançamento do ’Music v2” do ElevenLabs, consultada em agosto de 2026.

Resultados do teste do ElevenLabs Music v2

Utilizamos três execuções controladas da API com uma meta fixa de 90 segundos. O GPT gerou os conjuntos de letras originais uma vez em nossa plataforma, e nós os congelamos antes de testar o Music v2. As anotações de audição foram verificadas em cruz com a análise de áudio do Gemini 3.6 Flash. Os tempos abaixo correspondem ao tempo local de geração de ponta a ponta; os custos são os valores relatados pelas tarefas concluídas.

Teste 1: Música pop com letra fornecida

TESTE 01Música pop com letra incluída
Meta de 90 segundos112 BPMUm menorVoz de contralto

Configuração da tarefa: Crie uma música contemporânea de synth-pop sobre duas pessoas que estão deixando a cidade tarde da noite, utilizando exatamente as palavras fornecidas. Avaliamos a fidelidade à letra, a clareza vocal, a força do refrão, o arranjo e o acorde final solicitado.

Mostrar o prompt completo para copiar
Crie uma música de synth-pop contemporânea totalmente original, com 90 segundos de duração e um vocal principal em tom de contralto, quente e expressivo. Use 112 BPM e a menor. O clima deve ser esperançoso, íntimo e cinematográfico. Comece com um piano elétrico abafado e uma batida suave de sintetizador analógico. Adicione um baixo redondo e uma bateria eletrônica precisa no primeiro verso, crie tensão no pré-refrão e abra caminho para um refrão amplo e memorável com harmonias de fundo contidas. Mantenha a voz principal clara e centralizada, com separação nítida entre os instrumentos. Sem introdução falada, rap, sons de multidão, imitação de um artista real ou fade-out. Termine com um acorde final claro.

Interprete exatamente a letra abaixo. Não adicione, remova, substitua ou reordene palavras ou seções.

[Verso 1]
As luzes da cidade se desvanecem atrás de nós
Ruas silenciosas agora nos guiam
Sussurros da meia-noite, sem olhar para trás
Um novo horizonte rompe o cinza
[Pré-refrão]
De mãos dadas, caminhamos rumo ao desconhecido
Perseguindo sonhos que chamamos de nossos
[Refrão]
Estamos vivos na noite silenciosa
Encontrando estrelas além do horizonte
Perdidos nas sombras, mas tão brilhantes
Juntos, vamos redefinir
[Verso 2]
Passos suaves em ruas vazias
Cada respiração, uma história contada
Sem promessas, apenas céus infinitos
Em seus olhos, o futuro se revela
[Refrão final]
Estamos vivos na noite tranquila
Encontrando estrelas além do horizonte
Perdidos nas sombras, mas tão brilhantes
Juntos, vamos redefinir
Resultado do Teste 01Forte consistência nas letras, com uma introdução eletrônica mais longa
90,0 sSAÍDA
42,0 sTEMPO DE GERAÇÃO
$0.225RESPONSABILIDADE PELA TAREFA
  • Não há desvio claro na letra foi detectado nas palavras fornecidas.
  • O resultado final apresentava um estilo synth-pop eletrônico refinado e uma separação nítida entre vocais e instrumentos.
  • A introdução pareceu mais longa do que o solicitado antes da entrada do vocal.

Teste 2: Instrumental cinematográfico

TESTE 02Instrumental Cinematográfico
Meta de 90 segundos82 BPMRé menorSem vocais

Configuração da tarefa: Crie uma trilha sonora de ficção científica baseada em um tema reconhecível de piano com feltro, com um crescendo orquestral gradual, metais apenas no terço final, sem textura de voz humana e com um final conclusivo.

Mostrar o prompt completo para copiar
Crie uma trilha instrumental cinematográfica totalmente original de 90 segundos para uma cena dramática de exploração de ficção científica. Use 82 BPM e D menor. Sem vocais, falas, sussurros, coro ou sons semelhantes à voz humana. Comece suavemente com um motivo discreto de piano com feltro e cordas graves sustentadas. Introduza uma batida analógica sutil após a abertura e, em seguida, desenvolva gradualmente com camadas de cordas e percussão grave contida. Adicione metais apenas no terço final. Alcance um clímax emocional claro perto do final, sem volume excessivo ou distorção. Mantenha o motivo de piano reconhecível e preserve uma separação clara entre piano, cordas, percussão, pulso de sintetizador e metais. Use timbres orquestrais realistas com uma mixagem espaçosa, porém controlada. Evite efeitos de impacto típicos de trailers na primeira metade. Não imite nenhuma trilha sonora, compositor ou franquia já existente. Termine com um acorde sustentado e resolvido, em vez de um fade-out.
Resultado do Teste 02Uma construção cinematográfica convincente, com um impacto logo no início
90,0 sSAÍDA
20,9 sTEMPO DE GERAÇÃO
$0.225RESPONSABILIDADE PELA TAREFA
  • Sem textura semelhante à voz foi detectado.
  • O tema do piano continuava reconhecível à medida que o arranjo se desenvolvia em torno dele.
  • Um impacto ocorreu antes do previsto no cronograma, prejudicando o cumprimento rigoroso dos prazos.

Teste 3: Estrutura de uma canção em oito partes

TESTE 03Estrutura de uma canção em oito partes
Meta de 90 segundos104 BPMRé maiorOrdem das seções corrigida

Configuração da tarefa: Crie uma música de pop alternativo com oito seções distintas, na seguinte ordem fixa: Introdução, Verso, Pré-refrão, Refrão, Interlúdio instrumental, Ponte, Refrão final e Outro.

Mostrar o prompt completo para copiar
Crie uma música de pop alternativo totalmente original, com duração de 90 segundos, com um vocal principal de tenor claro e expressivo. Use 104 BPM e tom de Ré maior, com produção moderna de pop alternativo, pronúncia natural e efeitos vocais moderados. Sem narração falada, rap, imitação de um artista real ou fade-out. Mantenha exatamente essa ordem das seções e faça com que cada mudança na produção seja audível: Introdução — cerca de 6 segundos, apenas guitarra elétrica com filtro e sintetizador distante; Verso — adicione baixo sem efeito e percussão com batida no aro do tambor; Pré-refrão — adicione um pad crescente sem bateria completa; Refrão — introduza a bateria completa, sintetizadores mais amplos e um gancho melódico claro; Pausa instrumental — cerca de 8 segundos, repita a melodia do refrão sem vocais; Ponte — reduza para piano e um vocal íntimo e próximo; Refrão final — restaure a banda completa, adicione harmonias de apoio e uma linha de guitarra em oitava, e torne-o mais grandioso do que o primeiro refrão; Outro — remova a bateria, volte à guitarra com filtro e termine com um acorde final limpo.

Interprete exatamente a letra abaixo. Não adicione, remova, substitua, reordene nem cante as instruções instrumentais entre parênteses como se fossem letra.

[Intro]
(Instrumental)
[Verso]
Mostradores rachados zumbem uma melodia quebrada
Os dedos traçam as linhas desbotadas
Sussurros estáticos enchem a sala
Procurando entre os sinais emaranhados
[Pré-refrão]
Sinais piscam, som indistinto
Esperando por uma voz profunda
[Refrão]
Você consegue me ouvir em meio ao barulho?
Um chamado distante, uma escolha frágil
A estática se dissipa, uma voz mais clara
Segure firme, vamos encontrar o ruído
[Interlúdio instrumental]
(Instrumental)
[Ponte]
Esperança frágil na luz fragmentada
Ecos suaves, eles me puxam para perto
No silêncio, você aparece
[Refrão final]
Você consegue me ouvir em meio ao barulho?
Um chamado distante, uma escolha frágil
A estática se dissipa, uma voz mais clara
Segure firme, vamos encontrar o barulho
[Outro]
Sussurros se transformam em música
Estamos onde pertencemos
Resultado do Teste 03O resultado estrutural mais evidente, mas sem um controle perfeito do tempo
90,0 sSAÍDA
20,9 sTEMPO DE GERAÇÃO
$0.225RESPONSABILIDADE PELA TAREFA
  • Todas as oito seções foram fáceis de identificar, com um forte contraste entre o bridge e o refrão final.
  • O intervalo instrumental durou mais do que os oito segundos solicitados.
  • O final soou mais como um fade do que como o acorde final nítido descrito na instrução.

O que os três testes revelam

Conclusões sobre o desempenho

3/3Resultados úteis

Cada execução gerou um arquivo de 90 segundos reproduzível que se encaixava na tarefa musical em geral.

1Passagem com letra clara

As letras de músicas pop fornecidas não apresentaram nenhum desvio evidente em nossas verificações auditivas.

8Seções audíveis

A estrutura fixa da música facilitou a identificação de todas as seções solicitadas.

  • Vocal: nítidas, centralizadas e bem separadas do fundo eletrônico no Teste 1.
  • Composição instrumental: O motivo de piano e o desenvolvimento controlado na Prova 2 demonstraram que o modelo é capaz de lidar com mais do que apenas música pop vocal.
  • Controle de prompt: A estrutura geral se mostrou mais consistente do que a sincronização em nível de quadro; introduções, intervalos, momentos de impacto e finais ainda merecem uma revisão manual.
  • Carga de edição: Nenhuma das três versões estava imprópria para uso, mas os Testes 2 e 3 precisariam de pequenas alterações no arranjo para atender aos requisitos rigorosos da entrega em produção.

Conclusões sobre eficiência

Tempo de geração em três execuções de 90 segundos
Vocal pop
42,0 s
Instrumental
20,9 s
Canção em oito partes
20,9 s

Tempo médio de geração local de ponta a ponta: 27,9 segundos. O tempo local inclui o processamento da solicitação, a verificação periódica e o atraso de rede; não se trata da latência do provedor.

  • Produção total: 270 segundos distribuídos por três arquivos.
  • Valor total declarado na tarefa: $0.675.
  • Custo por execução: $0,225 por 90 segundos, o que equivale a 1,5 minuto × a taxa oficial da API de $0,15 por minuto.
  • Sem reprises: Todas as três tarefas concluídas produziram áudio utilizável logo na primeira tentativa de gravação.

Como acessar o ElevenLabs Music v2

Acesso por meio do ElevenLabs

Acesso por meio de GlobalGPT

  • Use o Music v2 junto com outros modelos de áudio e IA em uma única conta.
  • Não é necessária nenhuma configuração separada de VPN ou provedor.
  • A manutenção de uma única plataforma pode custar menos do que a de várias assinaturas independentes.
  • Você pode mudar para outro modelo sem precisar reconstruir toda a sua pilha de ferramentas.
Experimente o gerador de áudio GlobalGPT

Acesso à API e controles disponíveis

O SDK oficial disponibiliza o modelo por meio de elevenlabs.music.compose com model_id="music_v2". Uma solicitação básica pode definir uma linguagem natural prompt e duração_da_música_em_ms. Os planos de composição proporcionam uma estrutura de seções mais precisa, um controle mais preciso do tempo das letras e um maior controle do arranjo.

  • Geração: criar uma música completa ou uma faixa instrumental a partir de uma sugestão.
  • Resposta detalhada: solicitar mais informações sobre a composição gerada.
  • Transmissão: começar a ouvir o áudio sem esperar que o arquivo seja baixado por completo.
  • Preenchimento: regenerar uma região selecionada, em vez de substituir a faixa inteira.
  • Correspondência de referências: orientar uma geração com material de referência, quando for o caso.

Sugestões que mencionem artistas, músicas ou letras protegidas por direitos autorais podem acionar um bad_prompt ou plano_de_composição_inadequado resposta. Descreva os atributos musicais, em vez de perguntar qual é o estilo exato de um artista vivo.

Exemplo de solicitação de API

SDK do PythonModelo: music_v2
import os
from elevenlabs import ElevenLabs, save

client = ElevenLabs(api_key=os.environ["ELEVENLABS_API_KEY"])

audio = client.music.compose(
    model_id="music_v2",
    prompt=(
 "Crie uma música instrumental cinematográfica original com piano suave, "
 "cordas graves, um crescendo gradual e um acorde final resolvido."
    ),
    music_length_ms=90_000,
)

save(audio, "music-v2-test.mp3")

Mantenha a chave da API em uma variável de ambiente, e não dentro do script. Para um aplicativo em produção, adicione registro de solicitações, limites de repetição de tentativas e um limite de custo bem definido antes de gerar faixas longas.

Preços e custo do nosso teste

ItemValor verificadoO que isso significa
Tarifa oficial da API de música$0,15 por minutoPublicado em Página de preços da API ElevenLabs, excluindo impostos, taxas e direitos aduaneiros.
Duração máxima5 minutosComprimento máximo publicado para uma solicitação de música.
Nossa tarefa de 90 segundos$0.2251,5 minutos × $0,15; relatado por cada tarefa de teste concluída.
Nosso total nas três provas$0.675Três exibições de 90 segundos; sem custo de repetição incluído.

A tarifa unitária em nosso registro de teste corresponde à tarifa oficial da API. O valor do GlobalGPT, neste caso, está no acesso consolidado e na redução do número de assinaturas separadas — e não em um preço por minuto mais baixo e comprovado do Music v2.

Como usar o ElevenLabs Music v2

O Music v2 apresentou o melhor desempenho quando o briefing separou o objetivo musical das restrições inegociáveis. Elabore sua solicitação nesta ordem:

1SaídaMúsica ou instrumental, além da duração.
2Estrutura musicalGênero, clima, andamento, tonalidade e tipo de voz.
3AcordoAbertura, mudanças de seção, clímax e final.
4Prioridades mistasPosição vocal, separação, intensidade sonora e espaço.
5ExclusõesSem fala, sem fade, sem público ou sem textura de voz.
6Letra e estruturaRótulos das seções e se as palavras podem mudar.

Termos úteis da música em inglês

Clique em qualquer termo ou descritor para copiá-lo. Exemplo: voz principal calorosa e intimista, com dicção clara.

01Letra da primeira música popPara uma música com voz original usando exatamente as suas palavras
03Fundo musicalPara vídeos, podcasts, demonstrações de produtos ou cafés
Leia mais