Um único modelo pode construir todo o cenário sonoro.
O Seed Audio 1.0 é capaz de combinar voz, efeitos sonoros, ambiente, sincronização e música instrumental. Nossos testes revelaram um potencial criativo excepcionalmente alto — e um problema de repetibilidade que você não deve ignorar.
O Seed Audio 1.0 é um dos primeiros modelos de áudio que testei que parece ter sido projetado em torno de uma cena completa, em vez de um único tipo de saída. Ele é capaz de falar, atuar, adicionar ambiente sonoro, criar efeitos sonoros (Foley), inserir diálogos em uma linha do tempo e produzir música instrumental a partir de um único comando.
O veredicto resumido: O Seed Audio 1.0 oferece um potencial excepcionalmente alto para a criação unificada de áudio, especialmente para diálogos sincronizados e cenas sonoras cinematográficas. Seu ponto fraco é a repetibilidade. Uma execução bem-sucedida pode soar notavelmente completa, enquanto outra execução a partir do mesmo prompt pode apresentar fala distorcida, omitir um evento ou alterar a voz solicitada.
Gerei 23 amostras com trilha sonora por meio do ambiente de teste Anywhere/BrolyAI. Juntas, elas abrangeram narração, diálogos entre dois personagens, falas com marcação de tempo, sequências apenas com efeitos sonoros, cenas com voz e música, música independente, performance multilíngue, monólogos de dois minutos e continuação de áudio de referência.

Análise do Seed Audio 1.0: o veredicto rápido

| Categoria | Resultado dos nossos testes |
|---|---|
| Voz expressiva | Alta qualidade na melhor corrida, mas inconsistente nas repetições |
| Diálogo com vários interlocutores | Roteiros precisos e excelente separação entre os falantes |
| Sincronização do diálogo | A característica mais confiável em nosso conjunto de testes |
| Efeitos sonoros | Espaço realista e ordem dos eventos; apresenta dificuldades na contagem exata dos eventos |
| Voz + efeitos sonoros + música | Cenas completas e convincentes, nas quais todos os eventos esperados ocorrem |
| Música independente | Mais eficiente do que o esperado; gerou sinais estruturados de 30 segundos |
| Voz multilíngue | Excelente no melhor dos casos, mas em uma das duas execuções houve um trecho de fala a mais |
| Áudio de dois minutos | Identidade de voz marcante e coerência narrativa em ambas as execuções |
| Áudio de referência | Não se mostrou confiável em nosso ambiente de teste; a semelhança de voz foi baixa |
Melhor para: criadores que produzem dramas radiofônicos, cenas de jogos, conceitos de podcasts, protótipos cinematográficos e storyboards com foco no áudio.
Menos indicado para: tarefas que exigem formulações determinísticas, contagens exatas de eventos repetidos ou clonagem confiável de voz a partir de uma única geração automática.
O que é o Seed Audio 1.0?

O Seed Audio 1.0 é o modelo unificado de criação de texto para áudio da ByteDance Seed. Em vez de tratar a fala, o ambiente, os efeitos e a música como tarefas separadas, ele é capaz de gerá-los juntos como uma única cena sonora. A página oficial do produto informa que ele suporta sincronização de diálogos em intervalos de 100 milissegundos e pode gerar até dois minutos em uma única execução.
Esse design unificado é o verdadeiro destaque. Uma instrução pode descrever quem fala, como soa a voz, o que acontece na sala, quais efeitos são inseridos posteriormente e que tipo de música acompanha a cena. Quando bem executado, o resultado soa como uma composição coesa, e não como algo remendado.
Há uma distinção importante. O próprio roteiro da ByteDance indica que a sincronização detalhada concentra-se, atualmente, principalmente nos diálogos dos personagens. O controle mais preciso sobre efeitos sonoros, ambiente sonoro e música continua sendo uma área a ser desenvolvida. Nossos testes confirmaram essa distinção: a sincronização dos diálogos foi excelente, enquanto a precisão na contagem dos efeitos sonoros (Foley) foi menos confiável.
Fontes oficiais consultadas em 6 de agosto de 2026:
- Página do produto Seed Audio 1.0
- Apresentação do ByteDance Seed
- Documentação da API do BytePlus Audio 1.0
- Preços do BytePlus Audio 1.0
Como testamos o Seed Audio 1.0
Elaboramos nove tarefas e executamos 23 gerações avaliadas. A maioria dos testes de capacidade utilizou duas ou três repetições, pois uma amostra aperfeiçoada diz muito pouco sobre a confiabilidade da produção.
| Teste | Tarefa | Corridas |
|---|---|---|
| T01 | Narração expressiva em inglês | 3 |
| T02 | Diálogo de rádio entre dois personagens | 3 |
| T03 | Diálogo aos 0, 4 e 9 segundos | 3 |
| T04 | Sequência no corredor com apenas efeitos especiais | 2 |
| T05 | Voz, efeitos sonoros de ambiente, efeitos sonoros e música | 3 |
| T06 | Música instrumental independente | 3 |
| T07 | Um caractere em inglês, japonês e alemão | 2 |
| T08 | Monólogo de podcast de 120 segundos | 2 |
| T09 | Continuação de uma narração de referência | 2 |
Os 23 resultados planejados continham cerca de 12,5 minutos de áudio gerado e registraram $1.7504 em custo de geração upstream no ambiente de teste. O Seed Audio não informou o uso de tokens de texto. O faturamento foi baseado nos segundos gerados; portanto, os tokens de geração foram registrados como “não aplicável”.
Todas as saídas avaliadas eram arquivos WAV PCM estéreo de 40 kHz e 16 bits. Quando a reprodução automatizada direta não estava disponível, o Gemini 3.6 Flash recebia os arquivos WAV como entrada de áudio e retornava transcrições estruturadas, verificações de eventos, estimativas de tempo e notas sobre artefatos. Essas avaliações são análises auditivas automatizadas, e não pontuações MOS feitas por humanos.
Geração de voz: agudos impressionantes, repetibilidade irregular
T01 · Narração expressiva
Alta variânciaUma das falas parecia alucinada e exagerada, outra soava forçada e a terceira era natural e completa.
Prompt utilizado
Uma narradora, com voz calma, profere duas frases exatas, passando da preocupação à confiança. Sem música nem efeitos sonoros.
A orientação para a narração solicitava que uma locutora com voz calma proferisse duas frases exatas, passando de uma preocupação contida para uma confiança crescente, sem nenhum som de fundo.
As três execuções se comportaram de maneira muito diferente:
- Corrida 1: proferiu a sentença solicitada e, em seguida, continuou com vários segundos de discurso confuso e improvisado.
- Corrida 2: disse exatamente o mesmo texto, mas soou devagar e entrecortado.
- Corrida 3: interpretou o roteiro completo com naturalidade, mantendo o melhor ritmo e a consistência na voz.
Esse é o ponto central desta análise. O Seed Audio 1.0 é capaz de produzir um resultado de voz de alta qualidade, mas uma única execução não é suficiente para trabalhos em que a redação é fundamental. Gere alternativas e ouça todo o resultado final antes de publicar.
O modelo respeitou as instruções negativas nas três execuções da narração: não foram detectados música, efeitos sonoros nem ruídos de fundo indesejados.
Diálogo com vários personagens e separação de falantes
T02 · Peça de rádio com dois personagens
3/3 roteiros exatosTodos os três roteiros estavam idênticos. O som ambiente e a duração da introdução variaram entre as tomadas.
Prompt utilizado
Maya sussurra, Eli responde com calma, e o zumbido da geladeira acompanha as três falas fixas do diálogo.
Nossa cena na loja de conveniência contava com dois personagens adultos e três falas fixas. Maya precisava sussurrar com tensão, enquanto Eli tentava parecer calmo. O único efeito de fundo solicitado era um zumbido sutil de geladeira.
Todas as três execuções reproduziram o diálogo na ordem correta, com duas vozes distintas. A melhor execução combinou falas precisas, separação nítida entre os interlocutores, emoção convincente e um zumbido contínuo da geladeira.
As outras execuções apresentaram pequenos problemas no nível da cena. Em uma delas, cerca da metade dos 30 segundos de duração foi dedicada ao som ambiente antes do início do diálogo. Em outra, o zumbido da geladeira solicitado foi omitido. Nenhum dos erros prejudicou a cena falada, mas ambos reduzem a eficiência da edição.
No caso de dramas em áudio, o resultado prático é animador: o Seed Audio compreende as mudanças de personalidade dos personagens e o contraste vocal. Talvez ainda seja necessário cortar introduções muito longas ou gerar novamente o som ambiente adequado.
A sincronização dos diálogos foi o resultado mais positivo
T03 · Tempo no nível do prompt
Mais confiávelTodas as três execuções posicionaram as linhas próximas aos pontos solicitados, dentro da incerteza de tempo do avaliador.
Prompt utilizado
Coloque três linhas de rádio nos instantes 0,0; 4,0 e 9,0 segundos, com locutores do tipo homem/mulher/homem.

O teste de temporização exigiu três linhas de rádio:
- “Unidade sete, informe-se.” aos 0,0 segundos.
- “Entrada norte segura.” aos 4,0 segundos.
- “Mantenha a posição.” aos 9,0 segundos.
Em todas as três execuções, as linhas, a ordem e o padrão de falantes (homem-mulher-homem) estavam corretos. As estimativas de áudio do Gemini situaram os inícios das execuções repetidas em torno de 0,1, 4,0 e 9,0 segundos. A primeira repetição foi estimada em aproximadamente 0,1, 3,9 e 8,9 segundos.
Essas medições não devem ser apresentadas como prova de precisão de 100 milissegundos com nível de laboratório — o próprio avaliador indicou uma incerteza de aproximadamente 0,1 segundo. Mesmo com essa ressalva, essa foi a funcionalidade mais repetível que testamos. Se você precisa que os diálogos sejam inseridos em posições próximas às previstas na linha do tempo, o Seed Audio 1.0 é excepcionalmente promissor.
Geração de efeitos sonoros: cenas realistas, contagem imperfeita
T04 · Corredor apenas com efeitos sonoros
Falha na contagemO espaço e a ordem eram convincentes, mas as duas passagens produziram quatro passos e dois passos.
Prompt utilizado
Chaves, uma porta pesada, exatamente três passos, um estrondo e uma batida final. Nenhuma voz nem música.
A instrução, que previa apenas efeitos sonoros, descrevia um pequeno corredor com piso de azulejos: chaves perto do microfone, uma pesada porta de madeira se abrindo, três passos lentos se afastando, um trovão distante e, por fim, o barulho de uma porta batendo. Não era permitido usar fala nem música.
Ambas as saídas criaram um espaço acústico convincente, preservaram a sequência dos eventos e evitaram o vazamento de vozes ou música. Os efeitos foram considerados realistas, com boa sensação de distância e consistência do ambiente.
Nenhuma das duas execuções seguiu a contagem exata. Uma produziu quatro passos; a outra, dois. Isso torna o Seed Audio útil para gerar um conceito de efeitos sonoros convincente, mas menos confiável quando um editor precisa exatamente de três impactos, batidas, passos ou tiros.
O melhor fluxo de trabalho consiste em usar a geração de efeitos sonoros (SFX) em uma única passagem para criar a atmosfera e fazer a prototipagem rápida e, em seguida, substituir ou editar eventos em que o tempo é fundamental em uma DAW.
Voz, ambiente, efeitos sonoros e música em uma única cena
T05 · Mixagem cinematográfica completa
2/3 concluídoDuas das três tentativas completaram todas as jogadas. Uma delas não conseguiu acertar o golpe final no metal.
Prompt utilizado
Beco chuvoso, tráfego, sirene, sussurro do detetive, pulsação de cordas, passos rápidos e batida metálica.

O teste de cena completa foi deliberadamente repleto de elementos. Exigia um beco noturno molhado, gotas de água, tráfego, uma sirene de polícia em movimento, uma fala sussurrada do detetive, cordas contidas, passos rápidos e o barulho metálico de uma porta batendo.
Duas das três execuções incluíram a sequência completa do evento. O diálogo permaneceu nítido em meio ao ruído de fundo e à música, e a cena transmitiu uma sensação de coerência espacial, em vez de parecer uma sucessão de clipes desconexos sobrepostos. Uma das execuções não reproduziu o barulho metálico final, embora, fora isso, tenha criado a atmosfera correta e reproduzido a fala exatamente como deveria.
É nesse ponto que o modelo unificado se destaca com mais força. Para a criação de storyboards e ideias criativas, gerar uma cena mista completa a partir de um único prompt é mais rápido e mais expressivo do que obter cada componente separadamente. Para a produção final, os detalhes importantes ainda precisam ser verificados.
O Seed Audio 1.0 consegue gerar música?
T06 · Música independente
Obras musicaisTodos os três criaram música estruturada. Um deles fez com que o som abafado do piano fosse difícil de distinguir.
Prompt utilizado
Uma trilha de suspense a 72 BPM com ostinato de violoncelo, piano com surdina, drone analógico, crescendo e final em aberto.

Sim. Em nossos testes, o Seed Audio 1.0 gerou música instrumental autônoma e reconhecível, em vez de apenas uma textura ambiente vaga.
A solicitação pedia uma trilha de suspense de 30 segundos a 72 BPM com um ostinato grave de violoncelo, pulsos suaves de piano com sordina, um drone analógico suave, um crescendo claro e um acorde final não resolvido. Todas as três versões formaram uma trilha musical coerente, com a sensação de andamento e o final solicitados. Duas delas incluíam todos os elementos solicitados; em uma delas, o piano com sordina era difícil de distinguir.
Isso não significa, automaticamente, que o Seed Audio substitua um gerador de músicas dedicado. Nossa tarefa era criar uma curta sequência instrumental cinematográfica, e não uma música com verso e refrão e letra. Ainda assim, a capacidade musical é substancial o suficiente para dar suporte a cenas de jogos, trailers, podcasts e pré-visualização — especialmente quando a música precisa interagir com diálogos e design de som na mesma geração.
Desempenho multilíngue: excelente no melhor dos casos, fraco no pior dos casos
T07 · Uma voz, três idiomas
1/2 limpoUma execução foi impecável; a outra apresentou repetições e distorções na fala em torno da mudança de idioma.
Prompt utilizado
Uma personagem feminina fala inglês, japonês e alemão com a mesma identidade e a mesma serenidade.

A tarefa multilíngue consistia em pedir a uma personagem feminina que interpretasse o mesmo papel no estúdio de gravação em inglês, japonês e alemão. Duas gravações produziram impressões opostas.
A execução mais bem-sucedida reproduziu as três frases com precisão, manteve o mesmo tom de voz, preservou a emoção serena e utilizou pausas bem definidas. A execução menos bem-sucedida começou corretamente em inglês, mas depois repetiu e distorceu a fala na seção em japonês, além de prejudicar a abertura em alemão. A percepção de consistência da voz entre os idiomas caiu drasticamente.
Isso significa que o Seed Audio 1.0 é capaz de produzir performances convincentes de personagens multilíngues, mas o recurso requer vários candidatos e uma revisão que leve em conta os diferentes idiomas. Não aprove uma saída multilíngue verificando apenas o primeiro idioma.
Geração em dois minutos e estabilidade de áudio em formato longo
T08 · Monólogo de 120 segundos
2/2 estávelAmbos os arquivos duraram 120 segundos com uma voz estável. Um deles apresentou uma breve falha na pronúncia.
Prompt utilizado
Um apresentador de podcast conta uma história bem estruturada sobre uma estação meteorológica, com três descobertas e sem contextualização.

Ambas as tarefas de formato longo geraram arquivos WAV com duração exata de 120 segundos. Cada uma delas utilizou a voz de um apresentador de podcast do sexo masculino, com som de estúdio sem efeitos, sem música e sem efeitos sonoros.
A primeira versão manteve uma voz única e uma estrutura investigativa coerente do início ao fim: uma introdução clara, três descobertas cronológicas, uma transição da curiosidade para o desconforto e uma questão final não resolvida. Não foi detectado nenhum desvio óbvio na voz nem nenhum trecho confuso.
A segunda execução foi igualmente coerente e estável, com um breve tropeço na pronúncia por volta dos 1:31. Esse é um resultado sólido para um monólogo de dois minutos gravado em uma única tomada. Isso sugere que a afirmação da Seed Audio sobre o formato longo não se resume apenas a um limite de duração; o modelo é capaz de manter a identidade e a estrutura narrativa ao longo de todo o período.
A continuidade do áudio de referência requer cautela
T09 · Continuação da referência
Rota incertaO texto estava correto, mas a semelhança da voz era baixa; em uma das versões, a voz foi alterada para uma voz masculina e foram adicionados efeitos sonoros.
Prompt utilizado
Continuar a partir de uma referência feminina autorizada, preservando a identidade da voz e o estilo íntimo da gravação.
O teste de referência utilizou a amostra de narração mais marcante como entrada autorizada e solicitou uma continuação mantendo a mesma identidade feminina geral e o mesmo estilo íntimo de gravação.
Ambas as saídas reproduziram exatamente a continuação solicitada, mas nenhuma delas correspondeu bem à referência. A primeira transformou-se em um sussurro ofegante e recebeu uma pontuação conservadora de similaridade de voz de 2/5. A segunda foi avaliada como tendo usado uma voz masculina, recebeu uma pontuação de 1/5 em similaridade e acrescentou cerca de 17 segundos de efeitos sonoros indesejados antes de começar a falar.
Há uma limitação importante no ambiente aqui. O endpoint da tarefa “Anywhere” aceitou o campo de referência, mas não retornou uma confirmação mostrando como o modelo upstream consumiu essa referência. Esses resultados comprovam que a continuidade da referência não era confiável em nossa rota de teste; eles não comprovam que a API nativa do BytePlus sempre se comporte da mesma maneira.
Preços e limites do Seed Audio 1.0

Cobrança por segundo, com 60 minutos de teste gratuito na ativação do serviço.
potência máxima
caracteres de prompt
referências de áudio
imagem de referência
A BytePlus indica o preço oficial do plano pré-pago em $0,15 por minuto gerado, cobrado por segundo, com 60 minutos de teste gratuito quando o serviço for ativado. A documentação da API define um Potência máxima de 120 segundos, suporta prompts de até 3.000 caracteres, permite até três trechos de áudio de referência, e aceita uma imagem de referência.
Cada clipe de áudio de referência pode ter até 30 segundos e 10 MB. O limite para imagens de referência é de 10 MB. Esses são os limites nativos do BytePlus; plataformas de terceiros podem apresentar um formulário de entrada menor ou utilizar preços diferentes.
Nossa rota de teste Anywhere/BrolyAI apresentou o custo de envio separadamente, com uma média de cerca de $0,14 por minuto gerado. Esse campo do ambiente de teste não deve ser confundido com os preços de varejo do BytePlus nem com o preço final de outra plataforma.
Prós e contras do Seed Audio 1.0
Onde se destaca
- Voz unificada, efeitos sonoros, ambiente e música
- Excelente sincronização dos diálogos
- Identidade sólida e abrangente
- Música cinematográfica útil
Onde quebra
- Grande variação entre tomadas
- Fala ininteligível ocasionalmente
- Contagem exata fraca de SFX
- Continuidade de referência não confiável em nosso trajeto
Prós
- Gera voz, efeitos ambientais, efeitos sonoros e música em uma única etapa.
- Excelente sincronização dos diálogos em nossos testes repetidos.
- Boa separação entre os dois alto-falantes e reprodução precisa do roteiro.
- Produz músicas cinematográficas úteis que podem ser ouvidas de forma independente.
- Mantém a identidade da voz e a coerência narrativa ao longo de dois minutos.
- Gera um arquivo WAV estéreo de 40 kHz com som nítido em nossa rota de teste.
Contras
- As execuções repetidas podem variar significativamente em termos de naturalidade e confiabilidade.
- Discurso ocasionalmente alucinatório ou ininteligível.
- As contagens exatas de efeitos sonoros não são confiáveis.
- Algumas cenas completas não apresentam um evento final solicitado.
- O desempenho multilíngue precisa ser analisado cuidadosamente.
- A continuidade da voz de referência foi insatisfatória em nosso ambiente de teste.
- O envio em paralelo em grande escala provocou erros de concorrência no sistema upstream, embora as tarefas com falha não tenham sido cobradas.
Quem deve usar o Seed Audio 1.0?
O Seed Audio 1.0 é uma excelente opção para criadores de áudio que pensam em cenas, em vez de recursos isolados. É particularmente útil para dramas radiofônicos, diálogos de jogos, protótipos cinematográficos, storyboards de áudio, conceitos de podcasts e trechos curtos de suspense.
Ele não é tão convincente como um sistema de entrega final com apenas um clique. Se a redação exata, a identidade da voz ou a contagem de eventos forem fundamentais do ponto de vista jurídico ou criativo, planeje várias iterações e uma revisão humana. O modelo funciona melhor quando você o trata como um diretor de áudio rápido com várias tomadas — e não como um renderizador determinístico.
Perguntas frequentes
O Seed Audio 1.0 é um modelo de conversão de texto em fala?
O Seed Audio 1.0 consegue gerar efeitos sonoros sem voz?
O Seed Audio 1.0 consegue gerar música?
Por quanto tempo o Seed Audio 1.0 consegue gerar?
O Seed Audio 1.0 é compatível com áudio de referência?
Quanto custa o Seed Audio 1.0?
Veredicto final
O Seed Audio 1.0 é um modelo de áudio unificado realmente interessante. A capacidade de produzir fala, efeitos sonoros, ambiente e música convincentes a partir de um único prompt não é apenas um argumento de lançamento: nossos testes com cenas mistas e música demonstraram que os elementos podem funcionar em conjunto.
Seu melhor recurso foi o sincronismo dos diálogos. Seu maior ponto fraco foi a consistência. Nas 23 amostras analisadas, o modelo apresentou repetidamente um resultado excelente no melhor dos casos e uma versão alternativa visivelmente mais fraca.
Para a prototipagem criativa, essa escolha é fácil de aceitar. Gere várias versões, mantenha a melhor delas e analise cada finalidade. Para produção determinística, correspondência exata de voz ou trabalhos sensíveis à contagem de eventos, mantenha uma etapa de revisão e edição humana no fluxo de trabalho.
Veredicto geral: O Seed Audio 1.0 é um dos geradores de áudio em nível de cena mais avançados que já testamos, mas é mais adequado para ser usado como uma ferramenta criativa com várias tomadas do que como um renderizador final para uma única tomada.



