Un solo modelo puede recrear todo el panorama sonoro.
Seed Audio 1.0 permite combinar voz, efectos de sonido, ambiente, sincronización y música instrumental. Nuestras pruebas han revelado un potencial creativo excepcionalmente alto, así como un problema de repetibilidad que no debes pasar por alto.
Seed Audio 1.0 es uno de los primeros modelos de audio que he probado que parece estar diseñado en torno a una escena completa, en lugar de a un único tipo de salida. Es capaz de hablar, actuar, añadir ambiente, crear efectos de sonido, situar diálogos en una línea de tiempo y producir música instrumental a partir de una sola indicación.
El veredicto en pocas palabras: Seed Audio 1.0 ofrece un potencial excepcionalmente alto para la creación de audio unificada, especialmente en lo que respecta a diálogos sincronizados y escenas sonoras cinematográficas. Su punto débil es la repetibilidad. Una ejecución satisfactoria puede sonar sorprendentemente completa, mientras que otra ejecución a partir de la misma indicación puede incluir voz distorsionada, omitir un evento o cambiar la voz solicitada.
He generado 23 muestras con partitura a través del entorno de pruebas de Anywhere/BrolyAI. En conjunto, abarcaban narración, diálogos entre dos personajes, discursos con marca de tiempo, secuencias solo con efectos de sonido, escenas con voz y música, música independiente, interpretaciones multilingües, monólogos de dos minutos y continuaciones de audio de referencia.

Reseña de Seed Audio 1.0: el veredicto rápido

| Categoría | Resultados de nuestras pruebas |
|---|---|
| Voz expresiva | Alta calidad en la mejor pasada, pero irregular en las repeticiones |
| Diálogo entre varios interlocutores | Guiones precisos y una clara separación entre los interlocutores |
| Sincronización de los diálogos | La característica más fiable de nuestro conjunto de pruebas |
| Efectos sonoros | Espacio realista y orden de los sucesos; deficiencias en el recuento exacto de los sucesos |
| Voz + efectos de sonido + música | Escenas completas y convincentes en las que todo lo que se espera ocurre tal y como se espera |
| Música independiente | Más eficaz de lo esperado; generó señales estructuradas de 30 segundos |
| Voz multilingüe | Excelente en el mejor de los casos, pero en una de las dos reproducciones se escuchó un fragmento de diálogo adicional que no debía aparecer. |
| Audio de dos minutos | Una identidad narrativa sólida y una coherencia narrativa en ambas series |
| Audio de referencia | No resultó fiable en nuestro centro de pruebas; la similitud de voz fue escasa |
Lo mejor para: creadores que elaboran obras de teatro radiofónico, escenas de videojuegos, conceptos de podcasts, prototipos cinematográficos y guiones gráficos centrados en el audio.
Menos adecuado para: trabajos que requieren una redacción determinista, recuentos exactos de eventos repetidos o una clonación de voz fiable a partir de una generación automática.
¿Qué es Seed Audio 1.0?

Seed Audio 1.0 es el modelo unificado de creación de audio a partir de texto de ByteDance Seed. En lugar de tratar el habla, el ambiente, los efectos y la música como tareas independientes, es capaz de generarlos conjuntamente como una única escena sonora. Según la página oficial del producto, admite la sincronización de diálogos en intervalos de 100 milisegundos y puede generar hasta dos minutos de audio en una sola pasada.
Ese diseño unificado es el verdadero atractivo. Una indicación puede describir quién habla, cómo suena su voz, qué ocurre en la sala, qué efectos se incorporan más adelante y qué tipo de música acompaña la escena. Cuando se ejecuta bien, el resultado suena como una composición, en lugar de como algo ensamblado a tientas.
Hay una diferencia importante. Según la propia hoja de ruta de ByteDance, la sincronización detallada se centra actualmente sobre todo en los diálogos de los personajes. El control más preciso de los efectos de sonido, el ambiente sonoro y la música sigue siendo un ámbito que requiere un mayor desarrollo. Nuestras pruebas confirmaron esa distinción: la sincronización de los diálogos fue excelente, mientras que la precisión en el recuento de los efectos de sonido fue menos fiable.
Fuentes oficiales consultadas el 6 de agosto de 2026:
- Página del producto Seed Audio 1.0
- Presentación de ByteDance Seed
- Documentación de la API de BytePlus Audio 1.0
- Precios de BytePlus Audio 1.0
Cómo hemos probado Seed Audio 1.0
Diseñamos nueve tareas y llevamos a cabo 23 generaciones evaluadas. La mayoría de las pruebas de capacidad se realizaron con dos o tres repeticiones, ya que una sola muestra perfeccionada aporta muy poca información sobre la fiabilidad en producción.
| Prueba | Tarea | Carreras |
|---|---|---|
| T01 | Narración expresiva en inglés | 3 |
| T02 | Diálogo radiofónico entre dos personajes | 3 |
| T03 | Diálogo en los segundos 0, 4 y 9 | 3 |
| T04 | Secuencia en el pasillo con efectos especiales únicamente | 2 |
| T05 | Voces, ambientes, efectos de sonido y música | 3 |
| T06 | Música instrumental independiente | 3 |
| T07 | Un carácter en inglés, japonés y alemán | 2 |
| T08 | Monólogo de un podcast de 120 segundos | 2 |
| T09 | Continuación de una voz de referencia | 2 |
Los 23 resultados previstos contenían unos 12,5 minutos de audio generado y registraron un coste de generación en origen de $1.7504 en el entorno de prueba. Seed Audio no facilitó datos sobre el uso de tokens de texto. La facturación se basó en los segundos generados, por lo que los tokens de generación se registraron como «no aplicables».
Todos los archivos de salida evaluados eran archivos WAV PCM estéreo de 40 kHz y 16 bits. Cuando no era posible la reproducción automática directa, el Gemini 3.6 Flash recibía los archivos WAV como entrada de audio y generaba transcripciones estructuradas, comprobaciones de eventos, estimaciones de duración y notas sobre artefactos. Esas valoraciones son evaluaciones de escucha automatizadas, no puntuaciones MOS realizadas por personas.
Generación de voz: agudos impresionantes, repetibilidad irregular
T01 · Narración expresiva
Alta varianzaUna de las frases parecía sacada de una alucinación, otra sonaba forzada y la tercera resultaba natural y completa.
Prompt utilizado
Una narradora con voz tranquila pronuncia dos frases exactas, pasando de la preocupación a la confianza. Sin música ni efectos de sonido.
Las instrucciones de narración pedían que una locutora con voz tranquila pronunciara dos frases exactas, pasando de una preocupación contenida a una confianza creciente, sin ningún sonido de fondo.
Las tres ejecuciones se comportaron de forma muy diferente:
- Prueba 1: pronunció la frase solicitada y, a continuación, prosiguió con varios segundos de discurso incoherente e improvisado.
- Prueba 2: Pronunció el texto tal cual, pero lo hizo de forma lenta y entrecortada.
- Tercera carrera: interpretó el guion completo con naturalidad, con un ritmo óptimo y una voz coherente.
Este es el patrón principal de la reseña. Seed Audio 1.0 puede ofrecer un resultado vocal de gran calidad, pero una sola ejecución no es suficiente para trabajos en los que la redacción sea fundamental. Genera alternativas y escucha todo el resultado antes de publicarlo.
El modelo respetó las instrucciones negativas en las tres sesiones de narración: no se detectó música, efectos de sonido ni ruidos de fondo no deseados.
Diálogos con varios personajes y separación de hablantes
T02 · Obra de radio con dos personajes
3/3 guiones exactosLos tres guiones eran idénticos. El ruido de fondo de la sala y la duración de la introducción variaban de una toma a otra.
Prompt utilizado
Maya susurra, Eli responde con calma y el zumbido del frigorífico acompaña tres turnos de diálogo fijos.
En nuestra escena de la tienda de conveniencia aparecían dos personajes adultos y tres frases fijas. Maya tenía que susurrar con nerviosismo, mientras que Eli intentaba parecer tranquilo. El único sonido de fondo que se pedía era un sutil zumbido de nevera.
Las tres reproducciones reprodujeron el diálogo en el orden correcto con dos voces bien diferenciadas. La mejor reproducción combinó un texto exacto, una separación nítida entre los interlocutores, una emoción convincente y un zumbido continuo del frigorífico.
Las demás tomas presentaban pequeños problemas a nivel de escena. En una de ellas, se dedicó aproximadamente la primera mitad de sus 30 segundos de duración a los sonidos de ambiente antes de comenzar el diálogo. En otra, se omitió el zumbido del frigorífico que se había solicitado. Ninguno de estos errores estropeó la escena dialogada, pero ambos reducen la eficiencia del montaje.
En cuanto a los audiodramas, el resultado práctico es alentador: Seed Audio capta bien los cambios de los personajes y los contrastes vocales. Es posible que aún tengas que recortar las introducciones largas o volver a generar el sonido de ambiente adecuado.
La sincronización de los diálogos fue el aspecto más destacado
T03 · Sincronización a nivel de comando
El más fiableEn las tres ejecuciones, las líneas se situaron cerca de los puntos solicitados, dentro de la incertidumbre temporal del evaluador.
Prompt utilizado
Coloca tres líneas de radio en los segundos 0,0; 4,0 y 9,0 con locutores hombre/mujer/hombre.

La prueba de sincronización requirió tres líneas de radio:
- “Unidad siete, informa”, a los 0,0 segundos.
- “Entrada norte asegurada” a los 4,0 segundos.
- “Mantén la posición” a los 9,0 segundos.
En las tres reproducciones, las líneas, el orden y el patrón de locutores (hombre-mujer-hombre) fueron correctos. Las estimaciones de audio de Gemini situaron los inicios de las reproducciones repetidas en torno a los 0,1, 4,0 y 9,0 segundos. La primera serie se estimó en aproximadamente 0,1, 3,9 y 8,9 segundos.
Esas mediciones no deben presentarse como una prueba de precisión de 100 milisegundos con rigor de laboratorio, ya que el propio evaluador indicó una incertidumbre de aproximadamente 0,1 segundos. Aun con esa salvedad, esta fue la función con mayor repetibilidad de todas las que probamos. Si necesitas que los diálogos se inserten cerca de posiciones específicas de la línea temporal, Seed Audio 1.0 resulta excepcionalmente prometedor.
Creación de efectos especiales: escenas realistas, recuento imperfecto
T04 · Pasillo solo con efectos de sonido
Error al contarEl espacio y el orden resultaban convincentes, pero en las dos series se registraron cuatro pasos y dos pasos.
Prompt utilizado
Llaves, una puerta pesada, exactamente tres pasos, un trueno y un último portazo. Ni una voz ni música.
La indicación, que solo incluía efectos especiales, describía un pequeño pasillo con suelo de baldosas: llaves cerca del micrófono, una pesada puerta de madera que se abría, tres pasos lentos que se alejaban, un trueno lejano y, por último, el portazo de una puerta. No se permitían ni el habla ni la música.
Ambas salidas crearon un espacio acústico creíble, mantuvieron el orden de los acontecimientos y evitaron que se filtraran las voces o la música. Los efectos se consideraron realistas, con una buena sensación de distancia y coherencia espacial.
Ninguna de las dos reproducciones siguió el recuento exacto. Una generó cuatro pasos; la otra, dos. Esto hace que Seed Audio resulte útil para crear un concepto de efectos de sonido convincente, pero menos fiable cuando un editor necesita exactamente tres impactos, golpes, pasos o disparos.
El mejor proceso de trabajo consiste en utilizar la generación de efectos de sonido (SFX) en una sola pasada para crear ambiente y realizar prototipos rápidos, y luego sustituir o editar los eventos en los que el recuento es fundamental en un DAW.
Voces, efectos de ambiente, efectos especiales y música en una misma escena
T05 · Mezcla cinematográfica completa
Completado en un 2/3En dos de las tres series se completaron todas las jugadas. En una de ellas no se logró el golpe metálico final.
Prompt utilizado
Un callejón bajo la lluvia, tráfico, una sirena, un detective que susurra, un ritmo de cuerdas, pasos rápidos y un golpe metálico.

La prueba de escena completa estaba deliberadamente repleta de elementos. Se pedía un callejón nocturno mojado, gotas de agua, tráfico, una sirena de policía en movimiento, una frase susurrada por un detective, cuerdas moderadas, pasos rápidos y el portazo metálico de una puerta.
Dos de las tres reproducciones incluyeron la secuencia completa del evento. Los diálogos se escuchaban con claridad por encima del ruido de fondo y la música, y la escena daba la sensación de ser espacialmente coherente, en lugar de parecer fragmentos inconexos superpuestos. En una de las reproducciones faltó el golpe metálico final, aunque por lo demás se recreó la atmósfera adecuada y se reprodujo con exactitud el diálogo.
Es aquí donde el modelo unificado demuestra mejor su valía. En lo que respecta a la creación de guiones gráficos y la ideación creativa, generar una escena mixta completa a partir de una sola indicación es más rápido y más expresivo que obtener cada componente por separado. En cuanto a la producción final, las señales finales importantes siguen necesitando verificación.
¿Puede Seed Audio 1.0 generar música?
T06 · Música independiente
Obras musicalesLos tres crearon música estructurada. Uno de ellos hizo que el piano con sordina resultara difícil de distinguir.
Prompt utilizado
Una pieza de suspense a 72 BPM con un ostinato de violonchelo, piano con sordina, un zumbido analógico, una progresión creciente y un final sin resolver.

Sí. En nuestras pruebas, Seed Audio 1.0 generó música instrumental independiente y reconocible, en lugar de limitarse a crear una textura ambiental difusa.
Las instrucciones pedían una pieza de suspense de 30 segundos a 72 BPM con un ostinato de violonchelo grave, pulsos de piano con sordina, un suave zumbido analógico, una progresión clara y un acorde final sin resolver. Las tres versiones formaban una pieza musical coherente con el tempo y el final solicitados. Dos de ellas incluían todos los elementos solicitados; en una de ellas, el piano con sordina resultaba difícil de distinguir.
Esto no convierte automáticamente a Seed Audio en un sustituto de un generador de canciones específico. Nuestra tarea consistía en crear un breve fragmento instrumental de estilo cinematográfico, no una canción con estrofas y estribillos y letra. Aun así, su capacidad musical es lo suficientemente amplia como para acompañar escenas de videojuegos, tráilers, podcasts y previsualizaciones, sobre todo cuando la música debe interactuar con el diálogo y el diseño de sonido en la misma generación.
Rendimiento multilingüe: excelente en el mejor de los casos, deficiente en el peor de los casos
T07 · Una voz, tres idiomas
1/2 limpioUna ejecución fue impecable; la otra repetía y presentaba alucinaciones en el discurso en torno al cambio de idioma.
Prompt utilizado
Un personaje femenino habla inglés, japonés y alemán con la misma naturalidad y serenidad.

En la prueba multilingüe se pidió a un personaje femenino que interpretara el mismo papel en el estudio de grabación en inglés, japonés y alemán. Las dos grabaciones dieron lugar a impresiones opuestas.
La ejecución más sólida reprodujo las tres frases con precisión, conservó el mismo tono de voz, mantuvo la calma en la expresión emocional y utilizó pausas claras. La ejecución más débil comenzó correctamente en inglés, pero luego repitió y distorsionó el discurso en la sección en japonés y estropeó el inicio en alemán. La percepción de la coherencia del tono de voz entre los distintos idiomas se redujo drásticamente.
Esto significa que Seed Audio 1.0 puede ofrecer una interpretación convincente de personajes multilingües, pero esta función requiere varios candidatos y una revisión que tenga en cuenta los distintos idiomas. No apruebes un resultado multilingüe basándote únicamente en el primer idioma.
Generación en dos minutos y estabilidad de la voz en formatos largos
T08 · Monólogo de 120 segundos
2/2 estableAmbos archivos duraron 120 segundos con una voz estable. En uno de ellos se produjo un breve tropiezo en la pronunciación.
Prompt utilizado
Un presentador de un podcast cuenta una historia estructurada sobre una estación meteorológica con tres descubrimientos y sin contexto.

Ambas tareas de larga duración generaron archivos WAV de exactamente 120 segundos. En cada una de ellas se utilizó la voz de un presentador de podcast masculino con sonido de estudio sin efectos, sin música y sin efectos de sonido.
La primera versión mantuvo una voz única y una estructura narrativa coherente en todo momento: un inicio claro, tres descubrimientos cronológicos, una evolución de la curiosidad al malestar y una pregunta final sin resolver. No se detectó ninguna desviación evidente en la voz ni ningún fragmento confuso.
La segunda ejecución fue igualmente coherente y estable, con un breve tropiezo en la pronunciación alrededor del minuto 1:31. Se trata de un resultado muy bueno para un monólogo de dos minutos en una sola pasada. Esto sugiere que la afirmación de Seed Audio sobre el formato largo no se limita únicamente a la duración; el modelo es capaz de mantener la identidad y la estructura narrativa a lo largo de todo el intervalo.
La continuidad del audio de referencia requiere precaución
T09 · Continuación de la referencia
Ruta inciertaEl texto era exacto, pero la similitud de la voz era escasa; en una de las versiones se cambió a una voz masculina y se añadieron efectos de sonido.
Prompt utilizado
Continuar a partir de una referencia femenina autorizada, conservando la identidad de la voz y el estilo íntimo de la grabación.
La prueba de referencia utilizó la muestra de narración más impactante como material de partida autorizado y solicitó una continuación que mantuviera la misma identidad femenina general y el mismo estilo íntimo de grabación.
Ambos resultados reprodujeron exactamente la continuación solicitada, pero ninguno de los dos se ajustaba bien a la referencia. El primero se convirtió en un susurro completo y entrecortado y obtuvo una puntuación conservadora de similitud vocal de 2/5. Se consideró que el segundo utilizaba una voz masculina, obtuvo una puntuación de 1/5 en similitud y añadió aproximadamente 17 segundos de efectos de sonido no deseados antes de empezar a hablar.
Hay que tener en cuenta una limitación importante en este caso. El punto final de la tarea «Anywhere» aceptó el campo de referencia, pero no devolvió ninguna confirmación que indicara cómo el modelo anterior había utilizado dicha referencia. Estos resultados demuestran que la continuidad de la referencia no era fiable a lo largo de nuestra ruta de prueba; no demuestran que la API nativa de BytePlus se comporte siempre de la misma manera.
Precios y límites de Seed Audio 1.0

Se factura por segundos y se incluyen 60 minutos de prueba gratuitos al activar el servicio.
potencia máxima
caracteres de la línea de comandos
referencias de audio
imagen de referencia
BytePlus indica que el precio oficial de la tarifa de prepago es de $0,15 por minuto generado, que se factura por segundos, con 60 minutos de prueba gratuita cuando se active el servicio. La documentación de la API establece un Potencia máxima durante 120 segundos, admite indicaciones de hasta 3.000 caracteres, permite hasta tres fragmentos de audio de referencia, y admite una imagen de referencia.
Cada clip de audio de referencia puede tener una duración máxima de 30 segundos y un tamaño máximo de 10 MB. El límite para las imágenes de referencia es de 10 MB. Estos son los límites propios de BytePlus; es posible que otras plataformas ofrezcan un formulario de entrada más reducido o apliquen tarifas diferentes.
Nuestra ruta de prueba de Anywhere/BrolyAI indicaba el coste de envío por separado y arrojaba una media de aproximadamente $0,14 por minuto generado. No debe confundirse ese campo del entorno de prueba con los precios al por menor de BytePlus ni con el precio final de otra plataforma.
Ventajas e inconvenientes de Seed Audio 1.0
En qué destaca
- Voz unificada, efectos de sonido, ambiente y música
- Excelente sincronización de los diálogos
- Una identidad sólida y bien definida
- Música cinematográfica útil
Dónde se rompe
- Gran variación entre tomas
- Habla entrecortada de vez en cuando
- Recuento exacto débil de SFX
- La continuidad de las referencias en nuestro recorrido no es fiable
Pros
- Genera voces, efectos ambientales, efectos de sonido y música en una sola pasada.
- Excelente sincronización de los diálogos en nuestras pruebas repetidas.
- Gran separación entre los dos altavoces y reproducción fiel del guion.
- Crea música cinematográfica independiente muy útil.
- Mantiene la identidad vocal y la coherencia narrativa a lo largo de dos minutos.
- Emite un archivo WAV estéreo limpio a 40 kHz a través de nuestra ruta de prueba.
Contras
- Las ejecuciones repetidas pueden variar considerablemente en cuanto a naturalidad y fiabilidad.
- En ocasiones, habla alucinada o incoherente.
- Las cifras exactas de efectos especiales no son fiables.
- En algunas escenas completas falta un evento final solicitado.
- El rendimiento multilingüe requiere un análisis minucioso.
- La continuidad de la voz de referencia fue deficiente en nuestro entorno de pruebas.
- El elevado número de envíos paralelos provocó errores de concurrencia en las etapas anteriores, aunque las tareas fallidas no se facturaron.
¿Quién debería utilizar Seed Audio 1.0?
Seed Audio 1.0 es una opción ideal para los creadores de audio que piensan en escenas en lugar de en elementos aislados. Resulta especialmente útil para obras de teatro radiofónicas, diálogos de videojuegos, prototipos cinematográficos, guiones gráficos de audio, conceptos de podcasts y breves secuencias de suspense.
Resulta menos convincente como sistema de entrega final con un solo clic. Si la redacción exacta, la identidad de la voz o el recuento de eventos son fundamentales desde el punto de vista legal o creativo, hay que prever varias iteraciones y una revisión humana. El modelo funciona mejor cuando se considera como un director de audio rápido con varias tomas, y no como un renderizador determinista.
Preguntas frecuentes
¿Es Seed Audio 1.0 un modelo de conversión de texto a voz?
¿Puede Seed Audio 1.0 generar efectos de sonido sin voz?
¿Puede Seed Audio 1.0 generar música?
¿Durante cuánto tiempo puede generar audio Seed Audio 1.0?
¿Seed Audio 1.0 es compatible con el audio de referencia?
¿Cuánto cuesta Seed Audio 1.0?
Veredicto final
Seed Audio 1.0 es un modelo de audio unificado realmente interesante. La capacidad de generar voz, efectos de sonido, ambiente y música convincentes a partir de una sola indicación no es solo una promesa de lanzamiento: nuestras pruebas con escenas mixtas y música demostraron que los elementos pueden funcionar en conjunto.
Su mejor característica era la sincronización de los diálogos. Su mayor punto débil era la coherencia. En las 23 muestras analizadas, el modelo mostró repetidamente un resultado óptimo excelente y una toma alternativa notablemente más débil.
En el caso de la creación de prototipos creativos, esa compensación es fácil de aceptar. Genera varias versiones, quédate con la mejor y analiza cada final. Para la producción determinista, la correspondencia exacta de voces o los trabajos en los que el recuento de eventos es importante, mantén una fase de revisión y edición humana en el flujo de trabajo.
Veredicto general: Seed Audio 1.0 es uno de los generadores de audio a nivel de escena más potentes que hemos probado, pero se aprovecha mejor como herramienta creativa para múltiples tomas que como renderizador final de una sola toma.



