Одна модель может создать всю звуковую сцену.
Seed Audio 1.0 позволяет сочетать голос, звуковые эффекты, фоновые звуки, синхронизацию и инструментальную музыку. В ходе наших тестов мы обнаружили необычайно высокий творческий потенциал — а также проблему с воспроизводимостью результатов, которую не стоит игнорировать.
Seed Audio 1.0 — одна из первых аудиомоделей, которые я тестировал, и которая, как мне кажется, разработана с учетом целой сцены, а не отдельного типа вывода. Она может говорить, играть роли, добавлять фоновые звуки, создавать фоли, размещать диалоги на временной шкале и генерировать инструментальную музыку по одному запросу.
Краткий вывод: Seed Audio 1.0 обладает необычайно широкими возможностями для комплексного создания звуковых эффектов, особенно в области синхронизации диалогов и создания кинематографических звуковых сцен. Его слабым местом является повторяемость. Один удачный прогон может звучать на удивление целостно, в то время как другой прогон по тому же запросу может содержать неразборчивую речь, пропустить одно событие или изменить заданный голос.
Я сгенерировал 23 образца с музыкальным сопровождением с помощью тестовой среды Anywhere/BrolyAI. В совокупности они охватывали следующий спектр задач: повествование, диалог между двумя персонажами, речь с временными метками, эпизоды, состоящие исключительно из звуковых эффектов, сцены с голосом и музыкой, самостоятельные музыкальные композиции, многоязычное исполнение, двухминутные монологи и продолжение эталонного аудио.

Обзор Seed Audio 1.0: краткий вывод

| Категория | Результаты наших испытаний |
|---|---|
| Выразительный голос | Высокое качество при оптимальном прохождении, но нестабильное при повторных прохождениях |
| Диалог с участием нескольких собеседников | Четкие диалоги и хорошее разделение голосов |
| Синхронизация диалогов | Наиболее надежный элемент в нашем тестовом наборе |
| Звуковые эффекты | Реалистичное представление пространства и порядка событий; слабые результаты при точном подсчете количества событий |
| Голос + звуковые эффекты + музыка | Убедительные цельные сцены, в которых каждое ожидаемое событие происходит точно так, как и должно |
| Музыка в отдельном формате | Оказался более функциональным, чем ожидалось; генерировал структурированные 30-секундные сигналы |
| Многоязычный голос | Отличный результат в идеальном случае, но в одном из двух прогонов произошла ошибка, приведшая к появлению лишнего текста |
| Двухминутный аудиофайл | Четкая голосовая идентичность и повествовательная целостность в обоих прогонах |
| Эталонный звук | На нашей тестовой площадке система работала ненадёжно; степень сходства голосов была низкой |
Лучшее для: создатели, занимающиеся производством радиопостановок, игровых сцен, концепций подкастов, кинематографических прототипов и сценариев, ориентированных в первую очередь на аудио.
Менее подходит для: задачи, требующие детерминированной формулировки, точного подсчёта повторяющихся событий или надёжного клонирования голоса за один цикл генерации без участия оператора.
Что такое Seed Audio 1.0?

Seed Audio 1.0 — это унифицированная модель создания аудио на основе текста от ByteDance Seed. Вместо того чтобы рассматривать речь, фоновые звуки, эффекты и музыку как отдельные задачи, она может генерировать их вместе в виде единой звуковой сцены. Согласно официальной странице продукта, система поддерживает синхронизацию диалогов с интервалом в 100 миллисекунд и способна генерировать до двух минут аудио за один проход.
Именно этот целостный подход и является главной изюминкой. В сценарии можно описать, кто говорит, как звучит его голос, что происходит в комнате, какие звуковые эффекты добавляются позже и какая музыка сопровождает сцену. При удачном исполнении результат звучит как целостное произведение, а не как набор отдельных элементов, сшитых воедино.
Существует важная грань. Согласно собственной дорожной карте ByteDance, в настоящее время точная синхронизация в основном сосредоточена на диалогах персонажей. Более точное управление звуковыми эффектами, фоновым шумом и музыкой по-прежнему остается областью для дальнейшего развития. Наши тесты подтвердили это различие: синхронизация диалогов была превосходной, в то время как точность синхронизации звуковых эффектов оказалась менее надежной.
Официальные источники, проверенные 6 августа 2026 года:
- Страница продукта Seed Audio 1.0
- Представление программы ByteDance Seed
- Документация по API BytePlus Audio 1.0
- Цены на BytePlus Audio 1.0
Как мы тестировали Seed Audio 1.0
Мы разработали девять задач и провели 23 оцениваемых цикла генерации. В большинстве тестов на работоспособность использовалось два или три повторения, поскольку один «отлаженный» образец мало что говорит о надежности в производственных условиях.
| Тест | Задание | Забеги |
|---|---|---|
| T01 | Выразительное повествование на английском языке | 3 |
| T02 | Радиодиалог между двумя персонажами | 3 |
| T03 | Диалог на 0, 4 и 9 секундах | 3 |
| T04 | Сцена в коридоре, состоящая исключительно из звуковых эффектов | 2 |
| T05 | Голос, фоновые звуки, звуковые эффекты и музыка | 3 |
| T06 | Автономная инструментальная музыка | 3 |
| T07 | Один символ в английском, японском и немецком языках | 2 |
| T08 | 120-секундный монолог в подкасте | 2 |
| T09 | Продолжение из справочного голоса | 2 |
23 запланированных результата содержали около 12,5 минут сгенерированного аудио, а затраты на генерацию в тестовой среде составили $1.7504. Сервис Seed Audio не предоставил данных об использовании текстовых токенов. Оплата производилась исходя из количества сгенерированных секунд, поэтому токены генерации были указаны как «неприменимы».
Все обработанные выходные данные представляли собой файлы WAV в формате PCM со стереозвуком, частотой дискретизации 40 кГц и разрядностью 16 бит. В тех случаях, когда прямое автоматическое воспроизведение было недоступно, устройство Gemini 3.6 Flash принимало файлы WAV в качестве аудиовхода и выдавало структурированные транскрипты, проверки событий, оценки временных параметров и примечания об артефактах. Эти оценки представляют собой автоматизированные результаты прослушивания, а не оценки MOS, выставленные людьми.
Генерация голоса: впечатляющие высокие частоты, нестабильная повторяемость
T01 · Выразительное повествование
Высокая дисперсияВ одном случае речь звучала как галлюцинация, в другом — натянуто, а в третьем — естественно и полноценно.
Использованный запрос
Спокойный женский голос произносит два точных предложения, переходя от беспокойства к уверенности. Без музыки и звуковых эффектов.
В задании на озвучивание одной спокойной дикторше было предложено произнести два точных предложения, переходя от сдержанной озабоченности к растущей уверенности, без фоновых звуков.
Эти три прогона показали совершенно разные результаты:
- Заезд 1: произнес требуемую фразу, а затем в течение нескольких секунд продолжал говорить бессвязно, отступая от текста.
- Заезд 2: произносил слова точно по тексту, но говорил медленно и отрывисто.
- Заезд 3: прочитал весь сценарий естественно, с оптимальным темпом и сохраняя единообразие интонации.
В этом и заключается основная идея данного обзора. Seed Audio 1.0 способен обеспечить высокое качество озвучивания, однако одного прогона недостаточно для работ, где важна точность формулировок. Перед публикацией следует сгенерировать альтернативные варианты и прослушать весь текст от начала до конца.
Модель соблюдала запретительные инструкции во всех трёх прогонах наррации: не было обнаружено ни музыки, ни звуковых эффектов, ни нежелательного фонового шума.
Диалог с участием нескольких персонажей и разделение речи по говорящим
T02 · Радиопостановка с участием двух персонажей
3 из 3 точных сценариевВсе три сценария были точными. Фоновый шум в помещении и продолжительность вступительной части варьировались от дубля к дублю.
Использованный запрос
Майя шепчет, Илай спокойно отвечает, а в фоне трёх последовательных реплик слышен гул холодильника.
В сцене в мини-маркете участвовали два взрослых персонажа и три фиксированных реплики. Майя должна была напряженно шептать, а Илай старался говорить спокойным тоном. Единственным требуемым фоновым звуком был едва слышный гул холодильника.
Во всех трёх прогонах диалоги воспроизводились в правильном порядке двумя различимыми голосами. В лучшем прогоне сочетались точная передача реплик, чёткое разделение голосов, убедительная эмоциональность и непрерывный гул холодильника.
В остальных дублях были замечены менее значительные проблемы на уровне сцены. В одном из них примерно первая половина 30-секундного дубля была посвящена фоновым звукам, прежде чем начался диалог. В другом — не прозвучал требуемый гул холодильника. Ни одна из этих ошибок не испортила сцену с диалогом, но обе снижают эффективность монтажа.
Что касается аудиоспектаклей, то практические результаты обнадеживают: Seed Audio хорошо справляется с переходами между персонажами и контрастом голосов. Однако вам, возможно, по-прежнему придется обрезать длинные вступительные фразы или перегенерировать звук для получения нужного фонового шума помещения.
Наилучший результат был показан в категории «Синхронизация диалогов»
T03 · Время выполнения на уровне промпта
Наиболее надежныйВо всех трёх прогонах линии были размещены вблизи заданных точек в пределах погрешности измерения времени, допущенной оценщиком.
Использованный запрос
Разместите три радиолинии в точках 0,0; 4,0 и 9,0 секунд с дикторами мужского, женского и мужского пола.

В рамках теста на синхронизацию потребовалось три радиолинии:
- “Седьмой отряд, докладвайте” — в момент времени 0,0 секунды.
- “Северный вход обеспечен” — через 4,0 секунды.
- “Удерживать позицию” — на отметке 9,0 секунд.
Во всех трёх прогонах линии, порядок и схема «мужчина-женщина-мужчина» были правильными. По оценкам Gemini, начало повторных прогонов приходилось примерно на 0,1, 4,0 и 9,0 секунд. Время начала первого прогона было оценено примерно в 0,1, 3,9 и 8,9 секунды.
Эти измерения не следует представлять как лабораторное доказательство точности до 100 миллисекунд — сам разработчик указал погрешность примерно в 0,1 секунды. Даже с учетом этого оговорки данный показатель оказался самым воспроизводимым из всех, которые мы тестировали. Если вам нужно, чтобы диалоги вставлялись вблизи запланированных точек временной шкалы, Seed Audio 1.0 выглядит необычайно многообещающим решением.
Создание звуковых эффектов: реалистичные сцены, неточный подсчёт
T04 · Коридор (только звуковые эффекты)
Сбой при подсчетеПространство и порядок выглядели убедительно, но в ходе двух прогонов прозвучали четыре шага и два шага.
Использованный запрос
Ключи, тяжелая дверь, ровно три шага, раскат грома и заключительный хлопок. Ни голоса, ни музыки.
В задании, предусматривающем использование исключительно звуковых эффектов, описывался небольшой выложенный плиткой коридор: ключи рядом с микрофоном, открывающаяся массивная деревянная дверь, три медленных шага, удаляющихся вглубь коридора, отдаленный раскат грома и, в заключение, хлопок закрывающейся двери. Речь и музыка были запрещены.
Оба варианта воспроизведения создавали реалистичное акустическое пространство, сохраняли последовательность событий и не допускали просачивания голоса или музыки. Эффекты были оценены как реалистичные, с хорошим ощущением расстояния и целостностью звукового пространства.
Ни один из этих наборов не соответствовал точному количеству звуков. В одном было четыре шага, в другом — два. Благодаря этому Seed Audio удобно использовать для создания убедительных звуковых эффектов, но менее надежно, когда монтажеру требуется ровно три удара, стука, шага или выстрела.
Оптимальный рабочий процесс заключается в использовании однопроходного создания звуковых эффектов (SFX) для создания атмосферы и быстрого прототипирования, а затем — в замене или редактировании событий, требующих точного учета количества, в DAW.
Голос, фоновые звуки, звуковые эффекты и музыка в одной сцене
T05 · Полная кинематографическая версия
Выполнено на 2/3В двух из трёх прохождений удалось выполнить все элементы. В одном пропущен последний удар по металлическому предмету.
Использованный запрос
Дождь, улица, дорожное движение, сирена, шепот детектива, ритмичные удары струн, быстрые шаги и металлический хлопок.

В тестовом сценарии специально было создано ощущение суеты. В нём присутствовали: мокрый ночной переулок, капающая вода, дорожный шум, звук движущейся полицейской сирены, шепот детектива, сдержанные струнные, быстрые шаги и металлический звук захлопывающейся двери.
В двух из трёх прогонов была воспроизведена полная последовательность событий. Диалоги оставались чёткими на фоне окружающих звуков и музыки, а сцена воспринималась как единое целое, а не как набор несвязанных между собой фрагментов, наложенных друг на друга. В одном прогоне отсутствовал заключительный металлический удар, хотя в остальном удалось создать нужную атмосферу и точно воспроизвести реплики.
Именно в этом аспекте унифицированная модель демонстрирует свои сильные стороны наиболее ярко. При создании сторибордов и разработке творческих идей генерация целой смешанной сцены на основе одного запроса происходит быстрее и позволяет добиться большей выразительности, чем подбор каждого компонента по отдельности. На этапе окончательной реализации важные конечные сигналы по-прежнему требуют проверки.
Может ли программа Seed Audio 1.0 генерировать музыку?
T06 · Автономная музыка
Музыкальные произведенияВсе трое создавали структурированную музыку. У одного из них звуки фортепиано с приглушенным звуком было трудно различить.
Использованный запрос
Музыкальный фрагмент в стиле саспенс с темпом 72 ударов в минуту, включающий остинато виолончели, фортепиано с сурдиной, аналоговый дрон, нарастание и незавершённое окончание.

Да. В ходе наших тестов Seed Audio 1.0 генерировала узнаваемую самостоятельную инструментальную музыку, а не просто расплывчатую эмбиентную текстуру.
В задании требовалось создать 30-секундный музыкальный фрагмент в стиле «саспенс» с темпом 72 ударов в минуту, включающий низкое остинато виолончели, приглушенные импульсы фортепиано, мягкий аналоговый гул, четкое нарастание и неразрешенный заключительный аккорд. Все три варианта составили целостный музыкальный фрагмент с требуемым темповым ощущением и завершением. В двух вариантах были представлены все запрашиваемые элементы; в одном варианте приглушённое фортепиано было трудно различить.
Это не означает, что Seed Audio автоматически заменяет специализированный генератор песен. Нашей задачей было создать короткий инструментальный кинематографический фрагмент, а не песню с куплетами и припевом и текстом. Тем не менее, музыкальные возможности программы достаточно обширны, чтобы обеспечить сопровождение игровых сцен, трейлеров, подкастов и предварительной визуализации — особенно в тех случаях, когда музыка должна взаимодействовать с речью и звуковым оформлением в рамках одного цикла генерации.
Многоязычная производительность: в лучшем случае — отличная, в худшем — слабая
T07 · Один голос, три языка
1/2 чистыйОдин прогон прошел безупречно; в другом — при переключении языка повторялась речь и возникали галлюцинации.
Использованный запрос
Одна из героинь говорит на английском, японском и немецком языках, сохраняя при этом ту же манеру поведения и спокойный тон.

В рамках многоязычного задания одной из женских персонажей было предложено озвучить одну и ту же роль в студии на английском, японском и немецком языках. Два прогона произвели противоположные впечатления.
В более удачном прогоне все три предложения были воспроизведены точно, сохранился единый стиль речи, сохранилось спокойное эмоциональное наполнение и были использованы четкие паузы. В менее удачном прогоне начало на английском языке прошло правильно, но затем в японском фрагменте речь стала повторяться и искажаться, что привело к сбоям в немецком вступлении. Воспринимаемая межъязыковая согласованность стиля речи резко снизилась.
Это означает, что Seed Audio 1.0 способен обеспечивать убедительное воспроизведение речи персонажей на нескольких языках, однако для работы этой функции требуется наличие нескольких вариантов и проверка с учетом языковых особенностей. Не утверждайте многоязычный результат, проверяя его только на первом языке.
Генерация за две минуты и стабильность длинных голосовых записей
T08 · 120-секундный монолог
2/2 стабильноОба файла длились 120 секунд, и в обоих голос звучал ровно. В одном из них было небольшое заминка при произношении.
Использованный запрос
Один ведущий-мужчина в подкасте рассказывает четко построенную историю о метеостанции, в которой фигурируют три открытия и отсутствует вводная информация.

Оба задания с длинными аудиофрагментами дали WAV-файлы продолжительностью ровно 120 секунд. В каждом из них использовался голос одного ведущего подкаста мужского пола с «сухим» студийным звуком, без музыки и звуковых эффектов.
В первом прогоне на протяжении всего текста сохранялся единый стиль изложения и целостная структура расследования: чёткое вступление, три хронологических открытия, переход от любопытства к беспокойству и заключительный нерешённый вопрос. Очевидных отклонений в стиле изложения или неразборчивых фрагментов обнаружено не было.
Второй прогон был столь же связным и стабильным, за исключением одного краткого сбоя в произношении примерно в 1:31. Это отличный результат для двухминутного монолога, записанного за один проход. Это свидетельствует о том, что заявление Seed Audio о поддержке длинных текстов не сводится лишь к ограничению по продолжительности; модель способна сохранять целостность образа и структуру повествования на протяжении всего периода воспроизведения.
При использовании эталонного аудиосигнала следует соблюдать осторожность
T09 · Продолжение ссылки
Маршрут неясенТекст был точным, но сходство голосов было низким; в одном из результатов голос был заменен на мужской и добавлены звуковые эффекты.
Использованный запрос
Продолжить от лица авторизованной женской персонажи, сохранив при этом индивидуальный стиль речи и интимный характер повествования.
В контрольном тесте в качестве эталонного входного материала использовался образец повествования с наиболее выраженным стилем, и задавался запрос на продолжение текста в том же общем ключе — с женской точки зрения и в интимном стиле повествования.
Оба результата точно воспроизвели запрошенное продолжение, но ни один из них не соответствовал эталону. Первый результат перешел в хриплый, едва слышный шепот и получил умеренную оценку сходства голоса — 2 из 5. Во втором случае было установлено, что использовался мужской голос; оценка сходства составила 1 из 5, а перед началом речи были добавлены примерно 17 секунд нежелательных звуковых эффектов.
Здесь следует отметить важное ограничение, связанное с местом выполнения. Конечная точка задачи Anywhere приняла поле ссылки, но не вернула подтверждение, показывающее, как вышестоящая модель использовала эту ссылку. Эти результаты доказывают, что непрерывность ссылок в рамках нашего тестового маршрута была ненадежной; они не доказывают, что собственный API BytePlus всегда ведет себя таким же образом.
Стоимость и ограничения Seed Audio 1.0

Оплата производится по секундам, при активации услуги предоставляется 60 бесплатных минут.
максимальная мощность
символы командной строки
аудиоматериалы
эталонное изображение
BytePlus указывает официальную стоимость услуги с оплатой по факту использования в размере $0,15 за каждую минуту работы, с тарификацией по секундам, при этом 60 минут бесплатного пробного доступа при активации сервиса. В документации по API указано, что Максимальная мощность в течение 120 секунд, поддерживает подсказки длиной до 3 000 символов, позволяет до три эталонных аудиофрагмента, и принимает одно эталонное изображение.
Продолжительность каждого эталонного аудиофрагмента не должна превышать 30 секунд, а размер — 10 МБ. Максимальный размер эталонного изображения составляет 10 МБ. Указанные ограничения установлены платформой BytePlus; сторонние платформы могут предлагать формы ввода с меньшими ограничениями или применять иную систему ценообразования.
На нашем тестовом маршруте Anywhere/BrolyAI затраты на отправку данных учитывались отдельно и в среднем составляли около $0.14 за каждую сгенерированную минуту. Это поле, относящееся к тестовой среде, не следует путать с розничными ценами BytePlus или окончательной ценой на другой платформе.
Плюсы и минусы Seed Audio 1.0
В чем его преимущества
- Объединенные звуковые эффекты, фоли, окружающие звуки и музыка
- Отличное чувство ритма в диалогах
- Четко выраженная идентичность, основанная на длинных текстах
- Полезная музыка для кино
Где происходит поломка
- Большая дисперсия между отдельными пробоотборами
- Периодическое неразборчивое произношение
- Подсчёт слабых точных SFX
- Нарушение непрерывности маршрута
Плюсы
- Генерирует голос, фоновые звуки, звуковые эффекты и музыку за один проход.
- В ходе наших многократных тестов было отмечено отличное время отклика диалога.
- Четкое разделение реп между двумя исполнителями и точная передача текста.
- Создает полезную автономную кинематографическую музыку.
- Сохраняет стиль изложения и связность повествования на протяжении двух минут.
- По нашему тестовому маршруту выводится чистый стерео-файл WAV с частотой 40 кГц.
Cons
- Результаты повторных прогонов могут значительно различаться по степени естественности и достоверности.
- Иногда наблюдается галлюцинаторная или неразборчивая речь.
- Точные данные о количестве звуковых эффектов не являются достоверными.
- В некоторых завершенных сценах отсутствует заключительное событие, указанное в задании.
- Многоязычное исполнение требует тщательного анализа.
- В нашей тестовой среде непрерывность воспроизведения эталонного голоса оставляла желать лучшего.
- Массовая параллельная отправка запросов привела к возникновению ошибок параллелизма на верхнем уровне, хотя за невыполненные задачи оплата не взималась.
Кому рекомендуется использовать Seed Audio 1.0?
Seed Audio 1.0 идеально подходит для звукорежиссеров, которые мыслят сценами, а не отдельными аудиоэлементами. Это особенно полезно при создании радиопостановок, диалогов для игр, кинематографических прототипов, звуковых сторибордов, концепций подкастов и коротких саунд-эффектов, создающих напряжение.
В качестве системы окончательной доставки «в один клик» она выглядит менее убедительно. Если точная формулировка, голосовая идентичность или количество событий имеют решающее значение с юридической или творческой точки зрения, следует предусмотреть несколько итераций и проверку специалистом. Модель работает наиболее эффективно, когда к ней подходить как к быстрому «звуковому режиссёру» с несколькими дублями, а не как к детерминированному рендереру.
Часто задаваемые вопросы
Является ли Seed Audio 1.0 моделью преобразования текста в речь?
Может ли Seed Audio 1.0 генерировать звуковые эффекты без речи?
Может ли программа Seed Audio 1.0 генерировать музыку?
Как долго может работать программа Seed Audio 1.0?
Поддерживает ли Seed Audio 1.0 эталонный звук?
Сколько стоит Seed Audio 1.0?
Окончательный вердикт
Seed Audio 1.0 — это действительно интересная унифицированная аудиомодель. Возможность генерировать реалистичную речь, звуковые эффекты, фоновые звуки и музыку на основе одного запроса — это не просто рекламный слоган: наши тесты со смешанными сценами и музыкой показали, что все эти элементы могут гармонично сочетаться друг с другом.
Её главным преимуществом было правильное время произнесения реплик. Её главным недостатком была нестабильность. На примере 23 образцов модель неоднократно демонстрировала отличный результат в лучшем случае и заметно более слабый результат в альтернативном варианте.
В случае творческого прототипирования такой компромисс легко принять. Создайте несколько версий, оставьте наиболее удачную и проанализируйте каждую концовку. При детерминированном производстве, точном сопоставлении голосов или работе, где важно точное количество событий, включите в рабочий процесс этап проверки и редактирования человеком.
Общий вывод: Seed Audio 1.0 — один из самых функциональных генераторов звука на уровне сцены из всех, что мы тестировали, однако его лучше всего использовать в качестве творческого инструмента для работы с несколькими дублями, а не для однократного финального рендеринга.



