一个模型就能构建整个声音场景。.
Seed Audio 1.0 能够将人声、音效、环境音、节奏和器乐融合在一起。我们的测试发现,该软件的创意上限异常之高——但同时也存在一个不容忽视的可重复性问题。.
Seed Audio 1.0 是我测试过的首批音频模型之一,它给人的感觉是围绕整个场景而非单一输出类型进行设计的。它能够根据同一条提示进行语音合成、表演、添加环境音、制作音效、将对话放置在时间轴上,并生成器乐音乐。.
简短评价: Seed Audio 1.0 在统一音频创作方面具有异常高的潜力,特别是在同步对白和电影级音效场景方面。其弱点在于可重复性。. 一次表现出色的生成结果可能听起来非常完整,而针对同一提示生成的另一段内容,则可能会出现语音失真、遗漏某个事件,或者更改了要求的语气。.
我通过 Anywhere/BrolyAI 测试环境生成了 23 个带评分样本。这些样本涵盖了旁白、双人对话、带时间戳的语音、纯音效片段、人声加音乐场景、独立音乐、多语言表演、两分钟独白以及参考音频延续等内容。.

Seed Audio 1.0 评测:简评

| 类别 | 我们的测试结果 |
|---|---|
| 富有表现力的嗓音 | 在最佳运行时质量上乘,但在重复运行中表现不稳定 |
| 多角色对话 | 精准的脚本和出色的声道分离效果 |
| 对话时机 | 在我们的测试集中最可靠的特征 |
| 声音效果 | 空间和事件顺序符合实际;在精确计算事件数量方面较弱 |
| 配音 + 音效 + 音乐 | 当每个预期的事件都如期发生时,整个场景便显得极具说服力 |
| 独立音乐 | 表现比预期的更出色;生成了结构清晰的30秒提示音 |
| 多语言语音 | 虽然是极佳的最佳情况,但在两次运行中有一次回放了多余的语音 |
| 两分钟音频 | 两次运行中均展现出鲜明的叙事风格和连贯的叙事逻辑 |
| 参考音频 | 在我们的测试环境中表现不稳定;语音相似度较低 |
最适合 创作者们正在制作广播剧、游戏场景、播客创意、影视原型以及以音频为主的故事板。.
不太适合: 需要确定性表述、精确的重复事件计数,或通过单次无人值守生成即可实现可靠语音克隆的任务。.
什么是 Seed Audio 1.0?

Seed Audio 1.0 是字节跳动Seed推出的统一文本转语音生成模型。它不再将语音、环境音、音效和音乐视为独立任务,而是能够将它们整合生成一个完整的音频场景。 官方产品页面显示,该模型支持以 100 毫秒为间隔的对话时序控制,并可在单次处理中生成长达两分钟的内容。.
这种统一的设计才是真正的魅力所在。一条提示词可以描述说话者是谁、他们的声音听起来如何、房间里发生了什么、哪些音效会在后续加入,以及场景背景中播放着什么样的音乐。如果演绎得当,最终效果听起来会像是一首精心创作的乐曲,而非拼凑而成。.
这里存在一个重要的界限。字节跳动自身的路线图指出,目前精细的时机控制主要集中在角色对话上。对音效、环境音和音乐的更精准控制,仍是需要进一步开发的领域。我们的测试结果印证了这一区分:对话的时机控制非常出色,而音效的精确计数则不太可靠。.
2026年8月6日核查的官方来源:
我们如何测试Seed Audio 1.0
我们设计了九项任务,并进行了23轮带评分的生成。大多数性能测试都进行了两到三次重复,因为仅凭一个经过精心打磨的样本,很难判断生产可靠性。.
| 测试 | 任务 | 运行次数 |
|---|---|---|
| T01 | 富有表现力的英语旁白 | 3 |
| T02 | 两人之间的无线电对话 | 3 |
| T03 | 0、4 和 9 秒处的对话 | 3 |
| T04 | 仅含特效的走廊场景 | 2 |
| T05 | 人声、环境音、音效和音乐 | 3 |
| T06 | 纯器乐作品 | 3 |
| T07 | 英语、日语和德语中都有的一个字符 | 2 |
| T08 | 120秒播客独白 | 2 |
| T09 | 参考语音的续篇 | 2 |
这23项计划产出包含约12.5分钟的生成音频,并在测试环境中报告的上游生成成本为$1.7504。Seed Audio 未返回文本令牌的使用情况。计费基于生成的秒数,因此生成令牌被记录为“不适用”。.
所有评分输出均为 40 kHz、16 位、立体声 PCM WAV 文件。当无法直接进行自动播放时,Gemini 3.6 Flash 会接收这些 WAV 文件作为音频输入,并返回结构化转录文本、事件核查、时间估算以及瑕疵说明。 这些判断结果是自动聆听评估,而非人工MOS评分。.
声音生成:高音表现出色,重复性不稳定
T01 · 富有表现力的叙述
高方差其中一段话显得冗长且不自然,一段听起来生硬,还有一段则自然流畅、完整。.
使用的提示词
一位语调平和的女旁白念出两句完全相同的台词,语气从担忧逐渐转为自信。没有背景音乐或音效。.
旁白提示要求一位语调沉稳的女播音员朗读两句完全相同的台词,语气从克制的担忧逐渐转为日益增强的自信,且背景中不得有任何声音。.
这三次运行表现截然不同:
- 第1轮: 说出了要求的台词,随后又即兴说了几秒钟含糊不清的话。.
- 第2轮: 虽然说出了完全相同的台词,但语速很慢,而且断断续续。.
- 第3轮: 以自然流畅的方式完整演绎了整段台词,节奏把握得恰到好处,语调也始终如一。.
这是本次评测的核心结论。Seed Audio 1.0 能够生成出色的语音表现,但对于对措辞要求严格的工作而言,仅进行一次生成是不够的。在发布前,请生成多种备选方案并仔细聆听整个语音片段。.
该模型在所有三次旁白生成中均遵守了负面指令:未检测到音乐、音效以及任何不需要的背景声。.
多角色对话与说话人分离
T02 · 双人广播剧
3/3 完整脚本这三份剧本完全一致。各条的现场音和引子长度有所不同。.
使用的提示词
玛雅低声细语,伊莱平静地回答,三段固定的对话之间,冰箱的嗡嗡声若隐若现。.
便利店那场戏中,有两个成年角色和三句固定台词。玛雅必须紧张地低声说话,而伊莱则努力让自己听起来很平静。要求的唯一背景音是冰箱轻微的嗡嗡声。.
这三段播放均按正确顺序呈现了对话,且采用了两种截然不同的声音。表现最佳的那段播放不仅台词精准无误、说话者声音分明、情感表达自然,还伴随着持续不断的冰箱嗡嗡声。.
其他几段片段则存在一些较小的场景层面的问题。其中一段在30秒的时长中,大约前半段都在播放环境音,之后才开始对话;另一段则遗漏了要求的冰箱嗡嗡声。虽然这两个失误都没有破坏对话场景的效果,但都降低了剪辑效率。.
对于有声剧而言,实际效果令人鼓舞:Seed Audio 能够准确把握角色转变和声音对比。您可能仍需剪掉过长的开场白,或重新生成以获得合适的环境音。.
对话的节奏把握是表现最突出的一点
T03 · 提示级计时
最可靠这三次运行均将线段定位在目标点附近,且误差在评估器的时序不确定性范围内。.
使用的提示词
在0.0、4.0和9.0秒处分别放置三条广播音轨,配音者分别为男性、女性和男性。.

时序测试要求使用三条无线电线路:
- “第七小队,报告。”在0.0秒时。.
- “北入口已控制。” 4.0 秒时。.
- “9.0 秒时:”保持原地。”.
在全部三次运行中,语音片段、顺序以及“男-女-男”的发言者模式均正确。Gemini的音频估计结果显示,重复运行的起始时间分别约为0.1、4.0和9.0秒。 第一轮的起始时间估计值分别为约0.1、3.9和8.9秒。.
这些测量结果不应被视为具有100毫秒精度的实验室级证据——评估工具本身就指出其不确定度约为0.1秒。即便有这一限制,这也是我们在测试中发现重复性最强的功能。如果您需要将对话插入到接近计划时间轴位置的地方,Seed Audio 1.0的表现尤为令人期待。.
特效生成:逼真的场景,计数不准确
T04 · 仅含音效的走廊
计数失败空间感和秩序感令人信服,但这两次跑动分别产生了四声脚步声和两声脚步声。.
使用的提示词
钥匙声、一扇沉重的门、恰好三步的脚步声、雷声,以及最后一声砰地关门声。没有说话声,也没有音乐。.
该纯音效提示描述了一条铺着瓷砖的小走廊:麦克风旁有钥匙,一扇厚重的木门打开,三声缓慢的脚步声渐行渐远,远处传来雷声,最后是门“砰”地一声关上的声音。禁止出现对话和音乐。.
这两种输出方式都营造出了逼真的声学空间,保留了事件的顺序,并避免了人声或音乐的串音。这些效果被认为非常逼真,具有良好的距离感和空间一致性。.
这两次播放的结果都不完全符合预设的音效数量。一次产生了四个脚步声,另一次产生了两个。这使得Seed Audio在生成逼真的音效概念时非常有用,但当剪辑师需要精确三个撞击声、敲击声、脚步声或枪声时,其可靠性就相对较低了。.
最佳工作流程是先使用单次处理的音效生成技术来营造氛围并进行快速原型制作,然后在数字音频工作站(DAW)中替换或编辑那些对帧数要求严格的片段。.
一个场景中的配音、环境音、音效和音乐
T05 · 完整电影版混音
已完成2/3三轮中,有两轮每杆都完成了。有一轮错过了最后的金属撞击。.
使用的提示词
雨巷、车流、警笛声、侦探的低语、弦乐的脉动、急促的脚步声,以及金属撞击声。.

这个全景测试场景刻意营造出拥挤的氛围。其中包含湿漉漉的夜间小巷、水滴声、车流声、远处警笛声、侦探的低语、克制的弦乐、急促的脚步声,以及金属门被重重关上的声响。.
三次播放中有两次完整呈现了整个事件序列。对话在环境音和音乐的背景下依然清晰可辨,场景在空间上显得连贯统一,而非像几段互不相关的片段拼接而成。其中一次播放虽然营造了正确的氛围并准确还原了台词,但遗漏了最后的金属撞击声。.
这正是统一模型展现出最大优势的地方。在分镜设计和创意构思阶段,根据一个提示生成完整的混合场景,比分别获取每个组成部分更快、更具表现力。而在最终制作阶段,重要的结束提示仍需进行验证。.
Seed Audio 1.0 能生成音乐吗?
T06 · 独立音乐
音乐作品这三首作品都属于结构化音乐。其中一首让带弱音器的钢琴声难以辨识。.
使用的提示词
一首72 BPM的悬疑配乐,包含大提琴固定音型、弱音钢琴、模拟持续音、渐强段以及未解决的结尾。.

是的。在我们的测试中,Seed Audio 1.0 生成了可辨识的独立器乐作品,而不仅仅是一种模糊的环境音效。.
创作提示要求制作一段时长30秒、节奏为72 BPM的悬疑配乐,包含低音大提琴的持续音、带弱音器的钢琴脉冲音、柔和的模拟持续音、清晰的渐强处理以及未解决的终结和弦。这三段演示曲均形成了一段连贯的音乐片段,既符合要求的节奏氛围,也达到了预期的结尾效果。 其中两段包含所有要求的元素;但在其中一段中,带弱音器的钢琴声难以辨识。.
这并不意味着Seed Audio就能自动取代专业的歌曲生成器。我们的任务是制作一段简短的电影配乐,而不是带有歌词的副歌-主歌结构的歌曲。尽管如此,其音乐生成能力依然足够强大,足以支持游戏场景、预告片、播客以及预可视化——尤其是在音乐必须与对话和音效设计在同一生成过程中相互配合的情况下。.
多语言性能:最佳情况表现优异,最差情况表现较弱
T07 · 同一声音,三种语言
1/2 已清理一次运行毫无瑕疵;另一次则在语言切换时出现了重复和语义混乱的现象。.
使用的提示词
一位女性角色用同样的语气和沉稳的情绪,流利地讲着英语、日语和德语。.

在一项多语言任务中,要求一位女性角色用英语、日语和德语分别演绎同一个录音场景中的角色。两次演绎给人的印象截然不同。.
表现较佳的运行结果准确地生成了全部三句话,保持了相同的语调,情绪平稳,停顿处理得当。表现较差的运行结果虽然英语部分开头正确,但在日语部分出现了重复和语义错乱,并导致德语开头部分出现错误。其跨语言语调的一致性明显下降。.
这意味着Seed Audio 1.0能够呈现出令人信服的多语言角色表现,但该功能需要多个候选项以及具备语言意识的审核。请勿仅通过检查第一种语言就批准多语言输出结果。.
两分钟生成与长篇语音的稳定性
T08 · 120秒独白
2/2 稳定版这两个文件都持续了120秒,其中一个声音非常稳定,另一个则出现了一次短暂的发音卡顿。.
使用的提示词
一位男性播客主持人讲述了一个结构严谨的气象站故事,其中包含三项发现,但未提供任何背景信息。.

这两项长篇任务生成的WAV文件时长均为120秒。每项任务均采用一位男性播客主持人的声音,音质为干声,无背景音乐,也无音效。.
首次运行过程中,整个文本始终保持了统一的叙述语气和连贯的调查结构:开篇清晰,包含三个按时间顺序排列的发现,情绪从好奇逐渐转向不安,最后留下一个未解之谜。未发现明显的叙述语气偏离或内容混乱的段落。.
第二次生成同样连贯且稳定,仅在1分31秒左右出现了一次短暂的发音磕绊。对于一段两分钟、仅生成一次的独白而言,这是一个非常出色的结果。这表明Seed Audio关于“长篇”的宣称并非仅仅是时长限制;该模型能够在整个时间窗口内保持角色身份和叙事结构的连贯性。.
参考音频的连续性需谨慎对待
T09 · 参考资料续篇
路线不确定文本完全一致,但语音相似度较低;其中一个输出结果被改为男声,并添加了音效。.
使用的提示词
在保持语调特色和亲密录音风格的同时,延续来自一位受认可的女性参考音源的内容。.
该参考测试采用最具感染力的叙述样本作为授权输入,并要求以同样的女性视角和亲密叙事风格进行后续创作。.
这两个输出结果虽然都准确复述了要求的后续内容,但均与参考音频不甚吻合。第一个输出转为带气音的轻声耳语,其保守的语音相似度评分为2/5。第二个输出被判定为使用男性声音,相似度评分为1/5,且在开始说话前还添加了大约17秒的不需要的音效。.
这里存在一个重要的环境限制。Anywhere 任务端点虽然接受了引用字段,但并未返回确认信息,说明上游模型是如何使用该引用的。这些结果证明,通过我们的测试路径,引用的连续性并不可靠;但并不能证明 BytePlus 的原生 API 总是表现得一样。.
Seed Audio 1.0 的定价与限制

按秒计费,激活服务后可享60分钟免费试用。.
最大输出
提示字符
音频参考资料
参考图片
BytePlus 列出的官方按量计费价格为 每生成1分钟$0.15, ,按秒计费,其中 60分钟免费试用 当服务被激活时。API 文档中规定了 120秒最大输出, 支持长度不超过 3,000个字符, 最多允许 三个参考音频片段, ,并接受一张参考图片。.
每个参考音频片段最长为 30 秒,大小上限为 10 MB。参考图像的大小上限为 10 MB。这些是 BytePlus 自身的限制;第三方平台可能会提供更小的输入表单,或采用不同的定价方案。.
我们的 Anywhere/BrolyAI 测试路线单独报告了上行成本,平均每生成一分钟约为 $0.14。该测试环境的数值不应与 BytePlus 的零售定价或其他平台的最终价格混淆。.
Seed Audio 1.0 的优缺点
其优势所在
- 统一的对话、音效、环境音和音乐
- 对话节奏把握得恰到好处
- 鲜明的长篇内容特色
- 实用的电影配乐
断裂处
- 各次测量间存在较大差异
- 偶尔出现语无伦次的情况
- 弱精确SFX计数
- 我们路线中的参考连续性不可靠
优点
- 一次处理即可生成语音、环境音、音效和音乐。.
- 在多次测试中,对话的时机把握得非常到位。.
- 两声道分离度高,且能精准还原台词。.
- 创作实用且可独立成篇的电影配乐。.
- 在两分钟内保持语调一致和叙事连贯性。.
- 通过我们的测试路径输出清晰的 40 kHz 立体声 WAV 文件。.
缺点
- 重复运行的结果在自然度和可靠性方面可能存在巨大差异。.
- 偶尔出现幻觉或语无伦次。.
- 音效的具体次数并不准确。.
- 某些完整的场景缺少了最后一个要求的事件。.
- 多语言版本需要仔细审核。.
- 在我们的测试环境中,参考语音的连续性较差。.
- 高并行度提交触发了上游并发错误,不过失败的任务不会被计费。.
哪些人适合使用 Seed Audio 1.0?
Seed Audio 1.0 非常适合那些以场景而非孤立素材为创作思路的音频创作者。它特别适用于广播剧、游戏对话、影视原型、音频分镜、播客概念以及短篇悬疑配乐。.
作为“一键式”最终交付系统,它的说服力稍显不足。如果精确的措辞、声音特征或事件计数在法律或创意层面至关重要,请预留时间进行多次生成并由人工审核。将该模型视为一位提供多次录音版本的“快速音频导演”,而非确定性渲染器,其效果最佳。.
常见问题
Seed Audio 1.0 是一个文本转语音模型吗?
Seed Audio 1.0 能否生成不含语音的声音效果?
Seed Audio 1.0 能生成音乐吗?
Seed Audio 1.0 最多能生成多长时间的内容?
Seed Audio 1.0 是否支持参考音频?
Seed Audio 1.0 的售价是多少?
最终判决
Seed Audio 1.0 是一个真正引人入胜的统一音频模型。它能够根据同一条提示生成逼真的语音、音效、环境音和音乐,这绝非仅仅是发布时的宣传噱头:我们的混合场景和音乐测试表明,这些元素能够完美融合。.
该模型的最大亮点在于对话的节奏把握,而最大的弱点则在于一致性。在23个样本中,该模型多次展现出极佳的最佳表现,但其备选版本的表现则明显较弱。.
对于创意原型设计而言,这种权衡很容易接受。生成多个版本,保留最出色的版本,并仔细检查每个结局。对于确定性生产、精确的语音匹配或对事件计数敏感的工作,请在工作流程中保留人工审核和编辑环节。.
总体评价: Seed Audio 1.0 是我们测试过的功能最强大的场景级音频生成器之一,但它最适合作为多遍创作工具使用,而非一次性最终渲染工具。.



