ElevenLabs Music v2 评测:实际表现、API 及提示词

elevenlabs-music-v2-评测-hero-3x2-v2

AI音乐领域发展迅猛,而ElevenLabs Music v2 是最雄心勃勃的新歌生成模型之一。但它能否保留用户提供的歌词、遵循详细的编曲要求,并在无需大量编辑的情况下生成可用的音轨呢?

我们使用三段原始的90秒音频片段进行了测试:一首合成器流行人声歌曲、一首电影风格的器乐曲,以及一首八声部的另类流行乐编曲。本评测涵盖了音质、提示符符合度、生成时间、任务报告成本、官方控制功能以及API访问等方面。.

简答:ElevenLabs Music v2 表现如何?

我们的简短评价

在创意简报要求使用露骨歌词和段落控制时,ElevenLabs Music v2的表现最为出色。. 它生成了所有三个要求的90秒音频文件,在我们的歌词测试中完整保留了提供的歌词,并且使八个指定的歌曲片段听起来非常清晰。.

在细节处理上稍显不够精准:一段乐器打击声比要求的时间提前出现,一段乐器间奏时间过长,而且这首结构完整的歌曲结尾更像是渐隐,而非提示中要求的干净利落的终结和弦。.

  • 观测到的最大强度: 歌词和歌曲的结构。.
  • 主要局限性: 时间控制和结束指令并不总是非常精确。.
  • 测试范围: 三次受控的API运行,并非行业基准测试。.

ElevenLabs Music v2 也可通过 GlobalGPT 的音频生成器获取。通过这种方式,可以将多个音频和 AI 模型整合到一个账户中,无需单独配置 VPN 或服务商,并能降低维护多个独立订阅的成本。.

ElevenLabs Music v2 概述

在查看我们的结果之前,有必要将该模型已公布的特征集与这三个提示语实际上能够证明的内容区分开来。.

什么是 ElevenLabs Music v2?

ElevenLabs 于 2026 年 5 月 26 日推出了 Music v2 作为一款针对歌曲和伴奏的升级版音乐生成模型。该公司表示,此次发布在人声、乐器演奏、编曲、多语言支持、密集的歌词呈现、曲风过渡以及图像修复方面均有所提升。.

Music v2 为 ElevenMusic、ElevenAPI 和 ElevenCreative 提供支持。通过该 API,开发者可以以编程方式生成音轨、使用填补功能编辑选定区域,并进行参考匹配操作。.

型号 ID
music_v2
最长持续时间
5分钟
已发布的API费率
$0.15/分钟
音频输出
44.1 kHz
发布码率
128–192 kbps
API 访问
付费用户
ElevenLabs 官方《Introducing Music v2》发布页面
’ElevenLabs”官方Music v2发布页面,2026年8月核查。.

ElevenLabs Music v2 测试结果

我们使用了 三次受控的API运行 目标时长固定为90秒。GPT在我们的平台上生成了一组原始歌词,我们在测试Music v2之前将其锁定。聆听笔记已与Gemini 3.6 Flash音频分析结果进行了交叉核对。 下文中的时间均为本地端到端生成时间;费用数值则来自已完成的任务报告。.

测试 1:带歌词的流行歌曲

测试 01附有歌词的流行歌曲
90秒目标112 BPM未成年人女高音

任务设置: 请创作一首当代合成器流行歌曲,讲述两个人深夜离开一座城市的故事,并严格使用提供的歌词。我们在评审时重点考察了歌词的完整性、人声的清晰度、副歌的感染力、编曲以及是否使用了要求的终结和弦。.

显示完整的可复制提示语
创作一首完全原创的90秒当代合成器流行歌曲,主唱为温暖且富有表现力的中音女声。采用112 BPM和A小调。整体氛围应充满希望、亲密且富有电影感。开场以弱音电钢琴和柔和的模拟合成器脉冲声开始。 在第一段歌词中加入圆润的贝斯和紧凑的电子鼓点,在前副歌部分营造张力,随后过渡到宽广且令人难忘的副歌,并配以克制的背景和声。保持主唱声音清晰且居中,乐器声部分离分明。不得包含说唱式引子、说唱、人群声、模仿真实艺人的演唱,也不得使用淡出效果。 以一个清晰的终结和弦收尾。

请严格按照以下歌词演唱。不得添加、删除、替换或调整词语或段落的顺序。

[第一段]
城市灯光在我们身后渐渐淡去
寂静的街道如今指引着方向
午夜的低语,不再回首
新的地平线划破灰蒙
[前副歌]
手牵手,我们踏上未知的旅程
追寻属于我们自己的梦想
[副歌]
在这寂静的夜里,我们活着
在天际线彼端寻觅星辰
虽迷失在阴影中,却依然璀璨
携手同行,我们将重新定义
[第二段]
空荡的道路上,脚步轻柔
每一口气,都诉说着一个故事
没有承诺,只有无垠的天空
你的眼中,未来正等待
[终结副歌]
在这静谧的夜里,我们生机勃勃
在天际线彼端寻觅星辰
虽迷失在阴影中,却依然璀璨
携手同行,我们将重新定义
测试 01 结果歌词风格高度统一,电子前奏部分较长
90.0秒输出
42.0秒生成时间
$0.225任务费用
  • 歌词没有明显的偏差 在给定的单词中检测到了该词。.
  • 这首作品呈现出精致电子合成器流行乐的风格,人声与乐器之间分离度清晰。.
  • 在人声出现之前,前奏感觉比要求的要长。.

测试 2:电影风格器乐曲

测试 02电影风格器乐曲
90秒目标82 BPMD小调无人声

任务设置: 以一个耳熟能详的毛毡钢琴主题为核心,创作一段科幻风格的配乐,要求管弦乐声部逐渐增强,铜管乐器仅出现在最后三分之一处,不包含人声元素,并以一个圆满的结尾收尾。.

显示完整的可复制提示语
为一段充满戏剧张力的科幻探索场景创作一段完全原创的90秒电影风格器乐配乐。节奏为82 BPM,调性为D小调。不得包含人声、白话、低语、合唱或任何类似人声的声音。 以稀疏的毛毡钢琴主题和低音弦乐的持续音静谧开场。开场后引入微妙的模拟脉冲,随后通过分层弦乐和克制的低音打击乐逐渐铺陈。仅在最后三分之一处加入铜管乐器。在接近结尾处达到一个清晰的情感高潮,避免过度的音量或失真。 保持钢琴主题的辨识度,并确保钢琴、弦乐、打击乐、合成器脉冲和铜管乐器之间保持清晰的分离度。使用真实的管弦乐音色,混音效果应开阔但受控。前半部分避免使用预告片式的突击音效。不要模仿现有的配乐、作曲家或影视系列。结尾应以一个解决后的持续和弦收尾,而非淡出。.
测试 02 结果令人信服的电影式铺陈,开篇便给人留下深刻印象
90.0秒输出
20.9秒生成时间
$0.225任务费用
  • 无类似人声的质感 已被检测到。.
  • 随着编曲围绕这一钢琴主题展开,该主题依然清晰可辨。.
  • 某项影响的出现时间早于简报中允许的时间,导致对严格时间要求的遵守程度有所减弱。.

测试 3:八声部歌曲结构

测试 03八段式歌曲结构
90秒目标104 BPMD大调固定章节顺序

任务设置: 创作一首另类流行歌曲,歌曲包含八个可辨别的乐段,且顺序固定:前奏、主歌、前副歌、副歌、器乐间奏、过渡段、终结副歌和尾奏。.

显示完整的可复制提示语
创作一首完全原创的90秒另类流行歌曲,主唱为音色清晰、富有表现力的男高音。采用104 BPM和D大调,以现代另类流行风格制作,发音自然,人声效果克制。不得包含旁白、说唱、模仿真实艺人或淡出处理。 请严格保留以下段落顺序,并确保每次制作变化都能被清晰听出:前奏——约6秒,仅含经过滤波处理的电吉他和远处的合成器;主歌——加入干声贝斯和鼓边敲击声;前副歌——加入渐强的垫音,但不使用完整鼓组;副歌——加入完整鼓组、更宽广的合成器音色以及清晰的旋律钩子; 器乐间奏——约8秒,无人声,回响副歌旋律;过渡段——简化为钢琴伴奏和近距离亲密的人声;最终副歌——恢复完整乐队编曲,加入和声及八度吉他旋律线,并使其气势比第一个副歌更宏大; 尾奏——移除鼓组,回归经过滤波处理的吉他声,并以一个清澈的终结和弦收尾。

请严格按照以下歌词演唱。不得添加、删除、替换、调整顺序,也不得将括号内的器乐指示当作歌词演唱。

[前奏]
(器乐)
[主歌]
龟裂的表盘哼着破碎的旋律
指尖轻抚褪色的线条
静电的低语充盈整个房间
在错综复杂的征兆中搜寻
[前副歌]
信号闪烁,声音模糊
等待着那深邃的声音
[副歌]
你能穿过噪音听见我吗?
遥远的呼唤,脆弱的选择
杂音渐消,声音愈发清晰
紧握不放,我们会找到那片喧嚣
[器乐间奏]
(器乐)
[过渡段]
破碎光线中的脆弱希望
柔和的回声,将我拉近
在寂静中,你悄然出现
[终曲副歌]
你能穿过喧嚣听见我吗?
遥远的呼唤,脆弱的选择
杂音渐消,声音愈发清晰
紧握不放,我们会找到那喧嚣
[尾声]
低语化作歌声
我们回到了该在的地方
测试 03 结果最清晰的结构效果,但时间控制尚不完美
90.0秒输出
20.9秒生成时间
$0.225任务费用
  • 这八个部分都很容易辨认, ,其中桥段与最后一段副歌形成了鲜明的对比。.
  • 这段器乐间奏的时间超过了要求的8秒。.
  • 结尾处理得更像是一种渐弱,而非提示中提到的那个干脆利落的终止和弦。.

三项测试揭示了什么

性能测试结果

3/3可用的输出结果

每次运行都会生成一个符合该广泛音乐任务要求、可播放的90秒音频文件。.

1清晰歌词通行证

在我们的听觉检查中,提供的流行歌曲歌词未显示出明显的偏差。.

8可听部分

这种固定结构的歌曲使得所有指定段落都易于辨识。.

  • 主唱: 在测试1中,图像清晰、居中,且与电子背景之间留有足够的间距。.
  • 器乐作品: 测试2中的钢琴主题和有节制的渐强处理表明,该模型不仅能处理流行人声。.
  • 提示词控制: 整体结构比场景层面的节奏安排更为重要;开场、转折、高潮和结尾仍需人工审核。.
  • 编辑负担: 这三个成果中没有一个无法使用,但测试2和测试3在正式投入生产前需要对编排进行微调。.

效率研究结果

三次90秒运行中的生成时间
流行演唱
42.0秒
纯音乐
20.9秒
八声部歌曲
20.9秒

本地平均端到端生成时间: 27.9秒. 本地时间包括请求处理、轮询和网络延迟;它并非服务端延迟。.

  • 总产量: 三个文件共计270秒。.
  • 任务报告的总费用: $0.675.
  • 每次运行费用: $0.225 持续 90 秒,这相当于 1.5 分钟乘以官方规定的每分钟 $0.15 的 API 速率。.
  • 不重播: 这三项任务均在首次录制时就产生了可用的音频。.

如何访问 ElevenLabs Music v2

通过 ElevenLabs 访问

  • 使用 ElevenMusic 进行基于浏览器的作曲。.
  • 使用 ElevenAPI 进行程序化生成和编辑。.
  • "(《世界人权宣言》) 音乐 API 仅向付费用户开放.
  • “Starter”及以上套餐均提供商业用途许可。.

通过 GlobalGPT 访问

  • 在一个账户中,将 Music v2 与其他音频和 AI 模型结合使用。.
  • 无需单独配置VPN或服务提供商。.
  • 维护一个平台的成本可能比维护多个独立订阅的总成本更低。.
  • 您可以切换到另一种模型,而无需重新构建整个工具集。.
试用 GlobalGPT 音频发生器

API 访问和可用控件

官方 SDK 通过以下方式提供该模型: elevenlabs.music.composemodel_id="music_v2". 一个基本请求可以设置一个自然语言 推动音乐时长(毫秒). 作曲方案能进一步优化乐章结构、歌词时长及编曲控制。.

  • 生成: 根据提示创作一首完整的歌曲或纯音乐。.
  • 详细答复: 请求有关生成的作品的更多信息。.
  • 流媒体: 无需等待文件下载完成,即可开始接收音频。.
  • 图像修复: 对选定区域进行再生,而不是替换整条音轨。.
  • 参考匹配: 在条件允许的情况下,借助参考资料引导一代人。.

提及受版权保护的艺术家、歌曲或受保护歌词的提示可能会触发 bad_prompt糟糕的构图方案 回答。请描述音乐特征,而不是询问在世艺术家的具体风格。.

API 请求示例

Python SDK型号:music_v2
import os
from elevenlabs import ElevenLabs, save

client = ElevenLabs(api_key=os.environ["ELEVENLABS_API_KEY"])

audio = client.music.compose(
    model_id="music_v2",
    prompt=(
 "创作一首原创的电影配乐,包含柔和的钢琴声、"
 "低音弦乐、渐强效果以及一个解决的终止和弦。"
    ),
    music_length_ms=90_000,
)

save(audio, "music-v2-test.mp3")

请将 API 密钥保存在环境变量中,而非脚本内部。对于生产环境中的应用程序,在生成长音轨之前,请添加请求日志记录、重试限制以及明确的成本上限。.

定价及我们的测试费用

项目已验证的值是什么意思
官方音乐API费率每分钟 $0.15发布于 ElevenLabs API 定价页面, ,不含税、费及关税。.
最长时长5分钟单条音乐请求的最大发布长度。.
我们的90秒任务任务$0.2251.5 分钟 × $0.15;由每项已完成的测试任务报告。.
我们三项测试的总分$0.675三段90秒的输出;不包含重播费用。.

我们测试记录中的单价与官方 API 价格一致。GlobalGPT 的价值在于提供整合访问服务并减少单独订阅的数量——而非经核实的 Music v2 每分钟价格更低。.

如何向 ElevenLabs Music v2 发出提示

当简报将音乐目标与不可协商的限制条件区分开来时,Music v2 的响应效果最佳。请按以下顺序构建提示词:

1输出歌曲或器乐曲,以及时长。.
2音乐画框曲风、氛围、节奏、调性及声部类型。.
3安排开头、段落转换、高潮和结尾。.
4优先级混合声部位置、声部分离、音量和空间感。.
5除外条款没有对话、没有淡入淡出、没有人群,也没有声音质感。.
6歌词与结构章节标签以及文字是否可以更改。.

有用的英语音乐术语

点击任何术语或描述词即可将其复制。. 例如 温暖而富有亲和力的主唱嗓音,发音清晰。.

01歌词——第一首流行歌曲一首采用您原话创作的原创人声歌曲
03背景音乐适用于视频、播客、产品演示或咖啡馆