ElevenLabs Music v2 評測:實際表現、API 與提示詞

elevenlabs-music-v2-評測-hero-3x2-v2

AI 音樂領域發展迅速,而 ElevenLabs Music v2 正是其中最具野心的全新歌曲生成模型之一。但它能否保留提供的歌詞、遵循詳細的編曲,並在無需大量編輯的情況下產出可用的音軌呢?

我們使用三段原始的 90 秒音訊片段進行測試:一首合成器流行人聲歌曲、一首電影風格的器樂曲,以及一首八聲部另類流行樂編曲。本篇評測涵蓋音質、提示詞遵循度、生成時間、系統回報的成本、官方控制功能,以及 API 存取權限。.

簡答:ElevenLabs Music v2 的表現如何?

我們的簡短評語

當企劃書要求使用露骨歌詞並需進行樂段控制時,ElevenLabs Music v2 的表現最為出色。. 它成功產出了所有三段要求的 90 秒音檔,在我們的歌詞測試中完整保留了提供的詞句,並讓八段指定的歌曲片段聽起來十分清晰。.

在細節處理上稍顯不精準:其中一段樂器聲響出現的時間比要求稍早,另一段樂器間奏則過長,而這首結構完整的歌曲結尾,聽起來更像是漸弱收尾,而非提示中要求的乾淨利落的終結和弦。.

  • 最佳觀測強度: 歌詞與歌曲的結構。.
  • 主要限制: 精確的時機與結束指示並非總是完全準確。.
  • 測試範圍: 三項受控的 API 執行測試,並非業界基準測試。.

ElevenLabs Music v2 亦可透過 GlobalGPT 的音訊生成器取得。透過此方式,可將多個音訊與 AI 模型整合至單一帳戶中,無需另行設定 VPN 或服務供應商,並能降低維護多個獨立訂閱方案的成本。.

ElevenLabs Music v2 概覽

在檢視我們的結果之前,先將該模型已發表的特徵集與這三個提示實際能證明什麼區分開來,會有所幫助。.

什麼是 ElevenLabs Music v2?

ElevenLabs 於 2026 年 5 月 26 日推出 Music v2 作為歌曲與伴奏的升級版音樂生成模型。該公司表示,此次發布版本在人聲、樂器演奏、編曲、多語言支援、密集歌詞呈現、曲風轉換以及缺失部分補全等方面均有提升。.

Music v2 為 ElevenMusic、ElevenAPI 及 ElevenCreative 提供技術支援。透過 API,開發人員可以以程式化方式生成音軌、利用填補功能編輯選定的區段,並進行參考匹配。.

型號編號
music_v2
最長持續時間
5 分鐘
已發布的 API 費率
$0.15/分鐘
音訊輸出
44.1 千赫
發佈位元率
128–192 kbps
API 存取
付費用戶
ElevenLabs 官方《Introducing Music v2》發行頁面
「ElevenLabs」官方 Music v2 發行頁面,查閱於 2026 年 8 月。.

ElevenLabs Music v2 測試結果

我們使用了 三項受控的 API 執行 並設定為 90 秒的固定目標。GPT 曾在我們的平台上生成原始歌詞集一次,我們在測試 Music v2 之前便將其凍結。聆聽筆記已與 Gemini 3.6 Flash 音訊分析結果進行交叉核對。 下文所列時間為本地端到端生成時間;費用則為已完成任務所回報的數值。.

測驗 1:附有歌詞的流行歌曲

測試 01附有歌詞的流行歌曲
90 秒目標每分鐘 112 次未成年人女高音

任務設定: 請創作一首當代合成器流行歌曲,內容描述兩人在深夜離開一座城市,並須完全使用提供的歌詞。我們評審的重點包括歌詞的完整性、人聲的清晰度、副歌的感染力、編曲,以及是否符合要求的終結和弦。.

顯示完整的可複製提示字元
創作一首完全原創的 90 秒當代合成器流行歌曲,主唱為溫暖且富有表現力的中音女聲。節拍為 112 BPM,調性為 A 小調。整體氛圍應充滿希望、親密且具電影感。開頭以弱音電鋼琴搭配柔和的類比合成器脈動聲開始。 在第一段主歌中加入圓潤的貝斯與緊湊的電子鼓聲,於前副歌部分營造張力,並過渡至寬廣且令人難忘的副歌,搭配克制的背景和聲。保持主唱聲音清晰且居中,樂器聲部分層分明。不得包含說唱式引言、饒舌、群眾聲效、模仿真實藝人,或淡出效果。 以清晰的終結和弦收尾。

請嚴格按照以下歌詞演唱。不得增刪、替換或重新排列任何詞句或段落。

[第一段]
城市燈火在我們身後漸漸淡去
寂靜的街道如今引領前路
午夜的低語,不回頭
嶄新的地平線劃破灰濛
[前副歌]
十指相扣,我們踏上未知的旅程
追尋屬於我們自己的夢想
[副歌]
在寂靜的夜裡,我們活著
在天際線彼端尋覓星辰
迷失於陰影之中,卻依然璀璨
攜手同行,我們將重新定義
[第二段]
空蕩道路上輕柔的腳步聲
每一次呼吸都訴說著一個故事
沒有承諾,只有無垠的天空
未來,盡在你的眼底
[終結副歌]
我們在寂靜的夜裡活著
在天際線彼端尋覓星辰
雖迷失在陰影中,卻依然璀璨
我們將攜手重新定義
測試 01 結果歌詞風格極具一致性,並配有較長的電子樂前奏
90.0 秒輸出
42.0 秒生成時間
$0.225任務費用
  • 歌詞並無明顯偏差 在提供的單字中被偵測到。.
  • 這首作品展現出精緻的電子合成器流行樂風格,且人聲與樂器的分離度十分清晰。.
  • 在前奏進入人聲部分之前,感覺前奏比要求的時間更長。.

測試 2:電影風格器樂曲

測試 02電影風格器樂曲
90 秒目標每分鐘 82 次D小調無人聲

任務設定: 以一個易於辨識的毛氈鋼琴主題為核心,創作一段科幻風格的配樂;樂團聲部應逐步鋪陳,銅管樂器僅出現在最後三分之一處,不包含人聲質地,並以圓滿的結尾收束。.

顯示完整的可複製提示字元
為一幕充滿戲劇張力的科幻探索場景,創作一首完全原創、長度為 90 秒的電影風格器樂配樂。節拍為 82 BPM,調性為 D 小調。不得包含人聲、對白、低語、合唱或任何類似人聲的音效。 以稀疏的軟質鋼琴主題和低音弦樂的長音靜謐開場。開場後引入微妙的類比節拍,隨後透過層疊的弦樂與克制的低音打擊樂逐步鋪陳。僅在最後三分之一處加入銅管樂器。接近結尾時達到一個清晰的情感高潮,但避免過度響亮或失真。 保持鋼琴主題的辨識度,並確保鋼琴、弦樂、打擊樂、合成器脈動與銅管樂器之間有清晰的分離度。採用真實的管弦樂音色,混音效果應寬廣但受控。前半段應避免使用預告片常見的衝擊音效。請勿模仿現有的配樂、作曲家或系列作品。結尾應以一個解決後的長音和弦收尾,而非淡出。.
測試 02 結果一部鋪陳精采的電影,開場便帶來強烈衝擊
90.0 秒輸出
20.9 秒生成時間
$0.225任務費用
  • 沒有類似人聲的質感 已被偵測到。.
  • 隨著編曲以鋼琴主題為核心展開,該主題依然清晰可辨。.
  • 某項影響的出現時間比簡報所允許的更早,導致嚴格遵守時程的程度有所削弱。.

測試 3:八聲部歌曲結構

測試 03八段式歌曲結構
90 秒目標每分鐘 104 次D大調固定章節順序

任務設定: 創作一首另類流行歌曲,歌曲須包含八個可辨識的樂段,且順序固定:前奏、主歌、前副歌、副歌、器樂間奏、過門、終結副歌及尾奏。.

顯示完整的可複製提示字元
創作一首完全原創的 90 秒另類流行歌曲,主唱需為清晰且富有表現力的男高音。節拍為 104 BPM,調性為 D 大調,採用現代另類流行風格的製作手法,發音自然,且人聲效果應適度克制。不得包含口白、饒舌、模仿真實藝人,亦不得使用淡出效果。 請嚴格維持以下段落順序,並確保每項製作變更皆能清晰可辨:前奏——約6秒,僅含經過濾波處理的電吉他與遙遠的合成器聲;主歌——加入未經處理的貝斯與鼓邊敲擊聲;前副歌——加入漸強的墊音,但暫不使用完整鼓組;副歌——加入完整鼓組、更寬廣的合成器聲,以及清晰的主旋律鉤子; 器樂間奏——約 8 秒,無人聲,僅以迴響效果重現副歌旋律;過門——簡化為鋼琴與近距離的親密人聲;最終副歌——恢復完整樂團編制,加入和聲與八度吉他旋律線,並使其氣勢比第一個副歌更為宏大; 結尾段—移除鼓組,回歸經過濾波處理的吉他聲,並以一個清澈的終結和弦收尾。

請精準演唱以下歌詞。切勿增刪、替換、重新排序,亦不得將括號內的器樂指示當作歌詞來演唱。

[前奏]
(器樂)
[主歌]
龜裂的錶盤低鳴著破碎的旋律
指尖撫過褪色的線條
靜電的低語充斥整個房間
在糾結的徵兆中搜尋
[前副歌]
訊號閃爍,聲響模糊
等待著那深邃的聲音
[副歌]
你能穿過這喧囂聽見我嗎?
遙遠的呼喚,脆弱的抉擇
雜訊漸淡,聲音更清晰
緊緊抓住,我們將找到那噪音
[器樂間奏]
(器樂)
[過門]
破碎光線中的脆弱希望
柔和的迴聲,將我拉近
在寂靜中,你現身
[終曲副歌]
你能穿過這喧囂聽見我嗎?
遙遠的呼喚,脆弱的抉擇
雜訊漸消,聲音更清晰
緊緊抓住,我們將找到那喧囂
[尾聲]
低語化作歌聲
我們已回到歸屬之地
測試 03 結果最清晰的結構性成果,但時間控制尚不完美
90.0 秒輸出
20.9 秒生成時間
$0.225任務費用
  • 這八個部分都很容易辨識, ,其中橋段與最後的副歌之間形成鮮明的對比。.
  • 這段器樂間奏的時間比要求的八秒還要長。.
  • 結尾的處理更像是漸弱,而非提示中那種乾脆俐落的終止和弦。.

這三項測試揭示了什麼

效能分析結果

3/3可用的輸出結果

每次執行都會產生一個符合整體音樂任務要求、可播放的 90 秒檔案。.

1清晰歌詞通行證

在我們的聆聽檢測中,所提供的流行歌曲歌詞並未顯示出明顯的偏差。.

8可聽見的段落

這首採用固定曲式的歌曲,讓所有指定段落都容易辨識。.

  • 主唱: 在測試 1 中,字體清晰、居中,且與電子背景之間有明顯的間距。.
  • 器樂創作: 「Test 2」中的鋼琴主題與精準的層次堆疊,顯示該模型不僅能處理流行人聲歌曲。.
  • 提示字元控制: 整體結構比畫面層級的時序更為重要;開場、轉折、高潮和結尾仍需人工審查。.
  • 編輯負擔: 這三項成果中沒有任何一項無法使用,但若要符合嚴格的製作交付標準,測試 2 和 3 仍需進行些微的調整。.

效率研究結果

三次 90 秒運行中的生成時間
流行演唱
42.0 秒
器樂
20.9 秒
八段曲
20.9 秒

本地平均端到端生成時間: 27.9 秒. 本地時間包含請求處理、輪詢及網路延遲;這並非服務端延遲。.

  • 總產量: 三個檔案共計 270 秒。.
  • 任務報告的總費用: $0.675.
  • 每次運行費用: $0.225 持續 90 秒,這相當於 1.5 分鐘 × 官方每分鐘 $0.15 的 API 速率。.
  • 不重播: 這三項任務均在首次錄製嘗試時便產出了可用的音訊。.

如何存取 ElevenLabs Music v2

透過 ElevenLabs 存取

  • 使用 ElevenMusic 進行瀏覽器端作曲。.
  • 請使用 ElevenAPI 進行程式化生成與編輯。.
  • 音樂 API 僅供付費使用者使用.
  • 「Starter」方案及以上方案均提供商用授權。.

透過 GlobalGPT 存取

  • 在同一個帳戶中,將 Music v2 與其他音訊及 AI 模型搭配使用。.
  • 無需另行設定 VPN 或服務供應商。.
  • 維護單一平台的成本,可能比維護多個獨立訂閱方案更低。.
  • 您無需重新建置整個工具套件,即可切換至另一種模型。.
試試 GlobalGPT 音訊產生器

API 存取與可用控制項

官方 SDK 透過以下方式提供該模型: elevenlabs.music.composemodel_id="music_v2". 一個基本請求可以設定一個自然語言 提示音樂_長度_毫秒. 作曲計畫能提供更精確的樂段結構、歌詞時值及編曲控制。.

  • 世代: 根據提示創作一首完整的歌曲或純音樂。.
  • 詳細回覆: 索取有關所生成作品的更多資訊。.
  • 串流: 無需等待檔案完全下載,即可開始接收音訊。.
  • 缺失處填補: 重新生成選取的區域,而非替換整段音軌。.
  • 參考比對: 在條件允許的情況下,透過參考資料引導一代人。.

提及受版權保護的藝術家、歌曲或受保護歌詞的提示語可能會觸發 bad_prompt不良的編排計畫 回應。請描述音樂上的特徵,而非詢問在世藝術家的確切風格。.

API 請求範例

Python SDK型號:music_v2
import os
from elevenlabs import ElevenLabs, save

client = ElevenLabs(api_key=os.environ["ELEVENLABS_API_KEY"])

audio = client.music.compose(
    model_id="music_v2",
    prompt=(
 "創作一首原創的電影配樂,包含柔和的鋼琴聲、"
 "低音弦樂、漸強的鋪陳,以及一個解決的終止和弦。"
    ),
    music_length_ms=90_000,
)

save(audio, "music-v2-test.mp3")

請將 API 金鑰儲存於環境變數中,而非直接寫入腳本內。對於正式上線的應用程式,在生成長音軌之前,請先加入請求記錄、重試次數限制,並設定明確的成本上限。.

定價與我們的測試費用

項目經核實的數值這代表什麼
官方音樂 API 費率每分鐘 $0.15發佈於 ElevenLabs API 定價頁面, ,不含稅金、徵費及關稅。.
最長持續時間5 分鐘單一音樂請求的最大公布輸出長度。.
我們的 90 秒任務任務費$0.2251.5 分鐘 × $0.15;由每項已完成的測試任務分別回報。.
我們三項測試的總分$0.675三段各 90 秒的輸出;不包含重播費用。.

我們測試紀錄中的單價與官方 API 價格一致。GlobalGPT 的價值在於提供整合式存取服務並減少獨立訂閱數量——而非經確認的 Music v2 每分鐘較低價格。.

如何向 ElevenLabs Music v2 發出提示

當簡報將音樂目標與不可協商的限制條件區分開來時,Music v2 的回應效果最佳。請依照以下順序建構您的提示:

1輸出歌曲或器樂曲,以及播放時長。.
2音樂畫框曲風、氛圍、節奏、調性及聲部類型。.
3安排開頭、段落轉換、高潮與結尾。.
4優先順序的混淆聲部位置、聲部分離、音量與空間感。.
5除外事項沒有語音、沒有淡入淡出效果、沒有群眾聲,也沒有聲音質感。.
6歌詞與結構節標籤以及文字是否可能變更。.

實用的英語音樂術語

點擊任何術語或描述詞即可複製。. 範例: 溫暖而富有親和力的主唱聲線,發音清晰。.

01歌詞——第一首流行歌曲一首採用您原詞的原創人聲歌曲
03背景音樂適用於影片、播客、產品示範或咖啡廳