AI 音樂領域發展迅速,而 ElevenLabs Music v2 正是其中最具野心的全新歌曲生成模型之一。但它能否保留提供的歌詞、遵循詳細的編曲,並在無需大量編輯的情況下產出可用的音軌呢?
我們使用三段原始的 90 秒音訊片段進行測試:一首合成器流行人聲歌曲、一首電影風格的器樂曲,以及一首八聲部另類流行樂編曲。本篇評測涵蓋音質、提示詞遵循度、生成時間、系統回報的成本、官方控制功能,以及 API 存取權限。.
簡答:ElevenLabs Music v2 的表現如何?
我們的簡短評語當企劃書要求使用露骨歌詞並需進行樂段控制時,ElevenLabs Music v2 的表現最為出色。. 它成功產出了所有三段要求的 90 秒音檔,在我們的歌詞測試中完整保留了提供的詞句,並讓八段指定的歌曲片段聽起來十分清晰。.
在細節處理上稍顯不精準:其中一段樂器聲響出現的時間比要求稍早,另一段樂器間奏則過長,而這首結構完整的歌曲結尾,聽起來更像是漸弱收尾,而非提示中要求的乾淨利落的終結和弦。.
- 最佳觀測強度: 歌詞與歌曲的結構。.
- 主要限制: 精確的時機與結束指示並非總是完全準確。.
- 測試範圍: 三項受控的 API 執行測試,並非業界基準測試。.
ElevenLabs Music v2 亦可透過 GlobalGPT 的音訊生成器取得。透過此方式,可將多個音訊與 AI 模型整合至單一帳戶中,無需另行設定 VPN 或服務供應商,並能降低維護多個獨立訂閱方案的成本。.
ElevenLabs Music v2 概覽
在檢視我們的結果之前,先將該模型已發表的特徵集與這三個提示實際能證明什麼區分開來,會有所幫助。.
什麼是 ElevenLabs Music v2?
ElevenLabs 於 2026 年 5 月 26 日推出 Music v2 作為歌曲與伴奏的升級版音樂生成模型。該公司表示,此次發布版本在人聲、樂器演奏、編曲、多語言支援、密集歌詞呈現、曲風轉換以及缺失部分補全等方面均有提升。.
Music v2 為 ElevenMusic、ElevenAPI 及 ElevenCreative 提供技術支援。透過 API,開發人員可以以程式化方式生成音軌、利用填補功能編輯選定的區段,並進行參考匹配。.
型號編號
music_v2
最長持續時間
5 分鐘
已發布的 API 費率
$0.15/分鐘
音訊輸出
44.1 千赫
發佈位元率
128–192 kbps
API 存取
付費用戶
「ElevenLabs」官方 Music v2 發行頁面,查閱於 2026 年 8 月。.
ElevenLabs Music v2 測試結果
我們使用了 三項受控的 API 執行 並設定為 90 秒的固定目標。GPT 曾在我們的平台上生成原始歌詞集一次,我們在測試 Music v2 之前便將其凍結。聆聽筆記已與 Gemini 3.6 Flash 音訊分析結果進行交叉核對。 下文所列時間為本地端到端生成時間;費用則為已完成任務所回報的數值。.
測驗 1:附有歌詞的流行歌曲
測試 01附有歌詞的流行歌曲
90 秒目標每分鐘 112 次未成年人女高音
任務設定: 請創作一首當代合成器流行歌曲,內容描述兩人在深夜離開一座城市,並須完全使用提供的歌詞。我們評審的重點包括歌詞的完整性、人聲的清晰度、副歌的感染力、編曲,以及是否符合要求的終結和弦。.
顯示完整的可複製提示字元
創作一首完全原創的 90 秒當代合成器流行歌曲,主唱為溫暖且富有表現力的中音女聲。節拍為 112 BPM,調性為 A 小調。整體氛圍應充滿希望、親密且具電影感。開頭以弱音電鋼琴搭配柔和的類比合成器脈動聲開始。 在第一段主歌中加入圓潤的貝斯與緊湊的電子鼓聲,於前副歌部分營造張力,並過渡至寬廣且令人難忘的副歌,搭配克制的背景和聲。保持主唱聲音清晰且居中,樂器聲部分層分明。不得包含說唱式引言、饒舌、群眾聲效、模仿真實藝人,或淡出效果。 以清晰的終結和弦收尾。
請嚴格按照以下歌詞演唱。不得增刪、替換或重新排列任何詞句或段落。
[第一段]
城市燈火在我們身後漸漸淡去
寂靜的街道如今引領前路
午夜的低語,不回頭
嶄新的地平線劃破灰濛
[前副歌]
十指相扣,我們踏上未知的旅程
追尋屬於我們自己的夢想
[副歌]
在寂靜的夜裡,我們活著
在天際線彼端尋覓星辰
迷失於陰影之中,卻依然璀璨
攜手同行,我們將重新定義
[第二段]
空蕩道路上輕柔的腳步聲
每一次呼吸都訴說著一個故事
沒有承諾,只有無垠的天空
未來,盡在你的眼底
[終結副歌]
我們在寂靜的夜裡活著
在天際線彼端尋覓星辰
雖迷失在陰影中,卻依然璀璨
我們將攜手重新定義
測試 01 結果歌詞風格極具一致性,並配有較長的電子樂前奏90.0 秒輸出
42.0 秒生成時間
$0.225任務費用
- 歌詞並無明顯偏差 在提供的單字中被偵測到。.
- 這首作品展現出精緻的電子合成器流行樂風格,且人聲與樂器的分離度十分清晰。.
- 在前奏進入人聲部分之前,感覺前奏比要求的時間更長。.
測試 2:電影風格器樂曲
測試 02電影風格器樂曲
90 秒目標每分鐘 82 次D小調無人聲
任務設定: 以一個易於辨識的毛氈鋼琴主題為核心,創作一段科幻風格的配樂;樂團聲部應逐步鋪陳,銅管樂器僅出現在最後三分之一處,不包含人聲質地,並以圓滿的結尾收束。.
顯示完整的可複製提示字元
為一幕充滿戲劇張力的科幻探索場景,創作一首完全原創、長度為 90 秒的電影風格器樂配樂。節拍為 82 BPM,調性為 D 小調。不得包含人聲、對白、低語、合唱或任何類似人聲的音效。 以稀疏的軟質鋼琴主題和低音弦樂的長音靜謐開場。開場後引入微妙的類比節拍,隨後透過層疊的弦樂與克制的低音打擊樂逐步鋪陳。僅在最後三分之一處加入銅管樂器。接近結尾時達到一個清晰的情感高潮,但避免過度響亮或失真。 保持鋼琴主題的辨識度,並確保鋼琴、弦樂、打擊樂、合成器脈動與銅管樂器之間有清晰的分離度。採用真實的管弦樂音色,混音效果應寬廣但受控。前半段應避免使用預告片常見的衝擊音效。請勿模仿現有的配樂、作曲家或系列作品。結尾應以一個解決後的長音和弦收尾,而非淡出。.
測試 02 結果一部鋪陳精采的電影,開場便帶來強烈衝擊90.0 秒輸出
20.9 秒生成時間
$0.225任務費用
- 沒有類似人聲的質感 已被偵測到。.
- 隨著編曲以鋼琴主題為核心展開,該主題依然清晰可辨。.
- 某項影響的出現時間比簡報所允許的更早,導致嚴格遵守時程的程度有所削弱。.
測試 3:八聲部歌曲結構
測試 03八段式歌曲結構
90 秒目標每分鐘 104 次D大調固定章節順序
任務設定: 創作一首另類流行歌曲,歌曲須包含八個可辨識的樂段,且順序固定:前奏、主歌、前副歌、副歌、器樂間奏、過門、終結副歌及尾奏。.
顯示完整的可複製提示字元
創作一首完全原創的 90 秒另類流行歌曲,主唱需為清晰且富有表現力的男高音。節拍為 104 BPM,調性為 D 大調,採用現代另類流行風格的製作手法,發音自然,且人聲效果應適度克制。不得包含口白、饒舌、模仿真實藝人,亦不得使用淡出效果。 請嚴格維持以下段落順序,並確保每項製作變更皆能清晰可辨:前奏——約6秒,僅含經過濾波處理的電吉他與遙遠的合成器聲;主歌——加入未經處理的貝斯與鼓邊敲擊聲;前副歌——加入漸強的墊音,但暫不使用完整鼓組;副歌——加入完整鼓組、更寬廣的合成器聲,以及清晰的主旋律鉤子; 器樂間奏——約 8 秒,無人聲,僅以迴響效果重現副歌旋律;過門——簡化為鋼琴與近距離的親密人聲;最終副歌——恢復完整樂團編制,加入和聲與八度吉他旋律線,並使其氣勢比第一個副歌更為宏大; 結尾段—移除鼓組,回歸經過濾波處理的吉他聲,並以一個清澈的終結和弦收尾。
請精準演唱以下歌詞。切勿增刪、替換、重新排序,亦不得將括號內的器樂指示當作歌詞來演唱。
[前奏]
(器樂)
[主歌]
龜裂的錶盤低鳴著破碎的旋律
指尖撫過褪色的線條
靜電的低語充斥整個房間
在糾結的徵兆中搜尋
[前副歌]
訊號閃爍,聲響模糊
等待著那深邃的聲音
[副歌]
你能穿過這喧囂聽見我嗎?
遙遠的呼喚,脆弱的抉擇
雜訊漸淡,聲音更清晰
緊緊抓住,我們將找到那噪音
[器樂間奏]
(器樂)
[過門]
破碎光線中的脆弱希望
柔和的迴聲,將我拉近
在寂靜中,你現身
[終曲副歌]
你能穿過這喧囂聽見我嗎?
遙遠的呼喚,脆弱的抉擇
雜訊漸消,聲音更清晰
緊緊抓住,我們將找到那喧囂
[尾聲]
低語化作歌聲
我們已回到歸屬之地
測試 03 結果最清晰的結構性成果,但時間控制尚不完美90.0 秒輸出
20.9 秒生成時間
$0.225任務費用
- 這八個部分都很容易辨識, ,其中橋段與最後的副歌之間形成鮮明的對比。.
- 這段器樂間奏的時間比要求的八秒還要長。.
- 結尾的處理更像是漸弱,而非提示中那種乾脆俐落的終止和弦。.
這三項測試揭示了什麼
效能分析結果
3/3可用的輸出結果每次執行都會產生一個符合整體音樂任務要求、可播放的 90 秒檔案。.
1清晰歌詞通行證在我們的聆聽檢測中,所提供的流行歌曲歌詞並未顯示出明顯的偏差。.
8可聽見的段落這首採用固定曲式的歌曲,讓所有指定段落都容易辨識。.
- 主唱: 在測試 1 中,字體清晰、居中,且與電子背景之間有明顯的間距。.
- 器樂創作: 「Test 2」中的鋼琴主題與精準的層次堆疊,顯示該模型不僅能處理流行人聲歌曲。.
- 提示字元控制: 整體結構比畫面層級的時序更為重要;開場、轉折、高潮和結尾仍需人工審查。.
- 編輯負擔: 這三項成果中沒有任何一項無法使用,但若要符合嚴格的製作交付標準,測試 2 和 3 仍需進行些微的調整。.
效率研究結果
三次 90 秒運行中的生成時間本地平均端到端生成時間: 27.9 秒. 本地時間包含請求處理、輪詢及網路延遲;這並非服務端延遲。.
- 總產量: 三個檔案共計 270 秒。.
- 任務報告的總費用: $0.675.
- 每次運行費用: $0.225 持續 90 秒,這相當於 1.5 分鐘 × 官方每分鐘 $0.15 的 API 速率。.
- 不重播: 這三項任務均在首次錄製嘗試時便產出了可用的音訊。.
如何存取 ElevenLabs Music v2
透過 ElevenLabs 存取
- 使用 ElevenMusic 進行瀏覽器端作曲。.
- 請使用 ElevenAPI 進行程式化生成與編輯。.
- 的 音樂 API 僅供付費使用者使用.
- 「Starter」方案及以上方案均提供商用授權。.
透過 GlobalGPT 存取
- 在同一個帳戶中,將 Music v2 與其他音訊及 AI 模型搭配使用。.
- 無需另行設定 VPN 或服務供應商。.
- 維護單一平台的成本,可能比維護多個獨立訂閱方案更低。.
- 您無需重新建置整個工具套件,即可切換至另一種模型。.
試試 GlobalGPT 音訊產生器
API 存取與可用控制項
官方 SDK 透過以下方式提供該模型: elevenlabs.music.compose 與 model_id="music_v2". 一個基本請求可以設定一個自然語言 提示 和 音樂_長度_毫秒. 作曲計畫能提供更精確的樂段結構、歌詞時值及編曲控制。.
- 世代: 根據提示創作一首完整的歌曲或純音樂。.
- 詳細回覆: 索取有關所生成作品的更多資訊。.
- 串流: 無需等待檔案完全下載,即可開始接收音訊。.
- 缺失處填補: 重新生成選取的區域,而非替換整段音軌。.
- 參考比對: 在條件允許的情況下,透過參考資料引導一代人。.
提及受版權保護的藝術家、歌曲或受保護歌詞的提示語可能會觸發 bad_prompt 或 不良的編排計畫 回應。請描述音樂上的特徵,而非詢問在世藝術家的確切風格。.
API 請求範例
Python SDK型號:music_v2
import os
from elevenlabs import ElevenLabs, save
client = ElevenLabs(api_key=os.environ["ELEVENLABS_API_KEY"])
audio = client.music.compose(
model_id="music_v2",
prompt=(
"創作一首原創的電影配樂,包含柔和的鋼琴聲、"
"低音弦樂、漸強的鋪陳,以及一個解決的終止和弦。"
),
music_length_ms=90_000,
)
save(audio, "music-v2-test.mp3")
請將 API 金鑰儲存於環境變數中,而非直接寫入腳本內。對於正式上線的應用程式,在生成長音軌之前,請先加入請求記錄、重試次數限制,並設定明確的成本上限。.
定價與我們的測試費用
| 項目 | 經核實的數值 | 這代表什麼 |
|---|
| 官方音樂 API 費率 | 每分鐘 $0.15 | 發佈於 ElevenLabs API 定價頁面, ,不含稅金、徵費及關稅。. |
| 最長持續時間 | 5 分鐘 | 單一音樂請求的最大公布輸出長度。. |
| 我們的 90 秒任務任務費 | $0.225 | 1.5 分鐘 × $0.15;由每項已完成的測試任務分別回報。. |
| 我們三項測試的總分 | $0.675 | 三段各 90 秒的輸出;不包含重播費用。. |
我們測試紀錄中的單價與官方 API 價格一致。GlobalGPT 的價值在於提供整合式存取服務並減少獨立訂閱數量——而非經確認的 Music v2 每分鐘較低價格。.
如何向 ElevenLabs Music v2 發出提示
當簡報將音樂目標與不可協商的限制條件區分開來時,Music v2 的回應效果最佳。請依照以下順序建構您的提示:
1輸出歌曲或器樂曲,以及播放時長。.
2音樂畫框曲風、氛圍、節奏、調性及聲部類型。.
3安排開頭、段落轉換、高潮與結尾。.
4優先順序的混淆聲部位置、聲部分離、音量與空間感。.
5除外事項沒有語音、沒有淡入淡出效果、沒有群眾聲,也沒有聲音質感。.
6歌詞與結構節標籤以及文字是否可能變更。.
實用的英語音樂術語
點擊任何術語或描述詞即可複製。. 範例: 溫暖而富有親和力的主唱聲線,發音清晰。.