ElevenLabs 多語言版 v2 評測(2026):支援語言、語音品質與 API

Eleven Multilingual v2 評測:支援語言、品質與 API

Eleven Multilingual v2 並非 2026 年的新版本,但它仍是一個值得考慮的、仍在活躍開發中的 ElevenLabs 文字轉語音模型。. 該產品於 2023 年 8 月推出,至今仍屬該公司的旗艦產品陣容之一,支援 29 種語言,單次請求字數上限為 10,000 字,且官方特別強調其具備穩定的長篇內容生成能力。.

問題在於,「較新」與「更適合您的工作」並非同一回事。 Eleven v3 提供更具表現力的演繹風格與更廣泛的語言支援範圍,而 Flash v2.5 則著重於速度、規模以及更低的 API 成本。Multilingual v2 則介於兩者之間,是敘述、課程、在地化及其他單一講者工作中的成熟選擇——在這些情境中,一致性比戲劇性的表現更為重要。.

想在設定 API 請求之前先試用一下這個模型嗎? GlobalGPT 的音訊產生器 將 Eleven Multilingual v2 置於瀏覽器工作區中:選擇模型、貼上您的腳本、挑選語音,然後生成音訊。.

什麼是 Eleven Multilingual v2?

Eleven Multilingual v2 是 ElevenLabs 推出的一款多語言文字轉語音模型。其原生 API 模型 ID 為 eleven_multilingual_v2. 您將文字和語音身分驗證訊息傳送至 文字轉語音端點, ,該服務會以所選的語音回傳合成音訊。.

其實用價值很簡單:單一模型即可支援 29 種語言,且單次請求最多可處理 10,000 個字元。ElevenLabs 將其描述為長篇內容生成最穩定的選項,儘管此說法僅代表該公司的定位,而非針對每種語音、文字系統或語言所作的獨立保證。.

「多語言 v2」專為旁白、有聲書、電子學習、企業配音及在地化媒體等工作而設計。若您的最終產品是「會說話的角色」影片,同一段配音也能應用於更廣泛的 對白與口型同步的工作流程.

Eleven Multilingual v2 在 2026 年是否仍持續運作?

是的。截至 2026 年 8 月 11 日,ElevenLabs 將「Multilingual v2」列在其旗艦級文字轉語音模型之中。該模型並未出現在文件中的「已棄用模型」表格中。這便是其當前最明確的狀態:仍處於活躍狀態且有相關文件記載,但已不再是 ElevenLabs 最新的語音模型。.

發行日期與其目前的狀態無關。ElevenLabs 宣布推出「多語言版 v2」 2023年8月22日。包含「2026」的頁面標題應說明評測日期,而非暗示該機型是今年推出的。.

這種定位使 Multilingual v2 成為一種成熟的生產方案,而非已被棄用的軟體。這也意味著在做出採購決策時,應將其更穩定、支援更長腳本的特性,與 v3 及 Flash v2.5 的具體優勢進行比較。.

Eleven Multilingual v2 支援哪些語言?

ElevenLabs 正式列出 Multilingual v2 支援的 29 種語言:

  • 英語、日語、中文、德語、印地語和法語
  • 韓語、葡萄牙語、義大利語、西班牙語、印尼語及荷蘭語
  • 土耳其語、菲律賓語、波蘭語、瑞典語、保加利亞語及羅馬尼亞語
  • 阿拉伯語、捷克語、希臘語、芬蘭語、克羅埃西亞語、馬來語及斯洛伐克語
  • 丹麥語、泰米爾語、烏克蘭語和俄語

語言支援並不意味著每種聲音在每個地區聽起來都會同樣令人信服。ElevenLabs 建議選擇口音與目標語言及地區相符的聲音。這點對於西班牙語、葡萄牙語、英語以及其他具有明顯地區差異的語言至關重要。請務必測試您計劃發布的具體聲音與腳本,而非將模型的語言清單視為口音的保證。.

語音品質:自然度、一致性與相關證據

ElevenLabs 將「Multilingual v2」描述為栩栩如生、具備情感感知能力,且在不同語言間表現一致。這些都是供應商的宣稱。雖然這些描述有助於理解該模型的定位,但不應將其誤認為中立的測試結果。.

獨立證據的範圍較為有限。根據 2026 年 8 月 11 日的查詢結果,Artificial Analysis 在其「提供者語音競技場」中,將 Multilingual v2 的 Elo 分數列為約 1100.07。 該評測平台採用配對式聽眾偏好測試,並涵蓋八種橫跨美式與英式英語的服務商語音,且分別分為男性與女性語音。這屬於針對英語語音偏好的透明且特定於該模型的證據;但並不能證明其在所有 29 種語言、地區口音或長篇腳本中的表現均等。.

公眾反饋褒貶不一,但樣本規模過小,不足以代表整體用戶群體。在 2024 年的一場討論中,網友們表示 v2 比 v1 更為逼真,但也反映出偶爾會出現口音一致性問題。 另一位使用者回報曾短暫出現速度與一致性問題。其後一則與 ElevenLabs 相關的回應建議,若要處理更為一致的長篇內容,應選用「多語言 v2」或「Turbo v2」。這些貼文雖是實用的警示訊號,但並非盛行率數據或受控的基準測試結果。.

有什麼是能肯定地說的呢?

  • 該模型仍獲得官方支援,並專為穩定、高品質的長篇語音而設計。.
  • 獨立的英語偏好數據,在有限的英語語音集範圍內,為其提供了可信的外部訊號。.
  • 口音品質取決於語言、地區、語音選項及文字編碼——而不僅僅是模型 ID。.
  • 客觀的音訊檢測雖能偵測到訊號截斷、削波、格式問題及時間異常,但無法取代專業的聆聽檢核。.
實機音訊案例 01

跨語言的一致性

該情境分別以英語、西班牙語及普通話,並使用預設語音生成。每個播放器均包含根據「凍結測試規則」所保留的首個有效輸出結果。.

英語 T02
西班牙語 T02
普通話 T02
0.8232英語–西班牙語發言者嵌入相似度
0.8867英語–普通話發言者嵌入相似度
0.8822西班牙語與普通話的發音嵌入相似度

請留意: 說話者身份的一致性,以及明顯的發音問題。具備專業素養的西班牙語聽者應另行評估口音的真實性。.

這些嵌入向量僅作為輔助身份識別訊號;它們並不會評估自然度、發音、口音、語調或情感表達。目前並無不同講者的校準組可供使用。.

實測:透過 Anywhere API 路徑產生的前五個有效輸出

我們測試了通往該模型 ID 的 Anywhere 直接 HTTPS 路由 eleven-多語言-v2. 這與原生 ElevenLabs API 的識別碼格式不同,後者使用的是 eleven_multilingual_v2. 該路徑雖提供了包含模型與提示詞的任務介面,但並未提供可靠的語音選擇器,亦未提供穩定性、相似度、風格、語速或輸出格式的控制選項。因此,每次執行皆採用該路徑的預設值。.

預先註冊的批次包含五份腳本:一份 1,399 個字元的英文旁白、相同情境的英文、西班牙文及普通話版本,以及一份涵蓋人名、日期、貨幣、電話號碼、網址和縮寫詞的發音重音測試。 我們保留了第一個有效的可播放輸出結果,並未為確保品質而重新執行測試。.

客觀路線結果

路線可靠性摘要

五份預先註冊的腳本均採用了第一個有效的可執行輸出。由於該路徑未提供語音或生成控制選項,因此每次執行均採用其預設值。.

5/5任務在首次嘗試時即成功完成
172.486 秒正式音訊已交付
$0.2505正式途徑的返還成本
5 個有效的 MP3 檔案單聲道,44.1 kHz,無削波

範圍: 這些數據描述的是「Anywhere」路線,並非原生 ElevenLabs 延遲或 GlobalGPT 瀏覽器體驗。檔案檢查不會針對自然度、情感、口音或當地語速進行評分。.

五項正式任務均於首次嘗試時成功完成,並產出 44.1 kHz 的可解碼單聲道 MP3 檔案。這些檔案中既無剪切樣本,在局部波形掃描中亦無相鄰樣本跳變值超過 0.8 的情況。上述檢查旨在確認檔案完整性,並不針對自然度進行評分。.

長音穩定性、情感、發音與延遲之間的權衡

長篇劇本

根據 ElevenLabs 的字數限制表,10,000 字的上限已相當寬裕,約可對應十分鐘的音訊內容。若章節較長,請在自然的段落或場景分界處進行分割,而非依據任意的字數限制來裁切。該 API 提供 前文, next_text, ,以及請求 ID 連續性欄位,以協助相鄰的區塊順暢串接。.

我們的測試證明,一份長達 1,399 個字元的腳本,透過 Anywhere 途徑在首次嘗試時便成功生成有效的檔案。但這並不能證明該系統在達到 10,000 個字元的上限時,或處理整本有聲書時,都能保持穩定性。.

實作音訊案例 02

長期穩定性

T01 — 英語旁白第一個有效的輸出 · route-default voice
1,399 個字元輸入旁白
85.081 秒已傳送的音訊
首次生效無品質重播
$0.1399回程路線成本

請留意: 開頭與結尾段落之間的節奏偏差、尷尬的停頓、咔嗒聲、音訊截斷,或可聽見的雜訊。.

客觀結果: 該檔案解碼結果完整無缺,未出現取樣值被截斷或相鄰取樣值跳躍值超過 0.8 的情況。根據機器計時估算,前半段速度為 2.858 字元/秒,後半段為 2.670 字元/秒,且無跡象顯示後半段整體速度有所提升。.

僅進行一次測試,既無法證明在 10,000 字元限制下系統運作穩定,也無法排除需要人工聆聽來確認的局部節奏問題。.

情緒與穩定性設定

在原生的 ElevenLabs API 中,較低的穩定性能帶來更多變化,而較高的穩定性則能使呈現效果更為一致,但也可能使呈現過程變得單調。風格的誇張處理雖能增添表現力,但也可能降低可預測性並增加運算負擔。請將這些控制項視為創作上的權衡,而非通用的品質提升手段。.

發音

Multilingual v2 不支援音素標籤。ElevenLabs 建議使用帶有別名的發音詞典作為替代方案。在生成內容前,請先將模稜兩可的數字、縮寫、日期和網址進行標準化處理,然後針對對貴品牌至關重要的名稱或術語,保留一個小型回歸測試腳本。.

實機音訊案例 03

發音重音測驗

T03 — 名稱、數字與縮寫第一個有效輸出 · $0.0382 路由成本
2026年7月4日安娜·馬丁內斯博士GLB-2048$1,250.75聖保羅京都上午8時30分.9月12日1-800-555-0199glbgpt.comAPI / TTS / 聯合國教科文組織版本 2.5 / 10 百分比

聽力檢查點: 離線語音辨識將該電話號碼轉譯為「1-800-5555-0199」。發布前請仔細聆聽原始號碼及網址。.

多出的這個數字並非經確認的 TTS 錯誤。語音辨識可能會產生錯誤,因此這僅是審查時的檢查點,而非對發音的最終判定。.

延遲

Multilingual v2 並非 ElevenLabs 的低延遲選項。ElevenLabs 表示其延遲高於 Flash 型號。 針對五項正式測試任務,我們測得的路徑時間介於 10.161 至 31.489 秒之間,但這些數值包含「Anywhere」任務的路徑、網路、佇列及檔案傳輸時間。因此,這些數值絕不能被視為原生 ElevenLabs 模型的延遲。.

如何使用 Eleven Multilingual v2 API

開發者設定

原生 ElevenLabs API 請求

使用原生模型 ID eleven_multilingual_v2 在 JSON 請求內容中,並將選定的語音 ID 填入該端點中。.

POSThttps://api.elevenlabs.io/v1/text-to-speech/{voice_id}
最簡化的 cURL 請求請將 YOUR_VOICE_ID 替換為實際值,並使用環境變數作為鍵值
curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/YOUR_VOICE_ID" \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "您的多語言旁白內容請填入此處。",
    "model_id": "eleven_multilingual_v2",
    "voice_settings": {
 "stability": 0.5,
      "相似度增強": 0.75,
 "風格": 0,
 "使用發音人增強": true,
 "語速": 1.0
    }
  }' \
  --output narration.mp3

關鍵參數與限制

參數其控制範圍實務須知
voice_id精選 ElevenLabs 語音請選擇口音與目標語言及地區相符的配音員。.
model_id合成模型使用 eleven_multilingual_v2.
穩定性多樣性與一致性較低的音域變化可能更為豐富;較高的音域則可能變得較為克制。.
相似度增強參考語音相似度較高的數值有助於辨識,但無法保證在不同語言間皆能準確辨識。.
風格風格上的誇張當重複性至關重要時,請謹慎使用。.
use_speaker_boost額外的講者相似度處理可能會增加延遲。.
速度播放速度修改後,請重新檢查數字和標點符號。.
前文 / next_text語塊的上下文在分割長腳本時相當實用。.
語言代碼語言執法在目前的 API 參考文件中,此功能不適用於 multilingual_v2 模型。.

重要: 請將 API 金鑰存放在安全的環境變數中。切勿將真實的金鑰直接貼入公開的文章程式碼中。.

Eleven Multilingual v2 API 定價

「ElevenLabs」’ API 定價頁面 將「Multilingual v2」和「v3」列於 每 1,000 個字元 $0.10 截至 2026 年 8 月 11 日查閱時。稅金、徵費及關稅均不包含在內。.

費用與使用方式

直接 API 定價

根據 Multilingual v2 和 v3 的官方費率,每 1,000 個字元為 $0.10:

1K 字元
$0.10
5,000 個字元
$0.50
10,000 個字元
$1.00
ElevenLabs API 價格於 2026 年 8 月 11 日確認。價格不含稅金、徵費及關稅。.

直接 API 還是 GlobalGPT?

路線價格參考您的工作方式在以下情況下最具性價比
ElevenLabs API$0.10 / 1K 字元原生請求、語音、設定及計量用量您需要開發人員控制項和產品整合
GlobalGPT 採用其專屬的「積分」系統,因此這些訂閱方案並非根據 ElevenLabs API 費率按角色換算而來。. 比較 GlobalGPT 方案.

以該費率計算,最大 10,000 字元的請求,稅前費用為 $1.00。實際專案成本取決於您生成的文字量、重新生成的頻率,以及是否保留未成功的錄音片段。請根據輸入字元數而非音訊分鐘數來編列預算。.

對於無需建立原生 API 工作流程的創作者而言,GlobalGPT 提供了更實用的價值主張。 根據 2026 年 8 月 11 日的查詢結果,其年度方案的月均費用為:Basic 方案為 $5.80、Pro 方案為 $10.80,以及 Unlimited 方案為 $25,將多種 AI 模型與創意工具整合於單一訂閱方案中。該 GlobalGPT 音訊產生器 在瀏覽器工作區中整合了 Eleven Multilingual v2 與 Eleven v3,讓您無需事先設定 API 請求,即可生成語音解說並比較這兩款模型。.

GlobalGPT 採用其專屬的「積分」系統,因此這並非與 ElevenLabs API 進行直接的「每字元」價格比較。但當音訊是涉及寫作、研究、圖像、影片或多個 AI 模型等更廣泛工作流程的一部分時,, GlobalGPT 是整體性價比更高的選擇. 你可以 在此比較 GlobalGPT 方案.

Eleven 多語言版 v2 對比 Eleven v3 對比 Flash v2.5

決策指南

您應該選擇哪一款 ElevenLabs 型號?

應根據職位需求來選擇合適的人選,而非僅以發行日期作為唯一依據。.

長篇精選

多語言版 v2

請選擇: 穩定的旁白、成熟的作業流程、涵蓋 29 種語言,以及長達 10,000 字的腳本。.

表達精選

Eleven v3

請選擇: 戲劇性的演繹、多講者作品,以及涵蓋 70 多種語言的更廣泛範圍。.

快速選取

Flash v2.5

請選擇: 響應式產品、高吞吐量、40,000 字元的請求,以及更低的 API 成本。.

模型語言字元限制官方重點最適合
多語言版 v22910,000長期穩定性與品質的一致性旁白、課程、在地化、成熟的語音工作流程
Eleven v370+5,000富有表現力的語音與多講者對話演出表現、角色塑造、戲劇演繹、更廣泛的語言涵蓋範圍
Flash v2.53240,000模型延遲約為 75 毫秒,且 API 開銷較低互動式產品、處理量、較長的請求、成本敏感型擴展

GlobalGPT 還將 Eleven v3 整合至同一個音訊生成器中。請將同一個簡短腳本分別套用至這兩款模型:先使用 Multilingual v2 作為穩定的旁白基準,接著在需要更具表現力的演繹時,再與 v3 進行比較。 相較於通用示範音檔,您自己的腳本是更好的決策工具,因為它能呈現對您的專案至關重要的名稱、標點符號、語速以及語言切換等細節。.

哪些人應該——以及不應該——使用 Multilingual v2?

合身

  • 從事課程、解說影片、企業宣傳片或在地化配音製作的旁白員。.
  • 已擁有經過驗證的 ElevenLabs 語音模型,並希望取得穩定模型 ID 的團隊。.
  • 需要使用 29 種受支援語言或文字之一,且長度超過 v3 版本 5,000 字元限制的專案。.
  • 那些重視原生語音控制與片段連續性欄位,而非追求最低延遲的開發者。.

當……時,請另尋他處

  • 如果您需要極具表現力的演技、自然的多人對話,或是名單中未列出的 29 種語言以外的語言,不妨從 Eleven v3 開始嘗試。.
  • 您正在開發一個響應式語音代理程式或高吞吐量服務;請評估 Flash v2.5。.
  • 您需要音素層級的標記;Multilingual v2 不支援音素標籤。.
  • 您需要確保能呈現特定地區的口音,但無需透過試音或實際朗讀劇本來確認是否符合要求。.
  • 在由合格的聽者審查您的目標語言之前,您需要做出明確的主觀品質判斷。.

常見問題

2026 年時,Eleven Multilingual v2 是否仍可使用?

是的。ElevenLabs 將其列為旗艦級文字轉語音模型,且於 2026 年 8 月 11 日查閱時,該模型並未列入已廢棄模型表中。.

Eleven Multilingual v2 是何時發行的?

ElevenLabs 於 2023 年 8 月 22 日發布了 Multilingual v2。本篇評測中的「2026」指的是評測日期,而非發布年份。.

Eleven Multilingual v2 支援多少種語言?

它正式支援 29 種語言,包括英語、西班牙語、中文、日語、德語、法語、印地語、韓語、葡萄牙語、阿拉伯語和俄語。.

Eleven Multilingual v2 的模型 ID 是什麼?

ElevenLabs API 的原生模型 ID 是 eleven_multilingual_v2. Anywhere 測試路線採用了以連字號分隔的獨立識別碼 eleven-多語言-v2.

字元限制是多少?

官方規定的單次請求字元上限為 10,000 個,ElevenLabs 估計這相當於約十分鐘的音訊。.

Multilingual v2 是否比 Eleven v3 更好?

兩者皆無絕對優劣之分。多語言 v2 是較為穩定、請求時間較長的选择;v3 則提供更廣泛的語言支援、更具表現力的語音輸出,以及多發言人功能。.

Multilingual v2 適合用於長篇敘述嗎?

ElevenLabs 被定位為該公司最穩定的長篇模型。我們進行的 1,399 字路徑測試已成功完成,但單次運行並不能證明其在整本書或 10,000 字規模下的穩定性。.

我可以在 API 中設定語言代碼嗎?

當前的 Create speech API 參考文件指出: 語言代碼 多語言 v2 模型不支援此功能。.

Multilingual v2 是否支援音素標籤?

第 ElevenLabs 條建議,當您需要控制名稱或專業術語的呈現方式時,應選用附有別名的發音辭典。.

API 的費用是多少?

ElevenLabs 於 2026 年 8 月 11 日將「Multilingual v2」的報價定為每 1,000 個字元 $0.10,不含稅金、徵費及關稅。.

最終裁決

Eleven Multilingual v2 在 2026 年 ElevenLabs 產品陣容中佔有一席之地:它是穩健的多語言旁白、經過驗證的語音工作流程,以及最多 10,000 字元請求的成熟選擇。但它並非每個 TTS 專案的自動首選。 Eleven v3 是進行富有表現力的演繹及支援更廣泛語言的更強勁起點,而 Flash v2.5 則專為速度與規模而設計。.

我們的客觀測試為路徑可靠性和檔案完整性提供了有用的信心依據:五項正式的 Anywhere 任務均於首次嘗試時完成,產出了有效的 44.1 kHz 單聲道 MP3 檔案,且成本均未超出預先登記的上限。 這並不能取代人類的聆聽,因此我們不會僅憑機器檢查結果,就對自然度、情感或口音進行主觀評分。.

請從您接下來要進行的旁白、課程或在地化影片中,選取一段文字,並將其帶到 GlobalGPT 的音訊產生器. 建議先從 Eleven Multilingual v2 開始,保持語音和腳本的一致性,並在需要富有表現力的演繹時,將其與 Eleven v3 進行比較。這是一種直接且實用的方法,能幫助您選擇最適合您工作的模型。.

分享文章:

相關文章