Eleven Multilingual v2は2026年にリリースされた新しいモデルではありませんが、依然として検討に値する、現役のElevenLabsテキスト読み上げモデルです。. 2023年8月にリリースされ、現在も同社の主力ラインナップの一つとして位置づけられており、29言語に対応し、リクエスト上限は10,000文字で、長文生成の安定性に重点を置いていることが公式に強調されている。.
ただし、「新しい」ことと「業務に適している」ことは必ずしも同じではないという点が注意点です。 Eleven v3は表現力豊かなナレーションと幅広い言語対応を提供する一方、Flash v2.5は速度、スケーラビリティ、およびAPIコストの低減を優先しています。Multilingual v2は、その中間に位置し、ナレーション、コース、ローカライズ、および劇的な演技よりも一貫性が重視されるその他の単一ナレーターによる作業において、定評のある選択肢となっています。.
APIリクエストを設定する前に、モデルを試してみたいですか? GlobalGPTのオーディオジェネレータ ブラウザのワークスペースに「Eleven Multilingual v2」を配置します。モデルを選択し、スクリプトを貼り付け、音声を指定して、音声を生成します。.

「Eleven Multilingual v2」とは何ですか?
Eleven Multilingual v2 は、ElevenLabs が提供する多言語テキスト読み上げモデルです。そのネイティブ API モデル ID は eleven_multilingual_v2. テキストと音声IDを テキスト読み上げエンドポイント, 、そしてこのサービスは、選択された音声で合成された音声を返します。.
その実用的な魅力は単純明快です。1つのモデルで29言語に対応し、1回のリクエストで最大10,000文字まで処理可能です。ElevenLabs社は、これを長文生成において最も安定したオプションであると説明していますが、この記述は同社のポジショニングであり、すべての声、文字体系、言語に対して独立した保証が与えられているわけではありません。.
Multilingual v2は、ナレーション、オーディオブック、eラーニング、企業向けボイスオーバー、ローカライズされたメディアなどの制作向けに設計されています。最終的な成果物が「キャラクターが話す動画」である場合、同じボイスオーバーを幅広い用途に活用することも可能です。 対話とリップシンクのワークフロー.
「Eleven Multilingual v2」は2026年現在もまだ利用可能ですか?
はい。2026年8月11日現在、ElevenLabsは主力テキスト読み上げモデルとして「Multilingual v2」を掲載しています。このモデルは、ドキュメントの「非推奨モデル」一覧には掲載されていません。これが現在の状況を最も明確に示しています。つまり、このモデルは稼働中であり、ドキュメントにも記載されていますが、もはやElevenLabsの最新読み上げモデルではありません。.
発売日は現在の状況とは別です。ElevenLabs 「Multilingual v2」のリリースを発表しました 2023年8月22日。「2026」を含むページタイトルは、レビューの日付を表すものであり、そのモデルが今年発売されたことを示唆するものであってはなりません。.
こうした位置づけにより、Multilingual v2は、もはや開発が中止されたソフトウェアではなく、確立された本番環境向けの選択肢となっています。また、購入を検討する際には、その安定性が高く、スクリプトの歴史が長いという特徴と、v3やFlash v2.5が持つ具体的な利点を比較検討すべきであるということです。.
Eleven Multilingual v2 はどの言語に対応していますか?
ElevenLabsは、「Multilingual v2」について、公式に29の言語を掲載しています:
- 英語、日本語、中国語、ドイツ語、ヒンディー語、フランス語
- 韓国語、ポルトガル語、イタリア語、スペイン語、インドネシア語、オランダ語
- トルコ語、フィリピン語、ポーランド語、スウェーデン語、ブルガリア語、ルーマニア語
- アラビア語、チェコ語、ギリシャ語、フィンランド語、クロアチア語、マレー語、スロバキア語
- デンマーク語、タミル語、ウクライナ語、ロシア語
言語対応がされているからといって、すべての地域でどのボイスも同等に説得力を持って聞こえるとは限りません。ElevenLabsでは、対象言語や地域に合ったアクセントのボイスを選ぶことを推奨しています。これは、スペイン語、ポルトガル語、英語など、地域による違いが顕著な言語において特に重要です。モデルの対応言語リストをアクセントの保証と見なすのではなく、実際に公開する予定のボイスとスクリプトを実際にテストしてください。.
音声の質:自然さ、一貫性、そしてその根拠
ElevenLabsは、Multilingual v2について「人間らしく、感情を察知でき、言語を問わず一貫性がある」と説明しています。これらはベンダー側の主張です。モデルの意図する位置づけを理解する上では有用ですが、中立的な評価結果と混同してはなりません。.
独立した証拠はより限定的です。2026年8月11日に確認したところ、Artificial Analysisの「Provider Voice Arena」では、Multilingual v2のEloスコアが約1100.07と記載されていました。 このアリーナでは、リスナーの好みをペアで設定し、米国英語と英国英語の8つのプロバイダーボイス(男性と女性の声に分けて)を使用している。これは、英語の音声選好に関する透明性が高く、モデル固有の証拠である。しかし、29の言語すべて、地域ごとのアクセント、あるいは長文の台本において同等のパフォーマンスが得られることを証明するものではない。.
一般からの反応は賛否両論ですが、サンプル数が少なすぎるため、ユーザー層全体を概説するには不十分です。2024年のある議論では、コメント投稿者たちはv2をv1よりも現実的だと評する一方で、時折アクセントの一貫性に問題があることも報告していました。 別のユーザーは、短期間にわたり速度や一貫性の問題が発生したと報告した。その後、ElevenLabsに関連する回答では、長文の作業においてより一貫性を高めるために「Multilingual v2」または「Turbo v2」の使用が推奨された。これらの投稿は有用な警告サインではあるが、有病率データや管理されたベンチマークではない。.
自信を持って言えることは何でしょうか?
- このモデルは引き続き公式にサポートされており、安定した高品質な長文音声の生成に適しています。.
- 独立した英語嗜好データにより、限られた英語音声セットの範囲内において、信頼性の高い外部シグナルが得られる。.
- アクセントの質は、モデルIDだけでなく、言語、地域、音声の選択、およびスクリプトによっても異なります。.
- 客観的なオーディオチェックでは、音源の切り詰め、クリッピング、フォーマットの問題、タイミングの異常などを検出できますが、熟練した耳による聴き取りに取って代わることはできません。.
言語間の整合性
このシナリオは、ルートデフォルトの音声を使用して、英語、スペイン語、中国語で生成されました。各プレイヤーには、凍結テストルールに基づいて保持された最初の有効な出力が含まれています。.
次の点に注意してください: 話者の身元の連続性と、明らかな発音上の問題。スペイン語に精通した聞き手は、アクセントの信憑性について別途評価すべきである。.
これらの埋め込みは補助的な同一性信号であり、自然さ、発音、アクセント、プロソディ、あるいは感情の込め方などを評価するものではありません。異なる話者によるキャリブレーショングループは用意されていませんでした。.
実機テスト:Anywhere API 経由で得られた最初の有効な出力5件
モデルIDへの「Anywhere」ダイレクトHTTPSルートをテストしました eleven-multilingual-v2. これは、ネイティブの ElevenLabs API が採用している識別子形式とは異なります。同 API では eleven_multilingual_v2. このルートでは、モデルやプロンプトに対するタスクインターフェースは公開されていたものの、信頼性の高い音声選択機能や、安定性、類似度、スタイル、速度、出力形式の制御機能は公開されていなかった。そのため、すべての実行において、このルートのデフォルト設定が使用された。.
事前登録されたバッチには、5つのスクリプトが含まれていました。1つは1,399文字の英語のナレーション、同じシナリオの英語版、スペイン語版、中国語版、そして名前、日付、通貨、電話番号、URL、頭字語を対象とした発音・アクセントのテストです。 有効で再生可能な最初の出力を採用し、品質確認のために再実行は行いませんでした。.
ルートの信頼性に関する概要
事前登録された5つのスクリプトはすべて、最初に有効な再生可能な出力を使用しました。このルートでは音声や生成に関する設定が公開されていなかったため、すべての実行でデフォルト設定が使用されました。.
スコープ これらの数値は「Anywhere」ルートのものを示しており、ネイティブのElevenLabs遅延やGlobalGPTのブラウザ体験を示すものではありません。ファイルチェックでは、自然さ、感情、アクセント、現地の話し方のテンポなどは評価対象外です。.
5つの正式なタスクはすべて初回試行で成功し、44.1 kHzのデコード可能なモノラルMP3ファイルが生成された。これらのファイルには、クリップされたサンプルは含まれておらず、局所的な波形スキャンにおいて0.8を超える隣接サンプル間のジャンプも確認されなかった。これらのチェックはファイルの完全性を確認するものであり、自然さを評価するものではない。.
長期的安定性、感情、発音、および遅延のトレードオフ
長いスクリプト
ElevenLabsの文字数制限表によると、1万文字という上限は、およそ10分間の音声に相当する十分な余裕があります。章がそれより長い場合は、恣意的な文字数で切り分けるのではなく、自然な段落やシーンの区切りで分割してください。APIでは、 前のテキスト, next_text, 、および隣接するチャンクがスムーズに連携できるよう、リクエストIDの連続性フィールドを設定します。.
当社のテストでは、1,399文字のスクリプト1つが、「Anywhere」ルートを通じて初回試行で有効なファイルとして生成されたことが確認されました。ただし、これは文字数上限である10,000文字の全範囲や、オーディオブック全体にわたる安定性を証明するものではありません。.
長期保存安定性
次の点に注意してください: 冒頭と終盤のパート間のテンポのずれ、不自然な間、クリック音、クリッピング、または聞き取れるアーティファクト。.
客観的な結果: このファイルは、サンプルの切り捨てや0.8を超える隣接サンプル間のジャンプもなく、問題なくデコードされました。マシンによる計測では、前半の処理速度は2.858ワード/秒、後半は2.670ワード/秒と推定され、後半全体で処理速度が向上した兆候は見られませんでした。.
1回の実行だけでは、10,000文字の制限における安定性が証明されるわけではなく、また、人間による聴取が必要な局所的なペースの問題を排除できるわけでもない。.
感情と安定性の設定
ネイティブの ElevenLabs API では、安定性を低く設定するとバリエーションが増えますが、安定性を高く設定すると出力の一貫性は高まる一方で、単調になりがちです。表現を誇張することで表現力が高まる一方で、予測可能性が低下し、計算負荷が増加する可能性もあります。これらの設定は、普遍的な品質向上策ではなく、創造的なトレードオフとして捉えてください。.
発音
Multilingual v2 は音素タグに対応していません。ElevenLabs では、回避策としてエイリアスを含む発音辞書の使用を推奨しています。生成前に、曖昧な数値、略語、日付、URL を正規化し、ブランドにとって重要な名称や用語については、簡単な回帰テストスクリプトを用意しておくことをお勧めします。.
発音アクセントテスト
リスニングのチェックポイント: オフライン音声認識により、電話番号は「1-800-5555-0199」と認識されました。公開する前に、元の電話番号とURLをよく確認してください。.
余分な数字は、TTSのエラーとして確定したものではありません。音声認識では誤りが生じる可能性があるため、これは発音の判定というよりは、確認のためのチェックポイントとなります。.
レイテンシー
Multilingual v2は、ElevenLabsの低遅延オプションではありません。ElevenLabsによると、Flashモデルよりも遅延が大きいとのことです。 5つの正式なタスクについて測定したルート時間は10.161秒から31.489秒の範囲でしたが、これらの数値には「Anywhere」タスクのルート、ネットワーク、キューイング、およびファイル配信の時間が含まれています。これらは、ネイティブなElevenLabsモデルのレイテンシとして扱ってはなりません。.
Eleven Multilingual v2 API の使用方法
ネイティブ ElevenLabs API リクエスト
ネイティブのモデルIDを使用する eleven_multilingual_v2 JSONの本文内に、選択した音声IDをエンドポイントに指定してください。.
https://api.elevenlabs.io/v1/text-to-speech/{voice_id}curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/YOUR_VOICE_ID" \
-H "xi-api-key: $ELEVENLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"text": "ここに多言語ナレーションを入力してください。",
"model_id": "eleven_multilingual_v2",
"voice_settings": {
"stability": 0.5,
"similarity_boost": 0.75,
"style": 0,
"use_speaker_boost": true,
"speed": 1.0
}
}' \
--output narration.mp3主要なパラメータと制限値
| パラメータ | 制御対象 | 実用上の注意事項 |
|---|---|---|
voice_id | ElevenLabsの音声(抜粋) | 対象言語や地域に合ったアクセントの音声を選んでください。. |
model_id | 合成モデル | 用途 eleven_multilingual_v2. |
安定性 | 多様性対一貫性 | 低い音域では変化がより大きくなり、高い音域ではより抑制的になることがあります。. |
similarity_boost | 参照音声との類似度 | 値が大きいと識別の一助にはなりますが、言語をまたいで確実に識別できるとは限りません。. |
スタイル | スタイルの誇張 | 再現性が重要な場合は、慎重に使用してください。. |
use_speaker_boost | 追加のスピーカー類似性処理 | レイテンシが増加する可能性があります。. |
スピード | 再生速度 | 変更後は、数字と句読点を再度確認してください。. |
前のテキスト / next_text | チャンクを取り巻く文脈 | 長いスクリプトを分割する際に便利です。. |
language_code | 言語の運用 | 現在のAPIリファレンスでは、multilingual_v2モデルではサポートされていません。. |
重要だ: APIキーは安全な環境変数に保管してください。公開されている記事のコードに実際のキーを貼り付けることは絶対に避けてください。.
Eleven Multilingual v2 API の料金体系
「ElevenLabs」’ APIの料金ページ 「Multilingual v2」および「v3」を以下のURLに掲載しました。 1,000文字につき$0.10 2026年8月11日時点での確認による。税金、賦課金、関税は含まれていません。.
APIの直接価格設定
Multilingual v2 および v3 の公式レート(1,000 文字あたり $0.10)では:
ElevenLabs APIの価格(2026年8月11日時点)。税金、賦課金、関税は含まれていません。.Direct API それとも GlobalGPT?
| ルート | 価格参考 | 仕事の進め方 | 次のような場合に最もお得です |
|---|---|---|---|
| ElevenLabs API | $0.10 / 1K文字 | ネイティブリクエスト、音声、設定、および使用量の計測 | 開発者向けコントロールと製品との連携が必要です |
| グローバルGPT コストパフォーマンスに優れたおすすめ商品 | ベーシック $5.80/月 Pro $10.80/月 $25/月 無制限 | 1つのブラウザプラットフォームに、複数のAIモデルやクリエイティブツールが統合されており、オーディオジェネレーターも利用可能です | 音声は、執筆、調査、画像、動画、あるいはモデル比較といった、より広範なワークフローの一部です。 |
この料金体系では、最大10,000文字のリクエストの場合、税抜きで$1.00となります。実際のプロジェクト費用は、生成するテキストの量、再生成の頻度、および不成功のテイクを保持するかどうかによって異なります。予算は、音声の再生時間ではなく、入力文字数に基づいて算出してください。.
ネイティブAPIのワークフローを構築する必要のないクリエイターにとって、GlobalGPTはより実用的な価値提案を提供します。 2026年8月11日時点で確認したところ、年間プランの月額料金は、Basicが$5.80、Proが$10.80、Unlimitedが$25となっており、1つのサブスクリプションで複数のAIモデルとクリエイティブツールを組み合わせることができます。その GlobalGPT オーディオジェネレータ ブラウザ上のワークスペースに「Eleven Multilingual v2」と「Eleven v3」が含まれているため、APIリクエストを事前に設定することなく、ナレーションを生成したり、両モデルを比較したりすることができます。.

GlobalGPTでは独自のクレジットシステムを採用しているため、ElevenLabs APIとのキャラクターごとの価格を直接比較することはできません。しかし、音声が、執筆、調査、画像、動画、あるいは複数のAIモデルを伴うより広範なワークフローの一部である場合には、, GlobalGPTは、総合的に見てコストパフォーマンスに優れた選択肢です. あなたは~できます GlobalGPTのプランをここで比較する.
Eleven Multilingual v2 対 Eleven v3 対 Flash v2.5
どのElevenLabsモデルを選べばよいでしょうか?
発売日だけで選ぶのではなく、その仕事に適したモデルを選びましょう。.
多言語版 v2
対象を選択してください: 安定したナレーション、確立されたワークフロー、29言語に対応、最大10,000文字の台本。.
イレブンV3
対象を選択してください: ドラマチックな語り口、複数の話者が登場する作品、そして70以上の言語を網羅した幅広い対応。.
Flash v2.5
対象を選択してください: レスポンシブな製品、高いスループット、40,000文字のリクエスト、およびAPIコストの削減。.
| モデル | 言語 | 文字数制限 | 当局の強調 | ベストフィット |
|---|---|---|---|---|
| 多言語版 v2 | 29 | 10,000 | 長期保存性と安定した品質 | ナレーション、講座、ローカライズ、確立された音声制作ワークフロー |
| イレブンV3 | 70+ | 5,000 | 表現力豊かな話し言葉と複数話者による対話 | 演技、登場人物、ドラマチックな表現、より幅広い語彙 |
| Flash v2.5 | 32 | 40,000 | モデルレイテンシは約75ミリ秒、APIコストは低減 | 対話型製品、スループット、処理時間が長いリクエスト、コスト重視のスケーリング |
GlobalGPTには、同じオーディオジェネレーター内にEleven v3も含まれています。両方のモデルで同じ短いスクリプトを実行してみてください。安定したナレーションのベースラインにはMultilingual v2を使用し、より表現力豊かな語り口が必要な場合はv3と比較してみてください。 汎用的なデモよりも、ご自身のスクリプトの方が適切な判断材料となります。なぜなら、プロジェクトにとって重要な名前、句読点、ペース、言語の切り替えなどが、スクリプトには明確に表れているからです。.
Multilingual v2は、どのようなユーザーが利用すべきで、どのようなユーザーが利用すべきではないのでしょうか?
サイズがぴったり
- 講座、解説動画、企業向け動画、またはローカライズされたナレーションを制作するナレーター。.
- すでに検証済みのElevenLabs音声モデルを保有しており、安定したモデルIDを希望するチーム。.
- v3の5,000文字という制限を超える、サポートされている29の言語および文字体系のいずれかを使用する必要があるプロジェクト。.
- 可能な限り低いレイテンシよりも、ネイティブの音声制御やチャンク連続性フィールドを重視する開発者。.
次のような場合は、他の場所を探してください
- 表現力豊かな演技や、自然な複数人による会話、あるいは29言語のリストに含まれていない言語が必要な場合は、Eleven v3から始めてみてください。.
- レスポンシブな音声エージェントや高スループットなサービスを構築している場合は、Flash v2.5を検討してください。.
- 音素レベルのマークアップが必要です。Multilingual v2 は音素タグに対応していません。.
- 声の相性や実際の台本を確認することなく、特定の地方訛りが確実に再現されることが求められます。.
- 対象言語を熟練したリスナーが確認する前に、明確な主観的な品質評価を行う必要があります。.
よくある質問
2026年になっても、「Eleven Multilingual v2」は引き続き利用可能ですか?
はい。ElevenLabsでは、これをフラッグシップのテキスト読み上げモデルとして掲載しており、2026年8月11日に確認した時点では、非推奨モデル一覧には含まれていませんでした。.
「Eleven Multilingual v2」はいつリリースされましたか?
ElevenLabsは2023年8月22日に「Multilingual v2」を発表しました。本レビューにおける「2026」は、レビューの日付を指すものであり、リリース年を指すものではありません。.
Eleven Multilingual v2 は、いくつの言語に対応していますか?
英語、スペイン語、中国語、日本語、ドイツ語、フランス語、ヒンディー語、韓国語、ポルトガル語、アラビア語、ロシア語など、29の言語を公式にサポートしています。.
Eleven Multilingual v2のモデルIDは何ですか?
ElevenLabs APIのネイティブモデルIDは eleven_multilingual_v2. 「Anywhere」のテストルートでは、ハイフンで区切られた個別の識別子が使用されました eleven-multilingual-v2.
文字数制限はいくつですか?
公式の1回のリクエストあたりの文字数制限は10,000文字で、ElevenLabsの試算によると、これは約10分間の音声に相当します。.
Multilingual v2はEleven v3より優れていますか?
どちらが全体的に優れているというわけではありません。Multilingual v2は、より安定しており、リクエスト時間が長い選択肢です。一方、v3は、より幅広い言語に対応し、表現力豊かな音声出力と、複数の話者による読み上げ機能を提供します。.
Multilingual v2は、長文のナレーションに適していますか?
ElevenLabsは、同社にとって最も安定性の高い長文モデルとして位置づけられています。1,399文字のルートテストは成功裏に完了しましたが、この1回の実行だけでは、書籍全体や10,000文字規模での安定性が証明されたわけではありません。.
APIで言語コードを設定することはできますか?
現在の「Create speech」APIリファレンスには次のように記載されています。 language_code multilingual_v2 モデルではサポートされていません。.
Multilingual v2 は音素タグに対応していますか?
No. ElevenLabsでは、固有名詞や専門用語の表記を管理する必要がある場合、別名付きの読み方辞書の使用を推奨しています。.
APIの利用料金はいくらですか?
ElevenLabsは、2026年8月11日付けで、「Multilingual v2」を1,000文字あたり$0.10で上場しました(税、課徴金、関税は含まれません)。.
最終評決
Eleven Multilingual v2は、2026年のElevenLabsラインナップにおいて確固たる地位を築いています。安定した多言語ナレーション、実証済みの音声ワークフロー、最大10,000文字までのリクエストに対応する、定評のある選択肢です。ただし、すべてのTTSプロジェクトにおいて自動的に最適な選択肢となるわけではありません。 Eleven v3は、表現力豊かな演技やより幅広い言語に対応する上で、より強力な出発点となります。一方、Flash v2.5は、スピードとスケールを重視して設計されています。.
当社の客観的テストにより、ルートの信頼性やファイルの整合性について確かな自信が得られました。5つの正式な「Anywhere」タスクはすべて初回試行で完了し、有効な44.1 kHzモノラルMP3ファイルが生成され、事前に登録されたコスト上限の範囲内に収まりました。 ただし、これは人間の聴感評価に代わるものではないため、機械によるチェックのみに基づいて、主観的な「自然さ」「感情表現」「アクセント」などのスコアを付与することはありません。.
次のナレーション、講義、またはローカライズされた動画から、1つの段落を GlobalGPTのオーディオジェネレータ. まずは「Eleven Multilingual v2」から始め、声のトーンや台詞の表現を統一し、表現力重視の場面では「Eleven v3」と比較してみてください。これは、自分の作業に適したモデルを選ぶための、直接的で実用的な方法です。.



