AI音楽の分野は急速に進化しており、「ElevenLabs Music v2」は、最も野心的な新曲生成モデルのひとつです。しかし、このモデルは、与えられた歌詞を忠実に反映し、詳細なアレンジに従い、大幅な編集を必要とせずに実用的な楽曲を生み出すことができるのでしょうか?
私たちは、シンセポップのボーカル曲、シネマティックなインストゥルメンタル曲、8パートからなるオルタナティブ・ポップのアレンジという、3つのオリジナルの90秒間のブリーフを用いてテストを行いました。本レビューでは、音声品質、プロンプトへの準拠度、生成時間、タスク報告によるコスト、公式の制御機能、およびAPIへのアクセスについて取り上げます。.
簡単な答え:ElevenLabs Music v2はどれほど優れているのか?
私たちの簡潔な評価ElevenLabs Music v2は、ブリーフで露骨な歌詞やセクションごとの制御が求められた際に、最もその真価を発揮した。. 依頼された3つの90秒のファイルをすべて生成し、歌詞テストでは提供された単語をそのまま維持し、依頼された8つの楽曲セクションを聞き取りやすく仕上げてくれました。.
しかし、細部ではやや正確さに欠けていた。ある楽器のインパクトが指定より早く入っていたり、ある楽器のブレイクが長すぎたりしたほか、構成された楽曲の終わり方も、プロンプトにあるようなすっきりとした最終和音というよりは、フェードアウトのような形になっていた。.
- 最もよく観測される強度: 歌詞と、耳で聴いてわかる曲の構成。.
- 主な制限事項: タイミングや終了に関する指示が、必ずしも正確だったとは限りませんでした。.
- テスト範囲: 3回の管理されたAPI実行であり、業界のベンチマークではありません。.
ElevenLabs Music v2は、GlobalGPTのオーディオジェネレーターからも利用可能です。この方法なら、1つのアカウントに複数のオーディオモデルやAIモデルを統合でき、別途VPNやプロバイダーの設定が不要になるほか、複数の単独サブスクリプションを維持するコストを削減できます。.
ElevenLabs Music v2 の概要
結果を見る前に、モデルで公表されている特徴セットと、3つのプロンプトで実際に証明できることを区別しておくと理解が深まります。.
「ElevenLabs Music v2」とは何ですか?
ElevenLabsは2026年5月26日に「Music v2」をリリースしました。 楽曲やインストゥルメンタル向けの、音楽生成機能のアップグレード版として。同社によると、今回のリリースにより、ボーカル、楽器演奏、アレンジ、多言語対応、歌詞の密度の高い表現、ジャンルの移行、およびインペインティングが改善されたという。.
Music v2は、ElevenMusic、ElevenAPI、およびElevenCreativeを支えています。このAPIを通じて、開発者はプログラムによって楽曲を生成したり、インペインティング機能を使って選択した領域を編集したり、リファレンスマッチングを活用したりすることができます。.
モデルID
music_v2
最大期間
5分
公表APIレート
$0.15/分
オーディオ出力
44.1 kHz
公開ビットレート
128~192 kbps
APIへのアクセス
有料ユーザー
「ElevenLabs」の公式『Music v2』リリースページ(2026年8月確認)。.
ElevenLabs Music v2 のテスト結果
私たちは 3回の制御されたAPI実行 目標時間は90秒に固定しました。GPTは当社のプラットフォーム上でオリジナルの歌詞セットを一度生成し、Music v2のテストを行う前にその内容を固定しました。リスニングノートは、Gemini 3.6 Flashの音声分析結果と照合しました。 以下の時間はローカルでのエンドツーエンド生成時間であり、処理回数は完了したタスクによって報告された値です。.
テスト1:歌詞が与えられたポップソング
テスト 01歌詞付きポップソング
90秒の目標112 BPM未成年者アルト声部
タスクの設定: 提供された単語を正確に使用し、深夜に街を後にする2人を題材にした現代的なシンセポップの楽曲を作成してください。審査では、歌詞の忠実さ、ボーカルの明瞭さ、フックの力強さ、アレンジ、および指定された最終和音を評価しました。.
コピー可能なプロンプトをすべて表示する
温かみがあり、表現力豊かなアルトのリードボーカルをフィーチャーした、完全にオリジナルの90秒間のコンテンポラリー・シンセポップ曲を1曲制作してください。BPMは112、調はAマイナーとします。ムードは希望に満ち、親密で、映画的な雰囲気を醸し出すものにしてください。ミュートをかけたエレクトリックピアノと、柔らかなアナログシンセのパルスから曲を始めます。 最初のヴァースでは、丸みのあるベースとタイトな電子ドラムを加え、プリコーラスで緊張感を高め、控えめなバックグラウンド・ハーモニーを伴った、広がりのある印象的なコーラスへと展開させてください。リードボーカルは明瞭に、センターに配置し、各楽器の分離を明確に保ってください。ナレーションによるイントロ、ラップ、観衆の歓声、実在するアーティストの模倣、フェードアウトは一切行わないでください。 明確な最終コードで終わらせてください。
以下の歌詞を正確に歌ってください。単語やセクションの追加、削除、置換、順序の変更は行わないでください。
[ヴァース1]
背後で街の明かりが消えていく
静まり返った通りが今、道を導く
真夜中のささやき、振り返ることはない
新しい地平線が、灰色の空を切り裂く
[プリコーラス]
手を取り合って、未知の道を歩む
自分たちだけの夢を追い求めて
[コーラス]
静かな夜に、私たちは生きている
地平線の彼方に星を見つける
影に迷いながらも、とても輝いている
共に、新たな定義を築こう
[ヴァース2]
人影のない道に響く柔らかな足音
息づかいひとつひとつが物語を紡ぐ
約束などない、ただ果てしない空があるだけ
君の瞳の中に、未来が宿っている
[Final Chorus]
静かな夜の中で、私たちは生きている
地平線の彼方に輝く星を見つける
影に迷いながらも、それでもとても輝いている
共に、新たな定義を切り拓こう
テスト01の結果歌詞の一貫性が強く、エレクトロニックなイントロが長め90.0秒出力
42.0秒生成時間
$0.225タスク料金
- 歌詞に明らかな逸脱は見られない 指定された単語の中に検出されました。.
- そのサウンドは、洗練されたエレクトロニック・シンセポップの趣きがあり、ボーカルと楽器の分離が明確だった。.
- ボーカルが入るまでのイントロは、依頼された時間よりも長く感じられた。.
テスト2:映画風のインストゥルメンタル
テスト 02映画的なインストゥルメンタル
90秒の目標82 BPMニ短調ボーカルなし
タスクの設定: 親しみやすいフェルト・ピアノのモチーフを軸に、SF風のキューを構築してください。オーケストラの音が徐々に盛り上がり、最後の3分の1の部分では金管楽器のみを使用し、人間の声の質感は一切含まないものとし、解決感のあるエンディングで締めくくってください。.
コピー可能なプロンプトをすべて表示する
ドラマチックなSF探検シーン向けに、完全にオリジナルの90秒間のシネマティック・インストゥルメンタル楽曲を1曲制作してください。BPMは82、調性はDマイナーとしてください。ボーカル、ナレーション、ささやき声、合唱、および人間の声に似た音は一切使用しないでください。 冒頭は、控えめなフェルトピアノのモチーフと低音域の持続する弦楽器で静かに始めます。オープニングの後、繊細なアナログのパルスを取り入れ、その後、重なり合う弦楽器と抑制の効いた低音パーカッションで徐々に盛り上げていきます。金管楽器は最後の3分の1の部分でのみ追加してください。終盤近くで、過度な音量や歪みを生じさせることなく、明確な感情的なクライマックスに達するようにしてください。 ピアノのモチーフは一聴してそれと分かるようにし、ピアノ、弦楽器、パーカッション、シンセのパルス、金管楽器の間の明確な分離を保つこと。リアルなオーケストラの音色を使用し、空間的でありながらもコントロールされたミックスにすること。前半ではトレーラー特有のインパクト音は避けること。既存の楽曲、作曲家、またはフランチャイズを模倣しないこと。フェードアウトではなく、解決された持続和音で終わらせること。.
テスト02の結果説得力のある映画的な展開で、序盤から強いインパクトを与える90.0秒出力
20.9秒生成時間
$0.225タスク料金
- 声のような質感がない が検出されました。.
- そのピアノのモチーフは、それを軸にアレンジが展開されていく中でも、一聴してそれとわかるものでした。.
- 予定より早く影響が生じたため、厳格なスケジュール遵守が損なわれた。.
テスト3:8声部の歌曲の構成
テスト 038部構成の歌曲
90秒の目標104 BPMニ長調セクションの順序を固定しました
タスクの設定: 「イントロ」、「ヴァース」、「プレコーラス」、「コーラス」、「インストルメンタル・ブレイク」、「ブリッジ」、「ファイナル・コーラス」、「アウトロ」という8つのセクションを、決まった順序で配置したオルタナティブ・ポップの楽曲を作成してください。.
コピー可能なプロンプトをすべて表示する
明確で表現力豊かなテノールのリードボーカルを特徴とする、完全にオリジナルの90秒間のオルタナティブ・ポップ曲を1曲制作してください。BPMは104、調性はDメジャーとし、モダンなオルタナティブ・ポップのサウンドプロダクション、自然な発音、控えめなボーカルエフェクトを採用してください。ナレーション、ラップ、実在するアーティストの模倣、フェードアウトは一切含まないこと。 以下のセクション順序を厳守し、プロダクション上の変更がすべて聴き取れるようにしてください:イントロ—約6秒、フィルターをかけたエレキギターと遠くで響くシンセのみ;ヴァース—ドライなベースとリムクリックのパーカッションを追加;プレコーラス—フルドラムなしで上昇するパッドを追加;コーラス—フルドラム、広がりのあるシンセ、そして明瞭なメロディックなフックを導入; インストゥルメンタル・ブレイク—約8秒間、ボーカルなしでコーラスのメロディをエコーさせる;ブリッジ—ピアノと親密で近距離感のあるボーカルのみに縮小;ファイナル・コーラス—フルバンドを復活させ、バックコーラスとオクターブ・ギター・ラインを追加し、最初のコーラスよりもスケールを大きくする; アウトロ—ドラムを削除し、フィルターをかけたギターに戻し、クリーンな最終コードで締めくくる。
以下の歌詞を正確に歌ってください。追加、削除、置換、順序変更を行わないでください。また、括弧内のインストゥルメンタルに関する指示を歌詞として歌わないでください。
[イントロ]
(インストゥルメンタル)
[ヴァース]
ひび割れたダイヤルが、壊れたメロディーを唸る
指が色あせた線をなぞる
雑音のささやきが部屋を満たす
絡み合った兆しを探し求める
[プレコーラス]
信号がちらつき、不鮮明な音
深遠な声を待ちわびて
[コーラス]
雑音の中、私の声が聞こえる?
遠くからの呼び声、儚い選択
雑音が消え、より鮮明な声が聞こえる
しっかり掴まって、そのノイズを見つけよう
[インストルメンタル・ブレイク]
(インストルメンタル)
[ブリッジ]
砕けた光の中の儚い希望
柔らかな残響が、私を引き寄せる
静寂の中、君が現れる
[ラスト・コーラス]
雑音の中、私の声が聞こえる?
遠くからの呼び声、儚い選択
雑音が消え、声が鮮明に
しっかり掴まって、その雑音を見つけよう
[アウトロ]
ささやきが歌へと変わる
私たちは、あるべき場所にいる
テスト03の結果構造面での成果は最も明確だが、タイミング制御は完璧とは言えない90.0秒出力
20.9秒生成時間
$0.225タスク料金
- 8つのセクションすべてが容易に特定できた, 、ブリッジと最後のコーラスとの対比が際立っている。.
- インストルメンタルのブレイクが、指定された8秒を超えて長くなってしまった。.
- エンディングは、プロンプトに書かれていたようなすっきりとした最終和音というよりは、フェードアウトのような感じでした。.
3つのテストが示すもの
パフォーマンスに関する調査結果
3/3利用可能な出力どの実行でも、その大まかな音楽的要件を満たす、再生可能な90秒のファイルが生成されました。.
1歌詞のクリアパス提供されたポップソングの歌詞については、聴取チェックの結果、明らかな逸脱は見られませんでした。.
8音声付きセクションこの固定構成の曲のおかげで、リクエストされたすべてのパートを簡単に特定することができました。.
- ボーカル: テスト1では、音がクリアで、中央に定位しており、電子音との分離も良好だった。.
- 器楽の作曲: テスト2におけるピアノのモチーフと抑制の効いた盛り上がり方は、このモデルがボーカル中心のポップス以外にも対応できることを示していた。.
- プロンプト制御: 大まかな構成は、フレーム単位のタイミングよりも重要度が高かった。導入部、区切り、クライマックス、結末については、依然として手作業による確認が必要である。.
- 編集の負担: 3つの成果物のいずれも使用できないものはありませんでしたが、テスト2と3については、本格的な制作納品に向けて、わずかな構成の修正が必要となるでしょう。.
効率性に関する調査結果
3回の90秒間の実行における生成時間ローカルでの平均エンドツーエンド生成時間: 27.9秒. ローカル時間には、リクエストの処理、ポーリング、およびネットワーク遅延が含まれます。これはプロバイダー側の遅延ではありません。.
- 総出力: 3つのファイルで合計270秒。.
- タスクで報告された合計料金: $0.675.
- 1回の実行あたりの料金: $0.225を90秒間。これは、公式の$0.15/分というAPIレートに1.5を掛けた値に相当します。.
- 再放送なし: 3つのタスクすべてにおいて、最初の録音で実用的な音声が得られた。.
ElevenLabs Music v2 の利用方法
ElevenLabs経由でのアクセス
- ブラウザ上で作曲を行うには、ElevenMusicをご利用ください。.
- プログラムによる生成や編集には、ElevenAPIをご利用ください。.
- について Music APIは有料ユーザー向けに利用可能です.
- 商用利用ライセンスは、「Starter」プランおよびそれ以上のプランで提供されています。.
GlobalGPT経由でのアクセス
- 1つのアカウントで、Music v2を他のオーディオモデルやAIモデルと併用できます。.
- 別途VPNやプロバイダーの設定は必要ありません。.
- 単一のプラットフォームの方が、複数の独立したサブスクリプションよりも維持コストが安くなる場合があります。.
- ツールスタック全体を再構築することなく、別のモデルに移行することができます。.
GlobalGPTオーディオジェネレータをお試しください
APIへのアクセスと利用可能なコントロール
公式SDKでは、モデルを以下を通じて公開しています。 elevenlabs.music.compose と model_id="music_v2". 基本的なリクエストでは、自然言語の 迅速 そして 音楽の長さ(ミリ秒). 作曲プランでは、より精緻なセクション構成、歌詞のタイミング、およびアレンジの制御が可能になります。.
- 世代: プロンプトに基づいて、完成した楽曲またはインストゥルメンタルを作成する。.
- 詳細な回答: 生成された構成に関する詳細情報をリクエストする。.
- ストリーミング: ファイルが完全にダウンロードされるのを待たずに、音声の再生を開始します。.
- インペインティング: トラック全体を置き換えるのではなく、選択した領域のみを再生成します。.
- 参照照合: 必要に応じて参考資料を活用し、次世代を導く。.
著作権で保護されているアーティスト、楽曲、または歌詞の名前を挙げたプロンプトは、 bad_prompt または 不適切な構成計画 回答。現役のアーティストの正確なスタイルを尋ねるのではなく、音楽的な特徴について説明してください。.
APIリクエストの例
Python SDKモデル:music_v2
import os
from elevenlabs import ElevenLabs, save
client = ElevenLabs(api_key=os.environ["ELEVENLABS_API_KEY"])
audio = client.music.compose(
model_id="music_v2",
prompt=(
"フェルトピアノ、"
"低音弦楽器、徐々に盛り上がる展開、そして解決された最終和音を特徴とするオリジナルのシネマティック・インストゥルメンタルを作成してください。"
),
music_length_ms=90_000,
)
save(audio, "music-v2-test.mp3")
APIキーはスクリプト内ではなく、環境変数に保存してください。本番環境のアプリでは、長いトラックを生成する前に、リクエストのログ記録、再試行回数の上限、および明確なコスト上限を設定してください。.
価格と当社のテスト費用
| 項目 | 検証済み値 | その意味 |
|---|
| 公式ミュージックAPIの料金体系 | $0.15/分 | 公開日: ElevenLabs API の価格ページ, (税、賦課金、関税を除く。). |
| 最大期間 | 5分 | 1件の音楽リクエストにつき、公開される出力文字数の最大値。. |
| 90秒間のタスク料金 | $0.225 | 1.5分 × $0.15;各完了したテスト課題ごとに報告される。. |
| 3つのテストの合計点 | $0.675 | 90秒間の出力3回分。再実行費用は含まれていません。. |
当社のテスト記録における単価は、公式APIの単価と一致しています。GlobalGPTの価値は、統合されたアクセスと個別のサブスクリプション数の削減にあり、Music v2の1分あたりの価格が実際に安くなっていることを示すものではありません。.
ElevenLabs Music v2 のプロンプトの使い方
Music v2は、要件定義書において音楽的な目標と譲れない制約条件が明確に区別されていた場合に、最も良好な反応を示しました。プロンプトはこの順序で作成してください:
1出力歌入りかインストゥルメンタルか、および再生時間。.
2音楽フレームジャンル、雰囲気、テンポ、調、声種。.
3編曲冒頭、展開、クライマックス、そして結末。.
4優先順位の組み合わせ声の位置、分離感、音量、そして空間感。.
5適用除外話し声がない、フェードがない、聴衆の声が聞こえない、あるいは声の質感がない。.
6歌詞と構成セクションのラベルと、単語が変更される可能性があるかどうか。.
役立つ英語の音楽用語
用語や記述語をクリックすると、その内容がコピーされます。. 例 温かみがあり、親しみやすいリードボーカルで、発音が明瞭だ。.