Muse Spark 1.3 レビュー:ベンチマーク、API、価格、コーディングテスト

Muse Spark 1.3は、Metaがこれまでにリリースした中で最も強力なMuse Sparkのバージョンです。公開されているxhighモデルは、Artificial Analysis Intelligence Indexで61点を記録し、100万トークンのコンテキストウィンドウを維持しており、当社の初回応答APIテストにおいて、中程度の難易度のコーディング課題3つすべてをクリアしました。. 重要な注意点として、Metaの主要なベンチマークチャートでは「max reasoning」が使用されていますが、本レビューの作成時点では、「max」は追加の安全性テストを経て、まだ広く公開されるのを待っている状態でした。.

Muse Spark 1.3 レビュー:総評

私たちの結論

Muse Spark 1.3は、エージェントのコーディング、長文コンテキストの処理、およびコスト重視の自動化において、試してみる価値があります。その公開されているxhighの結果はすでに最先端レベルですが、Metaの最高スコアを、あたかもすべてのAPIユーザーが今日すぐに再現できるかのように引用してはいけません。.

Metaは2026年9月2日、Muse Spark 1.3をリリースした。, これにより、長期的なエージェント型ワークフローへの対応、より整然としたコーディング出力、そしてより信頼性の高いコラボレーションが可能になります。これは、~への移行をさらに推進するものです。 道具使用モデルに基づいて構築されたAIエージェント. Metaによると、要件が曖昧な場合は確認のための質問を行い、処理が行き詰まった場合はフラグを立て、重大なアクションを実行する前には確認を行うとのことだ。バージョン1.2との内部比較において、Metaのエンジニアは、ツール呼び出しが約20%減少し、トークン数が25%減少したことを確認した。これらはプロバイダー側の主張であり、当社のテスト結果ではない。.

AAインデックス、xhigh61
文脈1M
当社のコーディングテスト3/3
試験費用総額$0.040
Meta Muse Spark 1.3のモデルページ:エージェント型ワークフロー、コーディング性能、およびネイティブなマルチモーダル知覚について解説
Metaによる「Muse Spark 1.3」の公式概要。出典:Metaのモデルページ。.

Muse Spark 1.2 から何が変更されましたか?

パブリック・インテリジェンス

人工分析:xhighで57~61。.

行為者コーディング

MetaはDeepSWEにおいて75.4対55.0と報告しているが、最大値の1.3とxhighの1.2を比較している。.

長い文脈

1Mの窓は依然として残っており、MetaのチャートではハイバンドのMRCRスコアが急上昇している。.

タスクのコスト

トークンレートは横ばいのままですが、AAの測定値は、評価対象タスク1件あたり$0.55に対し、$0.40でした。.

Muse Spark 1.3 のベンチマーク:Max と Xhigh は同じではない

Metaの公式チャート その性能は目覚ましい。Muse Spark 1.3は、Terminal-Bench 2.1で88.8、DeepSWE v1.1で75.4、MRCR 512K-1Mで98.1、OSWorld 2.0で66.9という最高スコアを記録している。 Terminal-BenchではGPT-5.6 Solの最高スコアと並び、2つの長文コンテキスト対応MRCRバンドでは、掲載されている競合製品を上回っています。より広範な市場を比較検討している開発者は、当社の coding-agent の概要 補足情報として。.

メタ報告、最大推論

ベンチマーク1.3(最大)1.2 × 高いGPT-5.6 太陽最大値Opus 5 max
ターミナル・ベンチ 2.188.882.988.886.7
DeepSWE v1.175.455.073.074.0
OSWorld 2.066.947.662.768.3
MRCR 512K-1M98.155.573.8該当なし

設定の差異、エージェントのハーネス、OSWorldのバージョンの違いにより、直接的な比較には限界があります。また、Metaは「Agentic IF Index」を内部的な複合指標であると説明しています。.

図表の見方

推論努力

1.3、GPT-5.6 Sol、およびOpus 5では「max」を使用し、1.2では「xhigh」を使用します。.

ハーネス

指定エージェントと固定ハーネスは、評価によって異なります。.

オーエスワールド

1.3 および 1.2 の実行では、異なる環境バージョンが使用されています。.

内部指標

「Agentic IF Index」はMetaが作成した複合指標であり、単一の公開ベンチマークではありません。.

Metaの評価手法を読む.

Muse Spark 1.3 max と、Muse Spark 1.2 xhigh、GPT-5.6 Sol max、Opus 5 max を比較したメタベンチマーク表
メタ分析による結果。実験条件やハーネスの仕様は異なるため、上記の方法論上の留意点に留意の上、本項をお読みください。.

「Artificial Analysis」は、よりすっきりとした表示を実現します ユーザーが現在アクセスできる機能のうち。 Muse Spark 1.3のxhighスコアは61で、1.2の57から上昇しています。Terminal-Benchの結果は85%、GDPval-AA v2は1709 Elo、Tau3-Bench Bankingは47%です。 限定プレビュー版のmaxバリアントは、総合スコアで62を記録しています。一方で、パフォーマンスの低下も見られます。AA-LCRは83%から79%へ、AA-Omniscience Accuracyはxhighモードで45%から42%へと低下しています。.

Artificial Analysis Muse Spark 1.3 に関する記事:一般公開版の xhigh および限定プレビュー版の max の結果を紹介
「人工分析」は、現在利用可能な「xhigh」の結果と、限定プレビューの「max」の結果を区別します。.

Muse Spark 1.3 の価格

寄稿者

muse-spark-1.3-contributor

$0.10 入力 / $0.002 キャッシュ / $0.20 出力 100万トークンあたり.

プロンプトは、Metaの製品を改善するために活用される場合があります。.

スタンダード

muse-spark-1.3

$1.25 入力 / $0.15 キャッシュ / $4.25 出力 100万トークンあたり.

Metaによると、このティアは自社製品の改善には使用されていないという。.

Meta Muse Spark 1.3 のコントリビューターおよび標準APIの価格設定(コンテキストウィンドウおよびデータ利用規約を含む)
Muse Spark 1.3の公式価格およびデータ利用規約(2026年9月3日確認)。.

について 公式トークン価格 はバージョン1.2から変更ありませんが、タスクあたりのコストは異なります。当社の オールインワンAIプラットフォームのレビュー アクセス価格とワークフローコストを別々に評価すべき理由を説明しています。Artificial Analysisの測定によると、インテリジェンス・インデックスのタスク1件あたりのコストは1.3倍の$0.55であったのに対し、1.2倍の場合は$0.40でした。この差は、主にエージェント評価における入力トークン数が約57%多かったことに起因しています。 コントリビューター・ティアは極めて安価ですが、そのデータ使用条件は単なる付記ではなく、製品選択における重要な要素です。.

Muse Spark 1.3 の API アクセス

Metaの 公式レシピ本 を使用している。 muse-spark-1.3 をデフォルトとして設定し、1,048,576トークンのコンテキストウィンドウを指定します。このAPIはOpenAI SDKと互換性があります。Muse CodeおよびMeta Model APIが、現時点で利用可能なアクセス経路として確認されています。 MetaのモデルページにはOpenRouterも表示されていますが、ボタンをクリックしても1.2のURLにリダイレクトされる状態が続いているため、デプロイ前にアクセス経路を確認してください。エージェントの相互運用性に関する背景情報については、当社のガイドを参照してください。 MCPとAIツール.

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.meta.ai/v1",
    api_key=os.environ["MODEL_API_KEY"],
)

response = client.chat.completions.create(
    model="muse-spark-1.3",
    messages=[{"role": "user", "content": "このパッチに回帰バグがないか確認してください。"}],
)

print(response.choices[0].message.content)

実践的なコーディングテスト:3回中3回合格

温度ゼロの状態で、APIを介して中程度の難易度のリポジトリタスク3つを、タスクごとに1つのレスポンスを用いてテストしました。各レスポンスは、構造化されたJSON形式の完全なファイルを返す必要がありました。その後、それらのファイルをディスポーザブルディレクトリ内で適用し、公開チェックと非公開チェックを実行しました。これらは小規模な制御されたテストであり、Terminal-Benchや本番リポジトリでの試験に代わるものではありません。.

PASS – Pythonの冪等性の修正

5/5回のテスト、18.4秒、2,473トークン、$0.00905。モデルは未使用のprocessed-IDセットを検出し、早期の重複チェックを追加し、回帰テストを作成しました。.

PASS – TypeScriptのモジュール化リファクタリング

型チェックと2つの実行時チェックに合格;47.6秒;4,945トークン;$0.01661。トランザクションの境界を損なうことなく、検証、永続化、および監査ログ記録を分離した。.

PASS – JSONLのインポートとドライランの安全性

9/9のテスト;20.3秒;3,789トークン;$0.01446。CSV互換性、行番号付きエラー、アトミック出力、ドライランの安全性、ヘルプ、およびドキュメントのすべてが合格しました。.

トータルだ: 11,207 トークンおよび $0.04013。時間はエンドツーエンドのリクエスト所要時間であり、Meta API 本来のレイテンシや TTFT ではありません。.

その結果は、単なる「3/3」という数字が示唆する以上に良好でした。最初の3つの回答はすべて、検証可能であり、制約を適切に考慮したものでした。この「証拠の扱い」という観点こそが、私たちの論文を読む際にも重要となります。 GPT-5のレビュー. 。とはいえ、このサンプルでは、ツール呼び出しの繰り返しにおける信頼性、大規模リポジトリのナビゲーション、あるいはMuse Codeのオーケストレーション層については測定されていません。低コストの代替案を検討している読者の皆様には、当社の 予算配分モデルの比較 役に立つ。.

開発者からの初期の反応

初期の反応は賛否が分かれており、数が少なすぎてコンセンサスがあるとは言い難い。ある Hacker Newsのテスト, サイモン・ウィリソンは、38秒、4.2266セントのSVGランを記録し、この1.3の結果を、自身の1.2との比較において「間違いなく優れている」と評価した。. ダックスはこのリリースについて次のように説明した 彼がセクシーなモデルたちをどれほど恋しく思っていたかを思い起こさせるものとして。. ソン・キム, 、Muse Codeを約1時間試用した後、そのモデル自体は優れているかもしれないが、Muse Codeの製品については「まだ多くの改善が必要だ」と述べた。この最後のコメントは、エージェントの体験に関するものであり、モデル単体の純粋なテスト結果についてのものではない。.

Simon Willison氏によるHacker Newsの「Muse Spark 1.3」SVGテスト:コストと時間の測定、およびバージョン1.2との比較
サイモン・ウィリソンによるクリエイティブ・コードに関する逸話の一つであり、ベンチマークや広範な合意ではない。.
ソン・キムによる『Muse Code』および『Muse Spark 1.3』の、約1時間使用後の初期レビュー
ソン・キムは主に、Muse Codeのエージェントとしての経験について批判している。.
ダックスは、Muse Spark 1.3について、「高速なモデルがいかに恋しかったかを思い出した」と語った。
Daxの投稿は、スピード感あふれる印象的な内容です。.

メリットとデメリット

うまくいったこと

  • 高い人気 × 最高スコア
  • 1Mトークンのコンテキストウィンドウ
  • OpenAI 対応 API
  • 3つのコーディング課題すべてで、初回回答に合格しました
  • 貢献度レベルが極めて低い場合のトークンレート

注目ポイント

  • 「ヘッドライン・マックス」の結果は、デフォルトの公開画面には表示されません
  • 独立タスクのコストが1.2と比較して上昇した
  • 2つの独立した指標が回帰した
  • 寄稿者データは、Metaの製品を改善する可能性がある
  • 『Early Muse Code』に対する反応は賛否両論だ

Muse Spark 1.3 はどのような方に適していますか?

こんな時に使ってみてください

コーディングエージェントの評価、大規模コンテキストリポジトリの構築、ツール主導の自動化、およびデータポリシーに問題のない範囲でのコスト重視の実験。.

スキップするか、いつ待つべきか

実績のある長期的な生産の信頼性が求められる場合、今すぐ最大限の容量が必要な場合、あるいは「コントリビューター」レベルのデータ利用を受け入れられず、標準価格では競争力がないと感じる場合。.

Muse Spark 1.3 レビューの総評

Muse Spark 1.3 は、評価対象として推奨されます。. この製品は、最先端レベルの公開用X高性能、優れたロングコンテキスト処理能力、使い慣れたAPIの操作性、そして競争力のある価格設定を兼ね備えています。当社が実施した3つの初期対応コーディングタスクの結果は、本製品が複数ファイルにわたる制約条件に従い、テスト可能なパッチを生成できることを裏付けています。.

機密性の高いコードには、標準ティアを選択してください。他のフロンティアとの比較については、以下を参照してください。 GPT-5 対 Claude 4. その推論レベルが広く利用可能になるまでは、ベンチマークの最高スコアをあくまで予備的な証拠として扱うべきである。また、Muse CodeはモデルAPIとは別個に評価すべきである。エージェントのUX、ツールループ、リポジトリ制御は、ベースモデルとは無関係に成功も失敗も得得るからである。.

Muse Spark 1.3 よくある質問

Muse Spark 1.3 とは何ですか?

Muse Spark 1.3は、2026年9月2日にリリースされたMetaのコーディングおよびエージェント型ワークフローモデルであり、100万トークンのコンテキストウィンドウを備え、画像、動画、ドキュメントの認識機能をネイティブに搭載しています。.

Muse Spark 1.3の価格はいくらですか?

標準モデルの料金は、入力トークン100万個あたり$1.25、キャッシュされた入力の場合は$0.15、出力の場合は$4.25です。 コントリビューターモデルのコストは、それぞれ$0.10、$0.002、$0.20ですが、そのデータはMeta製品の改善に利用される可能性があります。.

max reasoning は利用可能ですか?

Metaによると、既存の推論モードはリリース時点で利用可能であり、maxモードは追加の安全性テストを経てその後提供される予定とのことです。一般提供が開始されたと想定する前に、最新のAPIドキュメントを確認してください。.

Muse Spark 1.3はコーディングテストに合格しましたか?

はい。最初のレスポンスは、Pythonのバグ修正、TypeScriptのリファクタリング、およびJSONLの機能テストにおけるすべての実行可能性チェックに合格しました。このサンプルには3つの制御されたタスクしか含まれておらず、一般的な信頼性率を示すものではありません。.

Muse Spark 1.3は1.2より優れていますか?

主に、入手可能な証拠に基づいています。公開されているxhigh知能のスコアは57から61に上昇し、Metaはエージェント機能と長文コンテキスト処理において大幅な向上を報告していますが、Artificial Analysisの調査では、タスクコストの増加や、長文コンテキストの検索および事実の照合においてわずかな後退も確認されました。.

「コントリビューター」モデルと「スタンダード」モデルのどちらを使うべきでしょうか?

機密性や独自性の高いプロンプトには「標準」を使用してください。Metaによると、このデータは自社製品の改善には使用されないとのことです。「コントリビューター」ははるかに安価ですが、そのプロンプトは製品改善に利用される可能性があります。.

記事を共有する

関連記事