Muse Spark 1.2 評測:效能測試、API、定價與程式碼測試

《Muse Spark 1.2 評測》

Muse Spark 1.2 結合了異常低廉的代幣定價與 100 萬代幣的上下文視窗,並在我們首次測試的 API 套件中,成功通過了所有三項基礎模型編碼任務。. Meta 於 2026年8月5日, ,具備 100 萬個代幣的上下文視窗、兩種 API 定價層級,以及一個名為 Muse Code 的獨立終端代理程式。Meta 的基準測試結果令人鼓舞;但獨立的公開程式設計排行榜尚未驗證相同的模型與代理程式組合。.

本評測將模型與代理程式、官方評分與獨立證據,以及標準定價與「貢獻者」層級的資料使用權衡區分開來。 在我們的測試中,該模型成功完成了 Python 冪等性修正、保留相容性的 TypeScript 重構,以及涵蓋整個儲存庫的 JSONL 功能,且無需重試。我們並未測試 Muse Code 代理程式的執行情況,亦未測試工具呼叫的可靠性。若您希望先比較更廣泛的領域,請參閱我們的 最適合編碼的 AI 模型 闡述了更廣泛的競爭背景。.

GlobalGPT 上的 Muse 火花

Muse Spark 1.2 評測:快速評析

Meta Research 於 2026 年 8 月 5 日發布的公告,標題為《介紹 Muse Code 與 Muse Spark 1.2》
正式推出。. Meta 於 2026 年 8 月 5 日宣布推出 Muse Code 及 Muse Spark 1.2。. 來源:Meta Research.

簡而言之: Muse Spark 1.2 是一款以程式設計為核心的 Meta 模型,具備 100 萬個標記的視窗、相容於 OpenAI SDK 的 API 存取功能,以及極具吸引力的「貢獻者」層級。 其最突出的公開亮點在於性價比:在「貢獻者」級別模型中,每百萬個標記的輸入成本為 $0.10,輸出成本為 $0.20。該級別可用於改進 Meta 的產品,而成本更高的標準模型則不適用於此目的。.

關於效能的描述需要更加謹慎。Meta 報告指出,在 Terminal-Bench 2.1 測試中,搭載 Muse Code 的 Muse Spark 1.2 獲得 82.9% 的成績,而在 DeepSWE 測試中則為 59.3%。這些是 Meta 自行執行的測試結果。 截至 2026 年 8 月 26 日查閱,公開的 Terminal-Bench 和 DeepSWE 評測平台仍未列出 Muse Spark 1.2。. 人工分析 提供了獨立的交叉核對:其智慧指數維持在 57,高於同類型號 35 的中位數。.

  • 現在就試試看的最棒理由: 低廉的貢獻者定價、龐大的語境,以及遵循熟悉的 OpenAI 客戶端模式的 API。.
  • 保持謹慎的最佳理由: 這三項受控的基礎模型任務,並未能證實 Muse Code 代理程式在大型生產儲存庫中的可靠性、工具呼叫品質或效能。.
  • 重要的隱私權選擇: 對於您不希望用於改善 Meta 產品的程式碼或提示字串,請使用標準模型。.

Muse Spark 1.2 功能一覽

經核實的規格

開發人員元數據於 2026 年 8 月 5 日推出
上下文1M一百萬個代幣
主要焦點程式設計 + 工具儲存庫相關工作與除錯
實作狀態3/3 項任務已通過每項任務限嘗試一次
muse-spark-1.2 muse-spark-1.2-contributor 繆斯程式碼 元模型 API OpenRouter 相容於 OpenAI SDK 文字 + 圖片輸入;文字輸出

Meta 將 Muse Spark 1.2 描述為一款相較於 Muse Spark 1.1,首次嘗試編碼的準確度更高、工具調用更可靠的模型。這些是來自 Muse Spark 官方產品頁面, ,而非我們自己編碼環節得出的結論。.

Muse Spark 1.2 與 Muse Code 比較

Muse Spark 1.2 即是該模型。Muse Code 則是由該模型驅動的獨立 beta 版終端代理程式。. 這項區別之所以重要,是因為代理程式可以在底層模型周圍加入規劃、工具協調、儲存庫導覽、工作樹隔離、記錄及重試行為等功能。.

將各層分開

該模型

Muse Spark 1.2

上下文、推理、API 行為、代幣計費、輸出結果,以及工具呼叫決策。.

模型識別碼1M 上下文API 定價

β 探員

繆斯程式碼

終端機使用者體驗、子代理、Git 工作樹、事件日誌、流程恢復、捆綁技能以及協調機制。.

代理工作流程Meta-run 系統結果

Meta Muse Spark 1.2 模型頁面,展示其編碼專注性及一百萬個標記的上下文視窗
官方車型總覽。. Meta 將 Muse Spark 1.2 定位為適用於程式碼工作流程的工具,具備 100 萬個代幣的上下文視窗,並提供更可靠的工具呼叫功能。. 來源:元模型頁面.

Muse Code 官方頁面 將該產品稱為「beta 編碼劑」。這使得與 Claude Code 和 Codex 等產品的比較,比假設所有觀察到的流程差異皆源自於單純的模型調用,來得更有參考價值。我們的 Codex 與 Claude 程式碼比較 解釋了為何周邊環境對開發者體驗的影響,竟能與模型本身同樣深遠。.

Muse Spark 1.2 效能測試:這些分數究竟透露了什麼

Muse Spark 1.2 在 Terminal-Bench、DeepSWE、內部編碼以及 GDPVal-AA 第二版上的 Meta 基準測試圖表
由服務提供者主導的基準研究證據。. Meta 發布了四組 Muse Spark 1.2 基準測試面板;在解讀各項分數時,仍需一併參考對應的測試框架與代理程式配對資訊。. 來源:元模型頁面.

根據 Meta 的基準測試圖表,Muse Spark 1.2 在多項編碼評估中名列前茅。這些數據值得深入探討,但並不能單純作為衡量模型原始品質的明確排名。模型、代理、測試框架、推理能力以及任務協議等要素,都可能同時發生變化。.

Meta 報導的 Terminal-Bench 2.1

Meta 基準測試面板

Terminal-Bench 2.1

全部 89 項任務 · 經過五次嘗試後,在 pass@1 條件下通過 · 選定的模型與代理組合

Meta-run Muse Code 執行結果 非經核實的公開排行榜紀錄
Opus 5 max + Claude 代碼86.7%
Muse Spark 1.2 + Muse Code82.9%
GPT-5.6 Terra max + Codex81.8%
Grok 4.5 高 + Grok 組裝81.6%
Gemini 3.6 閃光高 + 反重力 CLI78.9%
Muse Spark 1.1 + mini-swe-agent76.2%
資料來源:Meta 的 Muse Spark 1.2 模型頁面及評估方法。這些是由服務供應商運作的模型與代理組合。.

82.9% 這個數字是 Meta-run Muse Code 執行結果. . 公開版 Terminal-Bench 2.1 排行榜 在 2026 年 8 月 26 日並未列出 Muse Spark 1.2,因此它 非經核實的公開排行榜紀錄. 公開資料庫確實列出了配備 mini-SWE-agent 的 Muse Spark 1.1,其數值為 76.2% ±1.2%。.

Terminal-Bench 2.1 完整公開排行榜(截至 2026 年 8 月 7 日),共顯示十七項紀錄
獨立交叉核對。. 2026年8月7日查閱時,Terminal-Bench 2.1 開發板的完整公開清單中並未列出 Muse Spark 1.2。. 來源:Terminal-Bench.

DeepSWE 1.1 的元報告

Meta 基準測試面板

DeepSWE 1.1

113 項任務 · 91 個儲存庫 · 五種語言 · 五次嘗試中通過 1 次

作品第5號65.0%
GPT-5.6 Terra64.8%
Muse Spark 1.259.3%元報導
Grok 4.556.6%
Muse Spark 1.153.0%
Gemini 3.6 閃光燈40.0%

公開版 DeepSWE v1.1 排行榜 為保持一致性,該公司在其列出的所有型號中均採用 mini-swe-agent。經查,當時尚未將 Muse Spark 1.2 納入其中;Muse Spark 1.1 的測試結果為 53%。Meta 的 59.3% 結果則採用 Muse Code,因此這兩組數值並非來自相同的測試框架。.

DeepSWE 1.1 版完整公開排行榜已於 2026 年 8 月 6 日更新,內容包含圖表、表格及一致性說明
獨立交叉核對。. DeepSWE 針對所有列出的模型均採用了 mini-swe-agent,但尚未納入 Muse Spark 1.2。. 來源:DeepSWE v1.1.

Meta 的內部評估與通用代理評估

兩種不同的評量量表

Meta 內部編碼基準測試

440 項內部任務 · 每項任務可嘗試兩次

模型得分
作品第5號79.4%
Muse Spark 1.270.6%
GPT-5.6 Terra65.4%
Gemini 3.6 閃光燈63.9%
Grok 4.5未顯示

GDPVal-AA v2

一般代理任務評估 · Elo 式數值

模型得分
作品第5號1852
Muse Spark 1.21631
GPT-5.6 Terra1577
Grok 4.51526
Gemini 3.6 閃光燈1423

Meta 的 評估方法 指出,Terminal-Bench 在五次嘗試中均通過了所有 89 項任務,且 pass@1 達標。DeepSWE 涵蓋 91 個儲存庫及五種語言共計 113 項任務,同樣在五次嘗試中均通過了所有任務,且 pass@1 達標。 Meta 同時指出,其設定可能尚未針對第三方模型進行最佳化調整。若要了解基於實際產品決策所進行的最新競爭對手比較,請參閱 Claude Opus 5 對 GPT-5.6.

方法論改變了意義

Meta Terminal-Bench

車型 + 選定的經銷商

89 項任務、五次嘗試、推理設定各不相同,且 Meta 的測試框架可能未針對第三方系統進行同等調校。.

公共候車亭長椅

已驗證的條目

檢查時發現 Muse Spark 1.2 缺席。該板卡的配置與驗證狀態必須從 Meta 的表格中另行查閱。.

公開 DeepSWE

常見的 mini-swe-agent

橫跨 91 個儲存庫及五種語言的 113 項任務。其中未包含 Muse Spark 1.2;Muse Spark 1.1 的列出數為 53%。.

《Meta Muse Spark 1.2 與 Muse Code 評估方法論(含代理配對與推理設定)》第一頁
方法學證據。. Meta 會將不同的模型與不同的代理程式及推理設定進行配對,因此供應商排行榜並非僅基於模型本身的原始排名。. 來源:元分析方法論 PDF.

人工分析:有用的獨立背景

的 人工分析模型頁面 賦予 Muse Spark 1.2 的智慧指數為 57, ,高於 2026 年 8 月 26 日查詢時同級車型 35 的中位數。 其評測數據顯示:在 Terminal-Bench v2.1 上為 80%;經 GDPVal-AA v2 正規化後為 57%;在 SciCode 上為 56%;而在 AA-LCR 長上下文評估中則為 83%。.

人工分析版本漂移

智力指數54 → 57評估版本/結果已變更
GDPVal Elo1371 → 1631較高的電流值
終端工作檯78% → 80%AA線束在較高電流下的測試結果
每項任務的成本$0.29 → $0.40代幣使用量的增加推高了成本
幻覺發生率38% → 28%下降,同時棄權票數增加
嘗試率82% → 67%該模型嘗試解答的問題較少
來源:人工分析模型頁面及 發射分析. 初始值與當前值不應被混為一談,彷彿它們來自同一次未經變更的評估。.

實際的教訓很簡單:Muse Spark 1.2 看似具備競爭力,但沒有任何單一評分能孤立評估該模型。應將 Meta 的圖表視為 Muse Code 系統的佐證,將公開排行榜視為另一種交叉驗證,並將 Artificial Analysis 視為一種獨立但配置方式不同的評估方式。.

《Artificial Analysis Muse Spark 1.2》摘要,顯示智慧指數 57、排名、價格、評估成本,以及一百萬個代幣的上下文
獨立模型評估。. 「人工分析」報告顯示智慧指數為 57,並針對價格、語境、模式及評估成本進行了獨立檢核。. 來源:人工分析.

Muse Spark 1.2 的定價與隱私權權衡

Meta 提供了兩種價格差異極大的 API 模型 ID。較便宜的選項不僅僅是價格優惠:它還會改變提交資料的使用方式。.

每百萬枚代幣的美元價格 · 1M 語境

標準 · muse-spark-1.2

不適用於產品改進

不適用於改進 Meta 產品

輸入$1.25
快取記憶體$0.15
輸出$4.25
貢獻者 · muse-spark-1.2-contributor

價格更便宜,但需在數據用量上做出取捨

資料 可用於改善 Meta 的產品

輸入$0.10
快取記憶體$0.002
輸出$0.20
此為 2026 年 8 月 7 日查閱的 Meta 官方定價。隱私權條件會隨等級而有所不同。.
Meta Muse Spark 1.2 標準版與貢獻者版 API 定價表,包含模型識別碼及資料使用條款
官方定價。. Meta 分別列出了標準模型與貢獻者模型的 ID、代幣價格及資料使用條款。. 來源:元模型頁面, ,查閱日期:2026年8月7日。.

相較於標準層級,貢獻者層級的定價在輸入方面便宜 12.5 倍、快取輸入方面便宜 75 倍,而在輸出方面則便宜 21.25 倍。並沒有一個單一的折扣百分比能準確描述所有代幣類型。.

一位 Meta 研究員宣傳「貢獻者」級別,稱其比 Fable「便宜多達 250 倍」,比 GPT-5.6 Sol「便宜 150 倍」。那 社會比較 採用「貢獻者」定價,而非標準定價模式,且應始終附帶「數據使用」的限定條件。讀者若要比較當前競爭對手的成本,可參考我們另行的 GPT-5.6 定價指南Claude 代碼定價明細.

Matt Deitke 在社群媒體上發文,宣傳 Muse Spark 1.2「貢獻者級」的輸入、快取輸入及輸出代幣價格
說明定價背景。. 一位 Meta 研究人員推廣了「貢獻者」方案的價格比較;該貼文並未顯示較高的標準級方案價格,閱讀時必須考量數據使用量的權衡。. 來源:Matt Deitke 在 X 上的貼文.

對於公開儲存庫、合成任務或一次性評估環境,貢獻者層級(Contributor tier)可能頗具吸引力。至於私有程式碼、客戶資料、憑證或專有架構,標準層級則是更安全的預設選項。 Meta 還表示,已開始透過銷售管道受理「零資料保留」請求,這是一條獨立的存取途徑,而非預設的自助服務設定。.

Muse Spark 1.2 API 存取與範例

Meta Model API 頁面說明 Muse Spark 的直接自助存取功能現已進入公開預覽階段
官方 API 存取權限。. Meta 說明,透過 Meta Model API 直接以自助方式存取 Muse Spark 的功能現已進入公開預覽階段。. 來源:Meta Model API.

三條官方通行路線

碼頭代理Muse Code 測試版
直接 API元模型 API
聚合器OpenRouter

官方食譜網站的基礎網址: https://api.meta.ai/v1 · 本次審查中的第 1.2 項要求:未執行

元模型 API 支援與 OpenAI SDK 相容的工作流程。Meta 的官方實作指南使用以下基礎網址: https://api.meta.ai/v1 並從 MODEL_API_KEY. 產品頁面亦介紹了搜尋錨定機制,而這本實作指南則涵蓋了聊天對話自動完成、串流處理、工具呼叫、結構化輸出、提示詞快取、推理控制、視覺處理、長上下文、重試機制,以及搜尋實作範例。.

官方食譜範例 — 擷取版本:官方 GitHub 實戰指南 仍在使用 muse-spark-1.1. 這僅證明了客戶端結構和基礎 URL,並不表示此範例已針對 1.2 版本進行更新。.

import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.meta.ai/v1",
    api_key=os.environ["MODEL_API_KEY"],
)

response = client.chat.completions.create(
    model="muse-spark-1.1",
    messages=[{"role": "user", "content": "Hello, world!"}],
)

print(response.choices[0].message.content)
Meta Model API GitHub 實作指南,其中展示 OpenAI SDK 的基礎 URL、環境金鑰,以及完整的聊天自動完成範例
官方食譜。. 擷取的 README 文件中顯示了 OpenAI SDK 的範本和基礎網址,但經查證後發現,其中的範例仍使用 Muse Spark 1.1。. 來源:《Meta Model API 實作指南》.

已記錄的調整 — 未執行: Meta 另行列出 muse-spark-1.2 作為標準的 1.2 型號 ID。下方的最小替換結合了兩項官方事實,但在本次審查期間並未發出任何付費請求。.

response = client.chat.completions.create(
    model="muse-spark-1.2",
    messages=[{"role": "user", "content": "Hello, world!"}],
)

Muse Spark 是一個推理模型,而且 推理代幣會作為輸出進行計費. 這使得 $4.25 標準輸出速率比乍看之下更為重要:看似簡短的回答,仍可能蘊含隱藏的推理邏輯。實際延遲、首次標記時間、重試率以及每項任務的成本,在此仍未被量化。.

Meta 開發者指南,說明 Muse Spark 的推理代幣計費機制以及 Muse Code 的工作量控制機制
計費行為。. Meta 表示,Muse Spark 的推理代幣會以輸出形式計費,而 Muse Code 則 /努力 該指令會改變推理的深度。. 來源:Meta 開發者指南.

Muse Code 帶來了什麼

Muse Code 官方測試版頁面,展示終端編碼代理及其一指令安裝程式
Muse Code 測試版。. Meta 推出 Muse Code,作為處理複雜編碼工作流程的終端代理程式,並提供一鍵安裝程式。. 來源:Muse Code 官方頁面.

Muse Code 需透過終端機安裝,並將 Muse Spark 1.2 整合至代理程式工作流程中。Meta 的 開發者深度解析 描述了幾種不屬於純 API 呼叫的行為:

  • 並行代理: 任務可以在隔離的 Git 工作樹中執行。.
  • 僅追加式事件日誌: 會話和操作會寫入本機 JSONL 檔案,以供稽核和重播之用。.
  • 履歷流程: 繆斯履歷 可以繼續中斷的會話。.
  • 推理控制: the /努力 此指令用於調整推理強度。.
  • 明確技能: 元名稱 /口味, /燒烤, /帶說明文件的烤架, 以及 /plan.

代理產品功能

並行性

次級代理人

獨立任務可能會呈扇形擴散。.

隔離

工作樹

在並行作業期間,各分支會保持分離。.

審計

JSONL 日誌

僅追加的本地事件支援重播功能。.

復原

履歷表

繆斯履歷 繼續進行中斷的會議。.

顯式工具

技術

/口味, /燒烤, /帶說明文件的烤架, /plan.

這套功能使 Muse Code 能在更廣泛的程式設計代理市場中佔有一席之地,在該市場中,規劃、隔離、重播及工具紀律與模型智慧同樣至關重要。該 OpenClaw 與 Claude:Code 與 OpenCode 對比指南 這對於理解這些產品層面的差異而言,是一個有用的背景資訊。.

上市聲明與早期社群反饋

反應不等於認可

官方發布活動的整體規劃

培訓 + 長遠視野

更強大的程式碼運算能力、環境多樣性、協同訓練,以及一項涉及超過 1,000 個工具呼叫的壓力測試。.

一個正面的軼事

價格與 OpenCode

一位 Reddit 用戶盛讚自己早年的程式設計經驗及其價值。.

未解決的問題

隱私權 + 可靠性

其他使用者則對數據用量、標準價格、產品供應狀況以及初期可靠性等問題表達了擔憂。.

Meta 的 AI 團隊表示,Muse Spark 1.2 獲得了更多的程式碼訓練運算資源、更豐富多樣的環境,並更著重於整個儲存庫的生成與除錯,同時還與 Muse Code 進行了協同訓練。另一份 發起討論串 描述了一項在 NVIDIA Hopper GPU 上進行、持續長達 24 小時且包含超過 1,000 次工具呼叫的壓力測試。.

Meta AI 的一篇貼文,介紹 Muse Spark 1.2 的程式碼訓練、除錯、整個儲存庫生成,以及與 Muse Code 的協同訓練
官方發布的畫面構圖。. Meta 的 AI 團隊表示,該模型獲得了更多用於編碼任務的運算資源、更廣泛的環境,並與 Muse Code 進行了協同訓練。. 來源:Meta 人工智慧團隊在 X 上的貼文.
Meta 的一篇關於 AI 的貼文,描述了一項 Muse Code 壓力測試,該測試在長達二十四小時的時間內執行了超過一千次工具呼叫
長期示範。. Meta 展示了一項包含 1,000 多次工具呼叫的 GPU 核心壓力測試;這並非一般性的工具可靠性指標。. 來源:Meta 人工智慧團隊在 X 上的貼文.

這雖然是一次令人印象深刻的示範,但並非經過量測的整體成功率。它並未告訴我們,該代理程式選擇正確工具、從錯誤中恢復、避免重複呼叫,或是無需引導即可完成一般儲存庫任務的頻率。.

Reddit 上早期的貼文反應同樣褒貶不一。其中一篇 r/opencode 的一位使用者分享了其使用 OpenCode 的正面體驗 並稱讚了價格。另一篇 關於貢獻者定價的討論 引發了關於資料使用量、標準方案費用、可用性及可靠性的質疑。這些僅為個人反應,並非社群共識。.

一位 Reddit 用戶在 OpenCode 版塊中描述了早期使用 Muse Spark 1.2 編程的良好體驗及其低廉價格
一份早期使用者回報。. 一位 Reddit 用戶稱讚了 OpenCode 的編碼體驗和價格;這只是一則軼事,並非普遍共識。. 來源:r/opencode.
Reddit 上的一場討論,比較了 Muse Spark 1.2 的標準版與貢獻者版定價,同時也提出了關於資料共享的疑慮
隱私與價值反應。. 這場社群討論既探討了對「貢獻者」價格的關注,也涉及對資料使用、可用性及標準層級成本的疑慮。. 來源:r/opencodeCLI.

Muse Spark 1.2 編程測驗:3/3 項任務通過

在我們的測試中,基礎版 Muse Spark 1.2 模型透過一個相容於 OpenAI 的聊天補全 API,完成了三項受控的編碼任務。. 每項任務僅允許一次嘗試,不允許重試,且不進行人工干預。我們針對一次性儲存庫中回傳的檔案,依據公開與隱藏的檢查標準進行評估。本次測試未驗證 Muse Code 代理程式的執行情況,亦未測試工具呼叫的可靠性,因此這些結果不應被視為代理程式的基準測試。.

單次嘗試結果

任務3/33 項編碼任務中,已通過 3 項
平均延遲12.98 秒每項任務需時 12.98 秒
用法12,100總計 12,100 枚代幣
申報成本$0.045362三則模特徵選公告

這些回應共使用了 6,618 個推理標記。這三項最終理由分別是 停止, ,且「提供者」欄位顯示為 Meta。.

測試 1:Python 冪等性錯誤修正 — 通過

任務

在不修改公開 API 的情況下,阻止重複轉帳

該模型識別出缺失的 request-ID 保護機制,添加了最小的安全修正,並在維持原子性平衡更新的前提下,提供了回歸測試。.

通過 · 6 次測驗
延遲12.064 秒
代幣2,867
推理1,621
成本$0.01072675

原始的隱藏評估器錯誤地要求必須重複呼叫一次才能返回 錯誤, ,儘管該任務僅要求不得向發送者收取雙重費用。在修正了這項虛構的回傳值要求後,未經修改的首次回應通過了全部六項測試。我們並未重新嘗試,也未編輯模型的輸出結果。.

測試 2:TypeScript 多檔案重構 — 通過

任務

將驗證、持久化與稽核記錄分開處理

回傳的檔案保留了公開的路徑合約、嚴格的 TypeScript 規範,以及涵蓋訂單與稽核寫入的單一交易。此外,還新增了針對性強的驗證測試,且不依賴任何執行時元件。.

驗證PASS類型檢查、公開合約、隱藏交易檢查,以及新增的驗證測試
13.909 秒5,011 個代幣2,770 個推理$0.01833275

第一位評審將物件與原始資料進行了比較 JSON.stringify, 因此,具有相同內容但鍵值插入順序不同的物件會被視為不相等;其 Windows npx 在進行類型檢查之前,執行程序也失敗了。透過使用不區分順序的比較運算子,並以 Windows 安全模式呼叫指令,原始的回應通過了所有檢查。同樣地,系統並未進行模型重試。.

測試 3:JSONL 儲存庫功能 — 通過

遵循整個儲存庫的指示

新增 JSONL 功能,同時不影響 CSV 格式

該模型實作了擴充功能偵測、以 1 為起點的格式錯誤檢查、原子式輸出、模擬執行安全性、針對性測試、說明文字,以及一個 README 範例。.

結果9/9測試通過
延遲12.976 秒首次嘗試
4,222 個代幣2,227 項推理$0.0163025

測試結果顯示: Muse Spark 1.2 能夠在單次執行中,產出可用的多檔案修補程式、遵守相容性限制、新增測試,並處理整個儲存庫範圍內規模適中的功能。據報告顯示,每項任務的平均成本約為 $0.0151,但這些測試案例規模較小,不應以此來預測大型程式碼庫所需的成本。.

哪些人適合使用 Muse Spark 1.2?

決策指南

立即試用

受控評估

公開或合成程式碼、可量化的任務、大規模情境需求,以及一項令人期待的 3/3 基礎模型結果。.

請稍等

需提供代理人證明

Muse Code 的運作行為、穩定的速率限制、重複的工具呼叫,或是廣泛的儲存庫基準測試,皆為決策門檻。.

先進行比較

敏感代碼或高輸出

當隱私與推理代幣成本成為主要考量時,請使用標準層級,或比較其他替代方案。.

除非貴組織已另行核准「貢獻者條款」,否則請針對敏感代碼使用標準範本。若標準輸出價格會影響數值計算,請將其與當前 Codex 定價, Claude 編碼及其他編碼劑成本,再決定是否採用該工作流程。.

Muse Spark 1.2 評測結論

Muse Spark 1.2 成功入圍評估候選名單,但這並不代表自動獲得生產推薦。. 100 萬枚代幣的發行規模、熟悉的 API 架構、低廉的貢獻者定價、三次首次嘗試的編碼審核機會,以及在 Meta-run Muse Code 評分中表現優異,這些因素都讓人難以忽視。此外,Meta 在公布方法論細節方面,也比許多其他發行專案做得更為周全。.

相關注意事項同樣具體明確。貢獻者定價模式伴隨著數據使用量的權衡取捨。標準輸出與推理代幣可能會推高實際成本。 Meta 公布的頂尖編碼數據,尚未在公開的 Terminal-Bench 或 DeepSWE 排行榜上出現相應的對應紀錄,且我們的實測樣本涵蓋三項基礎模型任務,而非 Muse Code 代理程式執行。.

明智的做法是針對非敏感程式碼進行受控測試,並保存原始使用情況及本地驗證結果。將測量出的成本和延遲視為小型任務的樣本,然後在將其投入生產環境之前,先測試您自身的儲存庫規模、故障恢復能力以及代理程式工作流程。.

Muse Spark 1.2 常見問題集

什麼是 Muse Spark 1.2?

Muse Spark 1.2 是 Meta 專注於程式設計的模型,於 2026 年 8 月 5 日推出,具備 100 萬個代幣的上下文視窗,並可透過 Muse Code、Meta Model API 以及 OpenRouter 進行存取。.

Muse Spark 1.2 和 Muse Code 是同一款軟體嗎?

不,Muse Spark 1.2 是該模型;Muse Code 則是基於該模型運作的獨立 beta 版終端代理程式。Muse Code 增加了諸如子代理程式、隔離的 Git 工作樹、事件記錄、恢復功能以及捆綁式技能等產品功能。.

Muse Spark 1.2 API 的價格是多少?

標準模型每百萬個標記的輸入成本為 $1.25、快取輸入成本為 $0.15,輸出成本為 $4.25。 「貢獻者」模型的成本為每百萬個標記 $0.10 輸入、$0.002 快取輸入,以及 $0.20 輸出。.

Meta 是否使用 Muse Spark API 的資料進行訓練?

Meta 表示,標準層級的資料不會用於改善 Meta 產品。貢獻者層級的資料可能會用於改善 Meta 產品,因此除非組織另有批准,否則私有或專有程式碼應採用標準途徑。.

Muse Spark 1.2 是否出現在 Terminal-Bench 或 DeepSWE 的公開排行榜上?

於 2026 年 8 月 7 日查閱時,該項目並未出現在任何公開論壇上。Meta 報告指出,在搭配 Muse Code 的 Terminal-Bench 2.1 測試平台上,其成績為 82.9%;而在 DeepSWE 測試平台上則為 59.3%,但這些均為 Meta 自行執行測試所得的結果。.

這篇評測中是否實際測試過 Muse Spark 1.2?

是的。在三項單次嘗試的基礎模型測試中,Muse Spark 1.2 成功處理了一項 Python 錯誤修復、一項 TypeScript 重構,以及一項 JSONL 儲存庫功能。平均延遲為 12.98 秒,總報告成本為 $0.045362。 Muse Code 代理程式及工具呼叫的可靠性並未進行測試。.

開發人員該如何取得 Muse Spark 1.2?

Meta 列出了三種途徑:Muse Code 測試版終端代理程式、Meta Model API 以及 OpenRouter。官方實作指南使用的是與 OpenAI SDK 相容的客戶端,其基礎網址為 https://api.meta.ai/v1。.

分享文章:

相關文章