Muse Spark 1.2 评测:基准测试、API、定价及编码测试

Muse Spark 1.2 评测

Muse Spark 1.2 将异常低廉的令牌定价与 100 万令牌的上下文窗口相结合,并在我们首次尝试的 API 测试套件中通过了全部三项基础模型编码任务。. Meta 于 2026年8月5日, ,该系统采用100万个令牌的上下文窗口,提供两档API定价方案,并配备了一个名为Muse Code的独立终端代理。Meta的基准测试结果令人鼓舞;但独立的公开编程排行榜尚未对相同的模型与代理组合进行验证。.

本评测将模型与代理、官方评分与独立证据、标准定价与“贡献者”层级的数据使用权衡区分开来。 在我们的测试中,该模型完成了 Python 幂等性修复、保持兼容性的 TypeScript 重构,以及一个覆盖整个代码库的 JSONL 功能,且未出现重试情况。我们未测试 Muse Code 代理的执行情况,也未测试工具调用的可靠性。如果您打算先对比更广泛的领域,请参阅我们的 最适合编码的人工智能模型 提供了更广泛的竞争背景。.

GlobalGPT上的Muse火花

Muse Spark 1.2 评测:简要评价

Meta Research 于 2026 年 8 月 5 日发布的题为《推出 Muse Code 和 Muse Spark 1.2》的公告
正式发布。. Meta 于 2026 年 8 月 5 日发布了 Muse Code 和 Muse Spark 1.2。. 来源:Meta Research.

简而言之: Muse Spark 1.2 是一款专注于编程的 Meta 模型,具备 100 万令牌的窗口长度、与 OpenAI SDK 兼容的 API 访问功能,以及备受瞩目的“贡献者”层级。 其最突出的公开优势在于性价比:在“贡献者”模型上,每百万令牌的输入成本为 $0.10,输出成本为 $0.20。该层级可用于改进 Meta 的产品,而成本更高的标准模型则不适用于此目的。.

关于性能的表现,需要更加审慎看待。Meta报告称,在Terminal-Bench 2.1测试中,搭载Muse Code的Muse Spark 1.2取得了82.9%的成绩,而在DeepSWE测试中则为59.3%。这些是Meta运行的测试结果。 截至2026年8月26日,公开的Terminal-Bench和DeepSWE榜单中仍未列出Muse Spark 1.2。. 人工分析 提供了独立的交叉验证:其智能指数仍为57,高于同类模型35的中位数。.

  • 现在就尝试它的最佳理由: 低廉的贡献者定价、海量的语料库,以及遵循熟悉的 OpenAI 客户端模式的 API。.
  • 保持谨慎的最佳理由: 三项受控的基础模型任务并不能证明 Muse Code 代理在大型生产代码库中的可靠性、工具调用质量或性能。.
  • 重要的隐私选项: 对于您不希望用于改进 Meta 产品的代码或提示词,请使用标准模型。.

Muse Spark 1.2 概览

经验证的规格

开发人员梅塔2026年8月5日发布
背景1M100 万代币
主要重点编程 + 工具代码库维护与调试
实操状态3/3 项任务通过每个任务限试一次
muse-spark-1.2 muse-spark-1.2-contributor 缪斯代码 元模型 API 开放路由器 兼容 OpenAI SDK 文本+图像输入;文本输出

Meta 将 Muse Spark 1.2 描述为一款相比 Muse Spark 1.1 具有更高首次编码准确率且工具调用更可靠的模型。这些是来自 Muse Spark 官方产品页面, ,而不是我们自己编码环节得出的结论。.

Muse Spark 1.2 与 Muse Code 对比

Muse Spark 1.2 是该模型。Muse Code 是一个独立的测试版终端代理,由该模型提供支持。. 这一区别之所以重要,是因为代理可以在底层模型周围添加规划、工具协调、存储库导航、工作树隔离、日志记录和重试行为等功能。.

保持图层分离

模式

Muse Spark 1.2

上下文、推理、API 行为、令牌计费、输出以及工具调用决策。.

模型 ID1M 上下文应用程序接口定价

β-受体

缪斯代码

终端用户体验、子代理、Git 工作树、事件日志、流程恢复、捆绑技能和协调。.

代理工作流元运行系统结果

Meta Muse Spark 1.2 模型页面展示了其对编程的侧重以及 100 万令牌的上下文窗口
官方车型概览。. Meta 将 Muse Spark 1.2 定位于编码工作流,其具备 100 万令牌的上下文窗口,并提供了更可靠的工具调用功能。. 来源:元模型页面.

"(《世界人权宣言》) Muse Code 官方页面 将该产品称为“beta编码剂”。这使得将其与Claude Code和Codex等产品进行比较,比假装所有观察到的工作流差异都源于基础模型调用更为有意义。我们的 Codex 与 Claude 代码对比 解释了为什么周围的环境因素对开发者体验的影响,与模型本身同样显著。.

Muse Spark 1.2 基准测试:这些分数究竟说明了什么

Muse Spark 1.2 在 Terminal-Bench、DeepSWE、内部编码以及 GDPVal-AA 第二版上的元基准测试图表
由服务提供方主导的基准证据。. Meta 发布了四组 Muse Spark 1.2 基准测试面板;在解读各项得分时,仍需结合测试用例和代理的配对情况进行分析。. 来源:元模型页面.

Meta的基准图表显示,Muse Spark 1.2在多项编码评估中名列前茅。这些数据值得深入分析,但并不能直接反映模型原始质量的单一、明确排名。模型、代理、测试框架、推理能力以及任务协议都可能同时发生变化。.

Meta-reported Terminal-Bench 2.1

元基准测试面板

终端平台 2.1

全部 89 个任务 · 经过五次尝试后,pass@1 通过 · 选定的模型与智能体组合

Meta-run Muse Code 结果 未经验证的公开排行榜条目
Opus 5 max + Claude 代码86.7%
Muse Spark 1.2 + Muse Code82.9%
GPT-5.6 Terra max + Codex81.8%
Grok 4.5高 + Grok 构建81.6%
Gemini 3.6 闪光高 + 反重力 CLI78.9%
Muse Spark 1.1 + mini-swe-agent76.2%
来源:Meta 的 Muse Spark 1.2 模型页面及评估方法。这些是由服务提供商运行的模型与代理组合。.

82.9%这一数值是 Meta-run Muse Code 结果. .......。 public Terminal-Bench 2.1 排行榜 2026年8月26日未将Muse Spark 1.2列入列表,因此它 未经验证的公开排行榜条目. 公开榜单确实列出了搭载 mini-SWE-agent 的 Muse Spark 1.1,其性能指标为 76.2% ±1.2%。.

Terminal-Bench 2.1 完整公开排行榜(截至 2026 年 8 月 7 日),显示全部 17 条记录
独立交叉核查。. 2026年8月7日查阅时,Terminal-Bench 2.1 开发板的完整公开版本中并未列出 Muse Spark 1.2。. 来源:Terminal-Bench.

DeepSWE 1.1 的元报告

元基准测试面板

DeepSWE 1.1

113 个任务 · 91 个代码库 · 五种语言 · 五次尝试中通过了 1 次

作品第5号65.0%
GPT-5.6 Terra64.8%
Muse Spark 1.259.3%元报道
Grok 4.556.6%
Muse Spark 1.153.0%
Gemini 3.6 Flash40.0%

"(《世界人权宣言》) 公开版 DeepSWE v1.1 排行榜 为保持一致性,该公司在其列出的所有型号中均采用 mini-swe-agent。经核查,当时尚未将 Muse Spark 1.2 纳入其中;Muse Spark 1.1 的测试结果为 53%。Meta 的 59.3% 测试结果采用的是 Muse Code,因此这两个数值并非来自相同的测试平台。.

DeepSWE 1.1 版完整公开排行榜已于 2026 年 8 月 6 日更新,包括图表、表格及一致性说明
独立交叉核查。. DeepSWE 对所有列出的模型均使用了 mini-swe-agent,但尚未包含 Muse Spark 1.2。. 来源:DeepSWE v1.1.

Meta的内部评估和通用代理评估

两种不同的评价量表

Meta 内部编码基准

440项内部任务 · 每项任务有两次尝试机会

模型得分
作品第5号79.4%
Muse Spark 1.270.6%
GPT-5.6 Terra65.4%
Gemini 3.6 Flash63.9%
Grok 4.5未显示

GDPVal-AA v2

通用代理任务评估 · Elo 风格的评分

模型得分
作品第5号1852
Muse Spark 1.21631
GPT-5.6 Terra1577
Grok 4.51526
Gemini 3.6 Flash1423

Meta的 评估方法 据称,Terminal-Bench 覆盖了全部 89 个任务,并在五次尝试中均通过了 pass@1 测试。DeepSWE 则覆盖了 91 个代码库和 5 种编程语言中的 113 个任务,同样在五次尝试中均通过了 pass@1 测试。 Meta 还指出,其配置可能尚未针对第三方模型进行最优调整。有关基于实际产品决策的最新竞品对比,请参阅 Claude Opus 5 对 GPT-5.6.

方法论改变了意义

Meta 终端工作台

车型 + 选定的经销商

89项任务,5次尝试,推理设置各不相同,且Meta的测试框架可能并未针对第三方系统进行同等优化。.

公共候车亭-长椅

已验证条目

检查时未发现 Muse Spark 1.2。该电路板的配置和验证状态必须从 Meta 的图表中单独查阅。.

公开的 DeepSWE

常见的小型 Swe 代理

涉及 91 个代码库和 5 种编程语言的 113 个任务。Muse Spark 1.2 未被列入;Muse Spark 1.1 的性能指标为 53%。.

《Meta Muse Spark 1.2 与 Muse Code 评估方法论(含代理配对与推理设置)》第一页
方法学证据。. Meta 将不同的模型与不同的代理和推理设置进行配对,因此提供商图表并非仅基于模型的原始排名。. 来源:元分析方法学 PDF.

人工智能分析:有用的独立背景

"(《世界人权宣言》) 人工智能分析模型页面 将Muse Spark 1.2的智能指数评定为 57, ,高于2026年8月26日查询时同类机型35的 median 值。 其测试集在Terminal-Bench v2.1上报告80%,在GDPVal-AA v2上经标准化后为57%,在SciCode上为56%,在AA-LCR长上下文评估中为83%。.

人工分析版本漂移

智力指数54 → 57评估版本/结果已更改
GDPVal Elo简体中文(大陆)1371 → 1631更大的电流值
终端工作台78% → 80%AA线束在较高电流下的测试结果
每项任务的成本$0.29 → $0.40代币使用量的增加推高了成本
幻觉发生率38% → 28%下降,同时弃权票增加
尝试率82% → 67%该模型尝试解答的问题较少
来源:人工分析模型页面和 发射分析. 初始值和当前值不应混为一谈,仿佛它们来自同一次未被修改的求值结果。.

从中得出的实际教训很简单:Muse Spark 1.2 看起来颇具竞争力,但没有任何单一评分能单独反映该模型的真实水平。应将 Meta 的图表视为 Muse Code 系统的佐证,将公开排行榜视为一种独立的交叉验证,并将 Artificial Analysis 视为一种配置方式不同但同样独立的评估。.

Artificial Analysis Muse Spark 1.2 摘要,显示智能指数 57、排名、价格、评估成本以及 100 万代币的上下文
独立模型评估。. “人工智能分析”报告显示智能指数为57,并分别对价格、背景、模式和评估成本进行了核查。. 来源:人工分析.

Muse Spark 1.2 的定价与隐私权衡

Meta 提供了两种价格差异巨大的 API 模型 ID。较便宜的选项不仅仅只是价格优惠:它还会改变提交数据的使用方式。.

每100万枚代币的美元价格 · 1M 语境

标准 · muse-spark-1.2

不用于产品改进

不用于改进Meta的产品

输入$1.25
缓存$0.15
输出$4.25
贡献者 · muse-spark-1.2-contributor

价格更低,但需在数据使用方面做出取舍

数据 可用于改进Meta的产品

输入$0.10
缓存$0.002
输出$0.20
Meta官方定价信息核查于2026年8月7日。隐私条款随等级不同而有所变化。.
Meta Muse Spark 1.2 标准版和贡献者版 API 定价表(含模型标识符和数据使用条款)
官方定价。. Meta 分别列出了标准模型和贡献者模型的 ID、代币价格以及数据使用条款。. 来源:元模型页面, ,查阅于2026年8月7日。.

与标准层级相比,贡献者层级的输入价格便宜 12.5 倍,缓存输入价格便宜 75 倍,输出价格便宜 21.25 倍。没有一个单一的折扣百分比能准确描述所有代币类型的情况。.

一位 Meta 研究人员宣传称,“贡献者”等级的成本比 Fable “低达 250 倍”,比 GPT-5.6 Sol “低 150 倍”。那 社会比较 采用的是“贡献者”定价,而非标准定价模式,且应始终附带“数据使用”的限定条件。读者若要比较当前竞争对手的成本,可参考我们另一份 GPT-5.6 定价指南Claude 代码定价明细.

马特·戴特克(Matt Deitke)在社交媒体上发布了一条帖子,宣传了 Muse Spark 1.2 贡献者级别的输入、缓存输入和输出代币价格
发布定价背景。. 一位Meta研究人员推广了“贡献者”价格对比;该帖子未显示标准层级的更高价格,阅读时必须结合数据使用与成本之间的权衡来理解。. 来源:Matt Deitke 在 X 上的帖子.

对于公共仓库、合成任务或一次性评估环境,贡献者层级可能更具吸引力。而对于私有代码、客户数据、凭据或专有架构,标准层级则是更安全的默认选择。 Meta 还表示,已开始通过销售渠道受理“零数据保留”请求,这是一种独立的访问途径,而非默认的自助设置。.

Muse Spark 1.2 API 访问与示例

Meta Model API 页面介绍了通过公共预览版直接自助访问 Muse Spark 的方法
官方 API 访问。. Meta 表示,通过 Meta Model API 直接自助访问 Muse Spark 的功能现已进入公开预览阶段。. 来源:Meta Model API.

三条官方通道

码头代理Muse Code 测试版
直接 API元模型 API
聚合器开放路由器

官方食谱库基础网址: https://api.meta.ai/v1 · 本次审查中的第 1.2 项请求:未执行

"(《世界人权宣言》) 元模型 API 支持与 OpenAI SDK 兼容的工作流。Meta 的官方指南使用了基础 URL https://api.meta.ai/v1 并从 MODEL_API_KEY. 产品页面还介绍了搜索锚定,而《食谱》一书则涵盖了聊天自动补全、流式处理、工具调用、结构化输出、提示词缓存、推理控制、视觉处理、长上下文、重试以及搜索食谱等内容。.

官方食谱示例——截图版本: "(《世界人权宣言》) 官方 GitHub 实战指南 仍在使用 muse-spark-1.1. 这证明了客户端结构和基础 URL,但并不意味着该示例已针对 1.2 版本进行了更新。.

import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.meta.ai/v1",
    api_key=os.environ["MODEL_API_KEY"],
)

response = client.chat.completions.create(
    model="muse-spark-1.1",
    messages=[{"role": "user", "content": "Hello, world!"}],
)

print(response.choices[0].message.content)
Meta Model API GitHub 实践指南,其中展示了 OpenAI SDK 的基础 URL、环境密钥以及完整的聊天自动补全示例
官方食谱。. 截取的 README 文件中显示了 OpenAI SDK 的模式和基础 URL,但经核查,其中的示例仍在使用 Muse Spark 1.1。. 来源:《Meta Model API 实战指南》.

已记录的调整——未执行: Meta 另行列出 muse-spark-1.2 作为标准 1.2 型号 ID。下面的最小替换综合了两个官方事实,但在本次审查期间未发送任何付费请求。.

response = client.chat.completions.create(
    model="muse-spark-1.2",
    messages=[{"role": "user", "content": "Hello, world!"}],
)

Muse Spark 是一个推理模型,而且 推理令牌被计入输出. 这使得 $4.25 标准输出速率比乍看之下更为重要:一个看似简短的回答仍可能包含隐含的推理过程。实际延迟、首次令牌出现时间、重试率以及每项任务的成本在此仍未被测量。.

Meta开发者指南,详细介绍了Muse Spark的推理令牌计费机制以及Muse Code的工作量控制机制
计费方式。. Meta表示,Muse Spark的推理代币按输出计费,而Muse Code则 /努力 该命令会改变推理深度。. 来源:Meta 开发者指南.

Muse Code 带来了什么

Muse Code 官方测试版页面,展示了终端编码代理及其单行命令安装程序
Muse Code 测试版。. Meta 推出了 Muse Code,将其作为处理复杂编码工作流的终端代理,并提供了一键式安装程序。. 来源:Muse Code 官方页面.

Muse Code 通过终端安装,并将 Muse Spark 1.2 封装到代理工作流中。Meta 的 开发者深度解析 描述了若干不属于纯 API 调用的行为:

  • 并行代理: 任务可以在隔离的 Git 工作树中运行。.
  • 仅追加式事件日志: 会话和操作会被写入本地 JSONL 文件,以供审计和回放。.
  • 简历流程: 缪斯简历 可以继续中断的会话。.
  • 推理控制:/努力 该命令用于调整推理强度。.
  • 显性技能: 元名称 /口味, /烧烤, /带文档的烧烤, 和 /plan/plan.

代理产品功能

并行性

分代理商

独立任务可能会呈扇形展开。.

隔离

工作树

在并行处理期间,各分支保持分离。.

审计

JSONL 日志

仅追加的本地事件支持重放。.

恢复

简历

缪斯简历 继续进行中断的会议。.

显式工具

技能

/口味, /烧烤, /带文档的烧烤, /plan/plan.

这一功能集使Muse Code在更广泛的编程代理市场中具有重要意义,在这个市场中,规划、隔离、回放和工具规范与模型智能同样重要。该 OpenClaw 与 Claude 代码版与开放代码版指南 这对理解这些产品层面的差异很有帮助。.

发布声明与早期社区反馈

反应不等于认可

官方发布框架

培训 + 长远规划

更强大的编码计算能力、环境多样性、协同训练,以及一项涉及1,000多个工具调用的压力测试。.

一个积极的小故事

价格与OpenCode

一位Reddit用户称赞了自己早期的编程经历及其价值。.

未解决的问题

隐私 + 可靠性

其他用户对数据使用量、标准价格、供货情况以及早期可靠性提出了担忧。.

Meta旗下的人工智能部门表示,Muse Spark 1.2在编码训练方面获得了更强的计算能力、更丰富的训练环境,更加注重整个代码仓库的生成与调试,并实现了与Muse Code的协同训练。另一份 启动主题 描述了一项在 NVIDIA Hopper GPU 上进行的、持续长达 24 小时且包含超过 1,000 次工具调用的压力测试。.

Meta旗下AI团队发布的一篇博文,介绍了Muse Spark 1.2的编码训练、调试、整个代码库生成以及与Muse Code的协同训练功能
正式发布活动场景。. Meta的人工智能团队表示,该模型获得了更多的编程任务计算资源、更广泛的环境,并进行了与Muse Code的协同训练。. 来源:Meta人工智能团队在X上的帖子.
Meta上的一篇关于AI的文章,描述了一次Muse Code压力测试,该测试在长达24小时的时间内进行了超过一千次工具调用
长期示范。. Meta 展示了一项包含 1,000 多次工具调用的 GPU 内核压力测试;这并非工具的总体可靠性指标。. 来源:Meta人工智能团队在X上的帖子.

这是一次令人印象深刻的演示,但并非经过量化的总体成功率。它无法告诉我们,该代理选择正确工具的频率、从错误中恢复的频率、避免重复调用的频率,以及在无需人工干预的情况下完成常规仓库任务的频率。.

Reddit上早期的帖子同样褒贬不一。其中一篇 r/opencode 的一位用户分享了其使用 OpenCode 的积极体验 并称赞了价格。另一篇 关于贡献者定价的讨论 引发了关于数据使用量、标准套餐费用、可用性和可靠性的疑问。这些只是个人的反应,并非社区的共识。.

一位Reddit用户在OpenCode上描述了其早期使用Muse Spark 1.2进行编程的积极体验及其低廉的价格
一份早期用户报告。. 一位Reddit用户称赞了OpenCode的编程体验和价格;这只是一个个案,并非普遍共识。. 来源:r/opencode.
Reddit上的一场讨论,对比了Muse Spark 1.2的标准版和贡献者版定价,同时提出了关于数据共享的担忧
隐私与价值反应。. 本次社区讨论既涉及对“贡献者”价格的关注,也涉及对数据使用、可用性以及标准层级成本的担忧。. 来源:r/opencodeCLI.

Muse Spark 1.2 编程测试:3/3 项任务通过

在我们的测试中,基础版 Muse Spark 1.2 模型通过一个兼容 OpenAI 标准的聊天补全 API,完成了三项受控编码任务。. 每项任务仅允许一次尝试,不允许重试,且不进行人工干预。我们根据公开和隐藏的检查规则,对一次性存储库中返回的文件进行了评估。本次测试未涉及 Muse Code 代理的执行情况,也未测试工具调用的可靠性,因此这些结果不应被视为代理性能基准测试。.

单次尝试结果

任务3/33/3 编程任务已通过
平均延迟12.98秒每项任务12.98秒
使用方法12,100共计 12,100 个代币
报告的成本$0.045362三则模特招募启事

这些回复共使用了6,618个推理令牌。这三个最终理由分别是: 停止, ,且“提供商”字段报告的是Meta。.

测试 1:Python 幂等性漏洞修复 — 通过

任务

在不更改公共 API 的情况下阻止重复转账

该模型识别出了缺失的请求 ID 保护机制,添加了最小的安全修复方案,并提供了回归测试,同时保持了原子性平衡更新。.

通过 · 6 次测试
延迟12.064秒
代币2,867
推理1,621
费用$0.01072675

最初的隐藏评估器错误地要求重复调用一次才能返回 错误, ,尽管该任务仅要求避免向发件人重复收费。在纠正了这一虚构的返回值要求后,未经修改的首次响应通过了全部六项测试。我们既没有重试,也没有修改模型的输出结果。.

测试 2:TypeScript 多文件重构 — 通过

任务

将验证、持久化和审计日志记录分离

提交的文件保留了公共路由契约、严格的 TypeScript 规范,以及同时涵盖订单和审计写入操作的单一事务。此外,还添加了针对性强的验证测试,且不依赖运行时环境。.

验证PASS类型检查、公共合约、隐藏交易检查以及新增的验证测试
13.909秒5,011 个代币2,770 条推理$0.01833275

第一个评估器将对象与原始数据进行了比较 JSON.stringify, ,因此键插入顺序不同的等价对象看起来并不相等;其 Windows npx 在类型检查之前,启动操作也失败了。使用不区分顺序的比较器并采用 Windows 安全的命令调用方式后,原始响应通过了所有检查。同样,也没有进行模型重试。.

测试 3:JSONL 存储库功能 — 通过

全仓库范围的指令遵循

添加 JSONL 而不破坏 CSV 格式

该模型实现了扩展检测、以1为起点的格式错误检测、原子化输出、干跑安全性、重点测试、帮助文本以及README示例。.

结果9/9测试通过
延迟12.976秒第一次尝试
4,222 个代币2,227 条推理$0.0163025

测试结果显示: Muse Spark 1.2 能够一次性生成可用的多文件补丁、遵守兼容性约束、添加测试,并处理一个规模适中的全代码库范围的功能。报告的平均成本约为每项任务 $0.0151,但这些测试用例规模较小,不应据此预测大型代码库的成本。.

哪些人适合使用 Muse Spark 1.2?

决策指南

立即试用

对照评估

公开或合成代码、可衡量的任务、大上下文需求,以及一个前景看好的3/3基础模型结果。.

请稍等

需要提供代理证明

Muse Code 的行为、稳定的速率限制、重复的工具调用或广泛的代码库基准测试都是决策门。.

先进行比较

敏感代码或高输出

当隐私和推理令牌成本成为主要因素时,请使用标准层级或比较其他方案。.

除非贵组织已单独批准了“贡献者条款”,否则请对敏感代码使用标准模型。如果标准输出价格导致值计算发生变化,请将其与当前 Codex 定价, Claude 代码以及其他编码代理费用,然后再确定工作流程。.

Muse Spark 1.2 评测结论

Muse Spark 1.2 成功入选评估候选名单,但这并不意味着它会自动获得生产推荐。. 100万代币的发行规模、熟悉的API架构、低廉的贡献者费用、三次首次尝试的编码机会,以及在Meta-run Muse Code上取得的优异成绩,这些因素都让人难以忽视。此外,Meta在公布方法论细节方面也比许多其他项目做得更好。.

注意事项同样具体。贡献者定价模式伴随着数据使用量的权衡。标准输出和推理令牌可能会推高实际成本。 Meta公布的最高编程数据尚未在公开的Terminal-Bench或DeepSWE排行榜上以匹配条目的形式重现,而且我们的实测样本涵盖了三项基础模型任务,而非Muse Code代理的执行。.

明智的做法是在非关键代码上进行受控测试,同时保存原始使用数据和本地验证结果。将测得的成本和延迟视为小任务的样本,然后在将其投入生产环境之前,先测试您自己的代码库规模、故障恢复以及代理工作流。.

Muse Spark 1.2 常见问题解答

什么是 Muse Spark 1.2?

Muse Spark 1.2 是 Meta 推出的一款专注于编程的模型,于 2026 年 8 月 5 日发布,其上下文窗口大小为 100 万个令牌,可通过 Muse Code、Meta Model API 和 OpenRouter 进行访问。.

Muse Spark 1.2 和 Muse Code 是同一个软件吗?

不。Muse Spark 1.2 是该模型;Muse Code 是由其驱动的独立测试版终端代理。Muse Code 增加了诸如子代理、隔离的 Git 工作树、事件日志、恢复功能以及打包技能等产品功能。.

Muse Spark 1.2 API 的费用是多少?

标准模型每百万个令牌的输入成本为 $1.25,缓存输入成本为 $0.15,输出成本为 $4.25。 Contributor 模型的成本为每百万令牌 $0.10 输入、$0.002 缓存输入和 $0.20 输出。.

Meta 是否使用 Muse Spark API 数据进行训练?

Meta 表示,标准级数据不会用于改进 Meta 产品。贡献者级数据可能会用于改进 Meta 产品,因此,除非组织另有批准,否则私有或专有代码应采用标准路径。.

Muse Spark 1.2 是否出现在 Terminal-Bench 或 DeepSWE 的公开排行榜上?

2026年8月7日查询时,该模型在两个公开榜单上均未上榜。Meta报告称,该模型在搭载Muse Code的Terminal-Bench 2.1测试集上获得82.9%,在DeepSWE测试集上获得59.3%,但这些均为Meta自行运行的结果。.

本篇评测中是否对 Muse Spark 1.2 进行了实际测试?

是的。在三项单次尝试的基础模型测试中,Muse Spark 1.2 成功通过了 Python 错误修复、TypeScript 重构以及 JSONL 存储库功能测试。平均延迟为 12.98 秒,报告的总成本为 $0.045362。 Muse Code 代理和工具调用的可靠性未进行测试。.

开发人员如何获取 Muse Spark 1.2?

Meta 列出了三种实现途径:Muse Code 测试版终端代理、Meta Model API 以及 OpenRouter。官方指南中使用了一个与 OpenAI SDK 兼容的客户端,其基础 URL 为 https://api.meta.ai/v1。.

分享帖子:

相关帖子