Muse Spark 1.2 리뷰: 벤치마크, API, 가격 및 코딩 테스트

Muse Spark 1.2 리뷰

Muse Spark 1.2는 유례없이 저렴한 토큰 가격과 100만 토큰 규모의 컨텍스트 윈도우를 결합했으며, 당사의 첫 번째 API 테스트 모음에서 세 가지 기본 모델 코딩 과제를 모두 통과했습니다. 메타는 이 모델을 2026년 8월 5일, 100만 토큰 규모의 컨텍스트 윈도우, 두 가지 API 요금제, 그리고 ‘Muse Code’라는 별도의 터미널 에이전트를 갖추고 있습니다. 메타의 벤치마크 결과는 유망하지만, 독립적인 공개 코딩 순위표에서는 아직 동일한 모델-에이전트 조합에 대한 검증 결과가 나오지 않았습니다.

이 리뷰에서는 모델과 에이전트를 구분하고, 공식 점수와 독립적인 증거를 분리하며, 표준 가격 정책과 ‘기여자(Contributor)’ 등급의 데이터 사용량 상충 관계를 구분합니다. 테스트 결과, 모델은 재시도 없이 Python 이뎁포텐시 수정, 호환성을 유지하는 TypeScript 리팩토링, 리포지토리 전체에 걸친 JSONL 기능을 완료했습니다. Muse Code 에이전트 실행 및 도구 호출의 신뢰성은 테스트되지 않았습니다. 더 광범위한 분야를 먼저 비교하고 싶으시다면, 당사의 코딩을 위한 최고의 AI 모델 더 넓은 경쟁적 맥락을 제시한다.

GlobalGPT의 뮤즈 스파크

Muse Spark 1.2 리뷰: 한눈에 보는 평가

2026년 8월 5일자 메타 리서치(Meta Research)의 “Muse Code 및 Muse Spark 1.2 소개” 발표
공식 출시. 메타는 2026년 8월 5일, ‘뮤즈 코드(Muse Code)’와 ‘뮤즈 스파크(Muse Spark) 1.2’를 발표했습니다. 출처: 메타 리서치.

간단히 말하자면: Muse Spark 1.2는 100만 토큰 규모의 윈도우, OpenAI SDK와 호환되는 API 액세스, 그리고 주목할 만한 ‘Contributor’ 등급을 갖춘 코딩 중심 메타 모델입니다. 이 모델의 가장 큰 장점은 가성비입니다. 컨트리뷰터 모델의 경우 토큰 100만 개당 입력 $0.10, 출력 $0.20의 성능을 보여줍니다. 이 티어는 메타 제품 개선에 활용될 수 있는 반면, 더 비싼 표준 모델은 이러한 목적으로 사용되지 않습니다.

성능 관련 내용에는 좀 더 절제된 표현이 필요합니다. 메타(Meta)는 Muse Code를 적용한 Muse Spark 1.2의 Terminal-Bench 2.1 테스트 결과 82.9%, DeepSWE 테스트 결과 59.3%를 보고했습니다. 이는 메타가 직접 실행한 결과입니다. 2026년 8월 26일 확인한 바에 따르면, 공개된 Terminal-Bench 및 DeepSWE 게시판에는 여전히 Muse Spark 1.2가 등재되어 있지 않았습니다. 인공 분석 독립적인 교차 검증 기준을 제시한다. 이 모델의 인텔리전스 지수는 57을 유지하고 있으며, 이는 동급 모델의 중앙값인 35보다 높은 수치다.

  • 지금 바로 사용해 봐야 할 가장 큰 이유: 저렴한 기여자 요금, 방대한 컨텍스트, 그리고 익숙한 OpenAI 클라이언트 패턴을 따르는 API.
  • 신중을 기해야 할 가장 큰 이유: 세 가지 통제된 기본 모델 작업만으로는 대규모 운영 리포지토리 전반에 걸쳐 Muse Code 에이전트의 신뢰성, 도구 호출 품질 또는 성능을 입증할 수 없다.
  • 중요한 개인정보 처리 선택 사항: Meta 제품의 개선에 활용되기를 원하지 않는 코드나 프롬프트의 경우 표준 모델을 사용하십시오.

Muse Spark 1.2 개요

검증된 사양

개발자메타2026년 8월 5일 출시
문맥1M100만 토큰
주요 초점코딩 + 도구저장소 작업 및 디버깅
실습 현황3개 중 3개 과제를 통과했습니다작업당 한 번만 시도할 수 있습니다
muse-spark-1.2 muse-spark-1.2-기여자 뮤즈 코드 메타 모델 API OpenRouter OpenAI SDK 호환 텍스트 및 이미지 입력; 텍스트 출력

메타는 ‘뮤즈 스파크 1.2’를 ‘뮤즈 스파크 1.1’보다 첫 시도 코딩 정확도가 더 높고 도구 호출의 신뢰성이 더 뛰어난 모델이라고 설명합니다. 이는 제공업체 측의 주장으로, Muse Spark 공식 모델 페이지, 우리 자신의 코딩 세션에서 도출한 결론이 아닙니다.

Muse Spark 1.2 대 Muse Code

Muse Spark 1.2가 해당 모델입니다. Muse Code는 이 모델을 기반으로 하는 별도의 베타 터미널 에이전트입니다. 이러한 구분이 중요한 이유는 에이전트가 기본 모델 주변에 계획 수립, 도구 조정, 리포지토리 탐색, 워크트리 격리, 로깅 및 재시도 동작을 추가할 수 있기 때문입니다.

레이어를 분리해 두세요

모델

Muse Spark 1.2

컨텍스트, 추론, API 동작, 토큰 과금, 출력 결과, 도구 호출 결정.

모델 ID1M 컨텍스트API 가격

베타 요원

뮤즈 코드

터미널 UX, 서브에이전트, Git 워크트리, 이벤트 로그, 재개 흐름, 번들 스킬, 오케스트레이션.

에이전트 워크플로우메타 실행 시스템 결과

코딩에 중점을 두고 100만 토큰의 컨텍스트 창을 지원하는 Meta Muse Spark 1.2 모델 페이지
공식 모델 개요. 메타는 ‘Muse Spark 1.2’를 코딩 워크플로우에 최적화했으며, 100만 토큰 규모의 컨텍스트 윈도우와 더욱 안정적인 도구 호출 기능을 제공합니다. 출처: 메타 모델 페이지.

그리고 뮤즈 코드 공식 페이지 이 제품을 ‘베타 코딩 제제’라고 부릅니다. 따라서 관찰된 모든 워크플로우 차이가 단순한 모델 호출에서 비롯된 것처럼 가정하는 것보다, Claude Code나 Codex와 같은 제품과의 비교가 더 유용합니다. 우리의 Codex와 Claude 코드 비교 이는 주변 에이전트가 모델만큼이나 개발자 경험을 변화시킬 수 있는 이유를 설명해 줍니다.

Muse Spark 1.2 벤치마크: 점수가 실제로 보여주는 것

Terminal-Bench, DeepSWE, 내부 코딩, GDPVal-AA 버전 2를 대상으로 한 Muse Spark 1.2의 메타 벤치마크 차트
의료기관이 주도한 벤치마크 자료. Meta는 Muse Spark 1.2 벤치마크 패널 4개를 공개했습니다. 각 점수를 해석할 때는 여전히 하네스와 에이전트의 페어링 정보를 함께 고려해야 합니다. 출처: 메타 모델 페이지.

메타(Meta)의 벤치마크 차트에 따르면, Muse Spark 1.2는 여러 코딩 평가에서 상위권에 위치해 있습니다. 이 수치를 살펴볼 가치는 있지만, 이는 모델의 순수한 품질을 단일하고 명확하게 나타내는 순위는 아닙니다. 모델, 에이전트, 하네스, 추론 능력, 과제 프로토콜 등이 모두 함께 변동될 수 있기 때문입니다.

메타 리포트된 터미널-벤치 2.1

메타 벤치마크 패널

터미널-벤치 2.1

총 89개의 과제 · 5회 시도 중 1회 통과 · 선정된 모델-에이전트 조합

Muse 코드 메타 실행 결과 인증되지 않은 공개 순위표 등록 항목
Opus 5 max + Claude 코드86.7%
Muse Spark 1.2 + Muse Code82.9%
GPT-5.6 테라 맥스 + 코덱스81.8%
Grok 4.5 높이 + Grok 빌드81.6%
Gemini 3.6 플래시 하이 + 안티그래비티 CLI78.9%
Muse Spark 1.1 + mini-swe-agent76.2%
출처: 메타(Meta)의 Muse Spark 1.2 모델 페이지 및 평가 방법론. 이는 제공업체가 운영하는 모델-에이전트 조합입니다.

82.9%라는 수치는 Muse 코드 메타 실행 결과. . 공개 Terminal-Bench 2.1 순위표 2026년 8월 26일자 목록에 Muse Spark 1.2가 포함되지 않았으므로, 이는 인증되지 않은 공개 순위표 등록 항목. 공개 게시판에는 미니 SWE 에이전트가 탑재된 Muse Spark 1.1의 성능이 76.2% ±1.2%로 기재되어 있었습니다.

2026년 8월 7일 기준으로 확인된 Terminal-Bench 2.1 공개 순위표 전체, 17개 항목이 모두 표시됨
독립적인 교차 확인. 2026년 8월 7일 확인한 결과, 공개된 Terminal-Bench 2.1 보드 전체 목록에는 Muse Spark 1.2가 포함되어 있지 않았습니다. 출처: Terminal-Bench.

DeepSWE 1.1 메타 보고서

메타 벤치마크 패널

DeepSWE 1.1

113개 작업 · 91개 저장소 · 5개 언어 · 5번의 시도 끝에 pass@1 달성

오푸스 565.0%
GPT-5.6 테라64.8%
Muse Spark 1.259.3%메타 보고됨
Grok 4.556.6%
Muse Spark 1.153.0%
Gemini 3.6 플래시40.0%

그리고 공개 DeepSWE v1.1 순위표 일관성을 위해 목록에 포함된 모든 모델에 mini-swe-agent를 사용합니다. 확인 당시 Muse Spark 1.2는 추가되지 않았으며, Muse Spark 1.1의 결과는 53%로 표시되어 있었습니다. 메타의 59.3% 결과는 Muse Code를 사용한 것이므로, 두 수치는 테스트 환경이 동일하지 않습니다.

2026년 8월 6일 업데이트된 DeepSWE 버전 1.1 전체 공개 순위표(차트, 표 및 일관성 관련 참고 사항 포함)
독립적인 교차 확인. DeepSWE는 나열된 모든 모델에 mini-swe-agent를 사용했으며, 아직 Muse Spark 1.2는 포함하지 않았습니다. 출처: DeepSWE v1.1.

메타의 내부 및 일반 에이전트 평가

두 가지 서로 다른 평가 척도

메타 내부 코딩 벤치

440개의 내부 과제 · 과제당 두 번의 시도

모델점수
오푸스 579.4%
Muse Spark 1.270.6%
GPT-5.6 테라65.4%
Gemini 3.6 플래시63.9%
Grok 4.5표시되지 않음

GDPVal-AA v2

일반적 행위자 과제 평가 · 엘로(Elo) 방식의 값

모델점수
오푸스 51852
Muse Spark 1.21631
GPT-5.6 테라1577
Grok 4.51526
Gemini 3.6 플래시1423

메타의 평가 방법론 Terminal-Bench는 89개의 작업을 모두 처리했으며, 5번의 시도 모두에서 pass@1을 달성했다고 밝혔습니다. DeepSWE는 91개의 저장소와 5개 언어를 아우르는 113개의 작업을 처리했으며, 역시 5번의 시도 모두에서 pass@1을 달성했습니다. Meta는 또한 자사의 설정이 타사 모델에 대해 최적으로 조정되지 않았을 수 있다고 언급합니다. 실제 제품 의사결정을 기반으로 한 최신 경쟁사 비교 내용은 다음을 참조하십시오. Claude Opus 5 대 GPT-5.6.

방법론은 의미를 바꾼다

메타 터미널-벤치

모델 + 선정된 에이전트

89개의 과제, 5회의 시도, 최대 추론 설정의 차이 등이 있으며, 메타의 하네스가 타사 시스템에 대해 균등하게 조정되지 않았을 수도 있습니다.

공용 터미널-벤치

검증된 항목

확인해 본 결과 Muse Spark 1.2는 없었습니다. 보드의 구성 및 검증 상태는 Meta의 차트에서 별도로 확인해야 합니다.

공개 DeepSWE

일반적인 미니 스웨 에이전트

91개의 저장소와 5개 언어를 아우르는 113개의 작업. Muse Spark 1.2는 포함되지 않았으며, Muse Spark 1.1은 53%로 기재되어 있었다.

Meta Muse Spark 1.2 및 Muse Code 평가 방법론: 에이전트 페어링 및 추론 설정을 포함한 1페이지
방법론적 근거. Meta는 서로 다른 모델과 에이전트, 추론 설정을 조합하여 사용하므로, 제공자 차트는 단순히 모델만 기준으로 한 순위가 아닙니다. 출처: 메타 분석 방법론 PDF.

인공 분석: 유용한 독립적 맥락

그리고 인공 분석 모델 페이지 Muse Spark 1.2의 지능 지수를 57, 2026년 8월 26일 확인 기준 동급 모델의 중앙값인 35를 상회합니다. 이 모델의 하네스 결과는 Terminal-Bench v2.1에서 80%, GDPVal-AA v2 기준 정규화 시 57%, SciCode에서 56%, AA-LCR 장문 맥락 평가에서 83%를 기록했습니다.

인공 분석 버전의 드리프트

지능 지수54 → 57평가 버전/결과가 변경되었습니다.
GDPVal Elo1371 → 1631더 높은 전류값
터미널 벤치78% → 80%AA 하네스 고전류 측정 결과
작업당 비용$0.29 → $0.40토큰 사용량이 늘어나면서 비용이 증가했습니다
환각 발생률38% → 28%하락세와 함께 기권표도 늘어남
시도율82% → 67%그 모델은 더 적은 수의 문제를 풀려고 시도했다
출처: 인공 분석 모델 페이지 및 발사 분석. 초기값과 현재값을 마치 하나의 변하지 않는 평가 결과에서 나온 것처럼 혼용해서는 안 됩니다.

실무적인 교훈은 간단합니다. Muse Spark 1.2는 경쟁력이 있어 보이지만, 이 모델을 단독으로 평가할 수 있는 단일 점수는 없습니다. 메타(Meta)의 차트는 Muse Code 시스템에 대한 근거로, 공개 순위표는 별도의 교차 검증 자료로, Artificial Analysis는 독립적이면서도 구성 방식이 다른 평가 기준으로 삼아야 합니다.

지능 지수 57, 순위, 가격, 평가 비용 및 100만 토큰 분량의 문맥을 보여주는 ‘Artificial Analysis Muse Spark 1.2’ 요약
독립적인 모델 평가. Artificial Analysis는 지능 지수 57을 보고하며, 가격, 맥락, 양상 및 평가 비용에 대해 별도로 검토 결과를 제공합니다. 출처: Artificial Analysis.

Muse Spark 1.2의 가격 및 개인정보 보호 측면의 상충 관계

Meta는 가격이 현저히 다른 두 가지 API 모델 ID를 제공합니다. 더 저렴한 옵션은 단순히 할인된 가격일 뿐만 아니라, 제출된 데이터의 사용 방식에도 변화를 가져옵니다.

토큰 100만 개당 USD · 1M 맥락

표준 · muse-spark-1.2

제품 개선에 사용되지 않음

메타 제품의 개선에 사용되지 않음

입력$1.25
캐시$0.15
출력$4.25
기여자 · muse-spark-1.2-contributor

가격은 더 저렴하지만, 데이터 사용량 측면에서 타협이 필요합니다

데이터 메타 제품의 개선에 활용될 수 있습니다

입력$0.10
캐시$0.002
출력$0.20
2026년 8월 7일 확인된 메타의 공식 가격 정보입니다. 개인정보 보호 조건은 등급에 따라 달라집니다.
모델 식별자 및 데이터 사용 약관이 포함된 Meta Muse Spark 1.2 표준 및 기여자용 API 요금표
공식 가격. Meta는 표준 모델 ID와 기여자 모델 ID, 토큰 가격, 데이터 사용 조건을 별도로 명시하고 있습니다. 출처: 메타 모델 페이지, 2026년 8월 7일 확인.

기여자 요금제는 표준 요금제에 비해 입력의 경우 12.5배, 캐시된 입력의 경우 75배, 출력의 경우 21.25배 더 저렴합니다. 모든 토큰 유형을 포괄하는 단일 할인 비율은 존재하지 않습니다.

메타의 한 연구원은 “기여자(Contributor)” 등급을 Fable보다 “최대 250배 저렴”하고 GPT-5.6 Sol보다 “150배 저렴”하다고 홍보했습니다. 그 사회적 비교 표준 모델이 아닌 ‘기여자(Contributor)’ 요금제를 적용하며, 항상 데이터 사용 제한 조건이 적용됨을 명시해야 합니다. 현재 경쟁사의 요금을 비교하려는 독자들은 당사의 별도 GPT-5.6 가격 안내서 그리고 Claude 코드 가격 내역.

맷 디트케(Matt Deitke)가 뮤즈 스파크(Muse Spark) 1.2 버전의 기여자 등급(Contributor-tier) 입력, 캐시된 입력 및 출력 토큰 가격을 홍보하는 소셜 미디어 게시물
출시 가격의 배경을 설명합니다. 메타의 한 연구원이 ‘기여자’ 요금제 가격 비교를 소개했는데, 이 게시물에는 더 높은 ‘표준’ 요금제의 가격이 표시되어 있지 않으므로, 데이터 사용량과 비용 간의 상충 관계를 고려하여 읽어야 합니다. 출처: X의 Matt Deitke.

공개 저장소, 합성 작업 또는 일회용 평가 환경의 경우 ‘Contributor’ 등급이 매력적일 수 있습니다. 비공개 코드, 고객 데이터, 인증 정보 또는 독점 아키텍처의 경우 ‘Standard’ 등급이 더 안전한 기본 설정입니다. 또한 메타는 기본 셀프 서비스 설정이 아닌 별도의 접근 경로인 영업팀을 통해 데이터 비보관 요청을 접수하기 시작했다고 밝혔습니다.

Muse Spark 1.2 API 사용 방법 및 예제

공개 프리뷰 단계에서 Muse Spark에 대한 직접적인 셀프 서비스 접근 방식을 설명하는 메타 모델 API 페이지
공식 API 이용. 메타는 메타 모델 API를 통한 ‘뮤즈 스파크(Muse Spark)’의 직접 셀프 서비스 접속 기능을 공개 프리뷰 단계로 제공한다고 밝혔습니다. 출처: 메타 모델 API.

세 가지 공식 접근 경로

터미널 에이전트Muse Code 베타
직접 API메타 모델 API
애그리게이터OpenRouter

공식 요리책 기본 URL: https://api.meta.ai/v1 · 1.2. 본 검토에서 제기된 요청: 이행되지 않음

그리고 메타 모델 API OpenAI SDK와 호환되는 워크플로를 지원합니다. 메타의 공식 쿡북에서는 기본 URL을 사용합니다. https://api.meta.ai/v1 그리고 다음에서 키를 읽어오고 MODEL_API_KEY. 제품 페이지에는 검색 그라운딩에 대한 설명도 포함되어 있으며, 쿡북에서는 채팅 자동 완성, 스트리밍, 도구 호출, 구조화된 출력, 프롬프트 캐싱, 추론 제어, 비전, 긴 컨텍스트, 재시도 및 검색 레시피를 다룹니다.

공식 요리책 예시 — 캡처된 버전: 그리고 공식 GitHub 쿡북 여전히 사용하고 있다 muse-spark-1.1. 이는 클라이언트 구조와 기본 URL을 확인하는 것이며, 예제가 1.2 버전으로 업데이트되었다는 것을 의미하지는 않습니다.

import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.meta.ai/v1",
    api_key=os.environ["MODEL_API_KEY"],
)

response = client.chat.completions.create(
    model="muse-spark-1.1",
    messages=[{"role": "user", "content": "Hello, world!"}],
)

print(response.choices[0].message.content)
OpenAI SDK의 기본 URL, 환경 키 및 완전한 채팅 자동 완성 예제를 보여주는 메타 모델 API GitHub 쿡북
공식 요리책. 캡처된 README 파일에는 OpenAI SDK 패턴과 기본 URL이 표시되어 있지만, 확인해 본 결과 예제 코드에서는 여전히 Muse Spark 1.1이 사용되고 있었습니다. 출처: 메타 모델 API 쿡북.

문서화된 적용 — 실행되지 않음: 메타는 별도로 다음과 같이 나열합니다. muse-spark-1.2 표준 1.2 모델 ID로 지정되었습니다. 아래의 최소한의 대체 내용은 두 가지 공식 사실을 결합한 것이지만, 이번 검토 기간 동안 유료 요청은 전송되지 않았습니다.

response = client.chat.completions.create(
    model="muse-spark-1.2",
    messages=[{"role": "user", "content": "Hello, world!"}],
)

Muse Spark는 추론 모델이며, 추론 토큰은 출력으로 청구됩니다. 따라서 $4.25 표준 출력 속도는 겉보기에 보이는 것보다 더 중요합니다. 겉보기에는 짧아 보이는 응답에도 숨겨진 추론 과정이 담겨 있을 수 있기 때문입니다. 실제 지연 시간, 첫 토큰까지 걸리는 시간, 재시도 빈도, 작업당 비용 등은 아직 측정되지 않았습니다.

Muse Spark의 추론 토큰 기반 과금 방식과 Muse Code의 작업 제어 기능을 설명하는 메타 개발자 가이드
청구 방식. 메타에 따르면, Muse Spark의 추론 토큰은 출력으로 청구되는 반면, Muse Code는 /effort 이 명령은 추론의 깊이를 변경합니다. 출처: 메타 개발자 가이드.

뮤즈 코드가 제공하는 기능

터미널 코딩 에이전트와 단일 명령어 설치 프로그램을 보여주는 Muse Code 공식 베타 페이지
Muse Code 베타. 메타는 ‘뮤즈 코드(Muse Code)’를 복잡한 코딩 워크플로우를 위한 터미널 에이전트로 선보이며, 단 한 줄의 명령어로 설치할 수 있는 설치 프로그램을 제공합니다. 출처: 뮤즈 코드 공식 페이지.

Muse Code는 터미널을 통해 설치되며, Muse Spark 1.2를 에이전트 워크플로우로 감싸줍니다. 메타의 개발자 심층 분석 다음은 단순한 API 호출에 해당하지 않는 몇 가지 동작을 설명합니다:

  • 병렬 에이전트: 작업은 격리된 Git 작업 트리에서 실행될 수 있습니다.
  • 추가 전용 이벤트 로그: 세션과 작업 내역은 감사 및 재생을 위해 로컬 JSONL 파일에 기록됩니다.
  • 이력서 작성 절차: 뮤즈 이력서 중단된 세션을 계속할 수 있습니다.
  • 추론 제어: the /effort 이 명령은 추론 강도를 조정합니다.
  • 구체적인 기술: 메타 이름 /맛, /구이, /문서와 함께하는 그릴, 및 /계획.

에이전트 제품 기능

병렬 처리

하위 대리인

독립적인 작업들은 여러 방향으로 뻗어 나갈 수 있습니다.

고립

워크트리

병렬 작업 중에는 브랜치가 서로 분리된 상태를 유지합니다.

감사

JSONL 로그

추가 전용 로컬 이벤트는 재생을 지원합니다.

회복

이력서

뮤즈 이력서 중단되었던 세션을 계속합니다.

명시적 도구

기술

/맛, /구이, /문서와 함께하는 그릴, /계획.

이러한 기능 세트 덕분에 Muse Code는 모델의 지능뿐만 아니라 계획 수립, 격리, 재실행, 도구 활용 능력 등이 중요한 더 광범위한 코딩 에이전트 시장에서 주목받고 있습니다. 이 OpenClaw 대 Claude 코드 대 오픈코드 가이드 이러한 제품별 차이점을 이해하는 데 유용한 배경 정보입니다.

출시 관련 주장과 초기 커뮤니티 반응

반응이 곧 인정은 아니다

공식 출시 프레임

훈련 + 장기적 관점

더 많은 코딩 연산, 환경의 다양성, 공동 학습, 그리고 1,000개 이상의 도구 호출을 포함한 스트레스 테스트.

긍정적인 일화 하나

가격 및 OpenCode

한 레딧 사용자는 어린 시절의 코딩 경험과 그 가치를 높이 평가했다.

미해결 문제

개인정보 보호 + 신뢰성

다른 사용자들은 데이터 사용량, 기본 요금, 이용 가능성, 초기 신뢰성 등에 대한 우려를 제기했다.

메타의 AI 팀에 따르면, Muse Spark 1.2는 코딩 훈련을 위한 더 많은 연산 자원을 확보했으며, 더 다양한 환경에서 훈련을 받았고, 전체 리포지토리 생성 및 디버깅에 더 중점을 두었으며, Muse Code와의 공동 훈련을 거쳤다고 합니다. 별도의 시작 게시글 NVIDIA Hopper GPU에서 1,000회 이상의 툴 호출이 이루어지는, 최대 24시간 동안 진행되는 스트레스 테스트를 설명합니다.

메타(Meta) AI 팀의 게시물에서 Muse Spark 1.2의 코딩 훈련, 디버깅, 전체 리포지토리 생성, 그리고 Muse Code와의 공동 훈련에 대해 설명하고 있습니다.
공식 출시 행사 장면. 메타의 AI 팀에 따르면, 이 모델은 코딩 작업에 더 많은 연산 자원을 할당받았으며, 더 광범위한 환경에서 훈련을 받았고, Muse Code와의 공동 훈련을 거쳤다고 합니다. 출처: X의 ‘Meta의 AI’.
메타(Meta)의 AI 게시물에서, 24시간에 걸쳐 1,000회 이상의 도구 호출이 이루어진 Muse Code 스트레스 테스트에 대해 설명하고 있다.
장기 실증. 메타는 1,000회 이상의 툴 호출이 포함된 GPU 커널 부하 테스트를 하나 선보였는데, 이는 일반적인 툴 신뢰도 수치를 나타내는 것은 아닙니다. 출처: X의 ‘Meta의 AI’.

정말 인상적인 시연이지만, 이는 측정된 전반적인 성공률은 아닙니다. 이 시연만으로는 에이전트가 올바른 도구를 선택한 빈도, 오류에서 회복한 빈도, 중복 호출을 피한 빈도, 또는 별도의 개입 없이 일반적인 리포지토리 작업을 완료한 빈도를 알 수 없습니다.

초기 레딧 게시물들의 반응도 마찬가지로 엇갈린다. 한 r/opencode 사용자가 OpenCode에 대한 긍정적인 경험을 공유했습니다 그리고 가격을 칭찬했다. 별도의 기여자 가격 책정 관련 논의 데이터 사용량 증가, 표준 요금제 비용, 가용성 및 안정성에 대한 의문이 제기되었습니다. 이는 개별적인 반응일 뿐, 커뮤니티의 합의는 아닙니다.

레딧 사용자가 OpenCode에서 Muse Spark 1.2 코딩에 대한 초기 긍정적인 경험과 저렴한 가격을 소개하고 있다
초기 사용자 후기 한 건. 한 레딧 사용자는 OpenCode의 코딩 경험과 가격을 칭찬했는데, 이는 일화일 뿐 광범위한 공감대를 반영한 것은 아닙니다. 출처: r/opencode.
데이터 공유에 대한 우려를 제기하면서 Muse Spark 1.2의 표준 요금제와 기여자 요금제를 비교한 레딧 토론
개인정보 보호와 가치에 대한 반응. 이번 커뮤니티 토론에서는 ‘기여자’ 요금제에 대한 관심과 데이터 사용, 가용성, 그리고 표준 요금제 비용에 대한 우려가 함께 제기되고 있습니다. 출처: r/opencodeCLI.

Muse Spark 1.2 코딩 테스트: 3개 과제 중 3개 모두 통과

당사의 테스트에서, 기본형 Muse Spark 1.2 모델은 OpenAI 호환 채팅 자동 완성 API를 통해 세 가지 제어된 코딩 과제를 완료했습니다. 각 작업에는 한 번의 시도만 허용되었으며, 재시도는 없었고 수동 개입도 없었습니다. 일회용 저장소에 저장된 반환 파일을 공개 및 비공개 검증 기준에 따라 평가했습니다. Muse Code 에이전트 실행 및 도구 호출의 안정성은 테스트되지 않았으므로, 이 결과를 에이전트 벤치마크로 해석해서는 안 됩니다.

단일 시도 결과

작업3/3코딩 과제 3개 중 3개 통과
평균 지연 시간12.98초작업당 12.98초
사용법12,100총 12,100 토큰
보고된 비용$0.045362모델 모집 공고 3건

응답에는 6,618개의 추론 토큰이 사용되었습니다. 세 가지 최종 추론 이유는 다음과 같았습니다. 중지, 그리고 ‘제공자’ 필드에는 ‘Meta’라고 표시되었습니다.

테스트 1: 파이썬 항등성 버그 수정 — 통과

작업

공개 API를 변경하지 않고 중복 전송을 차단하세요

이 모델은 누락된 요청 ID 가드(request-ID guard)를 식별하고, 가장 최소한의 안전한 수정 사항을 적용하며, 원자적 균형 업데이트를 유지한 채 회귀 테스트를 제공했습니다.

합격 · 6회 시험
지연 시간12.064초
토큰2,867
추론1,621
비용$0.01072675

원래의 숨겨진 평가기는 반환을 위해 중복 호출을 잘못 요구했습니다. 틀림, 비록 해당 작업에서 요구한 것은 발신자에게 요금을 두 번 청구하지 않는 것뿐이었음에도 불구하고. 임의로 추가된 반환값 요구 사항을 수정한 후, 수정되지 않은 첫 번째 응답은 6개의 테스트를 모두 통과했습니다. 우리는 재시도하거나 모델 출력을 수정하지 않았습니다.

테스트 2: TypeScript 다중 파일 리팩토링 — 통과

작업

검증, 영속화 및 감사 로깅을 분리

반환된 파일들은 공개 라우트 계약, 엄격한 TypeScript 규약, 주문 및 감사 기록 쓰기를 모두 포괄하는 단일 트랜잭션을 그대로 유지했습니다. 또한 런타임 종속성 없이 핵심에 집중한 유효성 검사 테스트를 추가했습니다.

검증PASS타입 검사, 공개 계약, 숨겨진 트랜잭션 검사 및 추가된 유효성 검사 테스트
13.909초5,011 토큰2,770개의 추론$0.01833275

첫 번째 평가자는 사물들을 원시 데이터와 비교했다. JSON.stringify, 따라서 키 삽입 순서가 다른 동등한 객체들이 서로 다른 것으로 보였습니다; 해당 Windows npx 실행 또한 유형 검사 단계에서 실패했습니다. 순서에 구애받지 않는 비교 연산자와 Windows 호환 명령어 호출 방식을 사용했을 때, 원래 응답은 모든 검사를 통과했습니다. 이 경우에도 재시도 모델은 적용되지 않았습니다.

테스트 3: JSONL 저장소 기능 — 통과

리포지토리 전체에 적용되는 지침 준수

CSV 형식을 유지한 채 JSONL 추가하기

이 모델은 확장 기능 감지, 1을 기준으로 한 잘못된 줄 오류, 원자적 출력, 드라이런 안전성, 집중 테스트, 도움말 텍스트 및 README 예제를 구현했습니다.

결과9/9테스트 통과
지연 시간12.976초첫 시도
4,222 토큰2,227개의 추론$0.0163025

검사 결과: Muse Spark 1.2는 단 한 번의 실행으로 사용 가능한 다중 파일 패치를 생성하고, 호환성 제약 조건을 준수하며, 테스트를 추가하고, 리포지토리 전체에 걸친 소규모 기능을 처리할 수 있습니다. 보고된 평균 비용은 작업당 약 $0.0151이었으나, 이 테스트 사례들은 규모가 작았으므로 대규모 코드베이스의 비용을 예측하는 데는 사용해서는 안 됩니다.

Muse Spark 1.2는 어떤 분들이 사용해야 할까요?

결정 가이드

지금 사용해 보세요

통제된 평가

공개 코드 또는 합성 코드, 측정 가능한 과제, 광범위한 맥락에 대한 요구 사항, 그리고 유망한 3/3 베이스 모델 결과.

잠깐만

대리인 증명서 제출 필수

Muse Code의 동작, 안정적인 속도 제한, 반복적인 도구 호출 또는 광범위한 저장소 벤치마크는 의사 결정 기준이 됩니다.

먼저 비교해 보세요

민감한 코드 또는 높은 출력

개인정보 보호 및 추론 토큰 비용이 주요 고려 사항일 때는 표준 티어를 사용하거나 대안을 비교해 보십시오.

조직에서 기여자 약관을 별도로 승인하지 않은 한, 민감한 코드에는 표준 모델을 사용하십시오. 표준 산출 가격이 값 계산에 영향을 미치는 경우, 이를 현재 값과 비교하십시오. 코덱스 가격 정책, Claude 코드 및 기타 코딩 담당자 비용을 확인한 후 워크플로우를 확정하십시오.

Muse Spark 1.2 리뷰 결론

Muse Spark 1.2는 평가 최종 후보 목록에 이름을 올렸을 뿐, 자동적으로 생산용 추천을 받은 것은 아닙니다. 100만 토큰 규모의 규모, 익숙한 API 구조, 저렴한 기여자 요금, 세 번의 첫 시도 코딩 기회, 그리고 메타가 운영하는 뮤즈 코드(Muse Code)에서 기록한 높은 점수 등 여러 요인으로 인해 이 프로젝트를 무시하기 어렵습니다. 또한 메타는 방법론에 대한 세부 사항을 공개하는 데 있어서 다른 많은 출시 사례보다 더 잘 해냈습니다.

주의할 점도 마찬가지로 구체적입니다. 기여자 요금제는 데이터 사용량과의 상충 관계를 수반합니다. 표준 출력 및 추론 토큰은 실제 비용을 증가시킬 수 있습니다. 메타가 제시한 최고 코딩 기록은 공개된 Terminal-Bench나 DeepSWE 게시판에서 동일한 기록으로 재현되지 않았으며, 본 연구의 실증 샘플은 Muse Code 에이전트 실행이 아닌 세 가지 기본 모델 과제를 다루고 있습니다.

현명한 방법은 민감하지 않은 코드를 대상으로 통제된 테스트를 수행하고, 실제 사용 현황과 로컬 검증 결과를 저장해 두는 것입니다. 측정된 비용과 지연 시간을 소규모 작업의 샘플로 간주한 다음, 실제 운영 환경에 적용하기 전에 자체 리포지토리 규모, 장애 복구, 에이전트 워크플로우를 테스트해 보십시오.

Muse Spark 1.2 자주 묻는 질문

Muse Spark 1.2란 무엇인가요?

Muse Spark 1.2는 메타가 2026년 8월 5일에 출시한 코딩 중심 모델로, 100만 토큰 규모의 컨텍스트 윈도우를 갖추고 있으며, Muse Code, 메타 모델 API, OpenRouter를 통해 이용할 수 있습니다.

Muse Spark 1.2는 Muse Code와 같은 것인가요?

아니요. Muse Spark 1.2가 모델이며, Muse Code는 이를 기반으로 하는 별도의 베타 터미널 에이전트입니다. Muse Code는 서브에이전트, 격리된 Git 워크트리, 이벤트 로깅, 작업 재개, 번들 스킬 등의 제품 기능을 추가합니다.

Muse Spark 1.2 API 이용료는 얼마인가요?

표준 모델의 비용은 토큰 100만 개당 입력 $1.25, 캐시된 입력 $0.15, 출력 $4.25입니다. Contributor 모델의 비용은 입력당 $0.10, 캐시된 입력당 $0.002, 출력당 $0.20입니다.

메타는 모델 훈련에 Muse Spark API 데이터를 사용하나요?

메타는 표준 등급 데이터가 메타 제품의 개선에 사용되지 않는다고 밝혔습니다. 기여자 등급 데이터는 메타 제품의 개선에 사용될 수 있으므로, 조직에서 별도로 승인하지 않는 한 비공개 또는 독점 코드는 표준 경로를 통해 처리해야 합니다.

Muse Spark 1.2가 공개된 Terminal-Bench 또는 DeepSWE 순위표에 포함되어 있나요?

2026년 8월 7일 확인했을 당시, 이 모델은 두 공개 게시판 어디에도 등재되어 있지 않았습니다. 메타(Meta)는 터미널-벤치 2.1(Terminal-Bench 2.1)에서 뮤즈 코드(Muse Code)를 적용했을 때 82.9%, 딥스위(DeepSWE)에서는 59.3%를 기록했다고 보고했으나, 이는 메타가 직접 실행한 결과입니다.

이번 리뷰에서 Muse Spark 1.2를 직접 사용해 보았나요?

네. 3회의 단일 시도 기본 모델 테스트에서 Muse Spark 1.2는 Python 버그 수정, TypeScript 리팩토링, JSONL 리포지토리 기능을 성공적으로 처리했습니다. 평균 지연 시간은 12.98초였으며, 보고된 총 비용은 $0.045362였습니다. Muse Code 에이전트 및 도구 호출의 안정성은 테스트되지 않았습니다.

개발자들은 Muse Spark 1.2를 어떻게 이용할 수 있나요?

메타는 세 가지 경로를 제시합니다: Muse Code 베타 터미널 에이전트, 메타 모델 API, 그리고 OpenRouter입니다. 공식 쿡북에서는 기본 URL이 https://api.meta.ai/v1인 OpenAI SDK 호환 클라이언트를 사용합니다.

게시물을 공유하세요:

관련 게시물

GlobalGPT의 활용 가능한 GPT 출력에 대한 연구: 10만 건 이상의 사용자 메시지, 약 5만 개의 대화 ID 그룹, 2만 개 이상의 계정.

GPT 출력을 유용하게 만드는 요인은 무엇인가? GlobalGPT 요청에서의 작업 위임과 사용자 제어

GPT의 출력 결과가 활용 가능한 이유는 무엇일까요? GlobalGPT 연구는 공식적으로 승인되고 자발적으로 공유된 데이터, 즉 10만 건 이상의 사용자 메시지, 약 5만 개의 대화 ID 그룹, 2만 개 이상의 계정을 기반으로 합니다. 정성적 분석 결과는 선별된 요청 사항들을 대상으로 합니다.

자세히 보기