Ulasan Muse Spark 1.2: Uji Kinerja, API, Harga, dan Uji Pemrograman

Ulasan Muse Spark 1.2

Muse Spark 1.2 menggabungkan harga token yang sangat rendah dengan jendela konteks sebesar 1 juta token, dan berhasil menyelesaikan ketiga tugas pemrograman model dasar dalam rangkaian uji API percobaan pertama kami. Meta meluncurkan model tersebut pada 5 Agustus 2026, dengan jendela konteks sebesar 1 juta token, dua tingkatan harga API, dan agen terminal terpisah bernama Muse Code. Hasil uji kinerja Meta cukup menjanjikan; papan peringkat pemrograman publik independen belum memverifikasi kombinasi model dan agen yang sama.

Ulasan ini membedakan antara model dan agen, skor resmi dan bukti independen, serta penetapan harga standar dan pertukaran antara penggunaan data pada tingkatan Contributor. Dalam pengujian kami, model ini berhasil menyelesaikan perbaikan idempotensi Python, refaktorisasi TypeScript yang mempertahankan kompatibilitas, dan fitur JSONL di seluruh repositori tanpa perlu pengulangan. Eksekusi agen Muse Code tidak diuji, dan keandalan panggilan alat juga tidak diuji. Jika Anda ingin membandingkan bidang yang lebih luas terlebih dahulu, panduan kami mengenai model AI terbaik untuk pengkodean memberikan gambaran konteks persaingan yang lebih luas.

Percikan inspirasi pada GlobalGPT

Ulasan Muse Spark 1.2: Jawaban Singkat

Pengumuman Meta Research berjudul “Memperkenalkan Muse Code dan Muse Spark 1.2”, tertanggal 5 Agustus 2026
Peluncuran resmi. Meta mengumumkan Muse Code dan Muse Spark 1.2 pada tanggal 5 Agustus 2026. Sumber: Meta Research.

Ringkasnya: Muse Spark 1.2 adalah model Meta yang berfokus pada pemrograman, dilengkapi dengan jendela 1 juta token, akses API yang kompatibel dengan SDK OpenAI, serta tingkatan Contributor yang menarik perhatian. Keunggulan utamanya yang dipublikasikan adalah nilai: input sebesar $0.10 dan output sebesar $0.20 per satu juta token pada model Contributor. Tingkat layanan tersebut dapat digunakan untuk meningkatkan produk Meta, sementara model standar yang lebih mahal tidak digunakan untuk tujuan tersebut.

Data kinerja perlu ditinjau kembali. Meta melaporkan nilai 82,91 TP40T pada Terminal-Bench 2.1 untuk Muse Spark 1.2 dengan Muse Code dan 59,31 TP40T pada DeepSWE. Hasil-hasil tersebut diperoleh dari pengujian yang dilakukan oleh Meta. Papan skor Terminal-Bench dan DeepSWE yang terbuka untuk umum masih belum mencantumkan Muse Spark 1.2 saat diperiksa pada tanggal 26 Agustus 2026. Analisis Buatan memberikan verifikasi independen: Indeks Kecerdasannya tetap berada di angka 57, di atas nilai median model sejenis sebesar 35.

  • Alasan terbaik untuk mencobanya sekarang: Harga yang terjangkau bagi kontributor, konteks yang luas, dan API yang mengikuti pola klien OpenAI yang sudah dikenal.
  • Alasan terbaik untuk tetap waspada: Tiga tugas berbasis model terkontrol tersebut tidak membuktikan keandalan agen Muse Code, kualitas panggilan alat, maupun kinerjanya di repositori produksi berskala besar.
  • Pilihan privasi yang penting: Gunakan model standar untuk kode atau prompt yang tidak ingin Anda gunakan untuk meningkatkan produk Meta.

Sekilas tentang Muse Spark 1.2

Spesifikasi yang telah diverifikasi

PengembangMetaDiluncurkan pada 5 Agustus 2026
Kontekstual1M1 juta token
Fokus utamaPemrograman + alat bantuPekerjaan terkait repositori dan debugging
Status praktik langsung3 dari 3 tugas telah diselesaikanSatu kali percobaan per tugas
muse-spark-1.2 muse-spark-1.2-kontributor Kode Muse API Meta Model OpenRouter Kompatibel dengan SDK OpenAI Masukan teks + gambar; keluaran teks

Meta menggambarkan Muse Spark 1.2 sebagai model yang memiliki akurasi penulisan kode pada upaya pertama yang lebih tinggi serta pemanggilan alat yang lebih andal dibandingkan Muse Spark 1.1. Hal tersebut merupakan klaim dari penyedia yang berasal dari halaman resmi model Muse Spark, bukan kesimpulan dari sesi pemrograman kami sendiri.

Muse Spark 1.2 vs Muse Code

Muse Spark 1.2 adalah modelnya. Muse Code adalah agen terminal beta terpisah yang didukung oleh model tersebut. Perbedaan ini penting karena sebuah agen dapat menambahkan fitur perencanaan, pengaturan alat, navigasi repositori, isolasi worktree, pencatatan, dan perilaku percobaan ulang pada model dasarnya.

Pastikan setiap lapisan tetap terpisah

Model

Muse Spark 1.2

Konteks, penalaran, perilaku API, penagihan token, hasil keluaran, dan keputusan pemanggilan alat.

ID ModelKonteks 1MHarga API

Agen beta

Kode Muse

Antarmuka Pengguna Terminal, subagen, pohon kerja Git, log peristiwa, alur lanjutan, keterampilan terintegrasi, dan orkestrasi.

Alur kerja agenHasil sistem meta-run

Halaman model Meta Muse Spark 1.2 yang menampilkan fokusnya pada pemrograman serta jendela konteks sebesar satu juta token
Gambaran umum model resmi. Meta menghadirkan Muse Spark 1.2 untuk alur kerja pemrograman, jendela konteks berkapasitas 1 juta token, serta pemanggilan alat yang lebih andal. Sumber: Halaman model meta.

The halaman resmi Muse Code menyebut produk tersebut sebagai agen pengkodean beta. Hal itu membuat perbandingan dengan produk-produk seperti Claude Code dan Codex menjadi lebih bermanfaat daripada menganggap bahwa setiap perbedaan alur kerja yang diamati berasal semata-mata dari pemanggilan model dasar. Kami Perbandingan Kode Codex vs Claude menjelaskan mengapa agen di sekitarnya dapat memengaruhi pengalaman pengembang sama besarnya dengan model itu sendiri.

Uji Kinerja Muse Spark 1.2: Apa yang Sebenarnya Ditunjukkan oleh Skor-skor Tersebut

Grafik benchmark meta untuk Muse Spark 1.2 pada Terminal-Bench, DeepSWE, pemrograman internal, dan GDPVal-AA versi dua
Bukti perbandingan yang dikelola oleh penyedia layanan. Meta telah merilis empat panel benchmark Muse Spark 1.2; pasangan harness dan agen masih perlu diperhatikan bersamaan dengan setiap skor. Sumber: Halaman model meta.

Grafik perbandingan Meta menempatkan Muse Spark 1.2 di peringkat teratas dalam beberapa evaluasi pemrograman. Angka-angka tersebut layak untuk ditelaah, namun tidak mencerminkan peringkat tunggal yang jelas mengenai kualitas model mentah. Model, agen, sistem pengujian, kemampuan penalaran, dan protokol tugas semuanya dapat berubah secara bersamaan.

Meta-reported Terminal-Bench 2.1

Panel tolok ukur Meta

Terminal-Bangku 2.1

Semua 89 tugas · lulus@1 dalam lima kali percobaan · kombinasi model dan agen yang dipilih

Hasil Meta-run Kode Muse bukan entri papan peringkat publik yang terverifikasi
Opus 5 max + Kode Claude86.7%
Muse Spark 1.2 + Kode Muse82.9%
GPT-5.6 Terra max + Codex81.8%
Grok 4,5 tinggi + Grok Build81.6%
Gemini 3.6 Flash tinggi + Antigravity CLI78.9%
Muse Spark 1.1 + mini-swe-agent76.2%
Sumber: Halaman model Muse Spark 1.2 dari Meta dan metodologi evaluasinya. Ini adalah kombinasi model dan agen yang dijalankan oleh penyedia layanan.

Angka 82,9% merupakan sebuah Hasil Meta-run Kode Muse. The Papan Peringkat Terminal-Bench 2.1 Umum tidak mencantumkan Muse Spark 1.2 pada tanggal 26 Agustus 2026, sehingga bukan entri papan peringkat publik yang terverifikasi. Papan informasi umum memang mencantumkan Muse Spark 1.1 dengan mini-SWE-agent pada nilai 76,2% ±1,2%.

Papan peringkat publik Terminal-Bench 2.1 yang lengkap, diperiksa pada 7 Agustus 2026, dengan ketujuh belas entri yang terlihat
Pemeriksaan silang independen. Daftar lengkap papan Terminal-Bench 2.1 yang tersedia untuk umum tidak mencantumkan Muse Spark 1.2 saat diperiksa pada tanggal 7 Agustus 2026. Sumber: Terminal-Bench.

Laporan Meta tentang DeepSWE 1.1

Panel tolok ukur Meta

DeepSWE 1.1

113 tugas · 91 repositori · lima bahasa · lulus@1 dari lima kali percobaan

Opus 565.0%
GPT-5.6 Terra64.8%
Muse Spark 1.259.3%Dilaporkan oleh Meta
Grok 4,556.6%
Muse Spark 1.153.0%
Gemini 3,6 Flash40.0%

The Papan peringkat publik DeepSWE v1.1 Menggunakan mini-swe-agent pada seluruh model yang tercantum demi konsistensi. Saat diperiksa, Muse Spark 1.2 belum ditambahkan; Muse Spark 1.1 tercantum dengan nilai 53%. Hasil Meta sebesar 59,3% menggunakan Muse Code, sehingga kedua angka tersebut tidak berasal dari pengujian dengan pengaturan yang sama.

Papan peringkat publik DeepSWE versi 1.1 yang lengkap, diperbarui pada 6 Agustus 2026, termasuk grafik, tabel, dan catatan konsistensi
Pemeriksaan silang independen. DeepSWE menggunakan mini-swe-agent untuk semua model yang tercantum dan belum menyertakan Muse Spark 1.2. Sumber: DeepSWE v1.1.

Evaluasi internal dan evaluasi agen umum Meta

Dua skala penilaian yang berbeda

Meta Internal Coding Bench

440 tugas internal · dua kali percobaan per tugas

ModelSkor
Opus 579.4%
Muse Spark 1.270.6%
GPT-5.6 Terra65.4%
Gemini 3,6 Flash63.9%
Grok 4,5Tidak ditampilkan

GDPVal-AA v2

Evaluasi tugas agensial umum · Nilai bergaya Elo

ModelSkor
Opus 51852
Muse Spark 1.21631
GPT-5.6 Terra1577
Grok 4,51526
Gemini 3,6 Flash1423

Meta’s metodologi evaluasi Terminal-Bench dilaporkan menggunakan seluruh 89 tugas dan mencapai pass@1 dalam lima kali percobaan. DeepSWE mencakup 113 tugas di 91 repositori dan lima bahasa pemrograman, serta juga mencapai pass@1 dalam lima kali percobaan. Meta juga mencatat bahwa pengaturannya mungkin belum disesuaikan secara optimal untuk model pihak ketiga. Untuk perbandingan pesaing terkini yang didasarkan pada keputusan produk nyata, lihat Claude Opus 5 vs GPT-5.6.

Metodologi mengubah makna

Meta Terminal-Bench

Model + agen yang dipilih

89 tugas, lima kali percobaan, pengaturan penalaran maksimum yang berbeda-beda, dan sistem pengujian Meta mungkin tidak disesuaikan secara merata untuk sistem pihak ketiga.

Terminal Umum - Bangku

Entri yang telah diverifikasi

Muse Spark 1.2 tidak terdeteksi saat diperiksa. Konfigurasi papan dan status verifikasinya harus dibaca secara terpisah dari bagan Meta.

DeepSWE Umum

Agen mini-swe umum

113 tugas di 91 repositori dan lima bahasa pemrograman. Muse Spark 1.2 tidak tercantum; Muse Spark 1.1 tercatat dengan nilai 53%.

Halaman pertama dari Meta Muse Spark 1.2 dan metodologi evaluasi Muse Code beserta pasangan agen dan pengaturan penalaran
Bukti metodologis. Meta menggabungkan berbagai model dengan berbagai agen dan pengaturan penalaran, sehingga bagan penyedia ini bukanlah sekadar peringkat model mentah. Sumber: PDF Metodologi Meta.

Analisis Buatan: konteks independen yang bermanfaat

The Halaman Model Analisis Buatan memberikan Muse Spark 1.2 Indeks Kecerdasan sebesar 57, di atas nilai median model sejenis sebesar 35 berdasarkan data per 26 Agustus 2026. Harness-nya melaporkan skor 80% pada Terminal-Bench v2.1, 57% (dinormalisasi) pada GDPVal-AA v2, 56% pada SciCode, dan 83% pada evaluasi konteks panjang AA-LCR.

Perubahan versi Analisis Buatan

Indeks Kecerdasan54 → 57Versi evaluasi/hasil telah berubah
GDPVal Elo1371 → 1631Nilai arus yang lebih tinggi
Terminal-Meja78% → 80%Hasil pengujian rangkaian AA dengan arus yang lebih tinggi
Biaya per tugas$0,29 → $0,40Peningkatan penggunaan token menyebabkan kenaikan biaya
Tingkat halusinasi38% → 28%Angka yang lebih rendah, disertai dengan peningkatan jumlah yang tidak memberikan suara
Tingkat upaya82% → 67%Model tersebut mencoba menjawab lebih sedikit soal
Sumber: Halaman model Analisis Buatan dan analisis peluncuran. Nilai awal dan nilai saat ini tidak boleh dicampur seolah-olah keduanya berasal dari satu evaluasi yang tidak berubah.

Pelajaran praktisnya sederhana: Muse Spark 1.2 tampak kompetitif, tetapi tidak ada satu skor pun yang dapat dijadikan patokan tunggal untuk model ini. Anggaplah grafik dari Meta sebagai bukti keandalan sistem Muse Code, papan peringkat publik sebagai pengecekan silang terpisah, dan Artificial Analysis sebagai evaluasi independen namun dengan konfigurasi yang berbeda.

Ringkasan Artificial Analysis Muse Spark 1.2 yang menampilkan Indeks Kecerdasan 57, peringkat, harga, biaya evaluasi, dan konteks satu juta token
Evaluasi model secara independen. Analisis Buatan melaporkan Indeks Kecerdasan sebesar 57 dan melakukan pemeriksaan terpisah terhadap harga, konteks, modalitas, serta biaya evaluasi. Sumber: Analisis Buatan.

Pertimbangan antara Harga dan Privasi pada Muse Spark 1.2

Meta menawarkan dua ID model API dengan harga yang sangat berbeda. Opsi yang lebih murah ini bukan sekadar diskon: hal ini mengubah cara penggunaan data yang dikirimkan.

USD per satu juta token · dalam konteks 1 juta

Standar · muse-spark-1.2

Tidak digunakan untuk peningkatan produk

Tidak digunakan untuk meningkatkan produk Meta

Masukan$1.25
Cache$0.15
Output$4.25
Kontributor · muse-spark-1.2-contributor

Lebih murah, namun dengan kompromi dalam hal penggunaan data

Data dapat digunakan untuk meningkatkan produk-produk Meta

Masukan$0.10
Cache$0.002
Output$0.20
Harga resmi Meta yang diperiksa pada 7 Agustus 2026. Ketentuan privasi bervariasi sesuai dengan tingkatan.
Tabel harga API Meta Muse Spark 1.2 versi standar dan kontributor, beserta pengenal model dan ketentuan penggunaan data
Harga resmi. Meta mencantumkan ID model standar dan model Kontributor secara terpisah, beserta harga token dan ketentuan penggunaan data. Sumber: Halaman model meta, diperiksa pada 7 Agustus 2026.

Harga untuk kontributor 12,5 kali lebih murah untuk input, 75 kali lebih murah untuk input yang disimpan dalam cache, dan 21,25 kali lebih murah untuk output dibandingkan dengan tingkatan standar. Tidak ada persentase diskon tunggal yang tepat yang dapat menggambarkan semua jenis token.

Seorang peneliti dari Meta mempromosikan tingkatan Contributor sebagai “hingga 250 kali lebih murah” daripada Fable dan “150 kali lebih murah” daripada GPT-5.6 Sol. Itu perbandingan sosial menggunakan harga Contributor, bukan model standar, dan harus selalu disertai dengan keterangan mengenai penggunaan data. Pembaca yang ingin membandingkan biaya pesaing saat ini dapat menggunakan halaman terpisah kami Panduan Harga GPT-5.6 dan Rincian harga Kode Claude.

Postingan media sosial Matt Deitke yang mempromosikan harga token input, cached-input, dan output untuk tingkatan Kontributor di Muse Spark 1.2
Konteks penetapan harga peluncuran. Seorang peneliti Meta mempromosikan perbandingan harga untuk kategori Kontributor; postingan tersebut tidak menampilkan harga yang lebih tinggi pada kategori standar dan harus dibaca dengan mempertimbangkan pertukaran antara penggunaan data dan biaya. Sumber: Matt Deitke di X.

Untuk repositori publik, tugas sintetis, atau perangkat evaluasi sekali pakai, tingkatan Contributor mungkin menjadi pilihan yang menarik. Untuk kode privat, data pelanggan, kredensial, atau arsitektur eksklusif, tingkatan standar merupakan pilihan default yang lebih aman. Meta juga menyatakan bahwa mereka mulai menerima permintaan tanpa penyimpanan data melalui tim penjualan, yang merupakan jalur akses terpisah daripada pengaturan layanan mandiri default.

Akses API dan Contoh Penggunaan Muse Spark 1.2

Halaman API Meta Model yang menjelaskan akses mandiri langsung ke Muse Spark dalam tahap pratinjau publik
Akses API resmi. Meta menjelaskan bahwa akses langsung ke Muse Spark secara mandiri melalui Meta Model API kini telah memasuki tahap pratinjau publik. Sumber: API Meta Model.

Tiga jalur akses resmi

Agen terminalMuse Code versi beta
API LangsungAPI Meta Model
AggregatorOpenRouter

URL dasar buku resep resmi: https://api.meta.ai/v1 · 1.2 permintaan dalam tinjauan ini: belum dilaksanakan

The API Meta Model mendukung alur kerja yang kompatibel dengan SDK OpenAI. Buku panduan resmi Meta menggunakan URL dasar https://api.meta.ai/v1 dan membaca kunci dari MODEL_API_KEY. Halaman produk tersebut juga menjelaskan tentang “search grounding”, sedangkan buku panduan ini mencakup pelengkapan obrolan, streaming, pemanggilan alat, keluaran terstruktur, penyimpanan sementara prompt, kontrol penalaran, pengenalan gambar, konteks panjang, upaya ulang, dan resep pencarian.

Contoh buku resep resmi — versi yang telah disimpan: The Buku Panduan Resmi GitHub masih menggunakan muse-spark-1.1. Hal ini membuktikan struktur klien dan URL dasar, bukan berarti contoh tersebut telah diperbarui untuk versi 1.2.

import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.meta.ai/v1",
    api_key=os.environ["MODEL_API_KEY"],
)

response = client.chat.completions.create(
    model="muse-spark-1.1",
    messages=[{"role": "user", "content": "Hello, world!"}],
)

print(response.choices[0].message.content)
Buku panduan API Meta Model di GitHub yang menampilkan URL dasar SDK OpenAI, kunci lingkungan, dan contoh lengkap fitur pelengkapan obrolan
Buku resep resmi. Berkas README yang berhasil diambil menunjukkan pola SDK OpenAI dan URL dasar, namun saat diperiksa, contoh yang ada masih menggunakan Muse Spark 1.1. Sumber: Buku Panduan API Meta Model.

Adaptasi yang telah didokumentasikan — belum dilaksanakan: Meta mencantumkan secara terpisah muse-spark-1.2 sebagai model standar ID 1.2. Penggantian minimal di bawah ini menggabungkan dua fakta resmi, namun tidak ada permintaan berbayar yang dikirimkan selama proses peninjauan ini.

response = client.chat.completions.create(
    model="muse-spark-1.2",
    messages=[{"role": "user", "content": "Hello, world!"}],
)

Muse Spark adalah model penalaran, dan token penalaran diperhitungkan sebagai output. Hal itu membuat laju keluaran standar $4.25 lebih penting daripada yang terlihat pada pandangan pertama: jawaban yang tampaknya singkat tetap dapat mengandung penggunaan penalaran tersembunyi yang substansial. Latensi aktual, waktu hingga token pertama, laju percobaan ulang, dan biaya per tugas masih belum diukur di sini.

Panduan pengembang Meta yang menjelaskan sistem penagihan berdasarkan token penalaran di Muse Spark serta sistem pengendalian upaya di Muse Code
Pola penagihan. Meta menyatakan bahwa token penalaran Muse Spark ditagih sebagai output, sedangkan Muse Code /usaha Perintah tersebut mengubah kedalaman penalaran. Sumber: Panduan Pengembang Meta.

Apa yang Ditambahkan oleh Muse Code

Halaman beta resmi Muse Code yang menampilkan agen pemrograman terminal dan penginstal satu perintahnya
Muse Code versi beta. Meta memperkenalkan Muse Code sebagai agen terminal untuk alur kerja pemrograman yang kompleks dan menyediakan penginstal yang dapat dijalankan dengan satu perintah. Sumber: halaman resmi Muse Code.

Muse Code diinstal melalui terminal dan mengintegrasikan Muse Spark 1.2 ke dalam alur kerja agen. Meta’s ulasan mendalam tentang pengembang menjelaskan beberapa perilaku yang tidak termasuk dalam panggilan API murni:

  • Agen paralel: Tugas-tugas dapat dijalankan dalam struktur kerja Git yang terisolasi.
  • Catatan peristiwa yang hanya dapat ditambahkan: Sesi dan tindakan disimpan dalam berkas JSONL lokal untuk keperluan audit dan pemutaran ulang.
  • Lanjutkan alur: riwayat hidup Muse dapat melanjutkan sesi yang terputus.
  • Pengendalian penalaran: yang /usaha Perintah ini mengatur tingkat kekuatan penalaran.
  • Keterampilan eksplisit: Nama Meta /rasa, /memanggang, /panggang-dengan-dokumen, dan /rencana.

Fitur produk agen

Paralelisme

Subagen

Tugas-tugas independen dapat menyebar ke berbagai arah.

Isolasi

Pohon Kerja

Cabang-cabang tetap terpisah selama proses kerja paralel.

Audit

Log JSONL

Peristiwa lokal yang hanya dapat ditambahkan mendukung pemutaran ulang.

Pemulihan

Riwayat Hidup

riwayat hidup Muse melanjutkan sesi yang sempat terhenti.

Alat-alat eksplisit

Keterampilan

/rasa, /memanggang, /panggang-dengan-dokumen, /rencana.

Rangkaian fitur tersebut menjadikan Muse Code relevan bagi pasar agen pemrograman yang lebih luas, di mana perencanaan, isolasi, pemutaran ulang, dan disiplin penggunaan alat sama pentingnya dengan kecerdasan model. The Panduan Perbandingan OpenClaw vs Claude Code vs OpenCode merupakan konteks yang berguna untuk memahami perbedaan-perbedaan pada tingkat produk tersebut.

Klaim Peluncuran dan Tanda-Tanda Awal dari Komunitas

Reaksi bukanlah bentuk pengakuan

Konsep peluncuran resmi

Pelatihan + jangka panjang

Kapasitas komputasi pemrograman yang lebih besar, keragaman lingkungan, pelatihan bersama, dan uji ketahanan dengan lebih dari 1.000 panggilan alat.

Sebuah kisah menarik yang menginspirasi

Harga dan OpenCode

Seorang pengguna Reddit memuji pengalaman dan manfaat belajar pemrograman sejak dini.

Pertanyaan terbuka

Privasi + keandalan

Pengguna lain mengemukakan kekhawatiran terkait penggunaan data, harga standar, ketersediaan, dan keandalan pada tahap awal.

Tim AI di Meta menyatakan bahwa Muse Spark 1.2 telah mendapatkan alokasi daya komputasi yang lebih besar untuk pelatihan pemrograman, lingkungan pelatihan yang lebih beragam, penekanan yang lebih besar pada pembangkitan kode dan debugging pada seluruh repositori, serta pelatihan bersama dengan Muse Code. Sebuah laporan terpisah membuka utas menjelaskan uji ketahanan yang berlangsung hingga 24 jam dengan lebih dari 1.000 panggilan fungsi pada GPU NVIDIA Hopper.

Postingan AI di Meta yang menjelaskan pelatihan pemrograman Muse Spark 1.2, debugging, pembuatan repositori secara keseluruhan, dan co-training dengan Muse Code
Konsep peluncuran resmi. Tim AI di Meta menyatakan bahwa model tersebut mendapatkan alokasi daya komputasi yang lebih besar untuk tugas pemrograman, lingkungan pengujian yang lebih luas, serta pelatihan bersama dengan Muse Code. Sumber: AI di Meta di X.
Sebuah postingan AI di Meta yang menjelaskan uji ketahanan Muse Code dengan lebih dari seribu panggilan alat selama hingga dua puluh empat jam
Uji coba jangka panjang. Meta memamerkan satu uji beban pada kernel GPU yang melibatkan lebih dari 1.000 panggilan fungsi; hal ini bukanlah angka keandalan umum dari fungsi tersebut. Sumber: AI di Meta di X.

Itu memang demonstrasi yang mengesankan, tetapi bukan merupakan angka keberhasilan umum yang terukur. Hal itu tidak memberi tahu kita seberapa sering agen tersebut memilih alat yang tepat, memulihkan diri dari kesalahan, menghindari panggilan ganda, atau menyelesaikan tugas repositori biasa tanpa bimbingan.

Postingan-postingan awal di Reddit juga menunjukkan tanggapan yang beragam. Salah satunya Seorang pengguna r/opencode melaporkan pengalaman positifnya dengan OpenCode dan memuji harganya. Sebuah artikel terpisah Diskusi mengenai penetapan harga oleh kontributor menimbulkan pertanyaan seputar peningkatan penggunaan data, biaya paket standar, ketersediaan, dan keandalan. Ini adalah tanggapan individu, bukan konsensus komunitas.

Seorang pengguna Reddit menceritakan pengalaman positifnya saat pertama kali membuat kode dengan Muse Spark 1.2 serta harganya yang terjangkau di OpenCode
Sebuah laporan pengguna pada tahap awal. Seorang pengguna Reddit memuji pengalaman pemrograman dan harga di OpenCode; ini hanyalah sebuah kisah pribadi, bukan konsensus yang luas. Sumber: r/opencode.
Diskusi di Reddit yang membandingkan harga Muse Spark 1.2 versi standar dan versi Contributor sekaligus mengangkat kekhawatiran terkait pembagian data
Privasi dan reaksi terhadap nilai. Diskusi komunitas ini mengaitkan minat terhadap harga untuk Kontributor dengan kekhawatiran mengenai penggunaan data, ketersediaan, dan biaya paket standar. Sumber: r/opencodeCLI.

Uji Koding Muse Spark 1.2: 3 dari 3 Tugas Telah Dilewati

Dalam pengujian kami, model dasar Muse Spark 1.2 berhasil menyelesaikan tiga tugas pemrograman yang terkendali melalui API penyelesaian obrolan yang kompatibel dengan OpenAI. Setiap tugas diberi satu kali percobaan, tanpa kesempatan ulang dan tanpa campur tangan manusia. Kami mengevaluasi berkas yang dikembalikan di repositori sekali pakai berdasarkan kriteria penilaian yang terbuka dan tersembunyi. Eksekusi agen Muse Code tidak diuji, dan keandalan pemanggilan alat juga tidak diuji; oleh karena itu, hasil ini tidak boleh dianggap sebagai tolok ukur kinerja agen.

Hasil percobaan tunggal

Tugas3/33 dari 3 tugas pemrograman telah diselesaikan
Latensi rata-rata12,98 detik12,98 detik per tugas
Penggunaan12,100Total 12.100 token
Biaya yang dilaporkan$0.045362Tiga panggilan model

Respons-respons tersebut menggunakan 6.618 token penalaran. Ketiga alasan akhir tersebut adalah berhenti, dan kolom penyedia mencantumkan Meta.

Uji Coba 1: Perbaikan bug idempotensi Python — Lulus

Tugas

Hentikan transfer ganda tanpa mengubah API publik

Model tersebut mengidentifikasi adanya pengaman request-ID yang hilang, menerapkan perbaikan aman yang paling sederhana, dan menyediakan uji regresi sambil tetap mempertahankan pembaruan keseimbangan atomik.

LULUS · 6 ujian
Latensi12,064 detik
Token2,867
Penalaran1,621
Biaya$0.01072675

Evaluator tersembunyi yang asli secara keliru mensyaratkan panggilan berulang untuk mengembalikan hasil Salah, meskipun tugas tersebut hanya mensyaratkan agar pengirim tidak dikenakan biaya dua kali. Setelah memperbaiki persyaratan nilai kembalian yang dibuat-buat itu, respons pertama yang tidak diubah berhasil lulus keenam tes tersebut. Kami tidak melakukan percobaan ulang atau mengedit hasil keluaran model.

Uji Coba 2: Refaktorisasi berkas ganda TypeScript — Lulus

Tugas

Memisahkan validasi, penyimpanan data, dan pencatatan audit

Berkas-berkas yang dikembalikan tetap mempertahankan kontrak rute publik, penerapan TypeScript yang ketat, serta transaksi tunggal yang mencakup baik penulisan pesanan maupun penulisan audit. Selain itu, berkas-berkas tersebut juga menambahkan uji validasi yang terfokus tanpa ketergantungan pada runtime.

VerifikasiLULUSPemeriksaan tipe, kontrak publik, pemeriksaan transaksi tersembunyi, dan pengujian validasi tambahan
13,909 detik5.011 token2.770 penalaran$0.01833275

Penilai pertama membandingkan benda-benda dengan bahan mentah JSON.stringify, sehingga objek-objek yang setara namun memiliki urutan penyisipan kunci yang berbeda tampak tidak sama; versi Windows-nya npx Proses peluncuran juga gagal sebelum tahap pemeriksaan tipe. Dengan komparator yang tidak peka urutan dan pemanggilan perintah yang aman untuk Windows, respons asli berhasil melewati semua pemeriksaan. Sekali lagi, tidak ada upaya percobaan ulang.

Uji Coba 3: Fitur repositori JSONL — Lulus

Penerapan pedoman secara menyeluruh di seluruh repositori

Tambahkan JSONL tanpa merusak CSV

Model tersebut menerapkan fitur deteksi ekstensi, kesalahan baris yang tidak valid dengan penghitungan berbasis satu, keluaran atomik, uji coba tanpa eksekusi (dry-run), uji terfokus, teks bantuan, dan contoh berkas README.

Hasil9/9tes berhasil dilalui
Latensi12,976 detikupaya pertama
4.222 token2.227 penalaran$0.0163025

Hasil tes menunjukkan: Muse Spark 1.2 mampu menghasilkan patch multi-file yang dapat digunakan, mematuhi batasan kompatibilitas, menambahkan uji coba, serta menangani fitur berskala sedang di seluruh repositori dalam satu kali proses. Biaya rata-rata yang dilaporkan sekitar $0.0151 per tugas, namun fixture-fixture ini berukuran kecil dan tidak sebaiknya digunakan untuk memperkirakan biaya pada basis kode yang besar.

Siapa yang Sebaiknya Menggunakan Muse Spark 1.2?

Panduan pengambilan keputusan

Coba sekarang

Evaluasi terkendali

Kode publik atau sintetis, tugas yang dapat diukur, kebutuhan dalam konteks yang luas, dan hasil model dasar 3/3 yang menjanjikan.

Tunggu

Diperlukan bukti agen

Perilaku Muse Code, batas laju yang stabil, pemanggilan alat yang berulang, atau pengujian kinerja repositori secara menyeluruh merupakan faktor penentu.

Bandingkan dulu

Kode sensitif atau hasil yang tinggi

Gunakan tingkatan standar atau bandingkan alternatif-alternatifnya jika masalah privasi dan biaya token penalaran menjadi faktor utama.

Gunakan model standar untuk kode sensitif, kecuali jika organisasi Anda telah menyetujui secara terpisah Ketentuan Kontributor. Jika harga keluaran standar mengubah perhitungan nilainya, bandingkan dengan harga saat ini Harga Codex, Kode Claude, dan biaya agen pengkodean lainnya sebelum memutuskan untuk menggunakan alur kerja tersebut.

Kesimpulan Ulasan Muse Spark 1.2

Muse Spark 1.2 berhasil masuk dalam daftar pendek evaluasi, namun hal ini bukan berarti produk tersebut secara otomatis direkomendasikan untuk diproduksi. Konteks 1M-token, format API yang sudah dikenal, harga yang terjangkau bagi Kontributor, tiga putaran pengujian kode pada percobaan pertama, serta skor Muse Code yang tinggi dari Meta-run membuatnya sulit untuk diabaikan. Meta juga telah melakukan pekerjaan yang lebih baik daripada banyak peluncuran lainnya dalam mempublikasikan rincian metodologi.

Keterbatasannya juga sama konkretnya. Struktur harga untuk kontributor disertai dengan pertukaran terkait penggunaan data. Token keluaran dan penalaran standar dapat meningkatkan biaya riil. Angka-angka pemrograman teratas Meta belum direproduksi sebagai entri yang sesuai di papan Terminal-Bench atau DeepSWE yang terbuka untuk umum, dan sampel praktik langsung kami mencakup tiga tugas model dasar, bukan eksekusi agen Muse Code.

Langkah yang bijaksana adalah melakukan uji coba terkendali pada kode yang tidak sensitif, dengan data penggunaan mentah dan hasil verifikasi lokal disimpan. Anggaplah biaya dan latensi yang terukur sebagai sampel dari tugas-tugas kecil, lalu uji ukuran repositori Anda sendiri, pemulihan kegagalan, dan alur kerja agen sebelum memutuskan untuk menggunakannya dalam lingkungan produksi.

Pertanyaan Umum (FAQ) Muse Spark 1.2

Apa itu Muse Spark 1.2?

Muse Spark 1.2 adalah model Meta yang berfokus pada pemrograman, diluncurkan pada 5 Agustus 2026, dengan jendela konteks sebesar 1 juta token dan dapat diakses melalui Muse Code, Meta Model API, serta OpenRouter.

Apakah Muse Spark 1.2 sama dengan Muse Code?

Tidak. Muse Spark 1.2 adalah modelnya; Muse Code adalah agen terminal beta terpisah yang didukung oleh model tersebut. Muse Code menambahkan fitur-fitur produk seperti subagen, pohon kerja Git yang terisolasi, pencatatan peristiwa, fitur melanjutkan, dan keterampilan terintegrasi.

Berapa biaya API Muse Spark 1.2?

Model standar membutuhkan biaya sebesar $1,25 untuk input, $0,15 untuk input yang disimpan dalam cache, dan $4,25 untuk output per juta token. Model Contributor membutuhkan biaya sebesar $0,10 untuk input, $0,002 untuk input yang disimpan dalam cache, dan $0,20 untuk output.

Apakah Meta menggunakan data API Muse Spark untuk pelatihan?

Meta menyatakan bahwa data tingkat standar tidak digunakan untuk meningkatkan produk-produk Meta. Data tingkat kontributor mungkin digunakan untuk meningkatkan produk-produk Meta, sehingga kode pribadi atau eksklusif sebaiknya menggunakan jalur standar kecuali jika organisasi bersangkutan menyetujui hal lain.

Apakah Muse Spark 1.2 terdaftar di papan peringkat Terminal-Bench atau DeepSWE yang terbuka untuk umum?

Saat diperiksa pada 7 Agustus 2026, sistem tersebut tidak terdaftar di papan pengumuman publik mana pun. Meta melaporkan nilai 82,9% pada Terminal-Bench 2.1 dengan Muse Code dan 59,3% pada DeepSWE, namun angka-angka tersebut merupakan hasil pengujian yang dijalankan oleh Meta.

Apakah Muse Spark 1.2 sudah diuji secara langsung dalam ulasan ini?

Ya. Dalam tiga uji coba model dasar dengan satu kali percobaan, Muse Spark 1.2 berhasil menyelesaikan perbaikan bug Python, refaktorisasi TypeScript, dan fitur repositori JSONL. Latensi rata-rata adalah 12,98 detik dan total biaya yang dilaporkan adalah $0,045362. Keandalan agen Muse Code dan panggilan alat tidak diuji.

Bagaimana cara pengembang mengakses Muse Spark 1.2?

Meta mencantumkan tiga opsi: agen terminal Muse Code beta, Meta Model API, dan OpenRouter. Buku panduan resmi menggunakan klien yang kompatibel dengan SDK OpenAI dengan URL dasar https://api.meta.ai/v1.

Bagikan Postingan:

Postingan Terkait