Muse Spark 1.2 combina un costo per token insolitamente basso con una finestra di contesto di 1 milione di token e ha superato tutte e tre le attività di codifica del modello di base nella nostra suite di API al primo tentativo. Meta ha lanciato il modello il 5 agosto 2026, con una finestra di contesto di 1 milione di token, due livelli tariffari per l’API e un agente terminale separato denominato Muse Code. I risultati dei benchmark di Meta sono promettenti; le classifiche pubbliche indipendenti dedicate alla programmazione non hanno ancora verificato le stesse combinazioni di modelli e agenti.
Questa recensione distingue il modello dall’agente, i punteggi ufficiali dalle prove indipendenti e i prezzi standard dal compromesso tra utilizzo dei dati e livello “Contributor”. Nei nostri test, il modello ha completato una correzione di idempotenza in Python, una rifattorizzazione in TypeScript che preserva la compatibilità e una funzionalità JSONL a livello di repository senza necessità di riprovare. L’esecuzione dell’agente Muse Code non è stata testata, né è stata verificata l’affidabilità delle chiamate agli strumenti. Se si desidera prima confrontare il panorama più ampio, la nostra guida al I migliori modelli di intelligenza artificiale per la codifica fornisce un quadro più ampio del contesto competitivo.

Recensione di Muse Spark 1.2: risposta rapida
In breve: Muse Spark 1.2 è un modello Meta incentrato sulla programmazione con una finestra di 1 milione di token, accesso all’API compatibile con l’SDK OpenAI e un livello “Contributor” particolarmente interessante. Il suo punto di forza principale è il rapporto costo-prestazioni: $0,10 in ingresso e $0,20 in uscita per ogni milione di token sul modello Contributor. Questo livello può essere utilizzato per migliorare i prodotti Meta, mentre il modello standard, più costoso, non viene impiegato a tale scopo.
I dati sulle prestazioni richiedono una maggiore cautela. Meta riporta 82,91 TP40T su Terminal-Bench 2.1 per Muse Spark 1.2 con Muse Code e 59,31 TP40T su DeepSWE. Si tratta di risultati ottenuti da Meta. Le schede pubbliche di Terminal-Bench e DeepSWE non riportavano ancora Muse Spark 1.2 al momento della verifica effettuata il 26 agosto 2026. Analisi artificiale fornisce una verifica incrociata indipendente: il suo Indice di Intelligenza rimane a 57, al di sopra della mediana dei modelli comparabili, pari a 35.
- Il motivo migliore per provarlo subito: Prezzi vantaggiosi per i collaboratori, un contesto ampio e un'API che segue il familiare modello client OpenAI.
- Il motivo principale per cui è bene mantenere un atteggiamento prudente: Tre attività controllate sul modello di base non sono sufficienti a dimostrare l'affidabilità dell'agente Muse Code, la qualità delle chiamate agli strumenti o le prestazioni in un repository di produzione di grandi dimensioni.
- Scelta importante in materia di privacy: Utilizza il modello standard per i codici o i prompt che non desideri vengano utilizzati per migliorare i prodotti Meta.
Muse Spark 1.2 in sintesi
Specifiche verificate
Meta descrive Muse Spark 1.2 come un modello che offre una maggiore precisione nella scrittura del codice al primo tentativo e un'identificazione degli strumenti più affidabile rispetto a Muse Spark 1.1. Si tratta di affermazioni del fornitore tratte dal pagina ufficiale del modello Muse Spark, e non le conclusioni tratte dalla nostra sessione di codifica.
Muse Spark 1.2 vs Muse Code
Muse Spark 1.2 è il modello. Muse Code è un agente terminale beta separato basato su tale modello. Questa distinzione è importante perché un agente può integrare funzionalità quali la pianificazione, l’orchestrazione degli strumenti, la navigazione nel repository, l’isolamento dell’albero di lavoro, la registrazione degli eventi e il comportamento di riprova attorno al modello sottostante.
Mantenere separati gli strati
Muse Spark 1.2
Contesto, ragionamento, comportamento delle API, fatturazione dei token, risultati e decisioni relative alle chiamate agli strumenti.
ID dei modelliContesto 1MPrezzi API
Codice Muse
Esperienza utente del terminale, subagenti, alberi di lavoro Git, registro eventi, flusso di ripresa, competenze integrate e orchestrazione.
Flusso di lavoro dell'agenteRisultati del sistema Meta-run
Il pagina ufficiale di Muse Code definisce il prodotto un agente di codifica beta. Ciò rende i confronti con prodotti come Claude Code e Codex più utili rispetto al presupporre che ogni differenza osservata nel flusso di lavoro derivi da una semplice chiamata al modello. Il nostro Confronto tra Codex e Claude spiega perché l'ambiente circostante possa influire sull'esperienza dello sviluppatore tanto quanto il modello stesso.
Benchmark di Muse Spark 1.2: cosa rivelano davvero i punteggi
Il grafico di riferimento di Meta colloca Muse Spark 1.2 ai vertici di diverse valutazioni relative alla programmazione. Vale la pena esaminare i dati, ma questi non costituiscono una classifica univoca e chiara della qualità intrinseca del modello. Il modello, l’agente, l’harness, la capacità di ragionamento e il protocollo dell’attività possono variare tutti insieme.
Meta-report Terminal-Bench 2.1
Pannello di riferimento Meta
Terminal-Bench 2.1
Tutte le 89 attività · superamento di 1 su cinque tentativi · combinazioni selezionate di modelli e agenti
Il dato 82,9% è un Risultato del codice Muse in modalità Meta-run. Il Classifica pubblica di Terminal-Bench 2.1 il 26 agosto 2026 non ha inserito Muse Spark 1.2 nell'elenco, quindi è voce non verificata nella classifica pubblica. Il forum pubblico riportava Muse Spark 1.1 con mini-SWE-agent a 76,21 TP40T ±1,21 TP40T.
DeepSWE 1.1 riportato da Meta
Pannello di riferimento Meta
DeepSWE 1.1
113 attività · 91 repository · cinque lingue · superamento del test 1 dopo cinque tentativi
Il Classifica pubblica di DeepSWE v1.1 utilizza mini-swe-agent su tutti i modelli elencati per garantire la coerenza. Al momento della verifica, Muse Spark 1.2 non era stato aggiunto; Muse Spark 1.1 era indicato con il codice 53%. Il risultato di Meta, pari a 59,3%, utilizza Muse Code, quindi i due valori non sono identici in termini di harness.
Valutazioni interne e relative agli agenti generici di Meta
Due diverse scale di valutazione
Meta Internal Coding Bench
440 compiti interni · due tentativi per ogni compito
| Modello | Punteggio |
|---|---|
| Opus 5 | 79.4% |
| Muse Spark 1.2 | 70.6% |
| GPT-5.6 Terra | 65.4% |
| Gemini 3.6 Flash | 63.9% |
| Grok 4,5 | Non mostrato |
GDPVal-AA v2
Valutazione generale dei compiti agenti · Valori in stile Elo
| Modello | Punteggio |
|---|---|
| Opus 5 | 1852 |
| Muse Spark 1.2 | 1631 |
| GPT-5.6 Terra | 1577 |
| Grok 4,5 | 1526 |
| Gemini 3.6 Flash | 1423 |
Quelli di Meta metodologia di valutazione afferma che Terminal-Bench utilizza tutte le 89 attività e ottiene un pass@1 su cinque tentativi. DeepSWE copre 113 attività distribuite su 91 repository e cinque linguaggi, ottenendo anch’esso un pass@1 su cinque tentativi. Meta sottolinea inoltre che la propria configurazione potrebbe non essere ottimizzata per i modelli di terze parti. Per un confronto aggiornato con la concorrenza basato su decisioni reali relative ai prodotti, consultare Claude Opus 5 contro GPT-5.6.
La metodologia cambia il significato
Modello + agente selezionato
89 compiti, cinque tentativi, impostazioni di ragionamento massime diverse e il framework di Meta potrebbe non essere ottimizzato allo stesso modo per i sistemi di terze parti.
Voci verificate
Al momento della verifica, Muse Spark 1.2 risultava assente. Le configurazioni della scheda e lo stato di verifica devono essere consultati separatamente dalla tabella di Meta.
Agente mini-swe comune
113 attività distribuite su 91 repository e cinque linguaggi. Muse Spark 1.2 non era presente; Muse Spark 1.1 era indicato con il codice 53%.
Analisi artificiale: contesto indipendente utile
Il Pagina del modello di analisi artificiale assegna a Muse Spark 1.2 un indice di intelligenza pari a 57, superiore alla mediana dei modelli comparabili pari a 35, secondo i dati del 26 agosto 2026. Il suo harness riporta 80% su Terminal-Bench v2.1, 57% normalizzato su GDPVal-AA v2, 56% su SciCode e 83% nella valutazione a contesto lungo AA-LCR.
Variazione della versione dell'analisi artificiale
La lezione pratica è semplice: Muse Spark 1.2 sembra competitivo, ma nessun punteggio preso singolarmente è sufficiente a definire il modello. Considerate il grafico di Meta come una prova a sostegno del sistema Muse Code, le classifiche pubbliche come un controllo incrociato separato e Artificial Analysis come una valutazione indipendente ma configurata in modo diverso.
Muse Spark 1.2: compromessi tra costi e privacy
Meta offre due ID di modelli API con prezzi nettamente diversi. L'opzione più economica non è semplicemente uno sconto: modifica le modalità di utilizzo dei dati inviati.
USD per un milione di token · Contesto 1M
Non utilizzato per il miglioramento del prodotto
Non viene utilizzato per migliorare i prodotti Meta
Più economico, ma con un compromesso in termini di consumo dati
Dati potrebbe essere utilizzato per migliorare i prodotti Meta
Il prezzo per i contributori è 12,5 volte più conveniente per gli input, 75 volte più conveniente per gli input memorizzati nella cache e 21,25 volte più conveniente per gli output rispetto al livello standard. Non esiste un’unica percentuale di sconto che descriva in modo accurato tutti i tipi di token.
Un ricercatore di Meta ha pubblicizzato il livello “Contributor” come “fino a 250 volte più economico” rispetto a Fable e “150 volte più economico” rispetto a GPT-5.6 Sol. Questo confronto sociale utilizza i prezzi "Contributor", non il modello standard, e dovrebbe sempre riportare la precisazione relativa al consumo di dati. I lettori che desiderano confrontare i costi attuali della concorrenza possono utilizzare la nostra sezione dedicata Guida ai prezzi GPT-5.6 e Claude: Analisi dettagliata dei prezzi.
Per i repository pubblici, le attività sintetiche o gli ambienti di valutazione usa e getta, il livello “Contributor” potrebbe risultare interessante. Per il codice privato, i dati dei clienti, le credenziali o l’architettura proprietaria, il livello standard rappresenta l’opzione predefinita più sicura. Meta afferma inoltre di aver iniziato ad accettare richieste di conservazione zero dei dati tramite il reparto vendite, che rappresenta un percorso di accesso separato rispetto all’impostazione predefinita in modalità self-service.
Muse Spark 1.2: accesso all'API ed esempi
Tre percorsi di accesso ufficiali
URL di base del ricettario ufficiale: https://api.meta.ai/v1 · 1.2 Richiesta contenuta nella presente revisione: non eseguita
Il API del metamodello supporta un flusso di lavoro compatibile con l'SDK OpenAI. Il manuale ufficiale di Meta utilizza l'URL di base https://api.meta.ai/v1 e legge la chiave da MODEL_API_KEY. La pagina del prodotto descrive inoltre il "search grounding", mentre il manuale tratta argomenti quali il completamento automatico nelle chat, lo streaming, l'invocazione di strumenti, l'output strutturato, la memorizzazione temporanea dei prompt, i controlli sul ragionamento, la visione, il contesto esteso, i tentativi ripetuti e le ricette di ricerca.
Esempio di ricettario ufficiale — versione acquisita: Il Ricettario ufficiale di GitHub utilizza ancora muse-spark-1.1. Questo dimostra la struttura del client e l'URL di base, non che l'esempio sia stato aggiornato alla versione 1.2.
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.meta.ai/v1",
api_key=os.environ["MODEL_API_KEY"],
)
response = client.chat.completions.create(
model="muse-spark-1.1",
messages=[{"role": "user", "content": "Hello, world!"}],
)
print(response.choices[0].message.content)
Adattamento documentato — non eseguito: Meta elenca separatamente muse-spark-1.2 come ID del modello standard 1.2. La sostituzione minima riportata di seguito combina due dati ufficiali, ma durante questa revisione non è stata inviata alcuna richiesta a pagamento.
response = client.chat.completions.create(
model="muse-spark-1.2",
messages=[{"role": "user", "content": "Hello, world!"}],
)
Muse Spark è un modello di ragionamento, e i token di ragionamento vengono conteggiati come output. Ciò rende il tasso di output standard $4.25 più importante di quanto possa sembrare a prima vista: una risposta apparentemente breve può comunque nascondere un ragionamento sostanziale. La latenza effettiva, il tempo necessario per ottenere il primo token, la frequenza dei tentativi e il costo per task rimangono qui non misurati.
/sforzo Il comando modifica la profondità di ragionamento. Fonte: Guida per gli sviluppatori di Meta.Cosa offre Muse Code
Muse Code si installa dal terminale e integra Muse Spark 1.2 in un flusso di lavoro dell'agente. Meta’s Approfondimento sugli sviluppatori descrive diversi comportamenti che non rientrano in una semplice chiamata all'API:
- Agenti paralleli: Le attività possono essere eseguite in alberi di lavoro Git isolati.
- Registro eventi di sola aggiunta: Le sessioni e le azioni vengono salvate in un file JSONL locale a fini di controllo e riproduzione.
- Riprendi il flusso:
curriculum di Museè possibile riprendere le sessioni interrotte. - Controllo del ragionamento: il
/sforzoIl comando regola l'intensità del ragionamento. - Competenze specifiche: Nomi Meta
/gusto,/alla griglia,/grill-con-documentazione, e/piano.
Caratteristiche del prodotto "Agent"
Sottoagenti
Le attività indipendenti possono ramificarsi.
Alberi di lavoro
I rami rimangono separati durante il lavoro in parallelo.
Log JSONL
Gli eventi locali di tipo "solo aggiunta" supportano la riproduzione.
Curriculum
curriculum di Muse prosegue le sessioni interrotte.
Competenze
/gusto, /alla griglia, /grill-con-documentazione, /piano.
Tale insieme di funzionalità rende Muse Code rilevante per il più ampio mercato degli agenti di programmazione, in cui la pianificazione, l’isolamento, il replay e la disciplina degli strumenti sono fondamentali tanto quanto l’intelligenza dei modelli. Il Guida comparativa tra OpenClaw e Claude: Code vs OpenCode è un contesto utile per comprendere tali differenze a livello di prodotto.
Affermazioni al momento del lancio e primi segnali dalla community
Una reazione non equivale a una conferma
Formazione + orizzonte a lungo termine
Maggiore potenza di calcolo per la programmazione, diversità dell’ambiente, co-training e uno stress test con oltre 1.000 chiamate a strumenti.
Prezzo e OpenCode
Un utente di Reddit ha elogiato la sua prima esperienza di programmazione e il valore che ne ha tratto.
Privacy + affidabilità
Altri utenti hanno sollevato preoccupazioni relative al consumo di dati, al prezzo standard, alla disponibilità e all’affidabilità iniziale.
Il team di intelligenza artificiale di Meta afferma che Muse Spark 1.2 ha beneficiato di una maggiore potenza di calcolo per l'addestramento alla programmazione, di ambienti più vari, di una maggiore attenzione alla generazione e al debug di interi repository e di un addestramento congiunto con Muse Code. Un altro discussione di lancio descrive uno stress test della durata massima di 24 ore con oltre 1.000 chiamate alle funzioni sulle GPU NVIDIA Hopper.
Si tratta di una dimostrazione impressionante, ma non rappresenta un tasso di successo generale quantificato. Non ci dice con quale frequenza l’agente abbia scelto lo strumento giusto, abbia corretto gli errori, abbia evitato chiamate duplicate o abbia portato a termine un’attività standard relativa al repository senza bisogno di indicazioni.
Anche i primi post su Reddit presentano pareri contrastanti. Uno Un utente di r/opencode ha raccontato un'esperienza positiva con OpenCode e ne ha elogiato il prezzo. Un altro Discussione sui prezzi dei collaboratori hanno sollevato questioni relative all'utilizzo dei dati, al costo del piano standard, alla disponibilità e all'affidabilità. Si tratta di reazioni individuali, non di un consenso della comunità.
Test di programmazione di Muse Spark 1.2: 3 su 3 attività superate
Nei nostri test, il modello base Muse Spark 1.2 ha portato a termine tre attività di programmazione controllate tramite un'API di completamento delle conversazioni compatibile con OpenAI. Per ogni attività è stato effettuato un solo tentativo, senza riprovazioni e senza intervento umano. Abbiamo valutato i file restituiti in repository temporanei rispetto a controlli pubblici e nascosti. L'esecuzione dell'agente Muse Code non è stata testata, né è stata verificata l'affidabilità delle chiamate agli strumenti; pertanto, questi risultati non devono essere interpretati come un benchmark dell'agente.
Risultato del singolo tentativo
Le risposte hanno utilizzato 6.618 token di ragionamento. Le tre motivazioni finali erano fermati, e nel campo "fornitore" è stato indicato "Meta".
Test 1: correzione del bug di idempotenza in Python — Superato
Blocca i trasferimenti duplicati senza modificare l'API pubblica
Il modello ha individuato la mancanza del controllo sull'ID della richiesta, ha aggiunto la correzione minima necessaria e ha fornito un test di regressione, preservando al contempo gli aggiornamenti atomici del bilancio.
Il valutatore nascosto originale richiedeva erroneamente una chiamata duplicata per il ritorno Falso, anche se il compito richiedeva semplicemente che non venisse addebitato due volte il mittente. Dopo aver corretto quel requisito inventato relativo al valore di ritorno, la prima risposta, rimasta invariata, ha superato tutti e sei i test. Non abbiamo ripetuto il tentativo né modificato l'output del modello.
Test 2: Rifattorizzazione di un progetto TypeScript con più file — Superato
Separazione tra convalida, persistenza e registrazione degli audit
I file restituiti hanno mantenuto il contratto di route pubblico, il TypeScript rigoroso e l'unica transazione che copre sia le operazioni di ordine che quelle di audit. Sono stati inoltre aggiunti test di validazione mirati senza dipendenze di runtime.
Il primo valutatore ha confrontato gli oggetti con quelli grezzi JSON.stringify, per cui oggetti equivalenti con un ordine di inserimento delle chiavi diverso apparivano come non equivalenti; la sua versione per Windows npx Anche il lancio è fallito prima del controllo dei tipi. Con un comparatore insensibile all'ordine e un'esecuzione del comando compatibile con Windows, la risposta originale ha superato tutti i controlli. Anche in questo caso, non è stato effettuato alcun nuovo tentativo.
Test 3: Funzionalità del repository JSONL — Superato
Istruzioni valide per l'intero repository
Aggiungere JSONL senza compromettere il CSV
Il modello implementava il rilevamento delle estensioni, gli errori relativi alle righe non valide con numerazione a partire da 1, l'output atomico, la sicurezza in modalità simulata, i test mirati, il testo di aiuto e un esempio nel file README.
Cosa evidenziano i test: Muse Spark 1.2 è in grado di restituire patch utilizzabili su più file, rispettare i vincoli di compatibilità, aggiungere test e gestire una funzionalità di portata modesta a livello di repository in un unico tentativo. Il costo medio riportato è stato di circa $0.0151 per attività, ma si trattava di casi di test di piccole dimensioni che non dovrebbero essere utilizzati per stimare i costi relativi a un codice sorgente di grandi dimensioni.
A chi è destinato Muse Spark 1.2?
Guida alla scelta
Valutazione controllata
Codice pubblico o sintetico, compiti misurabili, esigenze legate a contesti di ampia portata e un risultato promettente del modello di base 3/3.
È richiesta la prova dell'agente
Il comportamento del codice Muse, i limiti di velocità stabili, le chiamate ripetute agli strumenti o i benchmark su larga scala dei repository costituiscono dei criteri decisionali.
Codice sensibile o rendimento elevato
Utilizzare il livello standard oppure valutare le alternative quando la privacy e il costo dei token di ragionamento sono fattori determinanti.
Utilizza il modello standard per il codice sensibile, a meno che la tua organizzazione non abbia approvato separatamente i termini per i collaboratori. Se il prezzo di uscita standard modifica il calcolo del valore, confrontalo con quello attuale Prezzi del Codex, il codice Claude e gli altri costi relativi agli agenti di codifica prima di definire un flusso di lavoro.
Verdetto della recensione di Muse Spark 1.2
Muse Spark 1.2 si è guadagnato un posto nella rosa dei candidati alla valutazione, ma non una raccomandazione automatica per la produzione. Il contesto del token 1M, la struttura familiare dell’API, i prezzi vantaggiosi per i contributori, i tre tentativi di codifica al primo tentativo e gli ottimi punteggi ottenuti da Muse Code nei test di Meta rendono difficile ignorarlo. Meta ha inoltre fatto un lavoro migliore rispetto a molti altri lanci nel pubblicare i dettagli della metodologia.
Anche le avvertenze sono ben precise. Il modello tariffario per i contributori comporta un compromesso in termini di utilizzo dei dati. I token standard di output e di ragionamento possono far aumentare il costo effettivo. I dati di programmazione di punta di Meta non sono stati riprodotti come voci corrispondenti sulle bacheche pubbliche di Terminal-Bench o DeepSWE, e il nostro campione pratico copre tre attività del modello di base anziché l’esecuzione dell’agente Muse Code.
La mossa più sensata è quella di condurre una prova controllata su codice non sensibile, salvando i dati grezzi sull'utilizzo e le verifiche locali. Considerate i costi e la latenza misurati come un campione relativo a compiti di piccola entità, quindi testate le dimensioni del vostro repository, il recupero in caso di errore e il flusso di lavoro degli agenti prima di adottarlo in produzione.
Domande frequenti su Muse Spark 1.2
Che cos’è Muse Spark 1.2?
Muse Spark 1.2 è il modello di Meta incentrato sulla programmazione, lanciato il 5 agosto 2026, con una finestra di contesto da 1 milione di token e accessibile tramite Muse Code, l’API Meta Model e OpenRouter.
Muse Spark 1.2 è uguale a Muse Code?
No. Muse Spark 1.2 è il modello; Muse Code è un agente terminale beta separato basato su di esso. Muse Code aggiunge funzionalità al prodotto quali sottoagenti, alberi di lavoro Git isolati, registrazione degli eventi, ripresa dell'attività e competenze integrate.
Quanto costa l'API Muse Spark 1.2?
Il modello standard costa $1,25 in ingresso, $0,15 in ingresso nella cache e $4,25 in uscita per ogni milione di token. Il modello Contributor costa $0,10 in ingresso, $0,002 in ingresso nella cache e $0,20 in uscita.
Meta utilizza i dati dell'API di Muse Spark per l'addestramento?
Meta afferma che i dati di livello standard non vengono utilizzati per migliorare i propri prodotti. I dati di livello “Contributor” possono essere utilizzati a tale scopo; pertanto, il codice privato o proprietario dovrebbe seguire il percorso standard, salvo diversa approvazione da parte di un’organizzazione.
Muse Spark 1.2 è presente nelle classifiche pubbliche di Terminal-Bench o DeepSWE?
Al momento della verifica, effettuata il 7 agosto 2026, non figurava in nessuna delle due bacheche pubbliche. Meta riporta 82,91 TP40T su Terminal-Bench 2.1 con Muse Code e 59,31 TP40T su DeepSWE, ma si tratta di risultati ottenuti da Meta.
In questa recensione è stata effettuata una prova pratica di Muse Spark 1.2?
Sì. In tre test sul modello base con un unico tentativo, Muse Spark 1.2 ha superato una correzione di bug in Python, una rifattorizzazione in TypeScript e una funzionalità relativa al repository JSONL. La latenza media è stata di 12,98 secondi e il costo totale riportato è stato di $0,045362. L’affidabilità dell’agente Muse Code e delle chiamate agli strumenti non è stata testata.
In che modo gli sviluppatori possono accedere a Muse Spark 1.2?
Meta elenca tre percorsi: l'agente terminale Muse Code beta, l'API Meta Model e OpenRouter. Il manuale ufficiale utilizza un client compatibile con l'SDK OpenAI con URL di base https://api.meta.ai/v1.



