Recensione di Muse Spark 1.2: benchmark, API, prezzi e test di programmazione

Recensione di Muse Spark 1.2

Muse Spark 1.2 combina un costo per token insolitamente basso con una finestra di contesto di 1 milione di token e ha superato tutte e tre le attività di codifica del modello di base nella nostra suite di API al primo tentativo. Meta ha lanciato il modello il 5 agosto 2026, con una finestra di contesto di 1 milione di token, due livelli tariffari per l’API e un agente terminale separato denominato Muse Code. I risultati dei benchmark di Meta sono promettenti; le classifiche pubbliche indipendenti dedicate alla programmazione non hanno ancora verificato le stesse combinazioni di modelli e agenti.

Questa recensione distingue il modello dall’agente, i punteggi ufficiali dalle prove indipendenti e i prezzi standard dal compromesso tra utilizzo dei dati e livello “Contributor”. Nei nostri test, il modello ha completato una correzione di idempotenza in Python, una rifattorizzazione in TypeScript che preserva la compatibilità e una funzionalità JSONL a livello di repository senza necessità di riprovare. L’esecuzione dell’agente Muse Code non è stata testata, né è stata verificata l’affidabilità delle chiamate agli strumenti. Se si desidera prima confrontare il panorama più ampio, la nostra guida al I migliori modelli di intelligenza artificiale per la codifica fornisce un quadro più ampio del contesto competitivo.

Ispirazione da Muse su GlobalGPT

Recensione di Muse Spark 1.2: risposta rapida

Comunicato stampa di Meta Research intitolato “Presentazione di Muse Code e Muse Spark 1.2”, datato 5 agosto 2026
Lancio ufficiale. Il 5 agosto 2026 Meta ha annunciato Muse Code e Muse Spark 1.2. Fonte: Meta Research.

In breve: Muse Spark 1.2 è un modello Meta incentrato sulla programmazione con una finestra di 1 milione di token, accesso all’API compatibile con l’SDK OpenAI e un livello “Contributor” particolarmente interessante. Il suo punto di forza principale è il rapporto costo-prestazioni: $0,10 in ingresso e $0,20 in uscita per ogni milione di token sul modello Contributor. Questo livello può essere utilizzato per migliorare i prodotti Meta, mentre il modello standard, più costoso, non viene impiegato a tale scopo.

I dati sulle prestazioni richiedono una maggiore cautela. Meta riporta 82,91 TP40T su Terminal-Bench 2.1 per Muse Spark 1.2 con Muse Code e 59,31 TP40T su DeepSWE. Si tratta di risultati ottenuti da Meta. Le schede pubbliche di Terminal-Bench e DeepSWE non riportavano ancora Muse Spark 1.2 al momento della verifica effettuata il 26 agosto 2026. Analisi artificiale fornisce una verifica incrociata indipendente: il suo Indice di Intelligenza rimane a 57, al di sopra della mediana dei modelli comparabili, pari a 35.

  • Il motivo migliore per provarlo subito: Prezzi vantaggiosi per i collaboratori, un contesto ampio e un'API che segue il familiare modello client OpenAI.
  • Il motivo principale per cui è bene mantenere un atteggiamento prudente: Tre attività controllate sul modello di base non sono sufficienti a dimostrare l'affidabilità dell'agente Muse Code, la qualità delle chiamate agli strumenti o le prestazioni in un repository di produzione di grandi dimensioni.
  • Scelta importante in materia di privacy: Utilizza il modello standard per i codici o i prompt che non desideri vengano utilizzati per migliorare i prodotti Meta.

Muse Spark 1.2 in sintesi

Specifiche verificate

SviluppatoreMetaLanciato il 5 agosto 2026
Contesto1M1 milione di gettoni
Obiettivo principaleProgrammazione + strumentiLavoro sul repository e debug
Stato dell'intervento pratico3/3 attività superateUn tentativo per ogni attività
muse-spark-1.2 muse-spark-1.2-collaboratore Codice Muse API del metamodello OpenRouter Compatibile con l'SDK OpenAI Input di testo e immagine; output di testo

Meta descrive Muse Spark 1.2 come un modello che offre una maggiore precisione nella scrittura del codice al primo tentativo e un'identificazione degli strumenti più affidabile rispetto a Muse Spark 1.1. Si tratta di affermazioni del fornitore tratte dal pagina ufficiale del modello Muse Spark, e non le conclusioni tratte dalla nostra sessione di codifica.

Muse Spark 1.2 vs Muse Code

Muse Spark 1.2 è il modello. Muse Code è un agente terminale beta separato basato su tale modello. Questa distinzione è importante perché un agente può integrare funzionalità quali la pianificazione, l’orchestrazione degli strumenti, la navigazione nel repository, l’isolamento dell’albero di lavoro, la registrazione degli eventi e il comportamento di riprova attorno al modello sottostante.

Mantenere separati gli strati

Il modello

Muse Spark 1.2

Contesto, ragionamento, comportamento delle API, fatturazione dei token, risultati e decisioni relative alle chiamate agli strumenti.

ID dei modelliContesto 1MPrezzi API

L'agente beta

Codice Muse

Esperienza utente del terminale, subagenti, alberi di lavoro Git, registro eventi, flusso di ripresa, competenze integrate e orchestrazione.

Flusso di lavoro dell'agenteRisultati del sistema Meta-run

Pagina del modello Meta Muse Spark 1.2 che ne illustra l'orientamento alla programmazione e la finestra di contesto da un milione di token
Panoramica ufficiale dei modelli. Meta presenta Muse Spark 1.2 per i flussi di lavoro di programmazione, una finestra di contesto da 1 milione di token e un'esecuzione più affidabile degli strumenti. Fonte: Pagina del metamodello.

Il pagina ufficiale di Muse Code definisce il prodotto un agente di codifica beta. Ciò rende i confronti con prodotti come Claude Code e Codex più utili rispetto al presupporre che ogni differenza osservata nel flusso di lavoro derivi da una semplice chiamata al modello. Il nostro Confronto tra Codex e Claude spiega perché l'ambiente circostante possa influire sull'esperienza dello sviluppatore tanto quanto il modello stesso.

Benchmark di Muse Spark 1.2: cosa rivelano davvero i punteggi

Grafici di benchmark Meta per Muse Spark 1.2 relativi a Terminal-Bench, DeepSWE, codifica interna e GDPVal-AA versione due
Dati di riferimento raccolti dagli stessi fornitori. Meta ha pubblicato quattro schede di benchmark relative a Muse Spark 1.2; per ogni punteggio occorre comunque tenere conto dell'abbinamento tra harness e agente. Fonte: Pagina del metamodello.

Il grafico di riferimento di Meta colloca Muse Spark 1.2 ai vertici di diverse valutazioni relative alla programmazione. Vale la pena esaminare i dati, ma questi non costituiscono una classifica univoca e chiara della qualità intrinseca del modello. Il modello, l’agente, l’harness, la capacità di ragionamento e il protocollo dell’attività possono variare tutti insieme.

Meta-report Terminal-Bench 2.1

Pannello di riferimento Meta

Terminal-Bench 2.1

Tutte le 89 attività · superamento di 1 su cinque tentativi · combinazioni selezionate di modelli e agenti

Risultato del codice Muse in modalità Meta-run voce non verificata nella classifica pubblica
Codice Opus 5 max + Claude86.7%
Muse Spark 1.2 + Muse Code82.9%
GPT-5.6 Terra max + Codex81.8%
Grok 4,5 di altezza + Grok Build81.6%
Gemini 3.6 Flash alto + CLI antigravità78.9%
Muse Spark 1.1 + mini-swe-agent76.2%
Fonte: pagina del modello Muse Spark 1.2 di Meta e metodologia di valutazione. Si tratta di combinazioni di modelli e agenti gestite dai fornitori.

Il dato 82,9% è un Risultato del codice Muse in modalità Meta-run. Il Classifica pubblica di Terminal-Bench 2.1 il 26 agosto 2026 non ha inserito Muse Spark 1.2 nell'elenco, quindi è voce non verificata nella classifica pubblica. Il forum pubblico riportava Muse Spark 1.1 con mini-SWE-agent a 76,21 TP40T ±1,21 TP40T.

Classifica pubblica completa di Terminal-Bench 2.1, verificata il 7 agosto 2026, con tutte le diciassette voci visibili
Verifica incrociata indipendente. La versione completa e pubblica della scheda Terminal-Bench 2.1 non riportava Muse Spark 1.2 al momento della verifica effettuata il 7 agosto 2026. Fonte: Terminal-Bench.

DeepSWE 1.1 riportato da Meta

Pannello di riferimento Meta

DeepSWE 1.1

113 attività · 91 repository · cinque lingue · superamento del test 1 dopo cinque tentativi

Opus 565.0%
GPT-5.6 Terra64.8%
Muse Spark 1.259.3%Riportato da Meta
Grok 4,556.6%
Muse Spark 1.153.0%
Gemini 3.6 Flash40.0%

Il Classifica pubblica di DeepSWE v1.1 utilizza mini-swe-agent su tutti i modelli elencati per garantire la coerenza. Al momento della verifica, Muse Spark 1.2 non era stato aggiunto; Muse Spark 1.1 era indicato con il codice 53%. Il risultato di Meta, pari a 59,3%, utilizza Muse Code, quindi i due valori non sono identici in termini di harness.

Classifica pubblica completa di DeepSWE versione 1.1, aggiornata il 6 agosto 2026, comprensiva di grafico, tabella e nota sulla coerenza
Verifica incrociata indipendente. DeepSWE ha utilizzato mini-swe-agent per tutti i modelli elencati e non ha ancora incluso Muse Spark 1.2. Fonte: DeepSWE v1.1.

Valutazioni interne e relative agli agenti generici di Meta

Due diverse scale di valutazione

Meta Internal Coding Bench

440 compiti interni · due tentativi per ogni compito

ModelloPunteggio
Opus 579.4%
Muse Spark 1.270.6%
GPT-5.6 Terra65.4%
Gemini 3.6 Flash63.9%
Grok 4,5Non mostrato

GDPVal-AA v2

Valutazione generale dei compiti agenti · Valori in stile Elo

ModelloPunteggio
Opus 51852
Muse Spark 1.21631
GPT-5.6 Terra1577
Grok 4,51526
Gemini 3.6 Flash1423

Quelli di Meta metodologia di valutazione afferma che Terminal-Bench utilizza tutte le 89 attività e ottiene un pass@1 su cinque tentativi. DeepSWE copre 113 attività distribuite su 91 repository e cinque linguaggi, ottenendo anch’esso un pass@1 su cinque tentativi. Meta sottolinea inoltre che la propria configurazione potrebbe non essere ottimizzata per i modelli di terze parti. Per un confronto aggiornato con la concorrenza basato su decisioni reali relative ai prodotti, consultare Claude Opus 5 contro GPT-5.6.

La metodologia cambia il significato

Meta Terminal-Bench

Modello + agente selezionato

89 compiti, cinque tentativi, impostazioni di ragionamento massime diverse e il framework di Meta potrebbe non essere ottimizzato allo stesso modo per i sistemi di terze parti.

Panchina pubblica

Voci verificate

Al momento della verifica, Muse Spark 1.2 risultava assente. Le configurazioni della scheda e lo stato di verifica devono essere consultati separatamente dalla tabella di Meta.

DeepSWE pubblico

Agente mini-swe comune

113 attività distribuite su 91 repository e cinque linguaggi. Muse Spark 1.2 non era presente; Muse Spark 1.1 era indicato con il codice 53%.

Prima pagina di Meta Muse Spark 1.2 e metodologia di valutazione di Muse Code con abbinamenti di agenti e impostazioni di ragionamento
Prove metodologiche. Meta abbina modelli diversi a diversi agenti e contesti di ragionamento, pertanto il grafico dei fornitori non rappresenta una semplice classifica basata esclusivamente sui modelli. Fonte: PDF sulla metodologia Meta.

Analisi artificiale: contesto indipendente utile

Il Pagina del modello di analisi artificiale assegna a Muse Spark 1.2 un indice di intelligenza pari a 57, superiore alla mediana dei modelli comparabili pari a 35, secondo i dati del 26 agosto 2026. Il suo harness riporta 80% su Terminal-Bench v2.1, 57% normalizzato su GDPVal-AA v2, 56% su SciCode e 83% nella valutazione a contesto lungo AA-LCR.

Variazione della versione dell'analisi artificiale

Indice di intelligenza54 → 57Versione di valutazione/risultato modificato
GDPVal Elo1371 → 1631Valore di corrente più elevato
Banco da terminale78% → 80%Risultato relativo al cablaggio AA a corrente più elevata
Costo per attività$0,29 → $0,40Un maggiore utilizzo dei token ha comportato un aumento dei costi
Tasso di allucinazioni38% → 28%In calo, con un numero maggiore di astensioni
Tasso di tentativi82% → 67%Il modello ha tentato di rispondere a un numero minore di domande
Fonte: pagina del modello di analisi artificiale e analisi di lancio. I valori iniziali e quelli attuali non devono essere mescolati come se derivassero da un'unica valutazione immutata.

La lezione pratica è semplice: Muse Spark 1.2 sembra competitivo, ma nessun punteggio preso singolarmente è sufficiente a definire il modello. Considerate il grafico di Meta come una prova a sostegno del sistema Muse Code, le classifiche pubbliche come un controllo incrociato separato e Artificial Analysis come una valutazione indipendente ma configurata in modo diverso.

Riepilogo di Artificial Analysis Muse Spark 1.2 con indicazione dell'Indice di Intelligenza pari a 57, della posizione in classifica, dei prezzi, del costo di valutazione e di un contesto di un milione di token
Valutazione indipendente del modello. Artificial Analysis riporta un indice di intelligenza pari a 57 e fornisce una verifica separata su prezzo, contesto, modalità e costo di valutazione. Fonte: Analisi artificiale.

Muse Spark 1.2: compromessi tra costi e privacy

Meta offre due ID di modelli API con prezzi nettamente diversi. L'opzione più economica non è semplicemente uno sconto: modifica le modalità di utilizzo dei dati inviati.

USD per un milione di token · Contesto 1M

Standard · muse-spark-1.2

Non utilizzato per il miglioramento del prodotto

Non viene utilizzato per migliorare i prodotti Meta

Ingresso$1.25
Cache$0.15
Uscita$4.25
Collaboratore · muse-spark-1.2-contributor

Più economico, ma con un compromesso in termini di consumo dati

Dati potrebbe essere utilizzato per migliorare i prodotti Meta

Ingresso$0.10
Cache$0.002
Uscita$0.20
Prezzi ufficiali di Meta verificati il 7 agosto 2026. Le condizioni relative alla privacy variano a seconda del livello.
Tabella dei prezzi delle API standard e per i collaboratori di Meta Muse Spark 1.2 con identificatori dei modelli e condizioni di utilizzo dei dati
Prezzi ufficiali. Meta elenca separatamente gli ID dei modelli standard e dei modelli Contributor, i prezzi dei token e le condizioni di utilizzo dei dati. Fonte: Pagina del metamodello, consultato il 7 agosto 2026.

Il prezzo per i contributori è 12,5 volte più conveniente per gli input, 75 volte più conveniente per gli input memorizzati nella cache e 21,25 volte più conveniente per gli output rispetto al livello standard. Non esiste un’unica percentuale di sconto che descriva in modo accurato tutti i tipi di token.

Un ricercatore di Meta ha pubblicizzato il livello “Contributor” come “fino a 250 volte più economico” rispetto a Fable e “150 volte più economico” rispetto a GPT-5.6 Sol. Questo confronto sociale utilizza i prezzi "Contributor", non il modello standard, e dovrebbe sempre riportare la precisazione relativa al consumo di dati. I lettori che desiderano confrontare i costi attuali della concorrenza possono utilizzare la nostra sezione dedicata Guida ai prezzi GPT-5.6 e Claude: Analisi dettagliata dei prezzi.

Post sui social di Matt Deitke che promuove i prezzi dei token di input, cached-input e output del livello Contributor di Muse Spark 1.2
Contesto dei prezzi di lancio. Un ricercatore di Meta ha promosso il confronto dei prezzi della formula “Contributor”; il post non riporta i prezzi più elevati della formula standard e va letto tenendo conto del compromesso tra dati e costi. Fonte: Matt Deitke su X.

Per i repository pubblici, le attività sintetiche o gli ambienti di valutazione usa e getta, il livello “Contributor” potrebbe risultare interessante. Per il codice privato, i dati dei clienti, le credenziali o l’architettura proprietaria, il livello standard rappresenta l’opzione predefinita più sicura. Meta afferma inoltre di aver iniziato ad accettare richieste di conservazione zero dei dati tramite il reparto vendite, che rappresenta un percorso di accesso separato rispetto all’impostazione predefinita in modalità self-service.

Muse Spark 1.2: accesso all'API ed esempi

Pagina dell'API del Meta Model che descrive l'accesso diretto in modalità self-service a Muse Spark, attualmente in anteprima pubblica
Accesso ufficiale all'API. Meta descrive l'accesso diretto in modalità self-service a Muse Spark tramite l'API Meta Model, attualmente in anteprima pubblica. Fonte: API Meta Model.

Tre percorsi di accesso ufficiali

Agente di terminalMuse Code beta
API direttaAPI del metamodello
AggregatoreOpenRouter

URL di base del ricettario ufficiale: https://api.meta.ai/v1 · 1.2 Richiesta contenuta nella presente revisione: non eseguita

Il API del metamodello supporta un flusso di lavoro compatibile con l'SDK OpenAI. Il manuale ufficiale di Meta utilizza l'URL di base https://api.meta.ai/v1 e legge la chiave da MODEL_API_KEY. La pagina del prodotto descrive inoltre il "search grounding", mentre il manuale tratta argomenti quali il completamento automatico nelle chat, lo streaming, l'invocazione di strumenti, l'output strutturato, la memorizzazione temporanea dei prompt, i controlli sul ragionamento, la visione, il contesto esteso, i tentativi ripetuti e le ricette di ricerca.

Esempio di ricettario ufficiale — versione acquisita: Il Ricettario ufficiale di GitHub utilizza ancora muse-spark-1.1. Questo dimostra la struttura del client e l'URL di base, non che l'esempio sia stato aggiornato alla versione 1.2.

import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.meta.ai/v1",
    api_key=os.environ["MODEL_API_KEY"],
)

response = client.chat.completions.create(
    model="muse-spark-1.1",
    messages=[{"role": "user", "content": "Hello, world!"}],
)

print(response.choices[0].message.content)
Guida pratica su GitHub relativa all'API Meta Model che illustra l'URL di base dell'SDK OpenAI, la chiave di ambiente e un esempio completo di completamento delle chat
Ricettario ufficiale. Il file README acquisito riporta il modello e l'URL di base dell'SDK OpenAI, ma, al momento della verifica, l'esempio riportato utilizzava ancora Muse Spark 1.1. Fonte: Manuale dell'API Meta Model.

Adattamento documentato — non eseguito: Meta elenca separatamente muse-spark-1.2 come ID del modello standard 1.2. La sostituzione minima riportata di seguito combina due dati ufficiali, ma durante questa revisione non è stata inviata alcuna richiesta a pagamento.

response = client.chat.completions.create(
    model="muse-spark-1.2",
    messages=[{"role": "user", "content": "Hello, world!"}],
)

Muse Spark è un modello di ragionamento, e i token di ragionamento vengono conteggiati come output. Ciò rende il tasso di output standard $4.25 più importante di quanto possa sembrare a prima vista: una risposta apparentemente breve può comunque nascondere un ragionamento sostanziale. La latenza effettiva, il tempo necessario per ottenere il primo token, la frequenza dei tentativi e il costo per task rimangono qui non misurati.

Guida per sviluppatori Meta che illustra il sistema di fatturazione basato sui token di ragionamento di Muse Spark e il controllo delle attività di Muse Code
Comportamento di fatturazione. Meta afferma che i token di ragionamento di Muse Spark vengono fatturati come output, mentre il Muse Code /sforzo Il comando modifica la profondità di ragionamento. Fonte: Guida per gli sviluppatori di Meta.

Cosa offre Muse Code

Pagina ufficiale della versione beta di Muse Code che mostra l'agente di codifica da terminale e il suo programma di installazione con un solo comando
Muse Code beta. Meta presenta Muse Code come agente da terminale per flussi di lavoro di programmazione complessi e mette a disposizione un programma di installazione attivabile con un solo comando. Fonte: pagina ufficiale di Muse Code.

Muse Code si installa dal terminale e integra Muse Spark 1.2 in un flusso di lavoro dell'agente. Meta’s Approfondimento sugli sviluppatori descrive diversi comportamenti che non rientrano in una semplice chiamata all'API:

  • Agenti paralleli: Le attività possono essere eseguite in alberi di lavoro Git isolati.
  • Registro eventi di sola aggiunta: Le sessioni e le azioni vengono salvate in un file JSONL locale a fini di controllo e riproduzione.
  • Riprendi il flusso: curriculum di Muse è possibile riprendere le sessioni interrotte.
  • Controllo del ragionamento: il /sforzo Il comando regola l'intensità del ragionamento.
  • Competenze specifiche: Nomi Meta /gusto, /alla griglia, /grill-con-documentazione, e /piano.

Caratteristiche del prodotto "Agent"

Parallelismo

Sottoagenti

Le attività indipendenti possono ramificarsi.

Isolamento

Alberi di lavoro

I rami rimangono separati durante il lavoro in parallelo.

Revisione contabile

Log JSONL

Gli eventi locali di tipo "solo aggiunta" supportano la riproduzione.

Ripresa

Curriculum

curriculum di Muse prosegue le sessioni interrotte.

Strumenti espliciti

Competenze

/gusto, /alla griglia, /grill-con-documentazione, /piano.

Tale insieme di funzionalità rende Muse Code rilevante per il più ampio mercato degli agenti di programmazione, in cui la pianificazione, l’isolamento, il replay e la disciplina degli strumenti sono fondamentali tanto quanto l’intelligenza dei modelli. Il Guida comparativa tra OpenClaw e Claude: Code vs OpenCode è un contesto utile per comprendere tali differenze a livello di prodotto.

Affermazioni al momento del lancio e primi segnali dalla community

Una reazione non equivale a una conferma

Contesto del lancio ufficiale

Formazione + orizzonte a lungo termine

Maggiore potenza di calcolo per la programmazione, diversità dell’ambiente, co-training e uno stress test con oltre 1.000 chiamate a strumenti.

Un aneddoto positivo

Prezzo e OpenCode

Un utente di Reddit ha elogiato la sua prima esperienza di programmazione e il valore che ne ha tratto.

Domande aperte

Privacy + affidabilità

Altri utenti hanno sollevato preoccupazioni relative al consumo di dati, al prezzo standard, alla disponibilità e all’affidabilità iniziale.

Il team di intelligenza artificiale di Meta afferma che Muse Spark 1.2 ha beneficiato di una maggiore potenza di calcolo per l'addestramento alla programmazione, di ambienti più vari, di una maggiore attenzione alla generazione e al debug di interi repository e di un addestramento congiunto con Muse Code. Un altro discussione di lancio descrive uno stress test della durata massima di 24 ore con oltre 1.000 chiamate alle funzioni sulle GPU NVIDIA Hopper.

Post sul blog “AI at Meta” che descrive il corso di programmazione Muse Spark 1.2, il debug, la generazione di repository completi e il co-training con Muse Code
Immagini del lancio ufficiale. Il team di IA di Meta afferma che il modello ha beneficiato di una maggiore potenza di calcolo per le attività di programmazione, di ambienti più ampi e di un co-training con Muse Code. Fonte: AI at Meta su X.
Post di AI at Meta che descrive uno stress test su Muse Code con oltre mille chiamate allo strumento nell’arco di ben ventiquattro ore
Dimostrazione a lungo termine. Meta ha presentato uno stress test del kernel della GPU con oltre 1.000 chiamate alle funzioni; non si tratta di un indicatore generale dell'affidabilità delle funzioni. Fonte: AI at Meta su X.

Si tratta di una dimostrazione impressionante, ma non rappresenta un tasso di successo generale quantificato. Non ci dice con quale frequenza l’agente abbia scelto lo strumento giusto, abbia corretto gli errori, abbia evitato chiamate duplicate o abbia portato a termine un’attività standard relativa al repository senza bisogno di indicazioni.

Anche i primi post su Reddit presentano pareri contrastanti. Uno Un utente di r/opencode ha raccontato un'esperienza positiva con OpenCode e ne ha elogiato il prezzo. Un altro Discussione sui prezzi dei collaboratori hanno sollevato questioni relative all'utilizzo dei dati, al costo del piano standard, alla disponibilità e all'affidabilità. Si tratta di reazioni individuali, non di un consenso della comunità.

Un utente di Reddit che descrive una prima esperienza positiva con la programmazione di Muse Spark 1.2 e il suo prezzo contenuto su OpenCode
Una delle prime testimonianze degli utenti. Un utente di Reddit ha elogiato l'esperienza di programmazione e il prezzo di OpenCode; si tratta di un aneddoto, non di un consenso generale. Fonte: r/opencode.
Discussione su Reddit in cui si confrontano i prezzi della versione standard e della versione Contributor di Muse Spark 1.2, sollevando al contempo preoccupazioni relative alla condivisione dei dati
Privacy e reazione al valore. Questa discussione della community mette a confronto l'interesse per il prezzo "Contributor" con le preoccupazioni relative all'utilizzo dei dati, alla loro disponibilità e al costo del piano standard. Fonte: r/opencodeCLI.

Test di programmazione di Muse Spark 1.2: 3 su 3 attività superate

Nei nostri test, il modello base Muse Spark 1.2 ha portato a termine tre attività di programmazione controllate tramite un'API di completamento delle conversazioni compatibile con OpenAI. Per ogni attività è stato effettuato un solo tentativo, senza riprovazioni e senza intervento umano. Abbiamo valutato i file restituiti in repository temporanei rispetto a controlli pubblici e nascosti. L'esecuzione dell'agente Muse Code non è stata testata, né è stata verificata l'affidabilità delle chiamate agli strumenti; pertanto, questi risultati non devono essere interpretati come un benchmark dell'agente.

Risultato del singolo tentativo

Compiti3/33/3 attività di programmazione superate
Latenza media12,98 s12,98 secondi per attività
Utilizzo12,10012.100 token in totale
Costo dichiarato$0.045362Tre bandi per modelle

Le risposte hanno utilizzato 6.618 token di ragionamento. Le tre motivazioni finali erano fermati, e nel campo "fornitore" è stato indicato "Meta".

Test 1: correzione del bug di idempotenza in Python — Superato

Compito

Blocca i trasferimenti duplicati senza modificare l'API pubblica

Il modello ha individuato la mancanza del controllo sull'ID della richiesta, ha aggiunto la correzione minima necessaria e ha fornito un test di regressione, preservando al contempo gli aggiornamenti atomici del bilancio.

PASS · 6 prove
Latenza12,064 s
Gettoni2,867
Ragionamento1,621
Costo$0.01072675

Il valutatore nascosto originale richiedeva erroneamente una chiamata duplicata per il ritorno Falso, anche se il compito richiedeva semplicemente che non venisse addebitato due volte il mittente. Dopo aver corretto quel requisito inventato relativo al valore di ritorno, la prima risposta, rimasta invariata, ha superato tutti e sei i test. Non abbiamo ripetuto il tentativo né modificato l'output del modello.

Test 2: Rifattorizzazione di un progetto TypeScript con più file — Superato

Compito

Separazione tra convalida, persistenza e registrazione degli audit

I file restituiti hanno mantenuto il contratto di route pubblico, il TypeScript rigoroso e l'unica transazione che copre sia le operazioni di ordine che quelle di audit. Sono stati inoltre aggiunti test di validazione mirati senza dipendenze di runtime.

VerificaPASSControllo dei tipi, contratto pubblico, controllo delle transazioni nascoste e test di convalida aggiuntivi
13,909 s5.011 token2.770 ragionamenti$0.01833275

Il primo valutatore ha confrontato gli oggetti con quelli grezzi JSON.stringify, per cui oggetti equivalenti con un ordine di inserimento delle chiavi diverso apparivano come non equivalenti; la sua versione per Windows npx Anche il lancio è fallito prima del controllo dei tipi. Con un comparatore insensibile all'ordine e un'esecuzione del comando compatibile con Windows, la risposta originale ha superato tutti i controlli. Anche in questo caso, non è stato effettuato alcun nuovo tentativo.

Test 3: Funzionalità del repository JSONL — Superato

Istruzioni valide per l'intero repository

Aggiungere JSONL senza compromettere il CSV

Il modello implementava il rilevamento delle estensioni, gli errori relativi alle righe non valide con numerazione a partire da 1, l'output atomico, la sicurezza in modalità simulata, i test mirati, il testo di aiuto e un esempio nel file README.

Risultato9/9test superati
Latenza12,976 sprimo tentativo
4.222 token2.227 ragionamenti$0.0163025

Cosa evidenziano i test: Muse Spark 1.2 è in grado di restituire patch utilizzabili su più file, rispettare i vincoli di compatibilità, aggiungere test e gestire una funzionalità di portata modesta a livello di repository in un unico tentativo. Il costo medio riportato è stato di circa $0.0151 per attività, ma si trattava di casi di test di piccole dimensioni che non dovrebbero essere utilizzati per stimare i costi relativi a un codice sorgente di grandi dimensioni.

A chi è destinato Muse Spark 1.2?

Guida alla scelta

Provalo subito

Valutazione controllata

Codice pubblico o sintetico, compiti misurabili, esigenze legate a contesti di ampia portata e un risultato promettente del modello di base 3/3.

Aspetta

È richiesta la prova dell'agente

Il comportamento del codice Muse, i limiti di velocità stabili, le chiamate ripetute agli strumenti o i benchmark su larga scala dei repository costituiscono dei criteri decisionali.

Confronta prima

Codice sensibile o rendimento elevato

Utilizzare il livello standard oppure valutare le alternative quando la privacy e il costo dei token di ragionamento sono fattori determinanti.

Utilizza il modello standard per il codice sensibile, a meno che la tua organizzazione non abbia approvato separatamente i termini per i collaboratori. Se il prezzo di uscita standard modifica il calcolo del valore, confrontalo con quello attuale Prezzi del Codex, il codice Claude e gli altri costi relativi agli agenti di codifica prima di definire un flusso di lavoro.

Verdetto della recensione di Muse Spark 1.2

Muse Spark 1.2 si è guadagnato un posto nella rosa dei candidati alla valutazione, ma non una raccomandazione automatica per la produzione. Il contesto del token 1M, la struttura familiare dell’API, i prezzi vantaggiosi per i contributori, i tre tentativi di codifica al primo tentativo e gli ottimi punteggi ottenuti da Muse Code nei test di Meta rendono difficile ignorarlo. Meta ha inoltre fatto un lavoro migliore rispetto a molti altri lanci nel pubblicare i dettagli della metodologia.

Anche le avvertenze sono ben precise. Il modello tariffario per i contributori comporta un compromesso in termini di utilizzo dei dati. I token standard di output e di ragionamento possono far aumentare il costo effettivo. I dati di programmazione di punta di Meta non sono stati riprodotti come voci corrispondenti sulle bacheche pubbliche di Terminal-Bench o DeepSWE, e il nostro campione pratico copre tre attività del modello di base anziché l’esecuzione dell’agente Muse Code.

La mossa più sensata è quella di condurre una prova controllata su codice non sensibile, salvando i dati grezzi sull'utilizzo e le verifiche locali. Considerate i costi e la latenza misurati come un campione relativo a compiti di piccola entità, quindi testate le dimensioni del vostro repository, il recupero in caso di errore e il flusso di lavoro degli agenti prima di adottarlo in produzione.

Domande frequenti su Muse Spark 1.2

Che cos’è Muse Spark 1.2?

Muse Spark 1.2 è il modello di Meta incentrato sulla programmazione, lanciato il 5 agosto 2026, con una finestra di contesto da 1 milione di token e accessibile tramite Muse Code, l’API Meta Model e OpenRouter.

Muse Spark 1.2 è uguale a Muse Code?

No. Muse Spark 1.2 è il modello; Muse Code è un agente terminale beta separato basato su di esso. Muse Code aggiunge funzionalità al prodotto quali sottoagenti, alberi di lavoro Git isolati, registrazione degli eventi, ripresa dell'attività e competenze integrate.

Quanto costa l'API Muse Spark 1.2?

Il modello standard costa $1,25 in ingresso, $0,15 in ingresso nella cache e $4,25 in uscita per ogni milione di token. Il modello Contributor costa $0,10 in ingresso, $0,002 in ingresso nella cache e $0,20 in uscita.

Meta utilizza i dati dell'API di Muse Spark per l'addestramento?

Meta afferma che i dati di livello standard non vengono utilizzati per migliorare i propri prodotti. I dati di livello “Contributor” possono essere utilizzati a tale scopo; pertanto, il codice privato o proprietario dovrebbe seguire il percorso standard, salvo diversa approvazione da parte di un’organizzazione.

Muse Spark 1.2 è presente nelle classifiche pubbliche di Terminal-Bench o DeepSWE?

Al momento della verifica, effettuata il 7 agosto 2026, non figurava in nessuna delle due bacheche pubbliche. Meta riporta 82,91 TP40T su Terminal-Bench 2.1 con Muse Code e 59,31 TP40T su DeepSWE, ma si tratta di risultati ottenuti da Meta.

In questa recensione è stata effettuata una prova pratica di Muse Spark 1.2?

Sì. In tre test sul modello base con un unico tentativo, Muse Spark 1.2 ha superato una correzione di bug in Python, una rifattorizzazione in TypeScript e una funzionalità relativa al repository JSONL. La latenza media è stata di 12,98 secondi e il costo totale riportato è stato di $0,045362. L’affidabilità dell’agente Muse Code e delle chiamate agli strumenti non è stata testata.

In che modo gli sviluppatori possono accedere a Muse Spark 1.2?

Meta elenca tre percorsi: l'agente terminale Muse Code beta, l'API Meta Model e OpenRouter. Il manuale ufficiale utilizza un client compatibile con l'SDK OpenAI con URL di base https://api.meta.ai/v1.

Condividi il post:

Messaggi correlati