Muse Spark 1.2 im Test: Benchmarks, API, Preise und Programmiertests

Muse Spark 1.2 – Testbericht

Muse Spark 1.2 kombiniert ungewöhnlich niedrige Token-Preise mit einem Kontextfenster von 1 Million Token und hat alle drei Codierungsaufgaben für Basismodelle in unserer API-Suite beim ersten Versuch bestanden. Meta hat das Modell am 5. August 2026, mit einem Kontextfenster von 1 Million Tokens, zwei API-Preisstufen und einem separaten Terminal-Agenten namens „Muse Code“. Die Benchmark-Ergebnisse von Meta sind vielversprechend; unabhängige öffentliche Coding-Ranglisten haben diese Modell- und Agenten-Kombinationen jedoch noch nicht überprüft.

Diese Bewertung unterscheidet zwischen dem Modell und dem Agenten, zwischen offiziellen Bewertungen und unabhängigen Belegen sowie zwischen der Standardpreisgestaltung und dem Kompromiss zwischen Datenverbrauch und Leistungsumfang der „Contributor“-Stufe. In unseren Tests führte das Modell eine Korrektur der Python-Idempotenz, eine kompatibilitätserhaltende TypeScript-Umgestaltung und eine repositoryweite JSONL-Funktion ohne Wiederholungsversuche durch. Die Ausführung des Muse Code-Agenten wurde nicht getestet, ebenso wenig wie die Zuverlässigkeit der Tool-Aufrufe. Wenn Sie zunächst einen Vergleich des breiteren Feldes vornehmen möchten, finden Sie in unserem Leitfaden zum beste AI-Modelle für die Codierung vermittelt den breiteren wettbewerblichen Kontext.

Muse-Funke auf GlobalGPT

Muse Spark 1.2 Testbericht: Kurzfassung

Mitteilung von Meta Research mit dem Titel „Vorstellung von Muse Code und Muse Spark 1.2“ vom 5. August 2026
Offizieller Start. Meta kündigte am 5. August 2026 Muse Code und Muse Spark 1.2 an. Quelle: Meta Research.

Die Kurzfassung: Muse Spark 1.2 ist ein auf Programmierung ausgerichtetes Meta-Modell mit einem Fenster von 1 Million Token, einem OpenAI-SDK-kompatiblen API-Zugriff und einer besonders attraktiven „Contributor“-Stufe. Sein größter öffentlicher Vorteil ist das Preis-Leistungs-Verhältnis: $0,10 für die Eingabe und $0,20 für die Ausgabe pro Million Token beim „Contributor“-Modell. Diese Stufe kann zur Verbesserung von Meta-Produkten genutzt werden, während das teurere Standardmodell nicht für diesen Zweck eingesetzt wird.

Was die Leistungsdaten angeht, ist etwas mehr Zurückhaltung geboten. Meta gibt für Muse Spark 1.2 mit Muse Code einen Wert von 82,91 TP40T auf Terminal-Bench 2.1 und einen Wert von 59,31 TP40T auf DeepSWE an. Dabei handelt es sich um von Meta ermittelte Ergebnisse. Auf den öffentlichen Terminal-Bench- und DeepSWE-Listen war Muse Spark 1.2 bei einer Überprüfung am 26. August 2026 noch immer nicht aufgeführt. Künstliche Analyse bietet eine unabhängige Gegenprüfung: Sein Intelligenzindex liegt weiterhin bei 57 und damit über dem Medianwert vergleichbarer Modelle von 35.

  • Der beste Grund, es jetzt auszuprobieren: Günstige Preise für Mitwirkende, ein umfangreicher Kontext und eine API, die dem bekannten OpenAI-Client-Muster folgt.
  • Der wichtigste Grund, vorsichtig zu bleiben: Drei kontrollierte Aufgaben auf Basis des Basismodells reichen nicht aus, um die Zuverlässigkeit des Muse-Code-Agenten, die Qualität der Tool-Aufrufe oder die Leistung in einem großen Produktions-Repository nachzuweisen.
  • Wichtige Entscheidung zum Datenschutz: Verwenden Sie das Standardmodell für Code oder Eingabeaufforderungen, die nicht zur Verbesserung von Meta-Produkten verwendet werden sollen.

Muse Spark 1.2 auf einen Blick

Geprüfte Spezifikationen

EntwicklerMetaGestartet am 5. August 2026
Kontext1M1 Million Token
HauptfokusProgrammierung + ToolsArbeit am Repository und Fehlerbehebung
Praktischer Status3 von 3 Aufgaben bestandenEin Versuch pro Aufgabe
muse-spark-1.2 muse-spark-1.2-Mitwirkender Muse-Code Meta-Modell-API OpenRouter Kompatibel mit dem OpenAI SDK Eingabe von Text und Bild; Ausgabe von Text

Meta beschreibt Muse Spark 1.2 als ein Modell mit einer höheren Genauigkeit beim Programmieren im ersten Versuch und einer zuverlässigeren Tool-Auswahl als Muse Spark 1.1. Dies sind Angaben des Anbieters aus dem Offizielle Modellseite von Muse Spark, nicht Schlussfolgerungen aus unserer eigenen Kodierungssitzung.

Muse Spark 1.2 im Vergleich zu Muse Code

„Muse Spark 1.2“ ist das Modell. „Muse Code“ ist ein separater Beta-Terminal-Agent, der auf diesem Modell basiert. Diese Unterscheidung ist von Bedeutung, da ein Agent um das zugrunde liegende Modell herum Funktionen wie Planung, Werkzeugkoordination, Repository-Navigation, Isolierung des Arbeitsverzeichnisses, Protokollierung und Wiederholungsverhalten hinzufügen kann.

Halten Sie die Ebenen getrennt

Das Modell

Muse Spark 1.2

Kontext, Argumentation, API-Verhalten, Token-Abrechnung, Ausgaben und Entscheidungen bezüglich des Aufrufs von Tools.

Modell-IDs1M KontextAPI-Preise

Der Beta-Agent

Muse-Code

Terminal-UX, Subagenten, Git-Worktrees, Ereignisprotokoll, Wiederaufnahme des Ablaufs, gebündelte Skills und Orchestrierung.

Agenten-WorkflowErgebnisse des Meta-Run-Systems

Modellseite zu „Meta Muse Spark 1.2“ mit Angaben zum Schwerpunkt „Programmierung“ und einem Kontextfenster von einer Million Token
Offizielle Modellübersicht. Meta positioniert Muse Spark 1.2 für Programmier-Workflows, ein Kontextfenster mit einer Größe von 1 Million Token und einen zuverlässigeren Aufruf von Tools. Quelle: Seite zum Metamodell.

Die offizielle Muse-Code-Seite bezeichnet das Produkt als Beta-Codierungsmittel. Dadurch sind Vergleiche mit Produkten wie Claude Code und Codex aussagekräftiger, als so zu tun, als ob jeder beobachtete Unterschied im Arbeitsablauf allein auf den Modellabruf zurückzuführen wäre. Unser Codex vs. Claude – Code-Vergleich erklärt, warum das Umfeld die Entwicklererfahrung ebenso stark beeinflussen kann wie das Modell.

Muse Spark 1.2-Benchmarks: Was die Ergebnisse wirklich aussagen

Meta-Benchmark-Diagramme für Muse Spark 1.2 für Terminal-Bench, DeepSWE, interne Programmierung und GDPVal-AA Version 2
Von Anbietern durchgeführte Vergleichsstudien. Meta hat vier Benchmark-Panels für Muse Spark 1.2 veröffentlicht; die Zuordnung von Harness und Agent muss weiterhin bei jedem Ergebnis berücksichtigt werden. Quelle: Seite zum Metamodell.

In der Benchmark-Übersicht von Meta rangiert Muse Spark 1.2 bei mehreren Programmierbewertungen ganz oben. Die Zahlen sind zwar eine genauere Betrachtung wert, stellen jedoch keine eindeutige Rangliste der reinen Modellqualität dar. Das Modell, der Agent, das Test-Harness, die Schlussfolgerungsfähigkeit und das Aufgabenprotokoll können sich alle gemeinsam ändern.

Meta-Bericht zu Terminal-Bench 2.1

Meta-Benchmark-Panel

Terminal-Bench 2.1

Alle 89 Aufgaben · „pass@1“ bei fünf Versuchen · ausgewählte Modell- und Agentenkombinationen

Ergebnis des Meta-Laufs des Muse-Codes Kein verifizierter Eintrag in der öffentlichen Rangliste
Opus 5 max + Claude-Code86.7%
Muse Spark 1.2 + Muse Code82.9%
GPT-5.6 Terra max + Codex81.8%
Grok 4,5 hoch + Grok-Konfiguration81.6%
Gemini 3.6 Flash high + Antigravity CLI78.9%
Muse Spark 1.1 + mini-swe-agent76.2%
Quelle: Die Modellseite zu „Muse Spark 1.2“ von Meta und die Bewertungsmethodik. Hierbei handelt es sich um vom Anbieter betriebene Kombinationen aus Modellen und Agenten.

Die Zahl 82,9% ist eine Ergebnis des Meta-Laufs des Muse-Codes. Das public Terminal-Bench 2.1-Rangliste hat „Muse Spark 1.2“ am 26. August 2026 nicht aufgeführt, daher ist es Kein verifizierter Eintrag in der öffentlichen Rangliste. In der öffentlichen Tabelle wurde Muse Spark 1.1 mit Mini-SWE-Agent mit 76,21 TP40T ±1,21 TP40T aufgeführt.

Vollständige öffentliche Rangliste von „Terminal-Bench 2.1“, Stand: 7. August 2026, mit allen siebzehn sichtbaren Einträgen
Unabhängige Gegenprüfung. In der vollständigen öffentlichen Liste von Terminal-Bench 2.1 war Muse Spark 1.2 bei einer Überprüfung am 7. August 2026 nicht aufgeführt. Quelle: Terminal-Bench.

Meta-Bericht zu DeepSWE 1.1

Meta-Benchmark-Panel

DeepSWE 1.1

113 Aufgaben · 91 Repositorys · fünf Sprachen · „pass@1“ bei fünf Versuchen

Opus 565.0%
GPT-5.6 Terra64.8%
Muse Spark 1.259.3%Meta-Bericht
Grok 4,556.6%
Muse Spark 1.153.0%
Gemini 3.6 Flash40.0%

Die Öffentliche DeepSWE v1.1-Rangliste verwendet aus Gründen der Einheitlichkeit bei allen aufgeführten Modellen den „mini-swe-agent“. Zum Zeitpunkt der Überprüfung war der „Muse Spark 1.2“ noch nicht hinzugefügt worden; der „Muse Spark 1.1“ war mit 53% aufgeführt. Das Ergebnis von Meta (59,3%) basiert auf „Muse Code“, sodass die beiden Werte nicht auf derselben Testumgebung beruhen.

Vollständige öffentliche Rangliste für DeepSWE Version 1.1, aktualisiert am 6. August 2026, einschließlich Diagramm, Tabelle und Hinweis zur Konsistenz
Unabhängige Gegenprüfung. DeepSWE verwendete für alle aufgeführten Modelle den „mini-swe-agent“ und berücksichtigte Muse Spark 1.2 noch nicht. Quelle: DeepSWE v1.1.

Die internen und allgemeinen Agentenbewertungen von Meta

Zwei verschiedene Bewertungsskalen

Meta-interne Programmierwerkbank

440 interne Aufgaben · zwei Versuche pro Aufgabe

ModellPunktzahl
Opus 579.4%
Muse Spark 1.270.6%
GPT-5.6 Terra65.4%
Gemini 3.6 Flash63.9%
Grok 4,5Nicht abgebildet

GDPVal-AA v2

Allgemeine Bewertung agentischer Aufgaben · Werte nach Elo-Art

ModellPunktzahl
Opus 51852
Muse Spark 1.21631
GPT-5.6 Terra1577
Grok 4,51526
Gemini 3.6 Flash1423

Meta’s Bewertungsmethodik Laut Angaben nutzt Terminal-Bench alle 89 Aufgaben und erreicht bei fünf Versuchen „pass@1“. DeepSWE deckt 113 Aufgaben in 91 Repositories und fünf Sprachen ab und erreicht ebenfalls bei fünf Versuchen „pass@1“. Meta weist zudem darauf hin, dass seine Konfiguration möglicherweise nicht optimal auf Modelle von Drittanbietern abgestimmt ist. Einen aktuellen Vergleich mit Wettbewerbern, der auf realen Produktentscheidungen basiert, finden Sie unter Claude Opus 5 gegen GPT-5.6.

Die Methodik verändert die Bedeutung

Meta-Terminal-Bench

Modell + ausgewählter Vermittler

89 Aufgaben, fünf Versuche, unterschiedliche Einstellungen für die maximale Schlussfolgerungsfähigkeit, und das Testumfeld von Meta ist möglicherweise nicht gleichermaßen auf Systeme von Drittanbietern abgestimmt.

Öffentliche Sitzbank

Verifizierte Einträge

Muse Spark 1.2 war bei der Überprüfung nicht vorhanden. Die Konfigurationen und der Verifizierungsstatus der Platine müssen separat aus der Tabelle von Meta entnommen werden.

Öffentliches DeepSWE

Gängiger Mini-Swe-Agent

113 Aufgaben in 91 Repositories und fünf Sprachen. Muse Spark 1.2 fehlte; Muse Spark 1.1 war mit 53% aufgeführt.

Seite 1: Bewertungsmethodik für Meta Muse Spark 1.2 und Muse Code mit Agentenpaarungen und Schlussfolgerungseinstellungen
Methodische Belege. Meta kombiniert verschiedene Modelle mit unterschiedlichen Agenten und Schlussfolgerungsszenarien, sodass die Anbieter-Tabelle keine reine Rangliste allein auf der Grundlage der Modelle darstellt. Quelle: PDF zur Meta-Methodik.

Künstliche Analyse: nützlicher unabhängiger Kontext

Die Seite zum Modell der künstlichen Analyse ergibt für Muse Spark 1.2 einen Intelligenzindex von 57, was über dem Medianwert vergleichbarer Modelle von 35 liegt (Stand: 26. August 2026). Sein Harness weist 80% auf Terminal-Bench v2.1, 57% (normalisiert) auf GDPVal-AA v2, 56% auf SciCode und 83% bei der AA-LCR-Bewertung mit langem Kontext auf.

Abweichung bei der künstlichen Analyse

Intelligenzindex54 → 57Testversion/Ergebnis geändert
GDPVal Elo1371 → 1631Höherer Stromwert
Terminal-Bank78% → 80%Ergebnis des AA-Kabelbaums mit höherer Stromstärke
Kosten pro Aufgabe$0,29 → $0,40Eine stärkere Nutzung der Token führte zu höheren Kosten
Häufigkeit von Halluzinationen38% → 28%Rückgang bei gleichzeitig höherer Enthaltungsquote
Versuchsquote82% → 67%Das Modell hat weniger Fragen versucht
Quelle: Seite zum Modell der künstlichen Analyse und Startanalyse. Start- und aktuelle Werte sollten nicht so vermischt werden, als stammten sie aus einer einzigen, unveränderten Auswertung.

Die praktische Erkenntnis ist einfach: Muse Spark 1.2 scheint wettbewerbsfähig zu sein, aber keine einzelne Bewertung kann das Modell isoliert betrachten. Betrachten Sie die Grafik von Meta als Beleg für das Muse-Code-System, öffentliche Ranglisten als separate Gegenprüfung und „Artificial Analysis“ als unabhängige, aber anders konfigurierte Bewertung.

Zusammenfassung zu „Artificial Analysis Muse Spark 1.2“ mit Angabe des Intelligenzindex von 57, des Rangs, der Preise, der Bewertungskosten und eines Kontexts von einer Million Token
Unabhängige Modellbewertung. Artificial Analysis gibt einen Intelligenzindex von 57 an und bietet eine separate Überprüfung hinsichtlich Preis, Kontext, Modalitäten und Bewertungskosten. Quelle: Künstliche Analyse.

Muse Spark 1.2: Abwägung zwischen Preis und Datenschutz

Meta bietet zwei API-Modell-IDs mit erheblich unterschiedlichen Preisen an. Die günstigere Variante ist nicht nur ein Preisnachlass: Sie hat auch Auswirkungen darauf, wie die übermittelten Daten genutzt werden dürfen.

USD pro einer Million Token · 1M-Kontext

Standard · muse-spark-1.2

Wird nicht zur Produktverbesserung verwendet

Wird nicht zur Verbesserung von Meta-Produkten verwendet

Eingabe$1.25
Cache$0.15
Ausgabe$4.25
Mitwirkender · muse-spark-1.2-contributor

Günstiger, allerdings mit Einschränkungen beim Datenverbrauch

Daten können zur Verbesserung von Meta-Produkten verwendet werden

Eingabe$0.10
Cache$0.002
Ausgabe$0.20
Offizielle Meta-Preise, Stand: 7. August 2026. Die Datenschutzbedingungen variieren je nach Stufe.
Preistabelle für die Meta Muse Spark 1.2 Standard- und Contributor-API mit Modellkennungen und Nutzungsbedingungen für Daten
Offizielle Preise. Meta listet die IDs für das Standard- und das Contributor-Modell, die Token-Preise sowie die Bedingungen für die Datennutzung separat auf. Quelle: Seite zum Metamodell, abgerufen am 7. August 2026.

Die Preise für „Contributor“ sind bei Eingaben 12,5-mal günstiger, bei zwischengespeicherten Eingaben 75-mal günstiger und bei Ausgaben 21,25-mal günstiger als in der Standardstufe. Es gibt keinen einheitlichen Rabattprozentsatz, der für alle Token-Typen gleichermaßen gilt.

Ein Meta-Forscher bewarb die “Contributor”-Stufe als “bis zu 250-mal günstiger” als Fable und „150-mal günstiger“ als GPT-5.6 Sol. Das sozialer Vergleich basiert auf den „Contributor“-Preisen und nicht auf dem Standardmodell und sollte stets mit dem Hinweis auf die Datennutzung versehen sein. Leser, die die aktuellen Kosten von Wettbewerbern vergleichen möchten, können unsere separate GPT-5.6-Preisliste und Aufschlüsselung der Preise für den Code Claude.

Beitrag von Matt Deitke in den sozialen Medien zur Bewerbung der Preise für „Input“, „Cached-Input“ und „Output-Token“ der „Contributor“-Stufe von Muse Spark 1.2
Kontext der Einführungspreise. Ein Meta-Forscher hat den „Contributor“-Preisvergleich beworben; der Beitrag lässt die höheren Preise der Standardstufe außer Acht und muss vor dem Hintergrund des Kompromisses zwischen Datenverbrauch und Leistung gelesen werden. Quelle: Matt Deitke auf X.

Für öffentliche Repositorys, synthetische Aufgaben oder Einweg-Testumgebungen könnte die „Contributor“-Stufe attraktiv sein. Für privaten Code, Kundendaten, Anmeldedaten oder proprietäre Architekturen ist die Standardstufe die sicherere Standardwahl. Meta gibt außerdem bekannt, dass es nun damit beginnt, Anträge auf keine Datenspeicherung über den Vertrieb anzunehmen; dies ist ein separater Zugangsweg und unterscheidet sich von der standardmäßigen Self-Service-Einstellung.

Muse Spark 1.2: API-Zugriff und Beispiel

Meta-Model-API-Seite mit einer Beschreibung des direkten Self-Service-Zugriffs auf Muse Spark in der öffentlichen Vorschau
Offizieller API-Zugriff. Meta beschreibt den direkten Self-Service-Zugriff auf Muse Spark über die Meta Model API, die sich derzeit in der öffentlichen Vorschau befindet. Quelle: Meta-Model-API.

Drei offizielle Zugangswege

Terminal-AgentMuse Code Beta
Direkte APIMeta-Modell-API
AggregatorOpenRouter

Offizielle Basis-URL des Kochbuchs: https://api.meta.ai/v1 · 1.2 Anfrage in dieser Überprüfung: nicht ausgeführt

Die Meta-Modell-API unterstützt einen OpenAI-SDK-kompatiblen Workflow. Das offizielle Kochbuch von Meta verwendet die Basis-URL https://api.meta.ai/v1 und liest den Schlüssel aus MODEL_API_KEY. Auf der Produktseite wird zudem das „Search Grounding“ beschrieben, während das Kochbuch Themen wie Chat-Vervollständigungen, Streaming, den Aufruf von Tools, strukturierte Ausgaben, das Zwischenspeichern von Eingabeaufforderungen, Steuerelemente für Schlussfolgerungen, Bildverarbeitung, lange Kontexte, Wiederholungsversuche und Suchrezepte behandelt.

Beispiel aus einem offiziellen Kochbuch – erfasste Version: Die Das offizielle GitHub-Kochbuch wird nach wie vor verwendet muse-spark-1.1. Dies belegt die Client-Struktur und die Basis-URL, nicht jedoch, dass das Beispiel für Version 1.2 aktualisiert wurde.

import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.meta.ai/v1",
    api_key=os.environ["MODEL_API_KEY"],
)

response = client.chat.completions.create(
    model="muse-spark-1.1",
    messages=[{"role": "user", "content": "Hallo, Welt!"}],
)

print(response.choices[0].message.content)
GitHub-Cookbook zur Meta Model API mit der Basis-URL des OpenAI-SDK, dem Umgebungsschlüssel und einem vollständigen Beispiel für Chat-Vervollständigungen
Offizielles Kochbuch. Die erfasste README-Datei enthält das OpenAI-SDK-Muster und die Basis-URL, doch bei der Überprüfung wurde festgestellt, dass im Beispiel weiterhin Muse Spark 1.1 verwendet wurde. Quelle: Meta Model API-Handbuch.

Dokumentierte Anpassung – nicht ausgeführt: Meta listet separat auf muse-spark-1.2 als Standard-Modell-ID 1.2. Die nachstehende minimale Ersetzung kombiniert zwei offizielle Angaben, es wurde jedoch im Rahmen dieser Überprüfung keine kostenpflichtige Anfrage gesendet.

response = client.chat.completions.create(
    model="muse-spark-1.2",
    messages=[{"role": "user", "content": "Hallo, Welt!"}],
)

Muse Spark ist ein Schlussfolgerungsmodell, und Argument-Token werden als Ausgabe abgerechnet. Damit ist die Standard-Ausgaberate von $4,25 wichtiger, als es auf den ersten Blick scheint: Eine scheinbar kurze Antwort kann dennoch eine verborgene logische Struktur enthalten. Die tatsächliche Latenz, die Zeit bis zum ersten Token, die Wiederholungsrate und die Kosten pro Aufgabe bleiben hier ungemessen.

Meta-Entwicklerhandbuch zur Erläuterung der Abrechnung von Reasoning-Token bei Muse Spark und der Projektsteuerung bei Muse Code
Abrechnungsverhalten. Laut Meta werden die „Muse Spark“-Reasoning-Token als Output abgerechnet, während der „Muse Code“ /Aufwand Der Befehl ändert die Tiefe der Schlussfolgerung. Quelle: Meta-Entwicklerhandbuch.

Was Muse Code bietet

Offizielle Muse-Code-Beta-Seite mit dem Terminal-Codierungs-Agenten und dem Ein-Befehl-Installationsprogramm
Muse Code Beta. Meta stellt „Muse Code“ als Terminal-Agent für komplexe Programmier-Workflows vor und bietet ein Installationsprogramm, das mit einem einzigen Befehl ausgeführt werden kann. Quelle: Offizielle „Muse Code“-Seite.

Muse Code wird über das Terminal installiert und bindet Muse Spark 1.2 in einen Agent-Workflow ein. Metas Ein tiefer Einblick in die Welt der Entwickler beschreibt verschiedene Verhaltensweisen, die nicht zu einem reinen API-Aufruf gehören:

  • Parallele Agenten: Aufgaben können in isolierten Git-Worktrees ausgeführt werden.
  • Ereignisprotokoll, das nur am Ende ergänzt wird: Sitzungen und Aktionen werden zu Prüfungs- und Wiedergabezwecken in eine lokale JSONL-Datei geschrieben.
  • Lebenslauf-Ablauf: Lebenslauf von Muse unterbrochene Sitzungen fortsetzen können.
  • Prüfung der Argumentation: das /Aufwand Der Befehl passt die Stärke der Argumentation an.
  • Konkrete Fähigkeiten: Meta-Bezeichnungen /Geschmack, /Grillen, /Grill-mit-Anleitungen, und /plan.

Produktmerkmale des Agenten

Parallelität

Untervertreter

Unabhängige Aufgaben können sich verzweigen.

Isolation

Arbeitsbäume

Die Zweige bleiben während der parallelen Arbeit voneinander getrennt.

Prüfung

JSONL-Protokoll

Lokale Ereignisse, die nur angehängt werden können, unterstützen die Wiedergabe.

Erholung

Lebenslauf

Lebenslauf von Muse setzt unterbrochene Sitzungen fort.

Explizite Werkzeuge

Fertigkeiten

/Geschmack, /Grillen, /Grill-mit-Anleitungen, /plan.

Dank dieser Funktionen ist Muse Code für den breiteren Markt für Programmieragenten von Bedeutung, auf dem neben der Modellintelligenz auch Planung, Isolation, Wiedergabe und Tool-Disziplin eine wichtige Rolle spielen. Die Leitfaden: OpenClaw vs. Claude Code vs. OpenCode bietet nützliche Hintergründe für diese Unterschiede auf Produktebene.

Behauptungen zum Start und erste Reaktionen der Community

Eine Reaktion ist keine Bestätigung

Rahmung der offiziellen Markteinführung

Ausbildung + langfristige Perspektive

Mehr Programmierleistung, Vielfalt der Umgebungen, Co-Training und ein Stresstest mit über 1.000 Tool-Aufrufen.

Eine positive Anekdote

Preis und OpenCode

Ein einzelner Reddit-Nutzer lobte seine frühen Erfahrungen mit dem Programmieren und deren Nutzen.

Offene Fragen

Datenschutz + Zuverlässigkeit

Andere Nutzer äußerten Bedenken hinsichtlich des Datenverbrauchs, des Standardpreises, der Verfügbarkeit und der anfänglichen Zuverlässigkeit.

Laut der KI-Abteilung von Meta erhielt Muse Spark 1.2 mehr Rechenleistung für das Programmiertraining, vielfältigere Umgebungen, einen stärkeren Fokus auf die Generierung und Fehlerbehebung ganzer Repositorys sowie ein gemeinsames Training mit Muse Code. Ein separates Start-Thread beschreibt einen bis zu 24 Stunden dauernden Stresstest mit mehr als 1.000 Tool-Aufrufen auf NVIDIA-Hopper-GPUs.

Beitrag von AI at Meta, in dem die Programmierschulung mit Muse Spark 1.2, das Debugging, die Generierung ganzer Repositorys und das Co-Training mit Muse Code beschrieben werden
Rahmung für die offizielle Markteinführung. Laut der KI-Abteilung bei Meta erhielt das Modell mehr Rechenleistung für Programmieraufgaben, umfassendere Umgebungen und ein gemeinsames Training mit Muse Code. Quelle: AI at Meta auf X.
Ein Beitrag von „AI at Meta“, in dem ein Muse-Code-Stresstest mit mehr als tausend Tool-Aufrufen über einen Zeitraum von bis zu vierundzwanzig Stunden beschrieben wird
Demonstration mit langfristigem Zeithorizont. Meta präsentierte einen GPU-Kernel-Stresstest mit mehr als 1.000 Tool-Aufrufen; dabei handelt es sich nicht um eine allgemeine Zuverlässigkeitsrate der Tools. Quelle: AI at Meta auf X.

Das ist zwar eine beeindruckende Demonstration, stellt jedoch keine gemessene allgemeine Erfolgsquote dar. Sie gibt keinen Aufschluss darüber, wie oft der Agent das richtige Werkzeug ausgewählt, Fehler behoben, doppelte Aufrufe vermieden oder eine normale Repository-Aufgabe ohne Eingriffe abgeschlossen hat.

Die ersten Beiträge auf Reddit sind ebenfalls gemischt. Einer Ein Nutzer von r/opencode berichtete von einer positiven Erfahrung mit OpenCode und lobte den Preis. Ein separater Diskussion zur Preisgestaltung für Mitwirkende Es wurden Fragen zur gestiegenen Datennutzung, zu den Kosten der Standardstufe sowie zur Verfügbarkeit und Zuverlässigkeit aufgeworfen. Dabei handelt es sich um individuelle Reaktionen, nicht um einen Konsens der Community.

Ein Reddit-Nutzer berichtet in „OpenCode“ von seinen ersten positiven Erfahrungen mit der Programmierung des Muse Spark 1.2 und dem günstigen Preis
Ein erster Erfahrungsbericht eines Nutzers. Ein Reddit-Nutzer lobte die Programmiererfahrung und den Preis bei OpenCode; dies ist jedoch nur eine Anekdote und kein allgemeiner Konsens. Quelle: r/opencode.
Reddit-Diskussion, in der die Standard- und Contributor-Preise von Muse Spark 1.2 verglichen werden und Bedenken hinsichtlich der Datenweitergabe geäußert werden
Datenschutz und Wertreaktion. In dieser Community-Diskussion geht das Interesse am „Contributor“-Preis mit Bedenken hinsichtlich der Datennutzung, der Verfügbarkeit und der Kosten der Standard-Stufe einher. Quelle: r/opencodeCLI.

Muse Spark 1.2 Programmiertests: 3 von 3 Aufgaben bestanden

In unseren Tests führte das Basismodell „Muse Spark 1.2“ drei kontrollierte Programmieraufgaben über eine OpenAI-kompatible API zur Vervollständigung von Chat-Beiträgen aus. Für jede Aufgabe gab es einen Versuch, ohne Wiederholungsversuche und ohne manuelle Steuerung. Wir haben die in temporären Repositorys zurückgegebenen Dateien anhand öffentlicher und versteckter Prüfkriterien ausgewertet. Die Ausführung des Muse-Code-Agenten wurde nicht getestet, ebenso wenig wie die Zuverlässigkeit der Tool-Aufrufe; daher sollten diese Ergebnisse nicht als Benchmark für den Agenten gewertet werden.

Ergebnis nach einem Versuch

Aufgaben3/33 von 3 Programmieraufgaben bestanden
Durchschnittliche Latenz12,98 s12,98 Sekunden pro Aufgabe
Verwendung12,100Insgesamt 12.100 Token
Ausgewiesene Kosten$0.045362Drei Model-Calls

Die Antworten umfassten 6.618 Argumentations-Token. Alle drei Schlussfolgerungsgründe lauteten Stopp, und im Feld „Anbieter“ wurde „Meta“ angegeben.

Test 1: Behebung eines Fehlers bezüglich der Idempotenz in Python — Bestanden

Aufgabe

Verhindern Sie doppelte Überweisungen, ohne die öffentliche API zu ändern

Das Modell identifizierte die fehlende Schutzmaßnahme für die Request-ID, fügte die kleinste sichere Korrektur hinzu und stellte einen Regressionstest bereit, wobei die atomaren Bilanzaktualisierungen beibehalten wurden.

BESTANDEN · 6 Prüfungen
Latenz12,064 s
Token2,867
Begründung1,621
Kosten$0.01072675

Der ursprüngliche versteckte Auswerter verlangte fälschlicherweise einen doppelten Aufruf, um einen Wert zurückzugeben. Falsch, obwohl die Aufgabe lediglich vorsah, dass dem Absender keine doppelte Gebühr berechnet werden darf. Nachdem wir diese erfundene Anforderung an den Rückgabewert korrigiert hatten, bestand die unveränderte erste Antwort alle sechs Tests. Wir haben weder einen erneuten Versuch unternommen noch die Modellausgabe bearbeitet.

Test 2: Refactoring mehrerer TypeScript-Dateien — Bestanden

Aufgabe

Getrennte Validierung, Persistenz und Protokollierung von Prüfvorgängen

Die zurückgegebenen Dateien behielten den öffentlichen Routenvertrag, striktes TypeScript und die einzige Transaktion bei, die sowohl Auftrags- als auch Audit-Schreibvorgänge abdeckt. Zudem wurden gezielte Validierungstests ohne Laufzeitabhängigkeit hinzugefügt.

ÜberprüfungPASSTypüberprüfung, öffentliche Verträge, Überprüfung auf verdeckte Transaktionen und zusätzliche Validierungstests
13,909 s5.011 Token2.770 Argumentationen$0.01833275

Der erste Bewerter verglich Objekte mit Rohdaten JSON.stringify, sodass gleichwertige Objekte mit unterschiedlicher Reihenfolge der Schlüsseleinfügung als ungleich erschienen; unter Windows npx Auch der Startvorgang schlug vor der Typprüfung fehl. Mit einem reihenfolgeunabhängigen Vergleichsoperator und einem Windows-sicheren Befehlsaufruf bestand die ursprüngliche Antwort alle Prüfungen. Auch hier erfolgte kein modellbasierter Wiederholungsversuch.

Test 3: JSONL-Repository-Funktion – Bestanden

Anweisungen für das gesamte Repository befolgen

JSONL hinzufügen, ohne die CSV-Datei zu beschädigen

Das Modell umfasste die Erkennung von Erweiterungen, Fehlermeldungen bei fehlerhaften Zeilen (beginnend bei 1), atomare Ausgabe, Sicherheit bei Trockenläufen, gezielte Tests, Hilfetext sowie ein README-Beispiel.

Ergebnis9/9Tests bestanden
Latenz12,976 serster Versuch
4.222 Token2.227 Argumentationen$0.0163025

Was die Tests zeigen: Muse Spark 1.2 kann in einem einzigen Durchlauf brauchbare Patches für mehrere Dateien liefern, Kompatibilitätsbeschränkungen berücksichtigen, Tests hinzufügen und eine überschaubare, repositoryweite Funktion bearbeiten. Die durchschnittlichen gemeldeten Kosten beliefen sich auf etwa $0,0151 pro Aufgabe, doch handelte es sich hierbei um kleine Testfälle, die nicht zur Prognose der Kosten für eine große Codebasis herangezogen werden sollten.

Für wen ist Muse Spark 1.2 geeignet?

Entscheidungshilfe

Jetzt ausprobieren

Kontrollierte Bewertung

Öffentlicher oder synthetischer Code, messbare Aufgaben, Anforderungen an große Kontexte und ein vielversprechendes 3/3-Ergebnis des Basismodells.

Warte

Nachweis des Maklers erforderlich

Das Verhalten von Muse Code, stabile Ratenbegrenzungen, wiederholte Tool-Aufrufe oder umfassende Repository-Benchmarks sind Entscheidungskriterien.

Zuerst vergleichen

Sensible Programmierung oder hohe Leistung

Verwenden Sie die Standardstufe oder vergleichen Sie Alternativen, wenn Datenschutz und die Kosten für Reasoning-Token im Vordergrund stehen.

Verwenden Sie das Standardmodell für sensiblen Code, es sei denn, Ihre Organisation hat die Bedingungen für Mitwirkende gesondert genehmigt. Falls sich durch den Standardausgabepreis die Wertberechnung ändert, vergleichen Sie diese mit den aktuellen Codex-Preise, den Claude-Code und die Kosten für andere Kodierungsbeauftragte, bevor Sie sich für einen Arbeitsablauf entscheiden.

Fazit zum Testbericht zu Muse Spark 1.2

Muse Spark 1.2 hat sich einen Platz auf der Auswahlliste der Bewertung gesichert, was jedoch keine automatische Empfehlung für den Einsatz in der Produktion bedeutet. Der Kontext des 1M-Tokens, die vertraute API-Struktur, die günstigen Preise für Mitwirkende, drei Programmierdurchläufe beim ersten Versuch und die hervorragenden Ergebnisse bei den Meta-Run-Muse-Code-Tests machen es schwer, dieses Projekt zu ignorieren. Außerdem hat Meta die Details zur Methodik besser offengelegt als viele andere Projekte bei ihrer Einführung.

Die Einschränkungen sind ebenso konkret. Die Preise für Mitwirkende gehen mit einem Kompromiss hinsichtlich der Datennutzung einher. Standard-Ausgabe- und Schlussfolgerungstoken können die tatsächlichen Kosten in die Höhe treiben. Die Spitzenwerte von Meta im Bereich der Programmierung konnten nicht als übereinstimmende Einträge auf den öffentlichen Boards von Terminal-Bench oder DeepSWE reproduziert werden, und unser Praxistest umfasst drei Aufgaben für Basismodelle anstelle der Ausführung von Muse-Code-Agenten.

Der sinnvolle Ansatz ist ein kontrollierter Test mit nicht sensiblen Code, bei dem die Rohdaten zur Nutzung und die lokale Überprüfung gespeichert werden. Betrachten Sie die gemessenen Kosten und die Latenz als Beispiel für kleine Aufgaben und testen Sie anschließend die Größe Ihres eigenen Repositorys, die Fehlerbehebung und den Agent-Workflow, bevor Sie sich für den Einsatz in der Produktion entscheiden.

Muse Spark 1.2 – Häufig gestellte Fragen

Was ist Muse Spark 1.2?

Muse Spark 1.2 ist das auf Programmierung ausgerichtete Modell von Meta, das am 5. August 2026 eingeführt wurde. Es verfügt über ein Kontextfenster von 1 Million Token und ist über Muse Code, die Meta Model API und OpenRouter zugänglich.

Ist Muse Spark 1.2 dasselbe wie Muse Code?

Nein. „Muse Spark 1.2“ ist das Modell; „Muse Code“ ist ein separater Beta-Terminal-Agent, der darauf basiert. „Muse Code“ bietet zusätzliche Produktfunktionen wie Subagenten, isolierte Git-Worktrees, Ereignisprotokollierung, Wiederaufnahme und gebündelte Skills.

Wie viel kostet die Muse Spark 1.2 API?

Das Standardmodell kostet $1,25 für den Input, $0,15 für den zwischengespeicherten Input und $4,25 für den Output pro Million Token. Das Contributor-Modell kostet $0,10 Eingabe, $0,002 zwischengespeicherte Eingabe und $0,20 Ausgabe.

Verwendet Meta Daten der Muse Spark-API für das Training?

Meta gibt an, dass Daten der Standardstufe nicht zur Verbesserung von Meta-Produkten verwendet werden. Daten der Contributor-Stufe können zur Verbesserung von Meta-Produkten verwendet werden; daher sollte privater oder proprietärer Code den Standardweg nutzen, sofern eine Organisation nichts anderes genehmigt.

Ist Muse Spark 1.2 in den öffentlichen Ranglisten von Terminal-Bench oder DeepSWE vertreten?

Bei einer Überprüfung am 7. August 2026 war es auf keiner der beiden öffentlichen Plattformen gelistet. Meta meldet 82,91 TP40T auf Terminal-Bench 2.1 mit Muse Code und 59,31 TP40T auf DeepSWE, doch dabei handelt es sich um von Meta ermittelte Ergebnisse.

Wurde Muse Spark 1.2 im Rahmen dieses Testberichts in der Praxis getestet?

Ja. In drei Tests mit dem Basismodell, bei denen jeweils nur ein Versuch unternommen wurde, hat Muse Spark 1.2 eine Python-Fehlerbehebung, eine TypeScript-Umgestaltung und eine JSONL-Repository-Funktion erfolgreich durchgeführt. Die durchschnittliche Latenz betrug 12,98 Sekunden und die gemeldeten Gesamtkosten beliefen sich auf $0,045362. Die Zuverlässigkeit des Muse Code-Agenten und der Tool-Aufrufe wurde nicht getestet.

Wie können Entwickler auf Muse Spark 1.2 zugreifen?

Meta nennt drei Möglichkeiten: den „Muse Code Beta Terminal Agent“, die „Meta Model API“ und „OpenRouter“. Im offiziellen Kochbuch wird ein OpenAI-SDK-kompatibler Client mit der Basis-URL https://api.meta.ai/v1 verwendet.

Teilen Sie den Beitrag:

Verwandte Beiträge