Análisis de Muse Spark 1.2: pruebas de rendimiento, API, precios y pruebas de programación

Reseña de Muse Spark 1.2

Muse Spark 1.2 combina un precio por token excepcionalmente bajo con una ventana de contexto de 1 millón de tokens, y superó las tres tareas de codificación del modelo base en nuestro conjunto de pruebas de API de primer intento. Meta lanzó el modelo el 5 de agosto de 2026, con una ventana de contexto de 1 millón de tokens, dos niveles de precios de la API y un agente de terminal independiente llamado Muse Code. Los resultados de las pruebas de rendimiento de Meta son prometedores; las clasificaciones públicas independientes de programación aún no han verificado las mismas combinaciones de modelo y agente.

Esta revisión distingue entre el modelo y el agente, entre las puntuaciones oficiales y las pruebas independientes, y entre los precios estándar y la relación entre uso de datos y nivel de colaborador. En nuestras pruebas, el modelo completó una corrección de idempotencia en Python, una refactorización de TypeScript que preservaba la compatibilidad y una función JSONL en todo el repositorio sin necesidad de reintentos. No se probó la ejecución del agente de Muse Code ni la fiabilidad de las llamadas a las herramientas. Si primero quieres comparar el panorama general, nuestra guía sobre el mejores modelos de IA para codificación ofrece una visión más amplia del contexto competitivo.

Chispa de inspiración en GlobalGPT

Reseña de Muse Spark 1.2: Respuesta rápida

Comunicado de Meta Research titulado «Presentación de Muse Code y Muse Spark 1.2», con fecha del 5 de agosto de 2026
Lanzamiento oficial. Meta anunció Muse Code y Muse Spark 1.2 el 5 de agosto de 2026. Fuente: Meta Research.

En resumen: Muse Spark 1.2 es un modelo de Meta centrado en la programación que cuenta con una ventana de 1 millón de tokens, acceso a una API compatible con el SDK OpenAI y un nivel «Contributor» que llama la atención. Su principal ventaja pública es la relación calidad-precio: $0,10 de entrada y $0,20 de salida por cada millón de tokens en el modelo «Contributor». Este nivel puede utilizarse para mejorar los productos de Meta, mientras que el modelo estándar, más caro, no se utiliza para ese fin.

Los datos de rendimiento deben interpretarse con mayor cautela. Meta informa de un resultado de 82,91 TP40T en Terminal-Bench 2.1 para Muse Spark 1.2 con Muse Code y de 59,31 TP40T en DeepSWE. Se trata de resultados obtenidos por Meta. Las tablas públicas de Terminal-Bench y DeepSWE aún no incluían Muse Spark 1.2 cuando se consultaron el 26 de agosto de 2026. Análisis artificial ofrece una verificación independiente: su Índice de Inteligencia se mantiene en 57, por encima de la mediana de los modelos comparables, que es de 35.

  • La mejor razón para probarlo ahora: Precios reducidos para colaboradores, un contexto amplio y una API que sigue el conocido patrón de cliente OpenAI.
  • La mejor razón para mantener la cautela: Las tres tareas controladas del modelo básico no permiten determinar la fiabilidad del agente Muse Code, la calidad de las llamadas a las herramientas ni el rendimiento en un repositorio de producción de gran tamaño.
  • Opción importante relativa a la privacidad: Utiliza el modelo estándar para el código o las indicaciones que no desees que se utilicen para mejorar los productos de Meta.

Muse Spark 1.2 de un vistazo

Especificaciones verificadas

DesarrolladorMetaLanzado el 5 de agosto de 2026
Contexto1M1 millón de tokens
Enfoque principalProgramación + herramientasTrabajo con el repositorio y depuración
Estado de la prueba práctica3 de 3 tareas superadasUn intento por tarea
muse-spark-1.2 muse-spark-1.2-colaborador Código Muse API del metamodelo OpenRouter Compatible con el SDK OpenAI Entrada de texto e imagen; salida de texto

Meta describe Muse Spark 1.2 como un modelo con una mayor precisión en la programación desde el primer intento y una selección de herramientas más fiable que Muse Spark 1.1. Se trata de afirmaciones del proveedor procedentes del página oficial del modelo Muse Spark, y no conclusiones extraídas de nuestra propia sesión de codificación.

Muse Spark 1.2 frente a Muse Code

Muse Spark 1.2 es el modelo. Muse Code es un agente de terminal en fase beta independiente que funciona con ese modelo. Esta distinción es importante porque un agente puede incorporar funciones de planificación, coordinación de herramientas, navegación por el repositorio, aislamiento del árbol de trabajo, registro de eventos y comportamiento de reintentos en torno al modelo subyacente.

Mantén las capas separadas

El modelo

Muse Spark 1.2

Contexto, razonamiento, comportamiento de la API, facturación de tokens, resultados y decisiones sobre las llamadas a herramientas.

Números de identificación de los modelosContexto 1MPrecios API

El agente beta

Código Muse

Experiencia de usuario en la terminal, subagentes, árboles de trabajo de Git, registro de eventos, reanudación del flujo, habilidades agrupadas y orquestación.

Flujo de trabajo de los agentesResultados del sistema Meta-run

Página del modelo Meta Muse Spark 1.2, en la que se muestra su enfoque en la programación y su ventana de contexto de un millón de tokens
Resumen oficial de los modelos. Meta presenta Muse Spark 1.2, diseñado para flujos de trabajo de programación, con una ventana de contexto de 1 millón de tokens y una mayor fiabilidad en la ejecución de herramientas. Fuente: Página del metamodelo.

En página oficial de Muse Code denomina al producto «agente de codificación beta». Esto hace que las comparaciones con productos como Claude Code y Codex resulten más útiles que dar por sentado que todas las diferencias observadas en el flujo de trabajo se deben únicamente a una simple llamada al modelo. Nuestro Comparación entre el código «Codex» y el código «Claude» explica por qué el entorno puede influir en la experiencia del desarrollador tanto como el modelo.

Pruebas de rendimiento de Muse Spark 1.2: lo que realmente revelan las puntuaciones

Gráficos de referencia de Meta para Muse Spark 1.2 en Terminal-Bench, DeepSWE, programación interna y GDPVal-AA versión dos
Datos comparativos proporcionados por los propios proveedores. Meta ha publicado cuatro paneles de resultados de pruebas de rendimiento de Muse Spark 1.2; es necesario consultar el arnés y el emparejamiento de agentes junto con cada puntuación. Fuente: Página del metamodelo.

El gráfico comparativo de Meta sitúa a Muse Spark 1.2 cerca de los primeros puestos en varias evaluaciones de programación. Merece la pena analizar las cifras, pero no constituyen una clasificación única y clara de la calidad bruta del modelo. El modelo, el agente, el conjunto de pruebas, la capacidad de razonamiento y el protocolo de la tarea pueden variar todos a la vez.

Meta-reported Terminal-Bench 2.1

Panel de referencia de Meta

Terminal-Bench 2.1

Las 89 tareas · superadas en el primer intento tras cinco intentos · combinaciones seleccionadas de modelo y agente

Resultado del código Muse de Meta-run No es una entrada verificada en la clasificación pública
Código Opus 5 max + Claude86.7%
Muse Spark 1.2 + Muse Code82.9%
GPT-5.6 Terra max + Codex81.8%
Grok de 4,5 de altura + Grok Build81.6%
Gemini 3.6 Flash alto + CLI antigravedad78.9%
Muse Spark 1.1 + mini-swe-agent76.2%
Fuente: Página del modelo Muse Spark 1.2 de Meta y metodología de evaluación. Se trata de combinaciones de modelos y agentes gestionadas por los proveedores.

La cifra 82,9% es un Resultado del código Muse de Meta-run. El Clasificación pública de Terminal-Bench 2.1 no incluyó Muse Spark 1.2 en la lista del 26 de agosto de 2026, por lo que es No es una entrada verificada en la clasificación pública. La tabla pública sí que incluía el Muse Spark 1.1 con mini-SWE-agent en 76,21 TP40T ±1,21 TP40T.

Clasificación pública completa de Terminal-Bench 2.1, consultada el 7 de agosto de 2026, con las diecisiete entradas visibles
Verificación independiente. La lista completa y pública de la placa Terminal-Bench 2.1 no incluía Muse Spark 1.2 cuando se consultó el 7 de agosto de 2026. Fuente: Terminal-Bench.

DeepSWE 1.1, según se recoge en Meta

Panel de referencia de Meta

DeepSWE 1.1

113 tareas · 91 repositorios · cinco idiomas · pass@1 tras cinco intentos

Obra n.º 565.0%
GPT-5.6 Terra64.8%
Muse Spark 1.259.3%Metarredactado
Grok 4,556.6%
Muse Spark 1.153.0%
Gemini 3,6 Flash40.0%

En Clasificación pública de DeepSWE v1.1 Utiliza mini-swe-agent en todos los modelos de su lista para garantizar la coherencia. En el momento de la comprobación, aún no había añadido el Muse Spark 1.2; el Muse Spark 1.1 figuraba con un valor de 53%. El resultado de Meta, 59,3%, utiliza Muse Code, por lo que las dos cifras no son idénticas en cuanto al banco de pruebas.

Clasificación pública completa de DeepSWE, versión 1.1, actualizada el 6 de agosto de 2026, que incluye gráfico, tabla y nota sobre la coherencia
Verificación independiente. DeepSWE utilizó mini-swe-agent para todos los modelos enumerados y aún no incluía Muse Spark 1.2. Fuente: DeepSWE v1.1.

Las evaluaciones internas y de agentes generales de Meta

Dos escalas de evaluación diferentes

Banco de codificación interno de Meta

440 tareas internas · dos intentos por tarea

ModeloPuntuación
Obra n.º 579.4%
Muse Spark 1.270.6%
GPT-5.6 Terra65.4%
Gemini 3,6 Flash63.9%
Grok 4,5No se muestra

GDPVal-AA v2

Evaluación general de tareas agentales · Valores al estilo Elo

ModeloPuntuación
Obra n.º 51852
Muse Spark 1.21631
GPT-5.6 Terra1577
Grok 4,51526
Gemini 3,6 Flash1423

Meta’s metodología de evaluación Según la información facilitada, Terminal-Bench utiliza las 89 tareas y obtiene un «pass@1» en cinco intentos. DeepSWE abarca 113 tareas repartidas en 91 repositorios y cinco lenguajes, y también obtiene un «pass@1» en cinco intentos. Meta también señala que es posible que su configuración no esté optimizada para modelos de terceros. Para ver una comparación actual con la competencia basada en decisiones reales sobre productos, consulta Claude Opus 5 contra GPT-5.6.

La metodología cambia el significado

Meta Terminal-Bench

Modelo + agente seleccionado

89 tareas, cinco intentos, los parámetros máximos de razonamiento varían, y es posible que el entorno de pruebas de Meta no esté ajustado de la misma manera para los sistemas de terceros.

Banco de la terminal pública

Entradas verificadas

Al comprobarlo, se constató que faltaba el Muse Spark 1.2. Las configuraciones de la placa y el estado de verificación deben consultarse por separado en la tabla de Meta.

DeepSWE público

Agente «mini-swe» común

113 tareas repartidas en 91 repositorios y cinco idiomas. Muse Spark 1.2 no aparecía; Muse Spark 1.1 figuraba con 53%.

Página uno de la metodología de evaluación de Meta Muse Spark 1.2 y Muse Code con emparejamientos de agentes y ajustes de razonamiento
Evidencia metodológica. Meta combina diferentes modelos con distintos agentes y configuraciones de razonamiento, por lo que el gráfico de proveedores no es una clasificación basada únicamente en los modelos sin procesar. Fuente: PDF sobre la metodología de Meta.

Análisis artificial: un contexto independiente y útil

En Página del modelo de análisis artificial otorga a Muse Spark 1.2 un índice de inteligencia de 57, por encima de la mediana de los modelos comparables, que era de 35 según los datos consultados el 26 de agosto de 2026. Su conjunto de pruebas registra 80% en Terminal-Bench v2.1, 57% normalizados en GDPVal-AA v2, 56% en SciCode y 83% en la evaluación de contexto largo AA-LCR.

Desviación de la versión del análisis artificial

Índice de inteligencia54 → 57Se ha modificado la versión o el resultado de la evaluación
GDPVal Elo1371 → 1631Valor de corriente más alto
Terminal-Bench78% → 80%Resultado del arnés AA con mayor intensidad de corriente
Coste por tarea$0,29 → $0,40Un mayor uso de los tokens aumentó el coste
Índice de alucinaciones38% → 28%A la baja, junto con un aumento de la abstención
Índice de intentos82% → 67%El modelo intentó responder a menos preguntas
Fuente: Página del modelo de análisis artificial y análisis de lanzamiento. No se deben mezclar los valores iniciales y los actuales como si procedieran de una única evaluación sin modificaciones.

La lección práctica es sencilla: Muse Spark 1.2 parece competitivo, pero ninguna puntuación por sí sola permite evaluar el modelo de forma aislada. Considera el gráfico de Meta como una prueba del sistema Muse Code, las clasificaciones públicas como una verificación cruzada independiente y Artificial Analysis como una evaluación independiente, aunque configurada de forma diferente.

Resumen de Artificial Analysis Muse Spark 1.2, en el que se muestran el índice de inteligencia 57, la clasificación, los precios, el coste de evaluación y un contexto de un millón de tokens
Evaluación independiente del modelo. Artificial Analysis indica un índice de inteligencia de 57 y ofrece un análisis independiente del precio, el contexto, las modalidades y el coste de la evaluación. Fuente: Análisis Artificial.

Muse Spark 1.2: Precios y compensaciones en materia de privacidad

Meta ofrece dos identificadores de modelo de API con precios muy diferentes. La opción más económica no es simplemente un descuento: cambia la forma en que se pueden utilizar los datos enviados.

USD por cada millón de tokens · Contexto de 1M

Estándar · muse-spark-1.2

No se utiliza para la mejora del producto

No se utiliza para mejorar los productos de Meta

Entrada$1.25
Caché$0.15
Salida$4.25
Colaborador · muse-spark-1.2-contributor

Más barato, pero con una limitación en el uso de datos

Datos puede utilizarse para mejorar los productos de Meta

Entrada$0.10
Caché$0.002
Salida$0.20
Precios oficiales de Meta consultados el 7 de agosto de 2026. Las condiciones de privacidad varían según el nivel.
Tabla de precios de la API estándar y de colaborador de Meta Muse Spark 1.2, con identificadores de modelos y condiciones de uso de datos
Precios oficiales. Meta recoge por separado los identificadores de los modelos estándar y de colaborador, los precios de los tokens y las condiciones de uso de los datos. Fuente: Página del metamodelo, consultado el 7 de agosto de 2026.

El precio del plan «Contributor» es 12,5 veces más barato para las entradas, 75 veces más barato para las entradas en caché y 21,25 veces más barato para las salidas que el plan estándar. No existe un único porcentaje de descuento que describa con precisión todos los tipos de tokens.

Un investigador de Meta promocionó el nivel “Contributor” como “hasta 250 veces más barato” que Fable y «150 veces más barato» que GPT-5.6 Sol. Eso comparación social utiliza los precios para colaboradores, no el modelo estándar, y siempre debe incluir la salvedad relativa al uso de datos. Los lectores que deseen comparar los costes actuales de la competencia pueden consultar nuestra sección separada Guía de precios de GPT-5.6 y Desglose de precios del código Claude.

Publicación de Matt Deitke en redes sociales en la que promociona los precios de los tokens de entrada, entrada en caché y salida del nivel «Contributor» de Muse Spark 1.2
Contexto de los precios de lanzamiento. Un investigador de Meta ha promocionado la comparación de precios del plan «Contributor»; la publicación no muestra los precios más elevados del plan estándar y debe interpretarse teniendo en cuenta la relación entre el uso de datos y el coste. Fuente: Matt Deitke en X.

En el caso de repositorios públicos, tareas sintéticas o entornos de evaluación desechables, el nivel «Contributor» puede resultar atractivo. Para código privado, datos de clientes, credenciales o arquitectura propia, el nivel «Standard» es la opción predeterminada más segura. Meta también afirma que está empezando a aceptar solicitudes de retención cero de datos a través del departamento de ventas, lo que constituye una vía de acceso independiente, distinta de la configuración predeterminada de autoservicio.

Acceso a la API de Muse Spark 1.2 y ejemplo

Página de la API de Meta Model que describe el acceso directo y autónomo a Muse Spark en versión preliminar pública
Acceso oficial a la API. Meta describe el acceso directo y autónomo a Muse Spark a través de la API de Meta Model, que se encuentra en fase de vista previa pública. Fuente: API de Meta Model.

Tres vías de acceso oficiales

Agente de terminalMuse Code beta
API directaAPI del metamodelo
AgregadorOpenRouter

URL oficial del libro de recetas: https://api.meta.ai/v1 · 1.2 Solicitud en esta revisión: no ejecutada

En API del metamodelo es compatible con un flujo de trabajo compatible con el SDK OpenAI. El manual oficial de Meta utiliza la URL base https://api.meta.ai/v1 y lee la clave desde MODEL_API_KEY. La página del producto también describe la «search grounding», mientras que el manual de recetas aborda la autocompletación en el chat, la transmisión en tiempo real, la invocación de herramientas, la salida estructurada, el almacenamiento en caché de las indicaciones, los controles de razonamiento, la visión, el contexto extenso, los reintentos y las recetas de búsqueda.

Ejemplo de libro de recetas oficial — versión capturada: En Libro de recetas oficial de GitHub sigue utilizando muse-spark-1.1. Esto demuestra la estructura del cliente y la URL base, no que el ejemplo se haya actualizado para la versión 1.2.

import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.meta.ai/v1",
    api_key=os.environ["MODEL_API_KEY"],
)

response = client.chat.completions.create(
    model="muse-spark-1.1",
    messages=[{"role": "user", "content": "¡Hola, mundo!"}],
)

print(response.choices[0].message.content)
Guía práctica de la API de Meta Model en GitHub que muestra la URL base del SDK OpenAI, la clave de entorno y un ejemplo completo de autocompletado en el chat
Libro de recetas oficial. El archivo README capturado muestra el patrón del SDK OpenAI y la URL base, pero, al comprobarlo, su ejemplo seguía utilizando Muse Spark 1.1. Fuente: Manual de uso de la API de Meta Model.

Adaptación documentada — no ejecutada: Meta los enumera por separado muse-spark-1.2 como el ID del modelo estándar 1.2. La sustitución mínima que figura a continuación combina dos datos oficiales, pero no se envió ninguna solicitud de pago durante esta revisión.

respuesta = client.chat.completions.create(
    model="muse-spark-1.2",
    mensajes=[{"rol": "usuario", "contenido": "¡Hola, mundo!"}],
)

Muse Spark es un modelo de razonamiento, y Los tokens de razonamiento se facturan como salida. Esto hace que la tasa de salida estándar $4.25 sea más importante de lo que parece a primera vista: una respuesta aparentemente breve puede ocultar un razonamiento sustancial. La latencia real, el tiempo hasta el primer token, la tasa de reintentos y el coste por tarea siguen sin medirse en este caso.

Guía para desarrolladores de Meta en la que se explica la facturación por tokens de razonamiento de Muse Spark y el control de esfuerzos de Muse Code
Comportamiento de facturación. Meta afirma que los tokens de razonamiento de Muse Spark se facturan como «output», mientras que el Muse Code /esfuerzo El comando modifica la profundidad del razonamiento. Fuente: Guía para desarrolladores de Meta.

Qué aporta Muse Code

Página oficial de la versión beta de Muse Code, en la que se muestra el agente de codificación de terminal y su instalador de un solo comando
Muse Code beta. Meta presenta Muse Code como un agente de terminal para flujos de trabajo de programación complejos y ofrece un instalador que se ejecuta con un solo comando. Fuente: página oficial de Muse Code.

Muse Code se instala desde el terminal e integra Muse Spark 1.2 en un flujo de trabajo de agente. Meta’s Análisis en profundidad para desarrolladores describe varios comportamientos que no forman parte de una llamada a la API sin más:

  • Agentes paralelos: Las tareas pueden ejecutarse en árboles de trabajo de Git aislados.
  • Registro de eventos de solo adición: Las sesiones y las acciones se guardan en un archivo JSONL local con fines de auditoría y reproducción.
  • Reanudar el proceso: currículum de Muse puede reanudar las sesiones interrumpidas.
  • Control del razonamiento: el /esfuerzo Este comando ajusta la intensidad del razonamiento.
  • Competencias explícitas: Nombres de Meta /sabor, /a la parrilla, /parrilla-con-documentación, y /plan.

Características del producto «Agent»

Paralelismo

Subagentes

Las tareas independientes pueden ramificarse.

Aislamiento

Árboles de trabajo

Las ramas permanecen separadas durante el trabajo en paralelo.

Auditoría

Registro JSONL

Los eventos locales de solo adición admiten la reproducción.

Recuperación

Currículum

currículum de Muse continúa con las sesiones interrumpidas.

Herramientas explícitas

Habilidades

/sabor, /a la parrilla, /parrilla-con-documentación, /plan.

Ese conjunto de características hace que Muse Code sea relevante para el mercado más amplio de los agentes de programación, en el que la planificación, el aislamiento, la reproducción y la disciplina en el uso de herramientas son tan importantes como la inteligencia de los modelos. El Guía comparativa entre OpenClaw, Claude, Code y OpenCode es un contexto útil para comprender esas diferencias a nivel de producto.

Afirmaciones sobre el lanzamiento y primeras reacciones de la comunidad

Una reacción no es una validación

Enmarcado para el lanzamiento oficial

Formación + perspectiva a largo plazo

Más recursos de programación, diversidad de entornos, formación conjunta y una prueba de estrés con más de 1.000 llamadas a herramientas.

Una anécdota positiva

Precio y OpenCode

Un usuario de Reddit destacó lo positivo de haber tenido una experiencia temprana con la programación y el valor que le aportó.

Preguntas abiertas

Privacidad + fiabilidad

Otros usuarios expresaron sus preocupaciones respecto al consumo de datos, el precio estándar, la disponibilidad y la fiabilidad inicial.

El departamento de IA de Meta afirma que Muse Spark 1.2 ha recibido más recursos computacionales para el entrenamiento en programación, entornos más variados, un mayor énfasis en la generación y depuración de repositorios completos, y un entrenamiento conjunto con Muse Code. Otro hilo de lanzamiento describe una prueba de estrés de hasta 24 horas de duración con más de 1.000 llamadas a herramientas en las GPU NVIDIA Hopper.

Publicación de AI at Meta en la que se describe la formación en programación con Muse Spark 1.2, la depuración, la generación de repositorios completos y el entrenamiento conjunto con Muse Code
Imágenes de la presentación oficial. El departamento de IA de Meta afirma que el modelo ha contado con mayor capacidad de cálculo para tareas de programación, entornos más amplios y un entrenamiento conjunto con Muse Code. Fuente: IA en Meta en X.
Publicación de AI at Meta en la que se describe una prueba de estrés de Muse Code con más de mil llamadas a la herramienta a lo largo de un periodo de hasta veinticuatro horas.
Demostración a largo plazo. Meta presentó una prueba de estrés del núcleo de la GPU con más de 1.000 llamadas a herramientas; esto no constituye un indicador general de la fiabilidad de las herramientas. Fuente: IA en Meta en X.

Es una demostración impresionante, pero no constituye una tasa de éxito general cuantificada. No nos indica con qué frecuencia el agente eligió la herramienta adecuada, se recuperó de los errores, evitó llamadas duplicadas o completó una tarea habitual del repositorio sin necesidad de intervención.

Las primeras publicaciones en Reddit también recogen opiniones dispares. Una de ellas Un usuario de r/opencode ha compartido una experiencia positiva con OpenCode y elogió el precio. Otro Debate sobre los precios de los colaboradores Han surgido dudas sobre el consumo de datos, el coste del plan básico, la disponibilidad y la fiabilidad. Se trata de reacciones individuales, no de un consenso de la comunidad.

Un usuario de Reddit describe en OpenCode su experiencia positiva inicial con la programación del Muse Spark 1.2 y su bajo precio.
Un informe de uno de los primeros usuarios. Un usuario de Reddit elogió la experiencia de programación y el precio de OpenCode; se trata de una anécdota, no de un consenso generalizado. Fuente: r/opencode.
Debate en Reddit en el que se comparan los precios de Muse Spark 1.2 (estándar y para colaboradores) y se plantean dudas sobre el intercambio de datos
Privacidad y reacción ante el valor. Este debate comunitario combina el interés por el precio del plan «Contributor» con las preocupaciones sobre el uso de los datos, la disponibilidad y el coste del plan estándar. Fuente: r/opencodeCLI.

Pruebas de programación de Muse Spark 1.2: 3 de 3 tareas superadas

En nuestras pruebas, el modelo básico Muse Spark 1.2 completó tres tareas de programación controladas a través de una API de autocompletado de chat compatible con OpenAI. Cada tarea se realizó en un único intento, sin reintentos y sin intervención humana. Evaluamos los archivos devueltos en repositorios desechables comparándolos con comprobaciones públicas y ocultas. No se probó la ejecución del agente Muse Code ni la fiabilidad de las llamadas a las herramientas, por lo que estos resultados no deben interpretarse como una evaluación comparativa del agente.

Resultado de un único intento

Tareas3/3Se han superado 3 de 3 tareas de programación
Latencia media12,98 s12,98 segundos por tarea
Uso12,10012 100 fichas en total
Coste declarado$0.045362Tres convocatorias para modelos

Las respuestas utilizaron 6.618 tokens de razonamiento. Las tres razones finales fueron: basta, y en el campo «proveedor» se indicó «Meta».

Prueba 1: Corrección del error de idempotencia en Python — Superada

Tarea

Evita las transferencias duplicadas sin modificar la API pública

El modelo identificó la falta del filtro de ID de solicitud, añadió la corrección mínima necesaria y proporcionó una prueba de regresión, al tiempo que preservaba las actualizaciones atómicas del saldo.

APROBADO · 6 exámenes
Latencia12,064 s
Fichas2,867
Razonamiento1,621
Coste$0.01072675

El evaluador oculto original exigía, erróneamente, una llamada duplicada para devolver el resultado. Falso, aunque la tarea solo exigía que no se cobrara dos veces al remitente. Tras corregir ese requisito inventado sobre el valor de retorno, la primera respuesta, sin modificaciones, superó las seis pruebas. No volvimos a intentar la tarea ni modificamos el resultado del modelo.

Prueba 2: Reestructuración de varios archivos en TypeScript — Aprobada

Tarea

Separación de la validación, la persistencia y el registro de auditoría

Los archivos devueltos mantuvieron el contrato de ruta pública, el uso estricto de TypeScript y la transacción única que abarcaba tanto las escrituras de pedidos como las de auditoría. Además, se añadieron pruebas de validación específicas sin dependencia de tiempo de ejecución.

VerificaciónPASSComprobación de tipos, contrato público, comprobación de transacciones ocultas y pruebas de validación añadidas
13,909 s5.011 fichas2.770 razonamientos$0.01833275

El primer evaluador comparó los objetos con datos sin procesar JSON.stringify, por lo que los objetos equivalentes con un orden de inserción de claves diferente parecían distintos; su versión para Windows npx El lanzamiento también falló antes de la comprobación de tipos. Con un comparador que no distingue el orden y una ejecución del comando compatible con Windows, la respuesta original superó todas las comprobaciones. Una vez más, no se produjo ningún reintento del modelo.

Prueba 3: Funcionalidad del repositorio JSONL — Superada

Cumplimiento de las instrucciones aplicables a todo el repositorio

Añadir JSONL sin afectar al CSV

El modelo incorporaba detección de extensiones, errores de líneas mal formadas a partir de 1, salida atómica, seguridad en la ejecución en modo de prueba, pruebas específicas, texto de ayuda y un ejemplo en el archivo README.

Resultado9/9pruebas superadas
Latencia12,976 sprimer intento
4.222 fichas2.227 razonamientos$0.0163025

Lo que revelan las pruebas: Muse Spark 1.2 puede generar parches útiles para varios archivos, respetar las restricciones de compatibilidad, añadir pruebas y gestionar una funcionalidad de alcance moderado en todo el repositorio de una sola vez. El coste medio registrado fue de aproximadamente $0,0151 por tarea, pero estos casos de prueba eran pequeños y no deberían utilizarse para estimar el coste de una base de código de gran tamaño.

¿Quién debería utilizar Muse Spark 1.2?

Guía para la toma de decisiones

Pruébalo ahora

Evaluación controlada

Código público o sintético, tareas cuantificables, necesidades en contextos amplios y un prometedor resultado de 3/3 en el modelo base.

Espera

Se requiere justificante del agente

El comportamiento de Muse Code, los límites de frecuencia estables, las llamadas repetidas a las herramientas o las pruebas de rendimiento a gran escala del repositorio son criterios decisivos.

Compara primero

Código sensible o alto rendimiento

Utiliza el nivel estándar o compara otras opciones cuando la privacidad y el coste de los tokens de razonamiento sean factores determinantes.

Utiliza el modelo estándar para el código sensible, a menos que tu organización haya aprobado por separado las condiciones de los colaboradores. Si el precio de salida estándar modifica el cálculo del valor, compáralo con el actual Precios de Codex, el código Claude y otros costes relacionados con los agentes de codificación antes de comprometerse con un flujo de trabajo.

Veredicto de la reseña de Muse Spark 1.2

Muse Spark 1.2 se ha ganado un puesto en la lista de finalistas de la evaluación, pero no supone una recomendación automática para su producción. El contexto del token 1M, el formato familiar de la API, los bajos precios para los colaboradores, las tres oportunidades de programación en el primer intento y las excelentes puntuaciones de Muse Code en las pruebas de Meta hacen que sea difícil pasarlo por alto. Además, Meta ha hecho un mejor trabajo que muchos otros lanzamientos a la hora de publicar los detalles de la metodología.

Las salvedades son igualmente concretas. La tarificación para colaboradores conlleva una compensación en cuanto al uso de datos. Los tokens estándar de salida y de razonamiento pueden elevar el coste real. Las cifras más destacadas de Meta en materia de programación no se han reproducido como entradas equivalentes en los tableros públicos de Terminal-Bench o DeepSWE, y nuestra muestra práctica abarca tres tareas de modelos básicos en lugar de la ejecución del agente Muse Code.

Lo más sensato es realizar una prueba controlada con código no sensible, guardando los datos de uso sin procesar y la verificación local. Considera el coste y la latencia medidos como una muestra basada en tareas pequeñas y, a continuación, comprueba el tamaño de tu propio repositorio, la recuperación ante fallos y el flujo de trabajo del agente antes de optar por utilizarlo en producción.

Preguntas frecuentes sobre Muse Spark 1.2

¿Qué es Muse Spark 1.2?

Muse Spark 1.2 es el modelo de Meta centrado en la programación, lanzado el 5 de agosto de 2026, con una ventana de contexto de 1 millón de tokens y acceso a través de Muse Code, la API de Meta Model y OpenRouter.

¿Muse Spark 1.2 es lo mismo que Muse Code?

No. Muse Spark 1.2 es el modelo; Muse Code es un agente de terminal beta independiente que funciona con tecnología de este. Muse Code añade características al producto, como subagentes, árboles de trabajo de Git aislados, registro de eventos, reanudación y habilidades integradas.

¿Cuánto cuesta la API de Muse Spark 1.2?

El modelo estándar tiene un coste de $1,25 de entrada, $0,15 de entrada en caché y $4,25 de salida por cada millón de tokens. El modelo «Contributor» cuesta $0,10 de entrada, $0,002 de entrada en caché y $0,20 de salida.

¿Utiliza Meta los datos de la API de Muse Spark para el entrenamiento?

Meta afirma que los datos del nivel «estándar» no se utilizan para mejorar los productos de Meta. Los datos del nivel «colaborador» pueden utilizarse para mejorar los productos de Meta, por lo que el código privado o propietario debe seguir la vía estándar, salvo que una organización apruebe lo contrario.

¿Aparece Muse Spark 1.2 en las clasificaciones públicas de Terminal-Bench o DeepSWE?

No aparecía en ninguno de los dos foros públicos cuando se comprobó el 7 de agosto de 2026. Meta indica 82,91 TP40T en Terminal-Bench 2.1 con Muse Code y 59,31 TP40T en DeepSWE, pero esos son resultados obtenidos por Meta.

¿Se ha probado Muse Spark 1.2 de forma práctica en esta reseña?

Sí. En tres pruebas del modelo básico con un único intento, Muse Spark 1.2 superó la corrección de un error en Python, una refactorización en TypeScript y una función de repositorio JSONL. La latencia media fue de 12,98 segundos y el coste total registrado fue de $0,045362. No se comprobaron la fiabilidad del agente Muse Code ni la de las llamadas a herramientas.

¿Cómo pueden los desarrolladores acceder a Muse Spark 1.2?

Meta enumera tres vías: el agente de terminal de la versión beta de Muse Code, la API de Meta Model y OpenRouter. La guía oficial utiliza un cliente compatible con el SDK OpenAI cuya URL base es https://api.meta.ai/v1.

Comparte el post:

Entradas relacionadas

Investigación de GlobalGPT sobre resultados útiles de GPT: más de 100 000 mensajes de usuarios, aproximadamente 50 000 grupos de ID de conversación y más de 20 000 cuentas.

¿Qué hace que el resultado de un modelo GPT sea útil? Delegación de tareas y control por parte del usuario en las solicitudes GlobalGPT

¿Qué hace que los resultados de un modelo GPT sean útiles? La investigación GlobalGPT se basa en datos autorizados y compartidos de forma voluntaria: más de 100 000 mensajes de usuarios, aproximadamente 50 000 grupos de identificadores de conversación y más de 20 000 cuentas. Los resultados cualitativos analizan una selección de solicitudes.

Seguir leyendo