Test de Muse Spark 1.3 : benchmarks, API, tarifs et tests de programmation

Muse Spark 1.3 est la version la plus performante de Muse Spark développée par Meta à ce jour : le modèle public « xhigh » atteint un score de 61 sur l’indice d’intelligence d’analyse artificielle (Artificial Analysis Intelligence Index), conserve une fenêtre de contexte de 1 million de tokens et a réussi les trois tâches de programmation de difficulté moyenne lors de notre test API de première réponse. Il convient toutefois de noter que le graphique de référence de Meta utilise la version « max » de Reasoning, alors que, au moment de la rédaction de cette analyse, cette version n’avait pas encore été largement déployée, dans l’attente de tests de sécurité supplémentaires.

Test du Muse Spark 1.3 : verdict rapide

Notre verdict

Muse Spark 1.3 mérite d’être testé pour la programmation d’agents, le traitement de contextes longs et l’automatisation sensible aux coûts. Son résultat public « xhigh » est déjà compétitif au niveau de la pointe de la technologie, mais il ne faut pas citer les scores maximaux de Meta comme si chaque utilisateur de l’API pouvait les reproduire dès aujourd’hui.

Meta a lancé Muse Spark 1.3 le 2 septembre 2026, ce qui le rend particulièrement adapté aux flux de travail agents à long terme, à un code plus épuré et à une collaboration plus fiable. Cela s'inscrit dans la continuité de l'évolution vers Agents d'IA conçus à partir de modèles d'utilisation d'outils. Meta indique qu'il pose des questions de clarification lorsque les exigences sont ambiguës, signale les blocages et demande confirmation avant d'entreprendre des actions ayant des conséquences importantes. Lors de comparaisons internes avec la version 1.2, les ingénieurs de Meta ont observé environ 20% d'appels à l'outil en moins et 25% de tokens en moins. Il s'agit là d'affirmations du fournisseur, et non des résultats de nos tests.

Indice AA, xhigh61
Contexte1M
Nos tests de programmation3/3
Coût total du test$0.040
Page du modèle Meta Muse Spark 1.3 décrivant les flux de travail agentiques, les performances de codage et la perception multimodale native
Présentation officielle de Muse Spark 1.3 par Meta. Source : page du modèle sur le site de Meta.

Quelles sont les nouveautés par rapport à Muse Spark 1.2 ?

Renseignement public

Analyse artificielle : de 57 à 61 sur xhigh.

Codage agentique

Meta annonce des résultats de 75,4 contre 55,0 sur DeepSWE, mais compare la valeur maximale de 1,3 à la valeur xhigh de 1,2.

Contexte détaillé

La fenêtre de 1 million est toujours d'actualité ; les scores MRCR de la bande haute augmentent fortement dans le graphique de Meta.

Coût de la tâche

Les taux de jetons restent stables, tandis que AA a enregistré une valeur de $0,55 contre $0,40 par tâche évaluée.

Tests de performances de Muse Spark 1.3 : « Max » et « Xhigh » ne sont pas identiques

Classement officiel de Meta est impressionnant. Muse Spark 1.3 atteint un score maximal de 88,8 sur Terminal-Bench 2.1, 75,4 sur DeepSWE v1.1, 98,1 sur MRCR 512K-1M et 66,9 sur OSWorld 2.0. Il égale le score maximal de GPT-5.6 Sol sur Terminal-Bench et devance les concurrents présentés sur les deux bandes MRCR à long contexte. Les développeurs souhaitant comparer l’ensemble du marché peuvent utiliser notre Présentation de Coding-Agent à titre d'information complémentaire.

MÉTA-RAPPORT, RAISONNEMENT MAX

Référence1,3 max.1,2 x hautGPT-5.6 Sol maxOpus 5 max
Terminal-Bench 2.188.882.988.886.7
DeepSWE v1.175.455.073.074.0
OSWorld 2.066.947.662.768.3
MRCR 512K-1M98.155.573.8N/A

Les différences au niveau des paramètres d'effort, des harnais d'agents et des versions d'OSWorld limitent la comparabilité directe. Meta décrit également l'indice Agentic IF comme un indicateur composite interne.

Comment lire le graphique

Effort de raisonnement

Les versions 1.3, GPT-5.6 Sol et Opus 5 utilisent « max » ; la version 1.2 utilise « xhigh ».

Harnais

Les agents désignés et les harnais fixes varient selon l'évaluation.

OSWorld

Les versions 1.3 et 1.2 utilisent des versions d'environnement différentes.

Mesure interne

L'indice « Agentic IF » est un indice composite élaboré par Meta ; il ne s'agit pas d'un indice de référence public unique.

Consultez la méthodologie d'évaluation de Meta.

Tableau de référence Meta comparant Muse Spark 1.3 max à Muse Spark 1.2 xhigh, GPT-5.6 Sol max et Opus 5 max
Résultats issus de méta-analyses. Les paramètres d'effort et les harnais variant d'une étude à l'autre, veuillez tenir compte des réserves méthodologiques mentionnées ci-dessus lors de la lecture de ces résultats.

L'analyse artificielle offre une vision plus claire par rapport à ce à quoi les utilisateurs ont accès actuellement. Muse Spark 1.3 xhigh affiche un score de 61, contre 57 pour la version 1.2. Son résultat au Terminal-Bench est de 85%, celui du GDPval-AA v2 est de 1 709 Elo, et celui du Tau3-Bench Banking est de 47%. La variante « max » en préversion limitée atteint 62 au total. On observe également des régressions : l’AA-LCR passe de 83% à 79%, tandis que l’AA-Omniscience Accuracy passe de 45% à 42% en mode xhigh.

Article sur Artificial Analysis Muse Spark 1.3 présentant les résultats « xhigh » (public) et « max » (en prévisualisation limitée)
L'analyse artificielle distingue les résultats « xhigh » actuellement disponibles de ceux dont l'aperçu est limité (« max »).

Tarifs de Muse Spark 1.3

Contributeur

muse-spark-1.3-contributeur

$0.10 en entrée / $0.002 en cache / $0.20 en sortie par million de jetons.

Les suggestions peuvent servir à améliorer les produits Meta.

Standard

muse-spark-1.3

$1,25 en entrée / $0,15 en mémoire cache / $4,25 en sortie par million de jetons.

Meta précise que ce niveau n'est pas utilisé pour améliorer ses produits.

Tarifs de l'API standard et des contributeurs de Meta Muse Spark 1.3, avec fenêtre contextuelle et conditions d'utilisation des données
Conditions officielles relatives aux tarifs et à l'utilisation des données de Muse Spark 1.3, consultées le 3 septembre 2026.

Le cours officiels des jetons restent inchangés par rapport à la version 1.2, mais le coût par tâche, lui, a changé. Notre Avis sur une plateforme d'IA tout-en-un explique pourquoi le prix d'accès et le coût du flux de travail doivent être évalués séparément. Artificial Analysis a mesuré une valeur de $0,55 par tâche de l'indice d'intelligence pour 1,3 xhigh, contre $0,40 pour 1,2, ce qui s'explique principalement par environ 57% de jetons d'entrée supplémentaires lors des évaluations agentiques. Le niveau « Contributeur » est exceptionnellement bon marché, mais sa clause d’utilisation des données constitue un véritable critère de choix du produit plutôt qu’une simple note de bas de page.

Accès à l'API Muse Spark 1.3

Meta’s livre de recettes officiel utilise désormais muse-spark-1.3 comme valeur par défaut et prend en charge une fenêtre contextuelle de 1 048 576 tokens. L’API est compatible avec le SDK OpenAI. Muse Code et l’API Meta Model constituent les voies d’accès actuellement confirmées. La page du modèle de Meta mentionne également OpenRouter, bien que son bouton renvoie encore vers une URL de la version 1.2 lorsqu’on clique dessus ; veillez donc à vérifier l’itinéraire avant le déploiement. Pour en savoir plus sur l’interopérabilité des agents, consultez notre guide sur MCP et outils d'IA.

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.meta.ai/v1",
    api_key=os.environ["MODEL_API_KEY"],
)

response = client.chat.completions.create(
    model="muse-spark-1.3",
    messages=[{"role": "user", "content": "Vérifie ce patch pour détecter d'éventuelles régressions."}],
)

print(response.choices[0].message.content)

Tests pratiques de programmation : 3 sur 3 réussis

Nous avons testé trois tâches de dépôt de difficulté moyenne via une API à la température de zéro, en utilisant une réponse par tâche. Chaque réponse devait renvoyer des fichiers complets au format JSON structuré. Nous avons ensuite placé ces fichiers dans des répertoires jetables et effectué des vérifications publiques et cachées. Il s'agit de petits tests contrôlés, qui ne remplacent en aucun cas Terminal-Bench ni un essai sur un dépôt de production.

PASS – Correction de l'idempotence en Python

5 tests sur 5 ; 18,4 s ; 2 473 jetons ; $0,00905. Le modèle a identifié l'ensemble des identifiants traités non utilisés, a ajouté un contrôle précoce des doublons et a rédigé un test de régression.

PASS – Refactorisation modulaire de TypeScript

Vérification des types et deux contrôles d'exécution réussis ; 47,6 s ; 4 945 tokens ; $0.01661. La validation, la persistance et la journalisation d'audit ont été séparées sans enfreindre les limites de la transaction.

PASS – Importation JSONL et simulation de sécurité

9 tests sur 9 ; 20,3 s ; 3 789 tokens ; $0,01446. La compatibilité CSV, les erreurs de numérotation des lignes, la sortie atomique, la sécurité en mode simulation, l'aide et la documentation ont toutes été validées.

Total : 11 207 jetons et $0,04013. Les durées indiquées correspondent aux temps de traitement de bout en bout des requêtes, et non à la latence native de l'API Meta ni au TTFT.

Le résultat s'est avéré meilleur que ne le laisse supposer un simple “ 3/3 ” : les trois premières réponses étaient toutes vérifiables et tenaient compte des contraintes. Cette même rigueur méthodologique est importante lorsqu'on lit notre Avis sur GPT-5. Toutefois, cet échantillon ne permet pas d'évaluer la fiabilité des appels répétés aux outils, la navigation dans les grands référentiels ni la couche d'orchestration de Muse Code. Les lecteurs qui évaluent des alternatives plus économiques pourraient également trouver notre Comparaison des modèles de codification budgétaire utile.

Premières réactions des développeurs

Les premières réactions sont mitigées et trop peu nombreuses pour qu'on puisse parler de consensus. Dans un Test de Hacker News, Simon Willison a enregistré un temps de 38 secondes et 4,2266 centimes en SVG et a estimé que ce résultat obtenu avec la version 1.3 était “ nettement meilleur ” que celui obtenu avec la version 1.2 à titre de comparaison. Dax a décrit cette sortie pour lui rappeler à quel point les mannequins rapides lui manquaient. Sung Kim, après avoir passé environ une heure avec Muse Code, a déclaré que le modèle était peut-être bon, mais que le produit Muse Code “ nécessitait encore beaucoup de travail ”. Ce dernier commentaire porte sur l'expérience de l'agent, et non sur un test pur et simple du modèle.

Test SVG de « Hacker News Muse Spark 1.3 » réalisé par Simon Willison, avec mesure des coûts et des temps, et comparaison avec la version 1.2
Une anecdote de Simon Willison sur la programmation créative ; il ne s'agit ni d'un test de performance ni d'un consensus général.
Première impression de Sung Kim sur Muse Code et Muse Spark 1.3 après environ une heure d'utilisation
Sung Kim critique principalement l'expérience proposée par Muse Code en tant qu'agent.
Dax a déclaré que Muse Spark 1.3 lui avait rappelé à quel point les modèles rapides lui manquaient
Le message de Dax donne une impression de vitesse démesurée.

Avantages et inconvénients

Ce qui a bien fonctionné

  • Fort soutien du public x meilleur score
  • Fenêtre contextuelle de 1 million de jetons
  • API compatible avec OpenAI
  • Les trois tâches de programmation ont toutes été validées dès la première réponse
  • Taux de conversion des jetons très bas pour les contributeurs de bas niveau

À ne pas manquer

  • Les résultats « Headline max » ne constituent pas l'expérience publique par défaut.
  • Le coût des tâches indépendantes a augmenté par rapport à 1,2
  • Régression de deux indicateurs indépendants
  • Les données fournies par les contributeurs pourraient permettre d'améliorer les produits Meta
  • Les premières réactions concernant Muse Code sont mitigées

À qui s'adresse Muse Spark 1.3 ?

UTILISEZ-LE POUR

Évaluations d'agents de codage, travaux sur des référentiels à large contexte, automatisation pilotée par des outils et expériences sensibles aux coûts pour lesquelles la politique en matière de données est acceptable.

PASSER OU ATTENDRE QUAND

Vous recherchez une fiabilité de production éprouvée sur le long terme, vous avez besoin d'une capacité maximale dès aujourd'hui, ou vous ne pouvez pas accepter les conditions d'utilisation des données propres au niveau « contributeur » et estimez que les tarifs standard ne sont pas compétitifs.

Verdict sur Muse Spark 1.3

Muse Spark 1.3 est recommandé à des fins d'évaluation. Il allie des performances publiques de pointe, d'excellents résultats en matière de contexte long, une ergonomie d'API familière et une tarification très compétitive. Nos trois tâches de codage de première intervention confirment qu'il est capable de respecter des contraintes multi-fichiers et de produire des correctifs testables.

Choisissez le niveau standard pour le code sensible. Pour une autre comparaison entre les différents niveaux, consultez GPT-5 contre Claude 4. Considérez les résultats des tests de performance de « Treat max » comme des indications préliminaires jusqu’à ce que ce niveau de raisonnement soit largement accessible. Et évaluez Muse Code indépendamment de l’API du modèle : l’expérience utilisateur d’un agent, sa boucle d’outils et le contrôle du référentiel peuvent réussir ou échouer indépendamment du modèle de base.

FAQ Muse Spark 1.3

Qu'est-ce que Muse Spark 1.3 ?

Muse Spark 1.3 est le modèle de Meta dédié à la programmation et aux workflows agentiques, lancé le 2 septembre 2026. Il dispose d’une fenêtre de contexte d’un million de tokens et prend en charge nativement la reconnaissance d’images, de vidéos et de documents.

Combien coûte Muse Spark 1.3 ?

Le modèle standard coûte $1,25 par million de jetons d'entrée, $0,15 pour les entrées mises en cache et $4,25 pour les sorties. Le modèle « contributeur » coûte respectivement $0,10, $0,002 et $0,20, mais ses données peuvent être utilisées pour améliorer les produits Meta.

La fonction « max reasoning » est-elle disponible ?

Meta a indiqué que les modes de raisonnement existants étaient disponibles dès le lancement et que le mode « max » suivrait après des tests de sécurité supplémentaires. Vérifiez la documentation actuelle de l'API avant de considérer que le service est accessible à tous.

Muse Spark 1.3 a-t-il réussi les tests de codage ?

Oui. Ses premières réponses ont passé avec succès tous les contrôles d'exécutabilité dans le cadre de nos tests de correction de bogues Python, de refactorisation TypeScript et de fonctionnalités JSONL. L'échantillon ne contient que trois tâches contrôlées et ne reflète pas un taux de fiabilité général.

La version 1.3 de Muse Spark est-elle meilleure que la 1.2 ?

Dans l'ensemble, d'après les données disponibles. L'intelligence publique xhigh est passée de 57 à 61 et Meta fait état d'importants gains en matière d'agentique et de contexte long, mais Artificial Analysis a également constaté un coût de tâche plus élevé ainsi que de légères régressions dans la récupération de contextes longs et l'étalonnage factuel.

Dois-je opter pour le modèle « contributeur » ou le modèle « standard » ?

Utilisez la version « standard » pour les invites sensibles ou confidentielles, car Meta précise que ces données ne sont pas utilisées pour améliorer ses produits. La version « Contributor » est bien moins chère, mais ses invites peuvent être utilisées à des fins d'amélioration des produits.

Partager l'article :

Articles connexes