Muse Spark 1.3 est la version la plus performante de Muse Spark développée par Meta à ce jour : le modèle public « xhigh » atteint un score de 61 sur l’indice d’intelligence d’analyse artificielle (Artificial Analysis Intelligence Index), conserve une fenêtre de contexte de 1 million de tokens et a réussi les trois tâches de programmation de difficulté moyenne lors de notre test API de première réponse. Il convient toutefois de noter que le graphique de référence de Meta utilise la version « max » de Reasoning, alors que, au moment de la rédaction de cette analyse, cette version n’avait pas encore été largement déployée, dans l’attente de tests de sécurité supplémentaires.
Test du Muse Spark 1.3 : verdict rapide
Notre verdict
Muse Spark 1.3 mérite d’être testé pour la programmation d’agents, le traitement de contextes longs et l’automatisation sensible aux coûts. Son résultat public « xhigh » est déjà compétitif au niveau de la pointe de la technologie, mais il ne faut pas citer les scores maximaux de Meta comme si chaque utilisateur de l’API pouvait les reproduire dès aujourd’hui.
Meta a lancé Muse Spark 1.3 le 2 septembre 2026, ce qui le rend particulièrement adapté aux flux de travail agents à long terme, à un code plus épuré et à une collaboration plus fiable. Cela s'inscrit dans la continuité de l'évolution vers Agents d'IA conçus à partir de modèles d'utilisation d'outils. Meta indique qu'il pose des questions de clarification lorsque les exigences sont ambiguës, signale les blocages et demande confirmation avant d'entreprendre des actions ayant des conséquences importantes. Lors de comparaisons internes avec la version 1.2, les ingénieurs de Meta ont observé environ 20% d'appels à l'outil en moins et 25% de tokens en moins. Il s'agit là d'affirmations du fournisseur, et non des résultats de nos tests.

Quelles sont les nouveautés par rapport à Muse Spark 1.2 ?
Analyse artificielle : de 57 à 61 sur xhigh.
Meta annonce des résultats de 75,4 contre 55,0 sur DeepSWE, mais compare la valeur maximale de 1,3 à la valeur xhigh de 1,2.
La fenêtre de 1 million est toujours d'actualité ; les scores MRCR de la bande haute augmentent fortement dans le graphique de Meta.
Les taux de jetons restent stables, tandis que AA a enregistré une valeur de $0,55 contre $0,40 par tâche évaluée.
Tests de performances de Muse Spark 1.3 : « Max » et « Xhigh » ne sont pas identiques
Classement officiel de Meta est impressionnant. Muse Spark 1.3 atteint un score maximal de 88,8 sur Terminal-Bench 2.1, 75,4 sur DeepSWE v1.1, 98,1 sur MRCR 512K-1M et 66,9 sur OSWorld 2.0. Il égale le score maximal de GPT-5.6 Sol sur Terminal-Bench et devance les concurrents présentés sur les deux bandes MRCR à long contexte. Les développeurs souhaitant comparer l’ensemble du marché peuvent utiliser notre Présentation de Coding-Agent à titre d'information complémentaire.
MÉTA-RAPPORT, RAISONNEMENT MAX
| Référence | 1,3 max. | 1,2 x haut | GPT-5.6 Sol max | Opus 5 max |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 88.8 | 82.9 | 88.8 | 86.7 |
| DeepSWE v1.1 | 75.4 | 55.0 | 73.0 | 74.0 |
| OSWorld 2.0 | 66.9 | 47.6 | 62.7 | 68.3 |
| MRCR 512K-1M | 98.1 | 55.5 | 73.8 | N/A |
Les différences au niveau des paramètres d'effort, des harnais d'agents et des versions d'OSWorld limitent la comparabilité directe. Meta décrit également l'indice Agentic IF comme un indicateur composite interne.
Comment lire le graphique
Les versions 1.3, GPT-5.6 Sol et Opus 5 utilisent « max » ; la version 1.2 utilise « xhigh ».
Les agents désignés et les harnais fixes varient selon l'évaluation.
Les versions 1.3 et 1.2 utilisent des versions d'environnement différentes.
L'indice « Agentic IF » est un indice composite élaboré par Meta ; il ne s'agit pas d'un indice de référence public unique.

L'analyse artificielle offre une vision plus claire par rapport à ce à quoi les utilisateurs ont accès actuellement. Muse Spark 1.3 xhigh affiche un score de 61, contre 57 pour la version 1.2. Son résultat au Terminal-Bench est de 85%, celui du GDPval-AA v2 est de 1 709 Elo, et celui du Tau3-Bench Banking est de 47%. La variante « max » en préversion limitée atteint 62 au total. On observe également des régressions : l’AA-LCR passe de 83% à 79%, tandis que l’AA-Omniscience Accuracy passe de 45% à 42% en mode xhigh.

Tarifs de Muse Spark 1.3
Contributeur
muse-spark-1.3-contributeur
$0.10 en entrée / $0.002 en cache / $0.20 en sortie par million de jetons.
Les suggestions peuvent servir à améliorer les produits Meta.
Standard
muse-spark-1.3
$1,25 en entrée / $0,15 en mémoire cache / $4,25 en sortie par million de jetons.
Meta précise que ce niveau n'est pas utilisé pour améliorer ses produits.

Le cours officiels des jetons restent inchangés par rapport à la version 1.2, mais le coût par tâche, lui, a changé. Notre Avis sur une plateforme d'IA tout-en-un explique pourquoi le prix d'accès et le coût du flux de travail doivent être évalués séparément. Artificial Analysis a mesuré une valeur de $0,55 par tâche de l'indice d'intelligence pour 1,3 xhigh, contre $0,40 pour 1,2, ce qui s'explique principalement par environ 57% de jetons d'entrée supplémentaires lors des évaluations agentiques. Le niveau « Contributeur » est exceptionnellement bon marché, mais sa clause d’utilisation des données constitue un véritable critère de choix du produit plutôt qu’une simple note de bas de page.
Accès à l'API Muse Spark 1.3
Meta’s livre de recettes officiel utilise désormais muse-spark-1.3 comme valeur par défaut et prend en charge une fenêtre contextuelle de 1 048 576 tokens. L’API est compatible avec le SDK OpenAI. Muse Code et l’API Meta Model constituent les voies d’accès actuellement confirmées. La page du modèle de Meta mentionne également OpenRouter, bien que son bouton renvoie encore vers une URL de la version 1.2 lorsqu’on clique dessus ; veillez donc à vérifier l’itinéraire avant le déploiement. Pour en savoir plus sur l’interopérabilité des agents, consultez notre guide sur MCP et outils d'IA.
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.meta.ai/v1",
api_key=os.environ["MODEL_API_KEY"],
)
response = client.chat.completions.create(
model="muse-spark-1.3",
messages=[{"role": "user", "content": "Vérifie ce patch pour détecter d'éventuelles régressions."}],
)
print(response.choices[0].message.content)
Tests pratiques de programmation : 3 sur 3 réussis
Nous avons testé trois tâches de dépôt de difficulté moyenne via une API à la température de zéro, en utilisant une réponse par tâche. Chaque réponse devait renvoyer des fichiers complets au format JSON structuré. Nous avons ensuite placé ces fichiers dans des répertoires jetables et effectué des vérifications publiques et cachées. Il s'agit de petits tests contrôlés, qui ne remplacent en aucun cas Terminal-Bench ni un essai sur un dépôt de production.
5 tests sur 5 ; 18,4 s ; 2 473 jetons ; $0,00905. Le modèle a identifié l'ensemble des identifiants traités non utilisés, a ajouté un contrôle précoce des doublons et a rédigé un test de régression.
Vérification des types et deux contrôles d'exécution réussis ; 47,6 s ; 4 945 tokens ; $0.01661. La validation, la persistance et la journalisation d'audit ont été séparées sans enfreindre les limites de la transaction.
9 tests sur 9 ; 20,3 s ; 3 789 tokens ; $0,01446. La compatibilité CSV, les erreurs de numérotation des lignes, la sortie atomique, la sécurité en mode simulation, l'aide et la documentation ont toutes été validées.
Total : 11 207 jetons et $0,04013. Les durées indiquées correspondent aux temps de traitement de bout en bout des requêtes, et non à la latence native de l'API Meta ni au TTFT.
Le résultat s'est avéré meilleur que ne le laisse supposer un simple “ 3/3 ” : les trois premières réponses étaient toutes vérifiables et tenaient compte des contraintes. Cette même rigueur méthodologique est importante lorsqu'on lit notre Avis sur GPT-5. Toutefois, cet échantillon ne permet pas d'évaluer la fiabilité des appels répétés aux outils, la navigation dans les grands référentiels ni la couche d'orchestration de Muse Code. Les lecteurs qui évaluent des alternatives plus économiques pourraient également trouver notre Comparaison des modèles de codification budgétaire utile.
Premières réactions des développeurs
Les premières réactions sont mitigées et trop peu nombreuses pour qu'on puisse parler de consensus. Dans un Test de Hacker News, Simon Willison a enregistré un temps de 38 secondes et 4,2266 centimes en SVG et a estimé que ce résultat obtenu avec la version 1.3 était “ nettement meilleur ” que celui obtenu avec la version 1.2 à titre de comparaison. Dax a décrit cette sortie pour lui rappeler à quel point les mannequins rapides lui manquaient. Sung Kim, après avoir passé environ une heure avec Muse Code, a déclaré que le modèle était peut-être bon, mais que le produit Muse Code “ nécessitait encore beaucoup de travail ”. Ce dernier commentaire porte sur l'expérience de l'agent, et non sur un test pur et simple du modèle.



Avantages et inconvénients
Ce qui a bien fonctionné
- Fort soutien du public x meilleur score
- Fenêtre contextuelle de 1 million de jetons
- API compatible avec OpenAI
- Les trois tâches de programmation ont toutes été validées dès la première réponse
- Taux de conversion des jetons très bas pour les contributeurs de bas niveau
À ne pas manquer
- Les résultats « Headline max » ne constituent pas l'expérience publique par défaut.
- Le coût des tâches indépendantes a augmenté par rapport à 1,2
- Régression de deux indicateurs indépendants
- Les données fournies par les contributeurs pourraient permettre d'améliorer les produits Meta
- Les premières réactions concernant Muse Code sont mitigées
À qui s'adresse Muse Spark 1.3 ?
UTILISEZ-LE POUR
Évaluations d'agents de codage, travaux sur des référentiels à large contexte, automatisation pilotée par des outils et expériences sensibles aux coûts pour lesquelles la politique en matière de données est acceptable.
PASSER OU ATTENDRE QUAND
Vous recherchez une fiabilité de production éprouvée sur le long terme, vous avez besoin d'une capacité maximale dès aujourd'hui, ou vous ne pouvez pas accepter les conditions d'utilisation des données propres au niveau « contributeur » et estimez que les tarifs standard ne sont pas compétitifs.
Verdict sur Muse Spark 1.3
Muse Spark 1.3 est recommandé à des fins d'évaluation. Il allie des performances publiques de pointe, d'excellents résultats en matière de contexte long, une ergonomie d'API familière et une tarification très compétitive. Nos trois tâches de codage de première intervention confirment qu'il est capable de respecter des contraintes multi-fichiers et de produire des correctifs testables.
Choisissez le niveau standard pour le code sensible. Pour une autre comparaison entre les différents niveaux, consultez GPT-5 contre Claude 4. Considérez les résultats des tests de performance de « Treat max » comme des indications préliminaires jusqu’à ce que ce niveau de raisonnement soit largement accessible. Et évaluez Muse Code indépendamment de l’API du modèle : l’expérience utilisateur d’un agent, sa boucle d’outils et le contrôle du référentiel peuvent réussir ou échouer indépendamment du modèle de base.
FAQ Muse Spark 1.3
Qu'est-ce que Muse Spark 1.3 ?
Muse Spark 1.3 est le modèle de Meta dédié à la programmation et aux workflows agentiques, lancé le 2 septembre 2026. Il dispose d’une fenêtre de contexte d’un million de tokens et prend en charge nativement la reconnaissance d’images, de vidéos et de documents.
Combien coûte Muse Spark 1.3 ?
Le modèle standard coûte $1,25 par million de jetons d'entrée, $0,15 pour les entrées mises en cache et $4,25 pour les sorties. Le modèle « contributeur » coûte respectivement $0,10, $0,002 et $0,20, mais ses données peuvent être utilisées pour améliorer les produits Meta.
La fonction « max reasoning » est-elle disponible ?
Meta a indiqué que les modes de raisonnement existants étaient disponibles dès le lancement et que le mode « max » suivrait après des tests de sécurité supplémentaires. Vérifiez la documentation actuelle de l'API avant de considérer que le service est accessible à tous.
Muse Spark 1.3 a-t-il réussi les tests de codage ?
Oui. Ses premières réponses ont passé avec succès tous les contrôles d'exécutabilité dans le cadre de nos tests de correction de bogues Python, de refactorisation TypeScript et de fonctionnalités JSONL. L'échantillon ne contient que trois tâches contrôlées et ne reflète pas un taux de fiabilité général.
La version 1.3 de Muse Spark est-elle meilleure que la 1.2 ?
Dans l'ensemble, d'après les données disponibles. L'intelligence publique xhigh est passée de 57 à 61 et Meta fait état d'importants gains en matière d'agentique et de contexte long, mais Artificial Analysis a également constaté un coût de tâche plus élevé ainsi que de légères régressions dans la récupération de contextes longs et l'étalonnage factuel.
Dois-je opter pour le modèle « contributeur » ou le modèle « standard » ?
Utilisez la version « standard » pour les invites sensibles ou confidentielles, car Meta précise que ces données ne sont pas utilisées pour améliorer ses produits. La version « Contributor » est bien moins chère, mais ses invites peuvent être utilisées à des fins d'amélioration des produits.




