
Qué entiendo por análisis, y qué no pude probar
Muse Spark 1.1 se lanzó el 9 de julio de 2026, así que ha pasado unas cuatro semanas en el mundo real y no cuatro días. Eso importa. Ahora hay datos independientes, no solo las sensaciones del día de lanzamiento. El panorama más amplio de la empresa está en mi resumen de Meta AI.
Hay menos reportes de primera mano de los que suele generar un lanzamiento puntero, y la razón es estructural. La Meta Model API se abrió solo para Estados Unidos. Desarrolladores reportaron estar bloqueados el primer día desde Vietnam, Canadá y Argentina, y no llegó a OpenRouter hasta aproximadamente una semana después. Un comentarista lo resumió de forma directa:
«Que no esté disponible en Openrouter hace que sea muy difícil probarlo. Iba a compararlo con Grok 4.5 y GPT-5.6 Luna, pero no quiero registrarme en Meta para esto a menos que valga la pena.»
Así que un hilo de lanzamiento con 413 puntos solo produjo un puñado de reportes de uso real. Todo lo que sigue se apoya en tres tipos de fuentes: las pruebas independientes de Artificial Analysis y el propio informe de evaluación de 105 páginas de Meta, más el pequeño número de ingenieros que realmente lograron hacerlo funcionar. Cuando nadie ha probado algo, lo digo en lugar de rellenar el hueco.
El gráfico que explica todos los demás resultados
Aquí está la clasificación de Muse Spark 1.1 en los benchmarks que componen el Intelligence Index. Mismo modelo, misma semana, un solo laboratorio ejecutando todas las pruebas.

La mayoría de los modelos son aburridos de una forma útil. Se sitúan aproximadamente en el mismo percentil sea cual sea la prueba, así que un solo número predice el resto. Este no. La distancia entre su mejor y su peor puesto es mayor que toda la brecha entre el nivel de precio más alto y el más bajo del mercado.
Por eso el titular que todos repiten, 50,6 frente al 60,7 de Opus 5, casi no te dice nada sobre lo que puedes hacer con esa información. Promedia un resultado excelente con uno pobre. Lo que necesitas saber es cuál de los dos estás comprando.
Dónde de verdad gana
Aquí hay tres cosas reales, y preferiría que la crítica que viene más abajo no las enterrase.
Escribe bien código. No «bien para el precio». Bien, sin más. En SciCode supera a Claude Opus 5, GPT-5.6 Sol y Grok 4.5. La frase «Meta va por detrás en programación» que siguió al lanzamiento se refiere a las ejecuciones de agente largas, no a la generación de código, y son dos trabajos distintos.
| Modelo | SciCode |
|---|---|
| Kimi K3 (max) | 58,7% |
| Muse Spark 1.1 (xhigh) | 58,2% |
| GPT-5.6 Sol (high) | 56,9% |
| Claude Opus 5 (max) | 55,7% |
| Grok 4.5 (high) | 54,1% |
| Gemini 3.6 Flash | 52,7% |
| DeepSeek V4 Flash | 49,9% |
Es lo más rápido del tablero. 217,4 tokens de salida por segundo frente a 55,7 de Claude Opus 5, y algo por delante de Gemini 3.6 Flash, que tiene 213,5. En cualquier caso de uso de cara al usuario, la gente nota una diferencia de rendimiento de 4x antes de que nadie la mida.
La tarifa de caché es la parte mejor diseñada del producto. A 0,15 $ por millón, eso supone un descuento del 88%, aplicado automáticamente, sin ninguna clave de caché que tengas que gestionar. Un ingeniero señaló por qué esa proporción importa más que el precio anunciado:
«El precio del input en caché tiene una buena proporción. Compáralo con Grok 4.5, que salió a 2 $/6 $ pero luego cobra en silencio 0,50 $ por 1M de tokens de input en caché. ¡Eso es tan alto como Opus 4.8!»
Junta todo eso y el buen caso de uso toma una forma evidente: prompts cortos, un system prompt estable, volumen enorme, una decisión por llamada. Clasificación por lotes, etiquetado, extracción, enrutamiento. La tarifa completa está en mi desglose de precios de Muse Spark 1.1. Para el resto del mercado, empieza por los precios de Claude. La gama de OpenAI está resumida en una sola tabla en todos los modelos de OpenAI.
Dónde se desmorona
Meta posicionó esto como un modelo agéntico. Su anuncio destaca el uso de herramientas y los flujos de trabajo de varios pasos, la línea que separa a los agentes de los chatbots. Así que la prueba justa son las evaluaciones agénticas independientes. Aquí es donde el análisis da un giro.
| Benchmark agéntico | Muse Spark 1.1 | Mejor del conjunto | Dónde queda |
|---|---|---|---|
| AA-Briefcase Elo | 868,9 | Claude Opus 5 con 1718,7 | 18º de 19 |
| GDPval-AA v2 Elo | 1370,6 | Claude Opus 5 con 1852,0 | Último de 7 |
| Tau-3 Banking | 25,2% | Kimi K3 con 34,0% | 9º de 10 |
La contradicción es difícil de pasar por alto. El modelo vendido por su uso agéntico de herramientas es el peor en rendimiento agéntico del tablero independiente. En GDPval queda 481 Elo por detrás de Opus 5, y los intervalos de confianza no se solapan con nada por encima de él. En uso agéntico de herramientas queda por detrás de DeepSeek V4 Flash, que cuesta 0,14 $ de entrada y 0,28 $ de salida.
Meta no lo niega del todo. Su propio informe de evaluación admite que «para tareas agénticas de largo horizonte (por ejemplo, DeepSWE y DeepSearchQA), las mejoras significativas todavía van por detrás o a la par de los modelos competidores con mejor rendimiento». Esa admisión se mide contra Opus 4.8 y GPT-5.5, ambos una generación por detrás de lo que comprarías hoy.
La lectura de la comunidad se ha asentado en un lugar parecido. Un comentarista, al verlo aparecer cerca de la cima de una tabla de programación, lo tomó como prueba de que la tabla estaba rota:
«tu benchmark está claramente mal si los 3 mejores modelos en Typescript (Combined) son Grok 4.5, Muse Spark 1.1 (jaja), Gemini 3.5! Flash»
El planteamiento más agudo salió de una comparativa entre cuatro modelos. Alguien allí se sorprendió de que Muse Spark produjera el mejor artefacto individual del conjunto y aun así obtuviera un 2 de 5. La aclaración resume el modelo entero en una sola frase:
«2/5 no es calidad, es consistencia, tal como está escrito ahí. Los enlaces completos están al final. La mayoría de los intentos de Spark son fallos»
Techo alto. Suelo bajo. Todo lo demás en este análisis se deriva de eso.
La sesión más larga que alguien ha publicado llega al mismo sitio. Tres horas con el modelo, de un desarrollador ejecutándolo a través de una CLI de programación:
«Lo probé durante 3 horas seguidas, y tengo que decir que me decepcionó. No sé qué le ha pasado a Meta últimamente, pero hay que recordar que fueron los creadores de Llama, los que encendieron la mecha del open source de los modelos. Incluso cerrado (al menos ahora), yo diría que está entre Kimi 2.7 y GLM 5.2, ni de cerca de Opus 4.8 medium/Sonnet5»
Tómalo con cautela. Es la tarde de una sola persona, y no reporta ninguna cifra medida. Casi nadie lo hace. En cuatro semanas de Reddit y Hacker News hay apenas una docena de reportes reales de primera mano de gente usando este modelo, y ninguno de ellos publica una cifra que haya medido él mismo. Tampoco nadie ha puesto a prueba en público la ventana de 1M de tokens. En parte por el bloqueo regional, en parte porque un modelo para el que no puedes conseguir una clave de API no acaba en los benchmarks de los aficionados.
¿Deberías confiarle este trabajo a Muse Spark 1.1?
Elige el trabajo que realmente tienes. La respuesta cambia más que el precio.
Este es el trabajo para el que fue diseñado. Entrada corta, una decisión, volumen enorme, y la tarifa de caché automática hace el resto.
Funciona a 217,4 tokens de salida por segundo, el más rápido del tablero, y con un system prompt estable factura a 0,15 $ por millón en lugar de 1,25 $.
La debilidad en programación que todos repiten se refiere a las ejecuciones de agente largas, no a escribir código. Si le pides una sola función, está cerca de la cima del sector.
En SciCode queda 2º de 8 con un 58,2%, por encima del 55,7% de Claude Opus 5 y de todas las variantes de GPT-5.6 probadas.
El trabajo de largo horizonte es donde se desvía, y los reintentos devuelven en silencio el ahorro conseguido. Mantén un modelo más potente para las ejecuciones de varias horas.
AA-Briefcase lo sitúa 18º de 19 con 868,9 Elo, por debajo de Gemini 3.6 Flash y de Nemotron 3 Ultra.
La ventana de un millón de tokens es la característica estrella y, a la vez, uno de los resultados medidos más débiles del modelo. Recupera información primero, luego escribe el prompt. No vuelques ahí todo el archivo.
El razonamiento de contexto largo queda 25º de 26, y el propio informe de Meta puntúa 54,1 en MRCR v2 frente al 74,0 de GPT-5.5.
La demo de uso de ordenador es real y verificable, no un montaje, y decide en cada paso si usar un script o hacer clic. Aun así, no lidera el benchmark que más promociona.
El propio informe de Meta lo sitúa en 80,8 en OSWorld-Verified, por detrás del 83,4 de Claude Opus 4.8.
No inventar datos no es lo mismo que saber cuándo quedarse callado, y esta es la dimensión de alineación más débil del modelo según las propias pruebas de Meta.
La evaluación Petri de Meta puntúa la alucinación de entrada en 1,67, peor que el 1,22 de GPT-5.5 y el 1,34 de Claude Opus 4.8.
El fallo que la propia Meta documenta
Esta es la parte que querría conocer antes de conectar esto a cualquier cosa. Está enterrada en la documentación, no en la publicación de lanzamiento.
Muse Spark 1.1 mantiene privada su cadena de razonamiento, algo normal hoy en día. Lo inusual es lo que ocurre en la ruta de integración más común. La propia documentación de razonamiento de Meta indica que en Chat Completions, el campo reasoning_content se redacta y queda vacío antes de llegar a quien hace la llamada, «así que no hay nada que reproducir y cada turno razona desde cero».
La guía de agentes de programación de Meta explica la consecuencia: el modelo «puede perder el hilo de su propio razonamiento previo y comportarse de forma errática: repitiendo trabajo que ya hizo, contradiciendo pasos anteriores».
Un modelo vendido por su trabajo agéntico de varios pasos olvida su propio razonamiento entre turnos en la ruta que usan por defecto la mayoría de las herramientas. El razonamiento multi-turno solo sobrevive en la Responses API, donde el servidor mantiene el contexto por ti a través de previous_response_id.
Nada de esto es teórico. El mejor reporte práctico del lanzamiento describe exactamente esta clase de problema, y viene de un ingeniero que consiguió que Codex funcionara contra la API dentro de un contenedor:
«Es algún tipo de error de parseo o de integración, debido a lo que creo que es que codex no anticipa la llamada a herramientas del lado del servidor y cómo meta trata esos ids... las primeras veces que ejecuté codex con muse, fallaba en su primera llamada que no fuera de búsqueda web.»
Lo arregló, y se mantuvo positivo sobre el modelo. Lo importante es que dos fuentes independientes, la propia documentación de Meta y la primera persona en integrarlo en un entorno real, llegan a la misma causa raíz. El engranaje agéntico es a medida, y los entornos de terceros tropiezan con él.
El número de alucinaciones que todo el mundo cita es el equivocado
Aquí tengo que corregir una lectura halagadora que ha estado circulando, incluida mi propia cobertura anterior.
Muse Spark 1.1 sí tiene una buena tasa de no-alucinación, es decir, se niega a responder en lugar de inventar cosas con bastante frecuencia. Cierto, y algo tiene de valor. Pero el índice compuesto de fiabilidad del conocimiento, que premia las respuestas correctas y penaliza las alucinaciones, lo sitúa en 18,0. Es el más bajo de las doce configuraciones listadas en su propia página de modelo. Claude Opus 5 obtiene 31,3.
Las propias pruebas de alineación de Meta coinciden, con un lenguaje más directo del que ha publicado cualquier competidor. De la evaluación Petri 3.0 en su informe de evaluación: «la alucinación de entrada (1,67) es la principal, más alta que GPT-5.5 (1,22) y Claude 4.8 Opus (1,34)». El mismo pasaje señala un engaño elevado hacia los usuarios y un exceso de negativas elevado.
Así que dos fuentes independientes, una de ellas la propia Meta, llegan a la misma conclusión: la alucinación es la dimensión más débil de este modelo, no la más fuerte.
Aun así, ni siquiera esa es la cifra con la que yo decidiría un despliegue de soporte. Esta sí:

Todo benchmark de alucinaciones mide si un modelo inventa datos sobre el mundo. Casi ningún fallo de soporte tiene ese aspecto. Un equipo de soporte técnico B2B con el que trabajamos, que gestionaba unos 200 tickets al mes en Zendesk y escalaba hacia los 2.000, se topó con la versión real del problema. Su bot le decía a los clientes que su producto daba soporte a vehículos que no estaban en su base de datos, porque su propio centro de ayuda decía «damos soporte a todos los modelos». El modelo fue fiel a su fuente. La fuente estaba equivocada.
Ninguna puntuación en ningún leaderboard detecta eso. Por eso entrenar la IA con una base de conocimiento es un problema de contenido antes que un problema de modelo, y por eso los umbrales de confianza hacen más por la calidad de las respuestas que cualquier mejora de razonamiento.
La misma lógica se aplica río arriba. Acertar en el triaje de tickets mueve la tasa de resolución de forma más fiable que cambiar de modelo. Los patrones de fallo son lo bastante consistentes como para que los problemas de los chatbots de IA los catalogue mejor que cualquier ficha de modelo.
La velocidad es real, pero mira el reloj correcto
El número de rendimiento es real, y es la mejor estadística individual del modelo. El número de latencia necesita una corrección.
| Medida | Muse Spark 1.1 | Claude Opus 5 (max) |
|---|---|---|
| Velocidad de salida | 217,4 tok/s | 55,7 tok/s |
| Tiempo hasta el primer token | 2,89 s | - |
| Tiempo de pensamiento antes de la primera respuesta | 9,20 s | - |
| Tiempo hasta el primer token de respuesta | 12,09 s | 51,22 s |
Los 2,89 s en bruto de Meta para el tiempo hasta el primer token son los mejores del tablero. Pero tampoco es lo que experimenta un usuario. Suma 9,2 segundos de razonamiento oculto y el primer token realmente útil llega a los 12,09 s. Aun así, sigue siendo claramente mejor que Opus 5, así que la conclusión se mantiene. Aunque es cuatro veces más lento de lo que sugiere el titular.
Ese mismo razonamiento oculto es lo que impulsa la historia del coste. El 68% de los tokens de salida facturados son pensamiento que quien hace la llamada nunca ve, con 15.164 tokens de razonamiento frente a 7.232 tokens de respuesta por tarea. En la ejecución completa del índice de Artificial Analysis, 360 $ de un total de unos 548 $ se fueron en razonamiento. Tokens baratos, hábito de pensar caro. Es la razón por la que el coste de la atención al cliente con IA nunca coincide con la tarifa publicada.
Cuatro trampas que conviene conocer antes de empezar
Ninguna de ellas es un motivo para descartarlo. Cada una cuesta una tarde si te la encuentras sin avisar.
tool_choicesolo acepta"auto". No puedes forzar una herramienta específica, y no existen"required"ni"none". Cualquier otra cosa devuelve un 400.- La salida estructurada viene desactivada por defecto. Con
strict: false, la referencia de llamada a herramientas de Meta advierte de que los argumentos generados «no tienen garantizado validar» tu esquema. Valídalos antes de ejecutar nada. - Claude Code necesita tres cambios distintos. Una URL base sin
/v1, los cinco alias de modelo redirigidos amuse-spark-1.1, y luegoANTHROPIC_AUTH_TOKENen lugar deANTHROPIC_API_KEY. - El MCP se afirma pero no se documenta. La publicación de lanzamiento dice que el modelo generaliza a servidores MCP y habilidades personalizadas. La referencia de llamada a herramientas no documenta ninguna de las dos cosas. Las herramientas definidas por el desarrollador son la única vía de extensibilidad realmente mostrada.
Tampoco hay un límite del lado del servidor para bucles descontrolados de herramientas personalizadas. max_tool_calls limita solo las herramientas integradas de Meta, algo que conviene saber si alguna vez has visto un bucle de agente de IA girar sin fin. La mitad de la delegación está cubierta en orquestación de subagentes, y el argumento a favor de probarlo tú mismo está en evaluaciones de agentes.
Lo que Meta todavía no ha publicado
Los vacíos también son material de análisis, y esta lista es más larga de lo que debería, cuatro semanas después del lanzamiento.
| No publicado | Por qué importa |
|---|---|
| Máximo de tokens de salida | No puedes dimensionar un límite de solicitud |
| Fecha de corte del conocimiento | No puedes razonar sobre lo desactualizado que está |
| Número de parámetros | Ningún detalle de arquitectura de ningún tipo |
| Lista de regiones permitidas | Todo lo que se sabe viene de usuarios bloqueados |
| Duración de la retención de datos | Los prompts de pago no entran en entrenamiento, pero no se indica cuánto se retienen |
| SLA de disponibilidad o uptime | Nada en absoluto |
| Prefijo mínimo cacheable | La tarifa de 0,15 $ depende de una variable no documentada |
Meta tampoco aparece en el leaderboard oficial de Terminal-Bench, así que la puntuación autodeclarada ahí no tiene confirmación de terceros. Mi resumen de Muse Spark 1.1 cubre la disputa metodológica en torno a esa cifra. Sigue sin resolverse.
Quién debería comprarlo, y quién debería pasar de largo

Cómpralo si manejas trabajo de alto volumen y horizonte corto: clasificación, etiquetado, extracción, enrutamiento, generación de código de un solo archivo, cualquier cosa donde una llamada produce una respuesta y haces millones de esas llamadas. La velocidad es real y la tarifa de caché es excelente, y con unos 0,29 $ por tarea, el ahorro frente a los precios de Opus 5 es lo bastante grande como para importar.
Pásalo si tu carga de trabajo son agentes de larga duración, ejecuciones de investigación profunda, o cualquier cosa que tenga que razonar sobre un gran conjunto de documentos. Las cifras agénticas independientes no están ni cerca. Este es uno de los pocos casos donde pagar por GPT-5.6 u Opus 5 sale más barato en cuanto cuentas los reintentos. Para entornos de programación en concreto, Codex es hoy la ruta mejor documentada.
Espera si estás fuera de Estados Unidos, o necesitas una política de retención publicada, o necesitas pesos abiertos. En este último punto, Kimi K3 es la opción cercana a la frontera con pesos que de verdad puedes tener en tus manos. El giro hacia pesos cerrados es la parte de este lanzamiento que la comunidad menos ha perdonado.
La lectura moderada, de alguien que sigue el leaderboard, es lo bastante justa como para suscribirla:
«Nuevo respeto por Meta Muse Spark. Parece situarse en muchos puntos dulces del leaderboard. No es el mejor en nada en particular, pero equilibra muy bien coste y rendimiento.»
Qué cambia esto para una cola de soporte
Casi nada. Lo digo como alguien cuyo trabajo consiste, en parte, en notar cuándo un modelo nuevo sí cambia algo.
Cada pocas semanas sale un modelo más barato y más rápido, y alguien pregunta si eso reescribe el plan de su mesa de ayuda. La respuesta honesta es que el modelo nunca fue la limitación. En nuestras propias pruebas cruzadas en eesel, cuando los agentes reescribían un borrador de IA, aproximadamente el 65% de las ediciones eran de longitud y tono. Alrededor de un 20% necesitaba datos a los que la IA no podía acceder en un ERP o un sistema logístico. Solo cerca de un 5% correspondía a la IA equivocándose en un hecho. Un modelo mejor resuelve ese último 5%. El resto es ingeniería de prompts, recuperación de información, coaching a los agentes sobre las respuestas que ya envía tu propio equipo, y profundidad de integración.
Por eso también el borrador estilo copiloto es donde deberían empezar la mayoría de los equipos, el patrón detrás de las herramientas de asistencia al agente, y por eso una ruta de escalada limpia importa más que una posición en el leaderboard. Si estás construyendo el caso de negocio y no la pila técnica, IA frente a coste humano es el marco más útil.
El fallo que más vigilo en producción es el que ningún benchmark de la página de lanzamiento de Meta mide. Un agente narrando una búsqueda que nunca ejecutó. Reportando archivos que nunca guardó. Un agente que afirma haber hecho el trabajo es un problema más difícil que un agente que lo hace mal, y un modelo que olvida su propio razonamiento entre turnos no es en el que confiaría para que se autoinforme.
Prueba eesel para soporte, no una clave de modelo en bruto
Si lo que de verdad quieres es una IA que responda tickets de clientes, la pregunta útil tiene poco que ver con qué modelo encabeza el índice este mes. Es si puedes demostrar que la cosa es segura antes de que le responda a nadie.
Ahí es donde está construido eesel. Puedes ejecutar un agente de IA en simulación contra tus propios tickets históricos, y leer sus respuestas sobre conversaciones pasadas reales antes de que un solo cliente vea una. Si las respuestas todavía no están a la altura, empiezas en modo copiloto, donde redacta y tu equipo sigue enviando.
La configuración es una conexión con la mesa de ayuda, no un proyecto. Se integra con Zendesk en pocos minutos, lee el centro de ayuda que ya has escrito, y factura por ticket resuelto en lugar de por millón de tokens, así que la factura refleja el trabajo hecho en lugar de lo locuaz que estuviera el modelo ese día. Gratis para probar, y los precios son públicos.
El veredicto
Muse Spark 1.1 es un buen modelo con la etiqueta equivocada. Meta vendió un agente, y los benchmarks de agente son sus peores resultados. Según la evidencia, es el mejor modelo rápido y barato de una sola pasada disponible ahora mismo, con una puntuación fuerte en generación de código y una tarifa de caché que nadie más iguala.
Júzgalo por el trabajo que tienes y no por la categoría en la que Meta lo archivó, y se vuelve fácil ubicarlo. Cómpralo para los millones de llamadas cortas. Reserva algo más fuerte para las ejecuciones largas. Y no dejes que una ventana de 1M de tokens te convenza de abandonar la recuperación de información. Con aproximadamente un octavo del coste por tarea de Opus 5, ser el segundo mejor en los trabajos correctos es un negocio perfectamente bueno.
Preguntas frecuentes
¿Meta Muse Spark 1.1 es bueno de verdad?
¿Cómo se compara Muse Spark 1.1 con Claude Opus 5?
¿Muse Spark 1.1 es rápido?
¿Muse Spark 1.1 alucina?
¿Puedo usar Muse Spark 1.1 con Claude Code o Codex?
/v1, los cinco alias de modelo redirigidos y ANTHROPIC_AUTH_TOKEN en lugar de una clave de API. La trampa mayor es que la ruta de Chat Completions descarta el razonamiento del modelo entre turnos, así que se repite y se contradice en ejecuciones largas. Usa la Responses API en su lugar.¿Muse Spark 1.1 vale la pena para atención al cliente?
¿Dónde puedo usar la Meta Model API?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








