Meta Muse Spark 1.1 a examen: un techo alto y un suelo bajo

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edición August 5, 2026

Verificado por expertos
Una mesa de trabajo de desarrollador donde un modelo de IA termina una tarea con limpieza y se atasca en la siguiente, en el color azul de marca de Meta

Qué entiendo por análisis, y qué no pude probar

Muse Spark 1.1 se lanzó el 9 de julio de 2026, así que ha pasado unas cuatro semanas en el mundo real y no cuatro días. Eso importa. Ahora hay datos independientes, no solo las sensaciones del día de lanzamiento. El panorama más amplio de la empresa está en mi resumen de Meta AI.

Hay menos reportes de primera mano de los que suele generar un lanzamiento puntero, y la razón es estructural. La Meta Model API se abrió solo para Estados Unidos. Desarrolladores reportaron estar bloqueados el primer día desde Vietnam, Canadá y Argentina, y no llegó a OpenRouter hasta aproximadamente una semana después. Un comentarista lo resumió de forma directa:

Hacker News

«Que no esté disponible en Openrouter hace que sea muy difícil probarlo. Iba a compararlo con Grok 4.5 y GPT-5.6 Luna, pero no quiero registrarme en Meta para esto a menos que valga la pena.»

Así que un hilo de lanzamiento con 413 puntos solo produjo un puñado de reportes de uso real. Todo lo que sigue se apoya en tres tipos de fuentes: las pruebas independientes de Artificial Analysis y el propio informe de evaluación de 105 páginas de Meta, más el pequeño número de ingenieros que realmente lograron hacerlo funcionar. Cuando nadie ha probado algo, lo digo en lugar de rellenar el hueco.

El gráfico que explica todos los demás resultados

Aquí está la clasificación de Muse Spark 1.1 en los benchmarks que componen el Intelligence Index. Mismo modelo, misma semana, un solo laboratorio ejecutando todas las pruebas.

Un modelo clasificado en seis benchmarks, desde el 3º de 26 en escritura de código hasta el 25º de 26 en razonamiento de contexto largo, con un corchete que abarca toda la distancia etiquetado como mismo modelo
Un modelo clasificado en seis benchmarks, desde el 3º de 26 en escritura de código hasta el 25º de 26 en razonamiento de contexto largo, con un corchete que abarca toda la distancia etiquetado como mismo modelo

La mayoría de los modelos son aburridos de una forma útil. Se sitúan aproximadamente en el mismo percentil sea cual sea la prueba, así que un solo número predice el resto. Este no. La distancia entre su mejor y su peor puesto es mayor que toda la brecha entre el nivel de precio más alto y el más bajo del mercado.

Por eso el titular que todos repiten, 50,6 frente al 60,7 de Opus 5, casi no te dice nada sobre lo que puedes hacer con esa información. Promedia un resultado excelente con uno pobre. Lo que necesitas saber es cuál de los dos estás comprando.

Dónde de verdad gana

Aquí hay tres cosas reales, y preferiría que la crítica que viene más abajo no las enterrase.

Escribe bien código. No «bien para el precio». Bien, sin más. En SciCode supera a Claude Opus 5, GPT-5.6 Sol y Grok 4.5. La frase «Meta va por detrás en programación» que siguió al lanzamiento se refiere a las ejecuciones de agente largas, no a la generación de código, y son dos trabajos distintos.

ModeloSciCode
Kimi K3 (max)58,7%
Muse Spark 1.1 (xhigh)58,2%
GPT-5.6 Sol (high)56,9%
Claude Opus 5 (max)55,7%
Grok 4.5 (high)54,1%
Gemini 3.6 Flash52,7%
DeepSeek V4 Flash49,9%

Es lo más rápido del tablero. 217,4 tokens de salida por segundo frente a 55,7 de Claude Opus 5, y algo por delante de Gemini 3.6 Flash, que tiene 213,5. En cualquier caso de uso de cara al usuario, la gente nota una diferencia de rendimiento de 4x antes de que nadie la mida.

La tarifa de caché es la parte mejor diseñada del producto. A 0,15 $ por millón, eso supone un descuento del 88%, aplicado automáticamente, sin ninguna clave de caché que tengas que gestionar. Un ingeniero señaló por qué esa proporción importa más que el precio anunciado:

Hacker News

«El precio del input en caché tiene una buena proporción. Compáralo con Grok 4.5, que salió a 2 $/6 $ pero luego cobra en silencio 0,50 $ por 1M de tokens de input en caché. ¡Eso es tan alto como Opus 4.8!»

Junta todo eso y el buen caso de uso toma una forma evidente: prompts cortos, un system prompt estable, volumen enorme, una decisión por llamada. Clasificación por lotes, etiquetado, extracción, enrutamiento. La tarifa completa está en mi desglose de precios de Muse Spark 1.1. Para el resto del mercado, empieza por los precios de Claude. La gama de OpenAI está resumida en una sola tabla en todos los modelos de OpenAI.

Dónde se desmorona

Meta posicionó esto como un modelo agéntico. Su anuncio destaca el uso de herramientas y los flujos de trabajo de varios pasos, la línea que separa a los agentes de los chatbots. Así que la prueba justa son las evaluaciones agénticas independientes. Aquí es donde el análisis da un giro.

Benchmark agénticoMuse Spark 1.1Mejor del conjuntoDónde queda
AA-Briefcase Elo868,9Claude Opus 5 con 1718,718º de 19
GDPval-AA v2 Elo1370,6Claude Opus 5 con 1852,0Último de 7
Tau-3 Banking25,2%Kimi K3 con 34,0%9º de 10

La contradicción es difícil de pasar por alto. El modelo vendido por su uso agéntico de herramientas es el peor en rendimiento agéntico del tablero independiente. En GDPval queda 481 Elo por detrás de Opus 5, y los intervalos de confianza no se solapan con nada por encima de él. En uso agéntico de herramientas queda por detrás de DeepSeek V4 Flash, que cuesta 0,14 $ de entrada y 0,28 $ de salida.

Meta no lo niega del todo. Su propio informe de evaluación admite que «para tareas agénticas de largo horizonte (por ejemplo, DeepSWE y DeepSearchQA), las mejoras significativas todavía van por detrás o a la par de los modelos competidores con mejor rendimiento». Esa admisión se mide contra Opus 4.8 y GPT-5.5, ambos una generación por detrás de lo que comprarías hoy.

La lectura de la comunidad se ha asentado en un lugar parecido. Un comentarista, al verlo aparecer cerca de la cima de una tabla de programación, lo tomó como prueba de que la tabla estaba rota:

Hacker News

«tu benchmark está claramente mal si los 3 mejores modelos en Typescript (Combined) son Grok 4.5, Muse Spark 1.1 (jaja), Gemini 3.5! Flash»

El planteamiento más agudo salió de una comparativa entre cuatro modelos. Alguien allí se sorprendió de que Muse Spark produjera el mejor artefacto individual del conjunto y aun así obtuviera un 2 de 5. La aclaración resume el modelo entero en una sola frase:

Hacker News

«2/5 no es calidad, es consistencia, tal como está escrito ahí. Los enlaces completos están al final. La mayoría de los intentos de Spark son fallos»

Techo alto. Suelo bajo. Todo lo demás en este análisis se deriva de eso.

La sesión más larga que alguien ha publicado llega al mismo sitio. Tres horas con el modelo, de un desarrollador ejecutándolo a través de una CLI de programación:

Reddit

«Lo probé durante 3 horas seguidas, y tengo que decir que me decepcionó. No sé qué le ha pasado a Meta últimamente, pero hay que recordar que fueron los creadores de Llama, los que encendieron la mecha del open source de los modelos. Incluso cerrado (al menos ahora), yo diría que está entre Kimi 2.7 y GLM 5.2, ni de cerca de Opus 4.8 medium/Sonnet5»

Tómalo con cautela. Es la tarde de una sola persona, y no reporta ninguna cifra medida. Casi nadie lo hace. En cuatro semanas de Reddit y Hacker News hay apenas una docena de reportes reales de primera mano de gente usando este modelo, y ninguno de ellos publica una cifra que haya medido él mismo. Tampoco nadie ha puesto a prueba en público la ventana de 1M de tokens. En parte por el bloqueo regional, en parte porque un modelo para el que no puedes conseguir una clave de API no acaba en los benchmarks de los aficionados.

¿Deberías confiarle este trabajo a Muse Spark 1.1?

Elige el trabajo que realmente tienes. La respuesta cambia más que el precio.

Cómpralo

Este es el trabajo para el que fue diseñado. Entrada corta, una decisión, volumen enorme, y la tarifa de caché automática hace el resto.

Funciona a 217,4 tokens de salida por segundo, el más rápido del tablero, y con un system prompt estable factura a 0,15 $ por millón en lugar de 1,25 $.

Cómpralo

La debilidad en programación que todos repiten se refiere a las ejecuciones de agente largas, no a escribir código. Si le pides una sola función, está cerca de la cima del sector.

En SciCode queda 2º de 8 con un 58,2%, por encima del 55,7% de Claude Opus 5 y de todas las variantes de GPT-5.6 probadas.

Evítalo

El trabajo de largo horizonte es donde se desvía, y los reintentos devuelven en silencio el ahorro conseguido. Mantén un modelo más potente para las ejecuciones de varias horas.

AA-Briefcase lo sitúa 18º de 19 con 868,9 Elo, por debajo de Gemini 3.6 Flash y de Nemotron 3 Ultra.

Evítalo

La ventana de un millón de tokens es la característica estrella y, a la vez, uno de los resultados medidos más débiles del modelo. Recupera información primero, luego escribe el prompt. No vuelques ahí todo el archivo.

El razonamiento de contexto largo queda 25º de 26, y el propio informe de Meta puntúa 54,1 en MRCR v2 frente al 74,0 de GPT-5.5.

Merece un vistazo

La demo de uso de ordenador es real y verificable, no un montaje, y decide en cada paso si usar un script o hacer clic. Aun así, no lidera el benchmark que más promociona.

El propio informe de Meta lo sitúa en 80,8 en OSWorld-Verified, por detrás del 83,4 de Claude Opus 4.8.

Con cuidado

No inventar datos no es lo mismo que saber cuándo quedarse callado, y esta es la dimensión de alineación más débil del modelo según las propias pruebas de Meta.

La evaluación Petri de Meta puntúa la alucinación de entrada en 1,67, peor que el 1,22 de GPT-5.5 y el 1,34 de Claude Opus 4.8.

El fallo que la propia Meta documenta

Esta es la parte que querría conocer antes de conectar esto a cualquier cosa. Está enterrada en la documentación, no en la publicación de lanzamiento.

Muse Spark 1.1 mantiene privada su cadena de razonamiento, algo normal hoy en día. Lo inusual es lo que ocurre en la ruta de integración más común. La propia documentación de razonamiento de Meta indica que en Chat Completions, el campo reasoning_content se redacta y queda vacío antes de llegar a quien hace la llamada, «así que no hay nada que reproducir y cada turno razona desde cero».

La guía de agentes de programación de Meta explica la consecuencia: el modelo «puede perder el hilo de su propio razonamiento previo y comportarse de forma errática: repitiendo trabajo que ya hizo, contradiciendo pasos anteriores».

Un modelo vendido por su trabajo agéntico de varios pasos olvida su propio razonamiento entre turnos en la ruta que usan por defecto la mayoría de las herramientas. El razonamiento multi-turno solo sobrevive en la Responses API, donde el servidor mantiene el contexto por ti a través de previous_response_id.

Nada de esto es teórico. El mejor reporte práctico del lanzamiento describe exactamente esta clase de problema, y viene de un ingeniero que consiguió que Codex funcionara contra la API dentro de un contenedor:

Hacker News

«Es algún tipo de error de parseo o de integración, debido a lo que creo que es que codex no anticipa la llamada a herramientas del lado del servidor y cómo meta trata esos ids... las primeras veces que ejecuté codex con muse, fallaba en su primera llamada que no fuera de búsqueda web.»

Lo arregló, y se mantuvo positivo sobre el modelo. Lo importante es que dos fuentes independientes, la propia documentación de Meta y la primera persona en integrarlo en un entorno real, llegan a la misma causa raíz. El engranaje agéntico es a medida, y los entornos de terceros tropiezan con él.

El número de alucinaciones que todo el mundo cita es el equivocado

Aquí tengo que corregir una lectura halagadora que ha estado circulando, incluida mi propia cobertura anterior.

Muse Spark 1.1 sí tiene una buena tasa de no-alucinación, es decir, se niega a responder en lugar de inventar cosas con bastante frecuencia. Cierto, y algo tiene de valor. Pero el índice compuesto de fiabilidad del conocimiento, que premia las respuestas correctas y penaliza las alucinaciones, lo sitúa en 18,0. Es el más bajo de las doce configuraciones listadas en su propia página de modelo. Claude Opus 5 obtiene 31,3.

Las propias pruebas de alineación de Meta coinciden, con un lenguaje más directo del que ha publicado cualquier competidor. De la evaluación Petri 3.0 en su informe de evaluación: «la alucinación de entrada (1,67) es la principal, más alta que GPT-5.5 (1,22) y Claude 4.8 Opus (1,34)». El mismo pasaje señala un engaño elevado hacia los usuarios y un exceso de negativas elevado.

Así que dos fuentes independientes, una de ellas la propia Meta, llegan a la misma conclusión: la alucinación es la dimensión más débil de este modelo, no la más fuerte.

Aun así, ni siquiera esa es la cifra con la que yo decidiría un despliegue de soporte. Esta sí:

Dos paneles que contrastan una pregunta de benchmark que el modelo rechaza correctamente con una pregunta de mesa de ayuda donde la base de conocimiento promete de más y el modelo está de acuerdo con confianza, ambas puntuadas como correctas
Dos paneles que contrastan una pregunta de benchmark que el modelo rechaza correctamente con una pregunta de mesa de ayuda donde la base de conocimiento promete de más y el modelo está de acuerdo con confianza, ambas puntuadas como correctas

Todo benchmark de alucinaciones mide si un modelo inventa datos sobre el mundo. Casi ningún fallo de soporte tiene ese aspecto. Un equipo de soporte técnico B2B con el que trabajamos, que gestionaba unos 200 tickets al mes en Zendesk y escalaba hacia los 2.000, se topó con la versión real del problema. Su bot le decía a los clientes que su producto daba soporte a vehículos que no estaban en su base de datos, porque su propio centro de ayuda decía «damos soporte a todos los modelos». El modelo fue fiel a su fuente. La fuente estaba equivocada.

Ninguna puntuación en ningún leaderboard detecta eso. Por eso entrenar la IA con una base de conocimiento es un problema de contenido antes que un problema de modelo, y por eso los umbrales de confianza hacen más por la calidad de las respuestas que cualquier mejora de razonamiento.

La misma lógica se aplica río arriba. Acertar en el triaje de tickets mueve la tasa de resolución de forma más fiable que cambiar de modelo. Los patrones de fallo son lo bastante consistentes como para que los problemas de los chatbots de IA los catalogue mejor que cualquier ficha de modelo.

La velocidad es real, pero mira el reloj correcto

El número de rendimiento es real, y es la mejor estadística individual del modelo. El número de latencia necesita una corrección.

MedidaMuse Spark 1.1Claude Opus 5 (max)
Velocidad de salida217,4 tok/s55,7 tok/s
Tiempo hasta el primer token2,89 s-
Tiempo de pensamiento antes de la primera respuesta9,20 s-
Tiempo hasta el primer token de respuesta12,09 s51,22 s

Los 2,89 s en bruto de Meta para el tiempo hasta el primer token son los mejores del tablero. Pero tampoco es lo que experimenta un usuario. Suma 9,2 segundos de razonamiento oculto y el primer token realmente útil llega a los 12,09 s. Aun así, sigue siendo claramente mejor que Opus 5, así que la conclusión se mantiene. Aunque es cuatro veces más lento de lo que sugiere el titular.

Ese mismo razonamiento oculto es lo que impulsa la historia del coste. El 68% de los tokens de salida facturados son pensamiento que quien hace la llamada nunca ve, con 15.164 tokens de razonamiento frente a 7.232 tokens de respuesta por tarea. En la ejecución completa del índice de Artificial Analysis, 360 $ de un total de unos 548 $ se fueron en razonamiento. Tokens baratos, hábito de pensar caro. Es la razón por la que el coste de la atención al cliente con IA nunca coincide con la tarifa publicada.

Cuatro trampas que conviene conocer antes de empezar

Ninguna de ellas es un motivo para descartarlo. Cada una cuesta una tarde si te la encuentras sin avisar.

  1. tool_choice solo acepta "auto". No puedes forzar una herramienta específica, y no existen "required" ni "none". Cualquier otra cosa devuelve un 400.
  2. La salida estructurada viene desactivada por defecto. Con strict: false, la referencia de llamada a herramientas de Meta advierte de que los argumentos generados «no tienen garantizado validar» tu esquema. Valídalos antes de ejecutar nada.
  3. Claude Code necesita tres cambios distintos. Una URL base sin /v1, los cinco alias de modelo redirigidos a muse-spark-1.1, y luego ANTHROPIC_AUTH_TOKEN en lugar de ANTHROPIC_API_KEY.
  4. El MCP se afirma pero no se documenta. La publicación de lanzamiento dice que el modelo generaliza a servidores MCP y habilidades personalizadas. La referencia de llamada a herramientas no documenta ninguna de las dos cosas. Las herramientas definidas por el desarrollador son la única vía de extensibilidad realmente mostrada.

Tampoco hay un límite del lado del servidor para bucles descontrolados de herramientas personalizadas. max_tool_calls limita solo las herramientas integradas de Meta, algo que conviene saber si alguna vez has visto un bucle de agente de IA girar sin fin. La mitad de la delegación está cubierta en orquestación de subagentes, y el argumento a favor de probarlo tú mismo está en evaluaciones de agentes.

Lo que Meta todavía no ha publicado

Los vacíos también son material de análisis, y esta lista es más larga de lo que debería, cuatro semanas después del lanzamiento.

No publicadoPor qué importa
Máximo de tokens de salidaNo puedes dimensionar un límite de solicitud
Fecha de corte del conocimientoNo puedes razonar sobre lo desactualizado que está
Número de parámetrosNingún detalle de arquitectura de ningún tipo
Lista de regiones permitidasTodo lo que se sabe viene de usuarios bloqueados
Duración de la retención de datosLos prompts de pago no entran en entrenamiento, pero no se indica cuánto se retienen
SLA de disponibilidad o uptimeNada en absoluto
Prefijo mínimo cacheableLa tarifa de 0,15 $ depende de una variable no documentada

Meta tampoco aparece en el leaderboard oficial de Terminal-Bench, así que la puntuación autodeclarada ahí no tiene confirmación de terceros. Mi resumen de Muse Spark 1.1 cubre la disputa metodológica en torno a esa cifra. Sigue sin resolverse.

Quién debería comprarlo, y quién debería pasar de largo

Un cuadrante que enfrenta tareas cortas y largas contra trabajo de una sola respuesta y de varios pasos, marcando la clasificación por lotes y las funciones individuales como compra, y las ejecuciones de agente de varias horas y el razonamiento sobre documentos enormes como descarte
Un cuadrante que enfrenta tareas cortas y largas contra trabajo de una sola respuesta y de varios pasos, marcando la clasificación por lotes y las funciones individuales como compra, y las ejecuciones de agente de varias horas y el razonamiento sobre documentos enormes como descarte

Cómpralo si manejas trabajo de alto volumen y horizonte corto: clasificación, etiquetado, extracción, enrutamiento, generación de código de un solo archivo, cualquier cosa donde una llamada produce una respuesta y haces millones de esas llamadas. La velocidad es real y la tarifa de caché es excelente, y con unos 0,29 $ por tarea, el ahorro frente a los precios de Opus 5 es lo bastante grande como para importar.

Pásalo si tu carga de trabajo son agentes de larga duración, ejecuciones de investigación profunda, o cualquier cosa que tenga que razonar sobre un gran conjunto de documentos. Las cifras agénticas independientes no están ni cerca. Este es uno de los pocos casos donde pagar por GPT-5.6 u Opus 5 sale más barato en cuanto cuentas los reintentos. Para entornos de programación en concreto, Codex es hoy la ruta mejor documentada.

Espera si estás fuera de Estados Unidos, o necesitas una política de retención publicada, o necesitas pesos abiertos. En este último punto, Kimi K3 es la opción cercana a la frontera con pesos que de verdad puedes tener en tus manos. El giro hacia pesos cerrados es la parte de este lanzamiento que la comunidad menos ha perdonado.

La lectura moderada, de alguien que sigue el leaderboard, es lo bastante justa como para suscribirla:

Hacker News

«Nuevo respeto por Meta Muse Spark. Parece situarse en muchos puntos dulces del leaderboard. No es el mejor en nada en particular, pero equilibra muy bien coste y rendimiento.»

Qué cambia esto para una cola de soporte

Casi nada. Lo digo como alguien cuyo trabajo consiste, en parte, en notar cuándo un modelo nuevo sí cambia algo.

Cada pocas semanas sale un modelo más barato y más rápido, y alguien pregunta si eso reescribe el plan de su mesa de ayuda. La respuesta honesta es que el modelo nunca fue la limitación. En nuestras propias pruebas cruzadas en eesel, cuando los agentes reescribían un borrador de IA, aproximadamente el 65% de las ediciones eran de longitud y tono. Alrededor de un 20% necesitaba datos a los que la IA no podía acceder en un ERP o un sistema logístico. Solo cerca de un 5% correspondía a la IA equivocándose en un hecho. Un modelo mejor resuelve ese último 5%. El resto es ingeniería de prompts, recuperación de información, coaching a los agentes sobre las respuestas que ya envía tu propio equipo, y profundidad de integración.

Por eso también el borrador estilo copiloto es donde deberían empezar la mayoría de los equipos, el patrón detrás de las herramientas de asistencia al agente, y por eso una ruta de escalada limpia importa más que una posición en el leaderboard. Si estás construyendo el caso de negocio y no la pila técnica, IA frente a coste humano es el marco más útil.

El fallo que más vigilo en producción es el que ningún benchmark de la página de lanzamiento de Meta mide. Un agente narrando una búsqueda que nunca ejecutó. Reportando archivos que nunca guardó. Un agente que afirma haber hecho el trabajo es un problema más difícil que un agente que lo hace mal, y un modelo que olvida su propio razonamiento entre turnos no es en el que confiaría para que se autoinforme.

Prueba eesel para soporte, no una clave de modelo en bruto

Si lo que de verdad quieres es una IA que responda tickets de clientes, la pregunta útil tiene poco que ver con qué modelo encabeza el índice este mes. Es si puedes demostrar que la cosa es segura antes de que le responda a nadie.

Ahí es donde está construido eesel. Puedes ejecutar un agente de IA en simulación contra tus propios tickets históricos, y leer sus respuestas sobre conversaciones pasadas reales antes de que un solo cliente vea una. Si las respuestas todavía no están a la altura, empiezas en modo copiloto, donde redacta y tu equipo sigue enviando.

La configuración es una conexión con la mesa de ayuda, no un proyecto. Se integra con Zendesk en pocos minutos, lee el centro de ayuda que ya has escrito, y factura por ticket resuelto en lugar de por millón de tokens, así que la factura refleja el trabajo hecho en lugar de lo locuaz que estuviera el modelo ese día. Gratis para probar, y los precios son públicos.

El veredicto

Muse Spark 1.1 es un buen modelo con la etiqueta equivocada. Meta vendió un agente, y los benchmarks de agente son sus peores resultados. Según la evidencia, es el mejor modelo rápido y barato de una sola pasada disponible ahora mismo, con una puntuación fuerte en generación de código y una tarifa de caché que nadie más iguala.

Júzgalo por el trabajo que tienes y no por la categoría en la que Meta lo archivó, y se vuelve fácil ubicarlo. Cómpralo para los millones de llamadas cortas. Reserva algo más fuerte para las ejecuciones largas. Y no dejes que una ventana de 1M de tokens te convenza de abandonar la recuperación de información. Con aproximadamente un octavo del coste por tarea de Opus 5, ser el segundo mejor en los trabajos correctos es un negocio perfectamente bueno.

Preguntas frecuentes

¿Meta Muse Spark 1.1 es bueno de verdad?
Depende completamente del trabajo, más que con cualquier otro modelo que haya revisado este año. En generación estática de código obtiene un 58,2% en SciCode, segundo de ocho y por delante de Claude Opus 5 con un 55,7%. En trabajo de conocimiento agéntico cae al puesto 18 de 19 en AA-Briefcase. Cómpralo para trabajo corto, de alto volumen y de una sola respuesta. Para cualquier tarea de larga duración, Claude Opus 5 sigue siendo la opción más segura.
¿Cómo se compara Muse Spark 1.1 con Claude Opus 5?
Artificial Analysis puntúa a Muse Spark 1.1 con 50,6 en su Intelligence Index frente a 60,7 de Claude Opus 5, una diferencia de 10,1 puntos, y Muse Spark ni siquiera entra en el top 20. La contrapartida es el coste: 0,292 $ por tarea del índice frente a 2,336 $, es decir, aproximadamente ocho veces más barato. Si estás eligiendo un nivel de precio y no un ganador, Opus 5 frente a Sonnet 5 repasa la misma decisión.
¿Muse Spark 1.1 es rápido?
Es el modelo más rápido del tablero, con 217,4 tokens de salida por segundo, aproximadamente cuatro veces más que Claude Opus 5. La salvedad está en qué reloj mires. Su tiempo hasta el primer token, de 2,89 s, es el mejor de su clase, pero detrás hay 9,2 segundos de razonamiento oculto, así que el primer token realmente útil llega a los 12,09 s. Aun así, supera a Opus 5 con comodidad de principio a fin.
¿Muse Spark 1.1 alucina?
Más que sus rivales, según dos mediciones independientes. La propia evaluación de alineación Petri 3.0 de Meta señala la alucinación de entrada como la principal debilidad del modelo, con 1,67, peor que GPT-5.5 (1,22) y Opus 4.8 (1,34). Artificial Analysis, por su parte, le da la puntuación más baja del tablero en fiabilidad del conocimiento. En una cola de soporte eso importa menos que el «grounding», que las alucinaciones de la IA en soporte cubre en detalle.
¿Puedo usar Muse Spark 1.1 con Claude Code o Codex?
Sí, y Meta documenta los tres entornos, pero hay trampas reales. Claude Code necesita la URL base sin /v1, los cinco alias de modelo redirigidos y ANTHROPIC_AUTH_TOKEN en lugar de una clave de API. La trampa mayor es que la ruta de Chat Completions descarta el razonamiento del modelo entre turnos, así que se repite y se contradice en ejecuciones largas. Usa la Responses API en su lugar.
¿Muse Spark 1.1 vale la pena para atención al cliente?
Como modelo puro es un motor razonable y barato para triaje y etiquetado. Como solución de soporte, no lo es, porque el modelo nunca fue la parte difícil. Lo difícil son el enrutamiento, la recuperación de información, la escalada y la profundidad de integración, por eso el triaje de tickets con IA y una transferencia a un humano bien hecha mueven más la tasa de resolución que cambiar de modelo.
¿Dónde puedo usar la Meta Model API?
La vista previa pública es exclusiva de Estados Unidos, y desarrolladores reportaron estar bloqueados desde Canadá, Argentina y Vietnam el día del lanzamiento. Meta nunca ha publicado la lista de regiones permitidas. Llegó a OpenRouter cerca de una semana después del lanzamiento, que es cuando de verdad empezaron las pruebas prácticas fuera de Estados Unidos. La tarifa completa y los límites están en mi desglose de precios de Muse Spark 1.1.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Un agente de IA saliendo de un monitor para operar ventanas de aplicaciones y documentos mientras dos colegas observan, en el color azul de marca de Meta
Trending

Meta Muse Spark 1.1: qué es, cuánto cuesta y dónde falla

La primera API de modelos de pago de Meta lanza un modelo agente con 1M de contexto a $1.25/$4.25. En qué es realmente bueno Muse Spark 1.1, y los benchmarks que Meta dejó fuera de la diapositiva.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Dos personas leyendo un gran medidor de uso y ajustando una pila de diales de facturación, en el color de marca azul de Meta
Trending

Precios de Meta Muse Spark 1.1: la factura tiene cuatro medidores

Muse Spark 1.1 tiene un precio de lista de $1.25 de entrada y $4.25 de salida por millón de tokens. Cuatro medidores separados determinan tu factura real, y el precio de lista es el más pequeño de todos.

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026
Ilustración editorial de agentes de codificación en paralelo y ventanas de terminal, que representa el panorama de alternativas a ZCode
Trending

Las 8 mejores alternativas a ZCode en 2026

ZCode es impresionante y tosco a la vez. Aquí tienes las 8 mejores alternativas a ZCode en 2026, con precios reales, contrapartidas honestas y para quién es cada una.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Ilustración editorial de una tabla de clasificación de benchmarks con una barra alta destacada, que representa a ZCode y el modelo GLM-5.2
Trending

ZCode: qué es realmente el nuevo agente de codificación con IA de Z.ai

Un análisis práctico de ZCode, la app gratuita de codificación agéntica del equipo de GLM: el modelo GLM-5.2 que hay detrás, las quejas reales de la semana de lanzamiento y quién debería usarla.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Portada de alternativas a PromptQL sobre un fondo índigo
Trending

Las 8 mejores alternativas a PromptQL en 2026

Las 8 mejores alternativas a PromptQL en 2026, desde Databricks Genie hasta el proyecto open source Wren AI, con precios reales, puntos fuertes y para quién es realmente cada una.

Rama Adi NugrahaRama Adi NugrahaJul 10, 2026
Banner principal del análisis de PromptQL con el logo de PromptQL sobre un fondo índigo
Trending

Análisis de PromptQL (2026): el agente de datos de Hasura, puesto a prueba

Un análisis práctico de PromptQL: cómo el agente de datos de Hasura separa la planificación de la ejecución, cuánto cuesta y si su promesa de fiabilidad se sostiene.

Alicia Kirana UtomoAlicia Kirana UtomoJul 10, 2026
Ilustración editorial de portada para un análisis del modelo de IA Muse Image de Meta, en azul Meta
Trending

Análisis de Meta Muse Image: ¿es realmente bueno?

Meta afirma que Muse Image ocupa el puesto n.º 2 en Arena para generación de imágenes. Comprobé esa afirmación con los propios datos de Meta y las primeras pruebas independientes.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 9, 2026
Ilustración de un modelo de control de robots humanoides, que representa a Gemini Robotics 2
Trending

Gemini Robotics 2: lo que muestran las cifras de DeepMind

Gemini Robotics 2 lanza tres modelos y una tabla de éxito por tarea en la que la mayoría de las puntuaciones no llega al 80%. Esa tabla es lo más útil de todo el lanzamiento.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Una ilustración de una persona seleccionando uno de los cinco diales de esfuerzo de razonamiento en una tira de control estilo Claude Opus 5
Trending

Claude Opus 5: qué es y cómo usarlo de verdad

Claude Opus 5 no es un modelo, son cinco. Una guía práctica sobre las especificaciones, el dial de esfuerzo que decide tu factura y los dos cambios de API que rompen el código antiguo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis