
O preço do Meta Muse Spark 1.1, a tabela completa
A Meta publica isso em dois lugares, e os dois concordam, o que nem sempre acontece. O blog Meta for Developers indica que o pagamento por uso começa em $1,25 de entrada e $4,25 de saída por milhão de tokens. A tarifa em cache e a linha de busca vêm do próprio documento da Meta sobre preços e limites de taxa. E a tabela de fornecedores do OpenRouter lista a Meta como o único fornecedor com esses mesmos três números.
| Item | Tarifa | Base |
|---|---|---|
| Tokens de entrada | $1,25 / 1M | Por token, uniforme em toda a janela de 1M |
| Tokens de entrada em cache | $0,15 / 1M | Automático em qualquer prefixo estável correspondente, 88% de desconto sobre a tabela |
| Tokens de saída | $4,25 / 1M | Inclui tokens de raciocínio ocultos |
| Grounding por busca na web | $2,50 / 1.000 consultas | Por consulta, cobrado além dos tokens da requisição |
| Entrada de imagem, vídeo, áudio, PDF | Nenhuma tarifa separada publicada | Convertido em tokens de entrada, cobrado a $1,25 |
| Sobretaxa de contexto longo | Nenhuma | Mesma tarifa a 5 mil tokens e a 900 mil |
| Desconto por lote | Não publicado | Não existe endpoint de lote na referência da API |
| Gasto mínimo | Nenhum | Sem compromisso, sem taxa de plataforma, sem cobrança por assento |
| Créditos gratuitos | $20 por única vez | Por conta, sem expiração publicada |
Três pontos estruturais primeiro, antes dos números. Eles mudam o que a tabela de preços realmente significa.
Não há taxa por requisição nem por assento. Talvez pareça óbvio, até você comparar com a forma como fornecedores de helpdesk cobram por IA. Os preços de IA da Gorgias cobram por interação, e os preços de IA da HubSpot cobram em créditos que você precisa converter mentalmente antes que signifiquem algo.
Não há sobretaxa de contexto longo. A documentação da Meta é explícita sobre isso: a tarifa não muda à medida que o contexto se enche. É uma diferenciação real, e eu volto a isso mais abaixo, assim que a tabela comparativa mostrar o que a OpenAI e o Google fazem em vez disso.
E não há nível de lote nenhum. Eu vasculhei a referência da API da Meta atrás de um. Nada. O mais próximo oferecido é um limite de 600 envios em segundo plano por minuto por equipe, e isso é um teto de throughput, não um desconto.
Quatro medidores, e o que você orçou é o menor deles
O erro que vejo engenheiros cometerem com qualquer nova API de modelo é sempre o mesmo: ler dois números na página e construir toda a planilha em cima desses dois números. O Muse Spark 1.1 opera quatro medidores ao mesmo tempo. Eles se comportam de forma distinta o suficiente para que a tarifa de entrada e saída sozinhas não prevejam sua fatura.

Coloque seus próprios números contra os quatro medidores e veja qual está realmente gastando:
O medidor 3 é o que se move
O Muse Spark 1.1 pensa antes de responder. O blog de desenvolvedores da Meta diz isso com bastante clareza, e os tokens gastos nesse pensamento voltam na resposta como usage.completion_tokens_details.reasoning_tokens. Eles são cobrados na tarifa de saída.
O que significa que o preço de tabela de $4,25 está sendo aplicado a tokens que você nunca vê. O tamanho dessa pilha é definido por reasoning_effort, que vai de minimal a xhigh. Um único parâmetro, e ele pesa mais na sua fatura do que qualquer escolha sobre qual modelo chamar.
Isso também explica por que as próprias pontuações de benchmark da Meta são difíceis de precificar. Todo resultado do Muse Spark 1.1 no relatório de avaliação da Meta foi executado com esforço de raciocínio xhigh, a configuração mais cara que a API oferece. Então a capacidade publicada e a tabela de preços barata não descrevem a mesma configuração.
A Artificial Analysis colocou um número nessa verbosidade. Ao longo de toda a execução do Intelligence Index, o Muse Spark 1.1 gerou 94 milhões de tokens de saída contra uma mediana de categoria de 63 milhões, segundo a Artificial Analysis, que o chama de um tanto verboso, cerca de 49% acima da mediana do seu nível. Por tarefa, isso equivale a cerca de 22.000 tokens de saída.
A entrada em cache é o desconto que já está ativado
A tarifa em cache de $0,15 é 8,3 vezes mais barata que a entrada nova. Mas o que importa mais é que você não precisa optar por ela. A documentação de preços da Meta afirma que o prefixo estável entra em cache automaticamente, sem flag para ativar e sem chave de cache para ninguém gerenciar.
Profissionais no Hacker News perceberam que essa era a verdadeira notícia, à frente da tarifa de destaque:
"É, isso se compara mais diretamente ao xAI Grok 4.5. Em ambos os casos, a direção é 'inteligência nível opus por preços de haiku', o que é um baita diferencial para desenvolvedores de aplicações que querem incluir modelos assim em seus produtos. Estou testando trocar haiku e sonnet por Grok 4.5, e talvez experimente este também (é bem mais barato, principalmente em cache)."
Outra pessoa no mesmo tópico fez a comparação de cache em voz alta:
"O Grok 4.5 tem uma tarifa relativamente alta de $0,50 por milhão de tokens de entrada em cache, comparado a $0,15 deste modelo."
O OpenRouter observa em sua própria página do modelo que, uma vez que o prompt caching entra em ação, os preços efetivos podem ficar de 60 a 80% abaixo do preço de tabela do fornecedor, dependendo de quanto do contexto se repete. E se você roda um system prompt fixo com um turno de usuário rotativo no final, essa é exatamente a sua situação.
O grounding por busca na web é cobrado separadamente
O quarto medidor é o que as pessoas mais deixam passar, principalmente porque não é uma tarifa por token de forma alguma. Fazer o grounding de uma requisição com busca na web custa $2,50 por 1.000 consultas além de qualquer token que essa requisição consuma. Perto da saída, isso permanece pequeno em taxas de consulta altas. Pequeno não é zero, porém, e isso escala conforme a frequência com que o modelo decide que precisa ir buscar algo, não conforme quantas chamadas você envia.

Entradas que não são texto funcionam ao contrário. Imagem, vídeo, áudio e PDF estão todos na documentação de modelos como modalidades de entrada, e nenhuma delas tem uma tarifa própria publicada. Elas são convertidas em tokens de entrada e cobradas a $1,25. Mais simples que a maioria dos fornecedores, sem dúvida. Também significa que você não consegue prever uma carga de trabalho multimodal até medir a tokenização primeiro.
O número que realmente prevê sua fatura
Pondere os três medidores de tokens da forma como uma carga de trabalho real e repetida faria, ou seja, sete partes de leitura de cache contra duas partes de entrada nova e uma parte de saída, e o Muse Spark 1.1 sai a $0,78 por milhão de tokens. Esse é o número que eu colocaria em um orçamento. Nem $1,25, nem $4,25.
Melhor ainda, meça tarefas inteiras. É exatamente isso que a AA faz, e é onde o modelo parece mais forte:
| Medida | Muse Spark 1.1 | Contexto |
|---|---|---|
| Tarifa combinada, ponderação 7:2:1 | $0,78 / 1M | Contra um preço de tabela de $1,25 / $4,25 |
| Custo por tarefa do Intelligence Index | ~$0,29 | 4º mais barato entre os 26 modelos de ponta listados |
| Custo total para rodar o índice completo da AA | $548,07 | O Claude Fable 5 precisou de ~$5.631 para a mesma execução |
| Tokens de saída por tarefa | ~22.000 | 12º mais enxuto entre 26, contra 5.000 do mais enxuto |
| Pontuação do Intelligence Index v4.1 | 51 | O Opus 5 no esforço máximo pontua 61 |
| Velocidade de saída | 211,9 tokens/seg | 4º de 184, mediana da categoria 74,0 |
A comparação que sustenta o argumento não é contra o topo da tabela. É uma linha abaixo. O Muse Spark 1.1 pontua 51 no índice da AA por cerca de $0,29 por tarefa. O Gemini 3.6 Flash pontua 50 por cerca de $0,56. Um ponto a mais no índice por aproximadamente metade do custo por tarefa é todo o argumento de venda, e ele se sustenta sob medição independente, o que é mais do que a maioria das alegações de lançamento consegue.
O próprio gráfico de lançamento da Meta faz o mesmo argumento visualmente, e é preciso reconhecer que ele é honesto sobre o teto.

Como o preço do Muse Spark 1.1 se compara
Todos os números abaixo vêm do preço de tabela publicado pelo próprio fornecedor, por milhão de tokens, nível padrão, verificado em 5 de agosto de 2026.
| Modelo | Entrada / 1M | Saída / 1M | Entrada em cache | Sobretaxa de contexto |
|---|---|---|---|---|
| Meta Muse Spark 1.1 | $1,25 | $4,25 | $0,15 | Nenhuma |
| DeepSeek V4 Flash | $0,14 | $0,28 | $0,0028 | Nenhuma, mas uma sobretaxa de 2x no horário de pico está chegando |
| GPT-5.6 Luna | $0,20 | $1,20 | Não listado | Sim |
| Gemini 3.6 Flash | $1,50 | $7,50 | Não listado | Não listado |
| GPT-5.6 Terra | $2,00 | $12,00 | Não listado | Sim, $4 / $18 acima do limite |
| Claude Sonnet 5 | $2,00 subindo para $3,00 | $10,00 subindo para $15,00 | Não listado | Nenhuma |
| Gemini 3.1 Pro Preview | $2,00 | $12,00 | Não listado | Sim, $4 / $18 acima de 200k |
| Kimi K3 | $3,00 | $15,00 | $0,30 | Nenhuma |
| Claude Opus 5 | $5,00 | $25,00 | Não listado | Nenhuma |
| GPT-5.6 Sol | $5,00 | $30,00 | Não listado | Sim, $10 / $45 acima do limite |
Duas notas de rodapé nessa tabela decidem mais do que a própria ordem.
O $2/$10 do Sonnet 5 é introdutório. A própria nota de rodapé da Anthropic mantém isso até 31 de agosto de 2026, e depois sobe para $3/$15. Então, a partir de 1º de setembro, a saída do Sonnet 5 custa 3,5 vezes o que custa a saída do Muse Spark 1.1.
O GPT-5.6 tem níveis por tamanho de prompt. Ao cruzar o limite de contexto curto, o Sol salta para $10 de entrada e $45 de saída, com o Terra indo para $4 e $18. O Gemini 3.1 Pro faz o mesmo movimento acima de 200 mil tokens.
O Muse Spark 1.1 publica uma única tarifa fixa até chegar a um milhão de tokens. Para uma carga de trabalho de agente com contexto longo, isso vale mais do que uma pequena diferença na tarifa base, com folga. As grades completas estão em todos os modelos da OpenAI, caso você queira compará-las lado a lado.
Nem todo mundo no Hacker News ficou impressionado. Dois comentários que vale a pena manter em vista:
"isso não é subsídio. isso é caro demais para um modelo sem nome."
"O hype do GLM 5.2 já soprava bem antes deste. Nem a xAI nem a Meta realmente fizeram diferença de outra forma — resultados parecidos / preços parecidos (com o GLM 5.2)."
Ambos os pontos são justos. O Muse Spark 1.1 tem preço competitivo dentro de um grupo que já existe, e não está derrubando os preços desse grupo.
Os limites de taxa são o teto de custo que ninguém lê
A tabela de preços diz quanto custa um token. Os limites de taxa dizem quantos você tem permissão de comprar, e para uma carga de trabalho de agente, essa segunda restrição é a mais difícil.
| Nível | Requisições/min | Tokens/min |
|---|---|---|
| Gratuito | 60 | 2.000.000 |
| Pago | 3.000 | 4.000.000 |
Segundo o documento da Meta sobre preços e limites de taxa, mais 600 envios em segundo plano por minuto por equipe. Sob essa tabela existem detalhes que importam mais do que a tabela em si:
- A forma do nível gratuito é incomum. Seu teto de tokens fica na metade do nível pago, enquanto seu teto de requisições é 50 vezes menor. Sessenta requisições por minuto com 2M de tokens disponíveis significa que o nível gratuito foi feito para um punhado de chamadas bem grandes. Não para um loop de agente falante batendo na API centenas de vezes por minuto.
- Os limites são por equipe, não por chave. A documentação da Meta especifica que várias chaves dentro de uma mesma equipe compartilham a mesma cota. Então o truque comum de distribuir chamadas entre várias chaves não gera nenhuma folga aqui.
- A cota é observável. Toda resposta bem-sucedida traz
x-ratelimit-remaining-tokensex-ratelimit-remaining-requests, o que permite recuar com base em números reais em vez de adivinhar.
O que a Meta não publicou
Ser honesto sobre as lacunas é melhor do que preenchê-las com suposições. Então aqui está o que eu não consegui encontrar em nenhuma página da própria Meta.
Sem desconto por lote. As duas principais concorrentes da Meta listam um nível de lote de 50%. A Meta não lista nada, e nem existe um endpoint de lote na referência da API para receber desconto, em primeiro lugar.
Sem tarifas por modalidade. Imagem, vídeo, áudio e PDF são entradas suportadas, nenhuma com preço por unidade publicado. Elas são cobradas como tokens de entrada, e isso é ótimo até você precisar prever uma carga de trabalho de vídeo.
Sem expiração para os $20. O blog de desenvolvedores da Meta confirma o crédito gratuito como único por conta. Nenhuma página em lugar nenhum diz quando ele expira.
A retenção de dados exigiu um tópico inteiro para se esclarecer. Surgiu primeiro no Hacker News como uma reclamação, e depois se resolveu em um achado real, que é o tipo de fonte mais útil que existe:
"Onde está a informação sobre a política de retenção de dados para usos pagos por token da API? Todo outro fornecedor tem uma e deixa claro como lida com seus dados. Uma olhada rápida não mostra nenhuma para essa nova oferta."
"Prompts pagos não são usados para treinamento. A retenção de dados não é totalmente clara, eles a mantêm se acharem que você está infringindo as regras, mas não fica claro por quanto tempo mantêm se não acharem que você está."
Sem preço para o consumidor no Meta One. As páginas de ajuda da Meta confirmam que existe uma assinatura paga para consumidores em teste limitado, e nomeiam os níveis do Meta One como Plus, Premium, Advanced, Expert e Max. Nenhum valor em dólares para nenhum deles, em lugar nenhum. Então qualquer preço para consumidor citado em outro lugar deve ser tratado como não verificado. O próprio Meta AI para consumidor continua gratuito, e o Muse Spark 1.1 já está exposto lá no modo Thinking sem cobrança declarada, o que vale a pena saber antes de pagar por acesso à API só para avaliar o modelo.
A barreira que você encontra antes da fatura
Nada desse preço está acessível fora dos Estados Unidos por enquanto. O próprio post de lançamento da Meta coloca a API de Modelos da Meta em pré-visualização pública para desenvolvedores dos EUA, e o OpenRouter mantém a mesma restrição de país na página do modelo. Contornar isso não funciona.
Desenvolvedores esbarraram direto nisso:
"Tentei ter acesso à API, aparentemente a API do modelo não está disponível na minha região..."
"Não sei onde preciso me cadastrar para experimentar. Qual é o preço? É API ou assinatura, o que é afinal?"
Aqui não há lista de espera, nem etapa de aprovação. O quickstart da Meta é só painel, chaves de API, criar chave. A API é compatível com o SDK da OpenAI, então trocar uma URL base cobre a maior parte do trabalho de integração. O limite de elegibilidade fica nas páginas de marketing em vez de na documentação, por isso as pessoas só descobrem depois de se cadastrar.
Custo por milhão de tokens é a unidade errada para uma equipe de suporte
Aqui é onde eu deveria ser direto sobre para quem essa tabela de preços é feita. Está construindo um agente de código ou uma ferramenta de pesquisa? Então $0,78 combinado é um bom negócio, e a análise do Muse Spark 1.1 é o lugar para saber se a capacidade atinge o seu padrão.
Mas se você está tentando descobrir quanto custa uma IA para responder aos seus clientes, tokens são completamente a unidade errada. A unidade é um ticket resolvido, e a dispersão nessa unidade é enorme. Uma conta de e-commerce sobre a qual tenho números reais processava cerca de 700 tickets por semana a aproximadamente $1,07 por ticket. A própria tarifa de pagamento por uso da eesel é de $0,40 por ticket, sem taxa de plataforma, e os preços da eesel estão ali mesmo para conferir. Mesma classe de modelo por baixo. Mais do que o dobro de dispersão, causada inteiramente pelo que cerca o modelo.
E a diferença entre um modelo acertar e um modelo estar pronto para uso é maior do que qualquer diferença de preço. Um varejista alemão de joias, processando cerca de 1.000 tickets por mês no Zendesk e na Shopify, submeteu a eesel a um teste com validação cruzada em tráfego real. O resultado: 93% de precisão na triagem, 100% de detecção de spam sem falsos positivos nos 22% da caixa de entrada que eram spam, 88% de precisão direcional nos rascunhos, e apenas 12% dos rascunhos enviados como estavam, com uma taxa de erro factual de 7%.
Leia esses dois últimos números juntos. Direcionalmente correto 88% das vezes, pronto para uso 12% das vezes. Quando eu decompus por que os agentes reescreviam os rascunhos, cerca de 65% se devia a comprimento e tom, cerca de 20% precisava de dados que ninguém tinha conectado ainda, como ERP e logística, e apenas cerca de 5% era a eesel errando factualmente. A qualidade do modelo era 5% do problema. O resto era contexto, tom de voz e profundidade de integração, exatamente a parte que uma tarifa de token mais barata não resolve em nada. Esse é o argumento em RAG vs. LLM e em respostas incorretas, e a solução está mais próxima do coaching de agentes do que de um upgrade de modelo.
A outra coisa que uma tabela de preços não consegue precificar é saber quando não dizer nada. Uma líder de CX em uma marca DTC de suplementos, processando cerca de 7.000 tickets do Gorgias por mês, disse isso melhor do que eu conseguiria:
"A IA nunca vai conseguir responder 100% das perguntas, mas se ela tentar e simplesmente responder 'desculpe, não sei isso', eu não consigo ir checar todos os meus 7.000 tickets para ver se a IA realmente deu uma boa resposta, e aí o sentido meio que se perde. Eu preciso de uma IA que só lide com os tickets nos quais ela está confiante e deixe todos os outros em paz."
Isso é um limiar de confiança mais um caminho de escalonamento. Não é um modelo. É trabalho de produto, e é exatamente por isso que o handoff da IA e a transferência para um humano tomam mais do meu tempo do que a escolha de modelo jamais tomou.
Construir isso você mesmo na API de Modelos da Meta é uma opção real, e eu não vou fingir o contrário. Algumas equipes deixaram a eesel para construir diretamente sobre uma API de ponta, e funcionou para elas. A versão honesta dessa troca, porém, veio de um líder de engenharia em uma empresa de caixas eletrônicos de Bitcoin com uma base de conhecimento de 300 artigos no Confluence e Telegram, que foi pelo caminho contrário:
"Poderíamos ter tentado escrever nossa própria aplicação de LLM, mas não queríamos investir nosso tempo nisso. Queríamos algo que não precisássemos manter."
O modelo nunca foi a parte difícil. A manutenção era a parte difícil. Se você quiser ver essa bifurcação bem explicada, tanto Anthropic vs. APIs da OpenAI quanto os preços do AgentKit cobrem o que o caminho de construir por conta própria realmente custa depois que se contam as partes que não são tokens.
Experimente a eesel nos seus próprios tickets
Chegou até aqui orçando uma IA de suporte em vez de um experimento de API? Pule a matemática de tokens. O agente de IA para helpdesk da eesel lê a central de ajuda e os tickets passados que você já tem, e cobra $0,40 por ticket, sem taxa de plataforma.
Ele se conecta ao helpdesk que você já usa, incluindo Zendesk, Freshdesk e Gorgias, então ninguém no time precisa aprender uma ferramenta nova para tirar valor dele.
As fontes de conhecimento se conectam da mesma forma. Uma central de ajuda hospedada no Confluence se torna uma fonte no primeiro dia, não um projeto de migração.
Antes de responder a qualquer pessoa, ele simula contra seus próprios tickets históricos, então a taxa de resolução e o custo aparecem primeiro contra o seu tráfego real. Foi essa etapa que transformou um teste de 88% e 12% em algo que valia a pena colocar em produção. Um app de motoristas de economia gig no Zendesk fez um teste de 7 dias, e a Gridwise resolveu 73% das solicitações de nível 1 no primeiro mês.

Grátis para experimentar, e os números caem na sua própria fila antes de você se comprometer com qualquer coisa. Se preferir comparar ferramentas primeiro, os panoramas por onde começar são melhor software de helpdesk com IA e melhor agente de IA, enquanto custo do atendimento ao cliente com IA faz a conta por resolução direito.
O veredito sobre o preço do Muse Spark 1.1
$1,25 e $4,25 são reais, verificados, e não são os números que vão decidir sua fatura. Planeje com $0,78 combinado e $0,29 por tarefa. Assuma que o desconto de cache já está trabalhando a seu favor, e trate reasoning_effort como o mostrador de preço que ele de fato é. A tarifa fixa ao longo de um milhão de tokens é uma vantagem real sobre a OpenAI e o Google, a falta de um nível de lote é uma lacuna real, e a barreira exclusiva para os EUA é a restrição que você encontra antes que qualquer outra coisa importe.
Para uma carga de trabalho de suporte, mantenha o enquadramento correto. O preço do token é uma variável do custo por ticket resolvido. Não é a maior variável.
Se essa é a sua pergunta real, há leituras mais profundas para cada parte: automação de tickets de suporte para o resultado, triagem de tickets para o mecanismo, e depois taxa de resolução para medir se algo disso funcionou.
E quando o financeiro pedir para você justificar o gasto, a comparação que eles realmente vão querer ver é custo de IA vs. agente humano.
Perguntas frequentes
Quanto custa o Meta Muse Spark 1.1?
O Muse Spark 1.1 é mais barato que o Claude ou o GPT-5.6?
Qual é o preço do Meta Muse Spark 1.1 para entrada em cache?
O Meta Muse Spark tem um nível gratuito?
Há limites de taxa na API de Modelos da Meta?
Existe desconto por lote (batch) para o Muse Spark 1.1?
Posso usar o Muse Spark 1.1 fora dos Estados Unidos?
Quanto custa o Meta One?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








