
A tabela oficial de preços do Grok 4.6
Aqui está a tabela ao vivo de modelos de texto da própria página da xAI, todos os modelos, ambas as faixas de contexto, sem arredondamento. O rodapé da página data isso em 3 de julho de 2026.
| Modelo | Contexto | Entrada | Cache | Saída | Longo: entrada / cache / saída |
|---|---|---|---|---|---|
grok-4.6 | 500k | US$ 2,00 | US$ 0,50 | US$ 6,00 | US$ 4,00 / US$ 1,00 / US$ 12,00 |
grok-4.5 | 500k | US$ 2,00 | US$ 0,30 | US$ 6,00 | US$ 4,00 / US$ 0,60 / US$ 12,00 |
grok-build-0.1 | 256k | US$ 1,00 | US$ 0,20 | US$ 2,00 | US$ 2,00 / US$ 0,40 / US$ 4,00 |
grok-4.3 | 1M | US$ 1,25 | US$ 0,20 | US$ 2,50 | US$ 2,50 / US$ 0,40 / US$ 5,00 |
grok-4.20-multi-agent-0309 | 1M | US$ 1,25 | US$ 0,20 | US$ 2,50 | US$ 2,50 / US$ 0,40 / US$ 5,00 |
grok-4.20-0309-reasoning | 1M | US$ 1,25 | US$ 0,20 | US$ 2,50 | US$ 2,50 / US$ 0,40 / US$ 5,00 |
grok-4.20-0309-non-reasoning | 1M | US$ 1,25 | US$ 0,20 | US$ 2,50 | US$ 2,50 / US$ 0,40 / US$ 5,00 |
Três coisas nessa tabela merecem atenção.
O limite de 200k é uma virada para a solicitação inteira. A redação da xAI é inequívoca: modelos com preços de contexto longo cobram as tarifas longas "para todos os tokens de uma solicitação" assim que o prompt atinge o limite. Um prompt de 201.000 tokens não paga 2x apenas no último milhar. Ele paga 2x nos 201.000 completos. Em um loop agêntico que acumula saída de ferramentas turno após turno, ultrapassar essa linha no turno nove reprecifica o turno nove inteiro desde seu primeiro token.
O carro-chefe não tem a janela de contexto mais ampla que a xAI vende. O grok-4.3 e toda a família 4.20 têm 1M; o 4.6 tem 500k pelo dobro da tarifa de saída. Se o trabalho é um único documento enorme em uma única chamada, o modelo mais antigo é ao mesmo tempo mais espaçoso e mais barato.
A entrada em cache é a única coluna em que o 4.6 é mais caro que o 4.5, com US$ 0,50 contra US$ 0,30. Vale a pena ser preciso sobre a direção: a xAI não aumentou um preço no meio do caminho. A tarifa de cache do Grok 4.5 caiu para US$ 0,30 após seu lançamento, e o 4.6 estreou com o número mais antigo. O efeito na tabela de hoje é o mesmo de qualquer forma, e atinge com mais força as cargas de trabalho que reenviam um prompt fixo. Nosso post sobre preços do Grok 4.5 tem a escala anterior, se você estiver comparando gerações, e o guia de preços da xAI cobre toda a linha, incluindo o Grok Imagine e os modelos de voz.
O que as pessoas realmente pagam
Essa é a parte que a cobertura de lançamento nunca tem, porque precisa de tráfego real em vez de um comunicado de imprensa. A OpenRouter publica tanto o preço de tabela quanto o preço que realmente é cobrado dos seus usuários, agregado em solicitações reais.

| Endpoint | Entrada efetiva | Saída efetiva | Tabela | Taxa de acerto de cache | Fatia de tokens |
|---|---|---|---|---|---|
| SpaceXAI | US$ 0,7249 | US$ 6,125 | US$ 2 / US$ 6 | 90,3% | 64,5% |
| SpaceXAI (ZDR) | US$ 0,7812 | US$ 6,116 | US$ 2 / US$ 6 | 88,0% | 35,5% |
| Média ponderada | US$ 0,7448 | US$ 6,122 | US$ 2 / US$ 6 |
Leia as duas colunas separadamente, porque elas contam coisas diferentes.
Na entrada, o preço real é aproximadamente um terço do preço de tabela, e o motivo inteiro é o cache. Nove em cada dez tokens de entrada no tráfego real do Grok 4.6 são servidos a partir do cache a US$ 0,50 em vez de calculados a US$ 2,00. Isso não é um desconto que a xAI anuncia; é uma propriedade emergente de como o modelo é realmente usado, em conversas longas com um prefixo estável.
Na saída, a tarifa efetiva está acima da tabela. US$ 6,122 contra US$ 6,00 significa que uma fatia do tráfego real está ultrapassando 200.000 tokens e pagando a tarifa de contexto longo de US$ 12,00. Pequeno no agregado, mas é evidência direta de que o precipício não é teórico.
O corolário importa mais do que qualquer um dos dois números: sua taxa de acerto de cache é a maior alavanca na sua fatura do Grok 4.6, valendo mais do que qualquer troca de modelo. E não é automático como as pessoas presumem. O cache acontece por conta própria, mas a documentação de cache de prompts da xAI recomenda definir o cabeçalho x-grok-conv-id especificamente "para maximizar sua taxa de acerto de cache", porque isso roteia as solicitações de uma conversa para o mesmo servidor. Pule esse cabeçalho e você pode acabar pagando US$ 2,00 onde a média da frota paga US$ 0,72.
Profissionais que comparam modelos notaram a mesma assimetria do outro lado:
"About the cost, Grok doesn't really cost less outright. Output token is cheaper, but their cache is not that cheap. Grok use less token than Sonnet tho."
Esse comentário é sobre o Grok 4.5, cuja tarifa de cache é a mais barata, a US$ 0,30. No 4.6 o ponto fica mais agudo, não mais suave.
Os itens que ninguém orça
Tarifas de tokens são uma linha de uma fatura muito mais longa. Aqui está tudo mais pelo qual a xAI pode te cobrar na mesma página.

Ferramentas do lado do servidor são cobradas por invocação, além dos tokens.
| Ferramenta | Tarifa |
|---|---|
| Busca na web, busca no X, execução de código | US$ 5 / 1k chamadas |
| Busca de anexos de arquivo | US$ 10 / 1k chamadas |
| Busca de coleções (RAG) | US$ 2,50 / 1k chamadas |
| Compreensão de imagem, vídeo do X, MCP remoto | Baseado em tokens, sem taxa de invocação |
| Geração de imagem | Cobrado nas tarifas da API do Imagine |
O item a observar em qualquer implementação de recuperação é a busca de coleções a US$ 2,50 por 1.000. Esse é o medidor que dispara quando seu agente consulta seus próprios documentos enviados, que é todo o mecanismo por trás de RAG versus um LLM bruto. Toda resposta fundamentada é uma chamada de ferramenta, e toda chamada de ferramenta tem um preço que não tem nada a ver com o modelo.
O armazenamento é outro medidor à parte. O armazenamento de arquivos custa US$ 0,025 por GiB por dia, o armazenamento de coleções US$ 0,10 por GiB por dia, e downloads US$ 0,20 por GiB transferido. Uma coleção de conhecimento de 50 GiB parada custa US$ 5 por dia, alguém fazendo perguntas ou não.
O Priority Processing é um acréscimo fixo de 2x em tudo. Tokens de entrada, saída, cache e raciocínio dobram todos. Dois detalhes justos que a xAI publica e merecem crédito: descontos de cache se aplicam antes do multiplicador, e você só é cobrado na tarifa prioritária quando a resposta confirma "service_tier": "priority". Se a solicitação for atendida no nível padrão, você paga as tarifas padrão.
O desconto em lote exclui o carro-chefe. O desconto de 20% da API em lote cobre o grok-4.3 e as três variantes grok-4.20. Não cobre o 4.6, o 4.5 nem o grok-build-0.1. Então, para trabalho em lote noturno como classificação de tickets ou triagem de backlog, o grok-4.3, de um ano atrás, fica em US$ 1,00 de entrada e US$ 2,00 de saída após o desconto, metade da tarifa do carro-chefe. A tabela principal de preços não dá nenhuma pista disso.
Uma solicitação bloqueada ainda custa dinheiro. Violações detectadas antes da geração na API de Responses carregam uma taxa de US$ 0,05 por solicitação. Você pode pagar cinco centavos por uma saída que nunca recebeu.
Monte sua própria fatura
Só a matemática de tokens vai subestimar o que você gasta. Ative as ferramentas e veja a proporção mudar.
A porta pela qual você compra muda o preço
O mesmo modelo, cinco caminhos de compra, e dois deles ainda não vendem.

A API da xAI é o preço de referência: US$ 2,00 / US$ 0,50 / US$ 6,00, pré-pago, sem nenhuma cota gratuita publicada.
A OpenRouter lista a mesma tarifa idêntica de US$ 2,00 / US$ 6,00 / US$ 0,50 de leitura em cache, e diz claramente que repassa o preço do fornecedor "sem nenhuma margem". O custo está em outro lugar: uma taxa de 5,5% ao comprar créditos, com um mínimo de US$ 0,80, 5% em cripto, e créditos não usados expiram após um ano. Se você trouxer sua própria chave da xAI, o uso acima da cota do plano carrega uma taxa de 5% do que a mesma solicitação teria custado. Ela também opera dois endpoints, padrão e de retenção zero de dados, à mesma tarifa mas com velocidade medida diferente: 74 contra 80 tokens por segundo na mediana, 1,02s contra 0,81s de latência, ambos com 100% de disponibilidade ao longo de 30 dias.
O SuperGrok a US$ 30/mês é o nível de consumidor mais barato que menciona o Grok 4.6 como um benefício, segundo a página de preços da xAI. O SuperGrok Plus custa US$ 100/mês. Free, SuperGrok Lite, SuperGrok Heavy, Business e Enterprise aparecem todos na comparação de planos, mas apenas Free, SuperGrok e SuperGrok Plus têm um valor publicado; o resto é fale-com-vendas ou não listado.
Azure AI Foundry e AWS Bedrock ainda estão uma geração atrás. A página de preços do Grok da Azure chega no máximo ao Grok-4.3 Global, a US$ 1,25 de entrada e US$ 2,50 de saída. Isso é mais barato por token, e são dois lançamentos mais antigo. Se a área de compras exige que a inferência passe por uma única nuvem, o Grok 4.6 ainda não é comprável para você a preço algum. É o mesmo padrão que vimos com o Grok Bot e o criador de agentes de voz do Grok: a xAI lança primeiro para suas próprias plataformas e deixa os revendedores correrem atrás.
Grok 4.6 contra os outros carros-chefe
| Modelo | Contexto | Entrada /1M | Cache /1M | Saída /1M |
|---|---|---|---|---|
| Grok 4.6 | 500k | US$ 2,00 | US$ 0,50 | US$ 6,00 |
| Claude Sonnet 5 | 1M | US$ 2,00 | US$ 0,20 | US$ 10,00 |
| Claude Opus 5 | 1M | US$ 5,00 | US$ 0,50 | US$ 25,00 |
| GPT-5.6 Sol | 1.05M | US$ 5,00 | US$ 0,50 | US$ 30,00 |
| DeepSeek V4 Flash | 1M | US$ 0,14 | US$ 0,0028 | US$ 0,28 |
Na saída, o Grok 4.6 é a opção de nível de fronteira mais barata aqui que não é de peso aberto. US$ 6,00 contra US$ 10, US$ 15, US$ 25 e US$ 30 não é uma decisão apertada, e explica por que o modelo aparece primeiro em agentes de codificação: essas cargas de trabalho consomem muita saída e são flexíveis em contexto.
Ao mudar para a coluna de cache, o ranking se inverte. O Sonnet 5 faz cache a US$ 0,20 contra os US$ 0,50 do Grok 4.6, tem uma janela de 1M sem sobretaxa de contexto longo e carrega um desconto em lote que o Grok 4.6 não tem. Para uma carga de trabalho que reenvia um prompt grande e fixo e retorna três frases, que é exatamente o que uma fila de suporte faz, a tarifa de saída mais barata praticamente não conta.
Uma nota de justiça sobre a própria comparação: a entrada em cache não é o mesmo produto entre fornecedores. A Anthropic e a OpenAI cobram separadamente para escrever uma entrada de cache, o Google cobra armazenamento de cache por hora, e a xAI publica uma tarifa de leitura sem taxa de escrita separada na página. Comparar só a coluna de cache favorece os fornecedores que dividem a cobrança. Se você quiser o campo mais amplo, alternativas ao Grok 4.5 cobre os vizinhos mais próximos e Qwen3.8 Max cobre a ponta de peso aberto.
O que isso realmente custa em uma fila de suporte
Rodando os números nos padrões do widget, o Grok 4.6 custa aproximadamente 1,5 centavo de tokens por conversa, mais outro centavo assim que recuperação e busca são ativadas. Com 20.000 conversas por mês, isso são algumas centenas de dólares.
Agora precifique o resto da implementação: a integração com o helpdesk, as regras de triagem, o portão de confiança, os caminhos de escalonamento, o ciclo de revisão, o plantão para quando algo dá errado. Os tokens são um erro de arredondamento perto de tudo isso.
É por isso que continuo apontando compradores para o custo por resolução em vez do custo por milhão de tokens, e por isso medir o ROI de suporte é um exercício mais útil do que otimizar uma tabela de tarifas.
Dois padrões de falha que vejo repetidamente em conversas de preço, e nenhum dos dois uma tabela de tokens vai te avisar.
O primeiro é volume, não tarifa. Um comprador testando nosso próprio produto chegou a 200 interações em um único dia de avaliação e imediatamente começou a projetar 9.000 por mês. Nada tinha mudado no preço. O que mudou foi a estimativa dele de com que frequência a coisa é usada, que é sempre maior do que a planilha dizia.
O segundo é a forma do próprio modelo de preços. Um usuário em teste fez doze chats de teste, viu o agente performar bem, abriu a página de faturamento e pediu o cancelamento na hora. O produto funcionou. A estrutura da fatura era o problema. É por isso que eu prefiro dar a um comprador de suporte um número por ticket resolvido do que um número por milhão de tokens: ninguém consegue prever o próprio consumo de tokens, e todo mundo consegue contar seus tickets.
E o que um modelo mais barato nunca resolve: o embasamento no seu próprio conteúdo. O corte de conhecimento do Grok 4.6 significa que ele não sabe nada sobre sua política de devolução, seus SKUs ou a interrupção da semana passada. Isso vem da sua base de conhecimento e de tickets passados, e é um custo de implementação independentemente de qual modelo está por baixo.
O mesmo vale para testes adversariais e para a medição de contenção. Itens reais, e nenhuma tabela de tarifas os contém.
A eesel precifica o resultado, não os tokens
Passei os últimos anos construindo a camada entre um modelo e um helpdesk, e o que eu diria a qualquer um lendo uma tabela de tokens pensando em um projeto de suporte é que você está precificando os 5% mais baratos do trabalho.
A eesel é os outros 95%. Ela se conecta ao Zendesk, ao Freshdesk e ao resto em poucos minutos, aprende com sua central de ajuda, macros e tickets resolvidos, então já soa como sua equipe, e simula contra seus próprios tickets históricos antes de responder a um único cliente real. Você vê a precisão nos seus dados primeiro, preenche as lacunas que ela revela, roda de novo, e então vai ao ar.

A cobrança funciona por resultados, não por medidores: 40 centavos por ticket ou chat resolvido, segundo nossa página de preços, cobrado pela conversa e não pela resposta, sem taxas por assento e sem nada cobrado por tickets que seus humanos assumem. Há US$ 50 de uso gratuito sem cartão, você pode rotear uma fatia do volume primeiro, e pode limitar o gasto mensal. Sem cabeçalho de chave de cache para esquecer, sem precipício de 200k, sem linha separada para a busca que produziu a resposta. Nossas páginas de segurança e enterprise cobrem o lado da conformidade.
Se você está escolhendo um modelo para uma fila de suporte em vez de um agente de codificação, o melhor agente de IA para esse trabalho é um ponto de partida melhor do que qualquer tabela de tarifas, e o software de atendimento ao cliente com IA cobre a camada de plataforma acima disso.
Os números aos quais eu submeteria uma implantação são a resolução automatizada de tickets e a taxa de resolução, não dólares por milhão de tokens. Se isso se sustenta em filas reais é para o que serve nossa página de clientes.
Experimente a eesel de graça, rode a simulação, e precifique o resultado em vez dos tokens.

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








