
Resumo
O Grok 4.6 custa 2,00 $ de entrada e 6,00 $ de saída, o preço mais baixo no topo da tabela de inteligência. O problema não é o número, é a forma. Depois de um prompt de 200 mil tokens, cada tarifa dobra para 4 $ e 12 $, e a própria página da xAI diz que as tarifas longas se aplicam a todos os tokens da solicitação, não apenas ao excedente.
Então ninguém troca sensatamente o Grok 4.6 por um modelo mais inteligente. Você troca por uma forma de fatura diferente. Existem três no mercado: o precipício (xAI e OpenAI cobram assim), a janela fixa (Anthropic e Google não fazem isso), e o piso (DeepSeek, Qwen e Kimi, onde a tarifa é baixa o suficiente para que a forma deixe de importar).
Eu construo agentes de IA na eesel, então me importo mais com a fatura do segundo mês do que com o benchmark da semana de lançamento. Em chamadas de vendas encontro sempre a mesma pessoa: um comprador consumiu 200 interações em um único dia de teste e depois teve que calcular quanto custariam 9.000 por mês. Nada em nenhuma tabela de tarifas dizia isso a ele. É esse o número sobre o qual trata este artigo.
Por que alguém deixa um modelo tão barato
O Grok 4.6 não é um modelo fraco. Ele obtém 61 pontos no Artificial Analysis Intelligence Index, empatado com o GPT-5.6 Sol e um ponto atrás do Claude Fable 5, enquanto cobra um quinto da tarifa de saída do Sol. No papel, o motivo para trocar quase não existe.
Depois você o coloca em produção e esbarra em uma de quatro paredes.
O precipício dos 200k repreça toda a solicitação. Este é o que mais surpreende. A página de preços da xAI diz isso claramente no rodapé da tabela: modelos com preços de contexto longo cobram as tarifas longas por todos os tokens de uma solicitação assim que o prompt ultrapassa o limite. Assim, um prompt de 199k custa 0,40 $ de entrada, e um de 201k custa 0,80 $, não 0,398 $ mais um pouco. A janela de contexto anunciada de 500k é real, mas só os primeiros 200k dela têm o preço que o marketing sugere. A tabela de tarifas completa está em nosso detalhamento de preços do Grok 4.6.

Existem sete medidores, não um. Busca na web, busca no X e execução de código custam 5 $ por 1.000 chamadas. A busca em anexos de arquivo custa 10 $ por 1.000. A busca em coleções, a de recuperação, custa 2,50 $ por 1.000. Depois há armazenamento de arquivos a 0,025 $ por GiB por dia, armazenamento de coleções a 0,10 $, e downloads a 0,20 $ por GiB. Um agente que busca em cada turno está rodando uma segunda fatura ao lado da fatura de tokens, além da linha por token que todo mundo orça.
O lote não cobre o carro-chefe. O desconto de 20% em lote da xAI se aplica ao grok-4.3 e às três variantes grok-4.20. Grok 4.6, 4.5 e grok-build-0.1 não recebem nada. Para um backfill noturno, o 4.3, duas gerações mais antigo, em lote sai pela metade da tarifa do carro-chefe.
Você não consegue comprá-lo pela sua nuvem. O Azure AI Foundry vai no máximo até o Grok-4.3, e o Bedrock está na mesma geração. Se sua empresa compra modelos por um marketplace de nuvem, o Grok 4.6 simplesmente não está no cardápio, e nenhum argumento de benchmark muda isso. O panorama mais amplo está em nosso guia de preços da xAI.
"Mudamos para um sistema que funciona bem pela metade do custo. Mas a longo prazo vamos simplesmente construir o nosso, o que é tão possível agora com IA."
Esse é um cliente de médio porte que perdemos, e o instinto está certo com mais frequência do que os fornecedores admitem. A questão é sempre qual limitação você realmente está resolvendo. Se você ainda está na geração anterior, comece por alternativas ao Grok 4.5.
As 7 alternativas em resumo
As tarifas abaixo são os preços de lista publicados pelos próprios fornecedores por 1M de tokens, verificados em 13 de agosto de 2026. A coluna que faz mais trabalho é a quarta.
| Modelo | Entrada | Saída | Penalidade de prompt longo | Leitura de cache | Contexto | Lote | Pesos abertos | Em AWS / Azure / GCP | Índice AA |
|---|---|---|---|---|---|---|---|---|---|
| Grok 4.6 (atual) | 2,00 $ | 6,00 $ | 2x todos os tokens ≥200k | 0,50 $ | 500k | Não | Não | Não | 61 |
| Claude Opus 5 | 5,00 $ | 25,00 $ | Nenhuma | 0,50 $ | 1M | 50% | Não | Sim | 63 |
| Claude Fable 5 | 10,00 $ | 50,00 $ | Nenhuma | 1,00 $ | 1M | 50% | Não | Sim | 62 |
| Claude Sonnet 5 | 2,00 $ | 10,00 $ | Nenhuma | 0,20 $ | 1M | 50% | Não | Sim | - |
| GPT-5.6 Sol | 5,00 $ | 30,00 $ | 2x ≥200k | 0,50 $ | Camada longa | Sim | Não | Sim (Bedrock) | 61 |
| GPT-5.6 Terra | 2,00 $ | 12,00 $ | 2x ≥200k | 0,20 $ | Camada longa | Sim | Não | Sim (Bedrock) | - |
| GPT-5.6 Luna | 0,20 $ | 1,20 $ | 2x ≥200k | 0,02 $ | Camada longa | Sim | Não | Sim (Bedrock) | - |
| Gemini 3.6 Flash | 1,50 $ | 7,50 $ | Nenhuma publicada | 0,15 $ | 1M | 50% | Não | Sim (Vertex) | - |
| Kimi K3 | 3,00 $ | 15,00 $ | Nenhuma | 0,30 $ | 1M | Não | Sim | Não | 57 |
| Qwen3.8 Max | 2,00 $ | 6,00 $ | Nenhuma | 0,25 $ | 1M | Não | Ainda não | Não | Não listado |
| DeepSeek V4 Flash | 0,14 $ | 0,28 $ | Nenhuma | 0,0028 $ | 1M | Não | Sim (MIT) | Não | 50 em esforço máximo |
Duas linhas merecem uma pausa. O Qwen3.8 Max cobra exatamente o que o Grok 4.6 cobra, 2 $ e 6 $, sem precipício e com o dobro da janela, o que o torna o mais próximo de um substituto direto apenas pelo preço. E o Claude Sonnet 5 iguala a tarifa de entrada do Grok cobrando 10 $ de saída em vez de 6 $, comprando uma janela fixa de 1M pela diferença.
Como escolhi estes modelos
Todo modelo aqui precisava estar geralmente disponível hoje, ter preço publicado por token, e ser acessível por uma chave de API normal. Isso exclui modelos em preview restrito e qualquer coisa apenas sob cotação. Depois li a página de preços de cada fornecedor diretamente, em vez de um site comparativo, porque as regras de contexto longo e medidores de ferramentas são exatamente os detalhes que se perdem em um resumo de terceiros.
Não os classifiquei por benchmark. Cinco pontos de índice não vão decidir sua arquitetura. A forma da fatura e o caminho de compra, sim.
1. Claude Opus 5 - o melhor se prompts longos são o problema

O que é. O carro-chefe da Anthropic, lançado em 24 de julho de 2026, atualmente em primeiro no Artificial Analysis Intelligence Index com 63.
Onde supera o Grok 4.6. No comportamento de contexto longo, sem ambiguidade. A documentação de preços da Anthropic afirma que o Claude 4.6 e posteriores incluem a janela completa de 1M ao preço padrão, e detalha a consequência: uma solicitação de 900 mil tokens é cobrada à mesma tarifa por token que uma de 9 mil. Descontos de cache e lote também se aplicam em toda essa janela. Ele também roda no Bedrock e no Vertex, o que resolve a barreira de compras de uma só vez.
Onde não supera. O preço de lista é 2,5x a entrada do Grok e cerca de 4x sua saída, e a diferença real é ainda maior. Testes da comunidade mostraram que o Opus 5 usa cerca do dobro dos tokens de saída do Opus 4.8 no mesmo esforço, e o custo independente por tarefa no índice AA ficou em 2,03 $ contra 0,84 $ do Grok 4.6. Ele também roda muito mais turnos: 103 por tarefa contra 55 do Opus 4.8.
Preços. 5,00 $ de entrada, 0,50 $ de leitura de cache, 25,00 $ de saída. O lote reduz pela metade. O modo rápido dobra. Nossa página preços do Claude Opus 5 tem o detalhamento completo, e Opus 5 vs Sonnet 5 cobre o irmão mais barato.
Veredito. A troca certa quando seus prompts são realmente longos, quando você precisa dos marketplaces de nuvem, ou quando uma tarefa falhar é mais caro do que uma tarefa custar mais. Leia a análise do Claude Opus 5 antes de assumir que a liderança no índice se traduz para sua carga de trabalho.
2. Claude Fable 5 - o melhor se você quer o topo da tabela de avaliação
O que é. O modelo mais caro da Anthropic, e aquele que realmente supera o Grok 4.6 na maior parte da própria tabela comparativa publicada pela xAI.
Onde supera o Grok 4.6. Na tabela de lançamento da xAI, o Fable 5 leva CursorBench, FrontierCode, APEX-Agents, APEX-SWE e o Índice AA de forma clara. São cinco de dez linhas indo para o concorrente no próprio marketing do líder incumbente. Ele carrega a mesma janela fixa de 1M do resto da linha Claude.
Onde não supera. 10 $ de entrada e 50 $ de saída são mais de oito vezes a tarifa de saída do Grok. No AA-Briefcase e no GDPVal-AA, o Grok 4.6 realmente vence, então isso não é uma varredura limpa em nenhuma direção.
Preços. 10,00 $ de entrada, 1,00 $ de leitura de cache, 50,00 $ de saída, 50% de desconto em lote. A Anthropic também lista um Claude Mythos 5 na mesma tarifa com disponibilidade limitada.
Veredito. Recorra a ele quando uma resposta errada sai cara e o volume é baixo. Em alto volume a aritmética fica brutal rapidamente, o que a comparação Opus 5 vs Fable 5 cobre em detalhe.
3. GPT-5.6 - o melhor se você quer três faixas de preço de um único fornecedor

O que é. Uma família, três camadas. Sol no topo, Terra no meio, Luna embaixo, todos atrás da mesma superfície de API.
Onde supera o Grok 4.6. O Sol vence as duas avaliações em que o Grok se sai pior: DeepSWE 73% contra 65,9%, e Terminal-Bench 34,6% contra 26%. Se sua carga de trabalho é engenharia de software autônoma, essa é a troca. O escalonamento também significa que você pode rotear turnos baratos para o GPT-5.6 Terra ou Luna sem trocar de SDK.
Onde não supera. Ele carrega o mesmo precipício. A página de preços da OpenAI publica uma coluna de contexto longo para as três camadas, então o Sol vai de 5 $ para 10 $ de entrada e de 30 $ para 45 $ de saída em prompts longos. Trocar do Grok para o GPT-5.6 para escapar do limite de 200k move o problema em vez de resolvê-lo. Endpoints de residência de dados adicionam uma sobretaxa de 10% para modelos lançados a partir de 5 de março de 2026, e o processamento prioritário foi renomeado para modo Fast em 30 de julho de 2026.
Preços. Sol 5,00 $/30,00 $, Terra 2,00 $/12,00 $, Luna 0,20 $/1,20 $, tudo por 1M. Veja nosso detalhamento preços do GPT-5.6 para o resto da família.
Veredito. A melhor troca equivalente entre os modelos de fronteira se código é o trabalho. Confira os preços do GPT-5.6 Sol contra a distribuição de comprimento dos seus próprios prompts antes de se comprometer, porque o precipício está no mesmo lugar. A análise do GPT-5.6 tem o detalhe das avaliações, e OpenAI vs Anthropic compara as duas superfícies de API.
4. Gemini 3.6 Flash - melhor custo-benefício se você puder viver com o Google

O que é. O cavalo de batalha do Google desde 21 de julho de 2026, posicionado para velocidade com qualidade próxima da fronteira.
Onde supera o Grok 4.6. Entrada mais barata a 1,50 $, uma janela de 1M sem camada de contexto longo publicada, uma camada gratuita real para prototipagem, e um corte de conhecimento de março de 2026. Ele também vem com uso de computador nativo e vence as linhas de contexto longo e uso de computador na própria tabela comparativa do Google.
Onde não supera. A saída custa 7,50 $ contra 6,00 $ do Grok, então em trabalho pesado em saída é mais caro, não mais barato. O grounding de busca custa 14 $ por 1.000 solicitações, quase o triplo do medidor de busca da xAI, embora o Google inclua 5.000 gratuitas por mês compartilhadas entre os modelos Gemini 3.x. Na camada gratuita seu conteúdo é usado para melhorar os produtos do Google; na paga, não.
Preços. 1,50 $ de entrada, 0,15 $ de leitura de cache, 7,50 $ de saída. O lote custa a metade. Detalhes completos em preços do Gemini 3.6 Flash.
Veredito. A escolha de melhor valor se seus prompts são longos e suas saídas curtas, o que descreve a maior parte do trabalho de suporte pesado em recuperação. A análise do Gemini 3.6 Flash tem o detalhe dos benchmarks, e a visão geral Gemini 3.6 Flash cobre o que foi lançado junto.
5. DeepSeek V4 Flash - o melhor se a tarifa em si é o problema

O que é. Um modelo de mistura de especialistas com 284 bilhões de parâmetros totais, 13 bilhões ativos, com pesos abertos licenciados sob MIT, em beta público desde 31 de julho de 2026.
Onde supera o Grok 4.6. No preço, por uma ordem de magnitude, a 0,14 $ de entrada e 0,28 $ de saída. Acertos de cache custam 0,0028 $. Ele também oferece um endpoint no formato Anthropic ao lado do formato OpenAI, o que encurta bastante uma migração, e pesos MIT significam que você pode trazer tudo para dentro de casa se a relação com o fornecedor der errado.
Onde não supera. A configuração barata e a configuração boa são execuções diferentes. A própria tabela cruzada de modos da DeepSeek mostra HLE em 8,1 sem pensamento contra 34,8 em esforço máximo, e tokens de raciocínio são cobrados à tarifa de saída. A Artificial Analysis mediu uma taxa de alucinação AA-Omniscience de 84% e precisou de 210M de tokens de saída para rodar o índice contra uma mediana de 100M na classe. Nosso guia sobre como prevenir alucinações cobre o que isso significa na frente dos clientes. Há também uma sobretaxa pendente de 2x em horário de pico, anunciada sem data de início.
Com dados de clientes, seja preciso. Os termos da API paga da DeepSeek são silenciosos sobre uso para treinamento em vez de permissivos, não há DPA publicada nem opção de retenção zero, e os dados estão sob jurisdição da RPC. Essa é uma questão real de compras, não uma questão resolvida.
Preços. 0,14 $ entrada com cache-miss, 0,0028 $ entrada com cache-hit, 0,28 $ saída. Veja preços do DeepSeek V4 Flash.
Veredito. A escolha óbvia para classificação, roteamento, resumo e outros turnos de alto volume e baixo risco. A análise do DeepSeek V4 Flash cobre onde a diferença de qualidade realmente aparece.
6. Kimi K3 - o melhor modelo de pesos abertos em escala de fronteira

O que é. O carro-chefe da Moonshot AI: 2,8 trilhões de parâmetros totais, 104 bilhões ativos, 1M de contexto, visão nativa, lançado em 16 de julho de 2026.
Onde supera o Grok 4.6. Pesos abertos realmente lançados, na data prometida, e o índice safetensors confirma o número de 2,8 trilhões vindo de fora do comunicado de imprensa. Ele traz entrada nativa de imagem e vídeo, e uma janela fixa de 1M.
Onde não supera. 3 $ de entrada e 15 $ de saída ficam acima do Grok nos dois lados, então isso não é uma jogada de custo. O raciocínio não pode ser desligado em nenhum nível de esforço, e os níveis são cobrados à mesma tarifa, então reasoning_effort é um controle de latência, não de custo. Em esforço baixo ele marca 47 pontos no índice a 0,24 $ por tarefa, o que é mais fraco e mais caro que o DeepSeek V4 Flash. URLs públicas de imagem não são aceitas, apenas base64 ou um ID de arquivo.
Preços. 3,00 $ entrada, 0,30 $ acerto de cache, 15,00 $ saída. As camadas para consumidor vão de gratuito a 199 $. Veja preços do Kimi K3.
Veredito. Escolha-o quando quiser pesos abertos em escala de fronteira e visão em um único modelo, e puder absorver a tarifa. A análise do Kimi K3 tem a comparação de benchmarks contra o Grok, e Flash vs K3 resolve a questão de orçamento entre as duas opções de pesos abertos.
7. Qwen3.8 Max - o substituto direto mais próximo

O que é. O carro-chefe da Alibaba, em disponibilidade geral desde 2 de agosto de 2026: 2,4 trilhões de parâmetros totais, 95 bilhões ativos, 1M de contexto.
Onde supera o Grok 4.6. Preço principal idêntico a 2 $ de entrada e 6 $ de saída, com o dobro da janela de contexto e nenhuma penalidade de prompt longo. No LMArena ele é forte: Texto #5, Visão #2, WebDev #4. Vem com raciocínio xhigh ativado por padrão, com o pensamento preservado.
Onde não supera. Ele não está no ranking da Artificial Analysis de forma alguma, então qualquer "pontuação de inteligência independente" citada para ele na verdade descreve um modelo Qwen diferente. Composições automatizadas e preferência humana apontam em direções opostas aqui, então um veredito de número único seria desonesto em qualquer direção. Os pesos foram prometidos na disponibilidade geral e continuam não publicados. Não há desconto em lote nem caminho de marketplace em nuvem.
Preços. 2,00 $ entrada, 0,25 $ leitura de cache implícita, 6,00 $ saída, segundo o Qwen Cloud. Detalhes em preços do Qwen3.8 Max, e os caminhos práticos em como acessar o Qwen3.8 Max.
Veredito. A troca a fazer se o precipício dos 200k é sua única reclamação e você quer manter a mesma linha de orçamento. Compare diretamente em Qwen3.8 Max vs Kimi K3 antes de decidir.
O que você realmente paga, versus o que está na tabela
Há mais uma camada que vale a pena conhecer antes de migrar qualquer coisa. O OpenRouter publica o preço médio ponderado que seus clientes realmente pagam, ao lado do preço de lista, e para o Grok 4.6 os dois não coincidem.

| Medida | Lista | Medido no OpenRouter |
|---|---|---|
| Entrada por 1M | 2,00 $ | 0,7748 $ |
| Saída por 1M | 6,00 $ | 6,249 $ |
| Fornecedores | - | SpaceXAI e SpaceXAI (ZDR) |
| Vazão (P50) | - | 53 e 55 tok/s |
| Latência (P50) | - | 1,23 s e 0,84 s |
| Disponibilidade | - | 99,96% e 100% |
A entrada fica 61% abaixo da lista, porque o cache está fazendo um trabalho enorme no tráfego real. A saída fica ligeiramente acima da lista, porque uma parte desse tráfego ultrapassa 200k e paga 12 $. Ambos os efeitos são invisíveis na tabela de tarifas, e ambos se moveram desde a última vez que verifiquei isso, há alguns dias, quando a entrada media 0,7448 $.
A lição se generaliza para além do Grok. Antes de migrar pelo preço, calcule sua própria taxa de acerto de cache e sua própria distribuição de comprimento de prompt. Um modelo com uma etiqueta pior e uma história de cache melhor pode ser mais barato na prática, e uma troca feita só com preços de lista é um palpite disfarçado de análise.
O modelo sequer importa para o suporte?
Menos do que a lista curta sugere, o que é desconfortável de escrever em um artigo que acabou de gastar 2.000 palavras nessa lista curta.
O Grok 4.6 é um dos dois melhores modelos no benchmark de atendimento ao cliente multiturno, com 50,7%. Leia isso ao pé da letra: o melhor modelo disponível falha em metade dessas conversas. Trocar para o Opus 5 por dois pontos de índice não toca nesse padrão de falha, e nenhuma arquitetura livre de escalonamento também não. A metade que dá errado dá errado em saber quando parar, quando transferir para um humano, qual macro disparar, e o que nunca prometer. Nada disso é uma capacidade do modelo.
Digo isso como alguém que constrói a camada acima do modelo. Clientes da eesel às vezes saem para construir diretamente sobre uma API de fronteira crua, e essa é a alternativa competitiva mais comum que vemos entre equipes técnicas. Às vezes funciona. O que geralmente os traz de volta não é a qualidade do modelo, e raramente é a qualidade da recuperação também. É o segundo mês.
Ninguém quer ser dono das regras de triagem de tickets, do desvio de voz da marca, das permissões na base de conhecimento, de um limite de pontuação de confiança, e de uma escala de plantão para um chatbot.
O comprador que mencionei no início, aquele que consumiu 200 interações em um dia de teste, não estava fazendo uma pergunta sobre modelo. Ele estava perguntando quanto custariam 9.000 por mês e se as respostas estariam certas. Nenhuma tabela de tarifas responde a nenhuma das duas metades, por isso o custo por resolução é o número que vale a pena modelar.
Escolhendo entre o Grok 4.6 e suas alternativas para uma fila de suporte?

Aqui está a parte que uma API crua não pode entregar a você. Antes que a eesel responda um único ticket ao vivo, ela reproduz seu agente pelos seus próprios tickets passados e mostra o que ele teria dito, com seus dados, incluindo as lacunas da sua base de conhecimento. Assim, "qual modelo" deixa de ser um argumento de benchmark e vira uma taxa de resolução que você mediu na sua própria fila, antes de um cliente ver uma única resposta. Conecte um helpdesk, observe a simulação, depois escolha o modelo. Experimente a eesel, grátis.
Veredito
Fique com o Grok 4.6 se seus prompts ficam confortavelmente abaixo de 200k, você não está bloqueado por compras em nuvem, e seu tráfego faz cache bem. Empatar com o GPT-5.6 Sol no índice por um quinto da tarifa de saída dele é uma posição forte, e nenhum modelo aqui o domina estritamente.
Troque para o Claude Opus 5 se prompts longos, compras em Bedrock ou Vertex, ou qualidade líder de índice são a limitação vinculante. Você pagará cerca de 2,4x por tarefa por isso.
Troque para o Qwen3.8 Max se o precipício é sua única reclamação. Mesmos 2 $ e 6 $, janela dobrada, sem penalidade, ao custo de uma pontuação de referência independente.
Troque para o DeepSeek V4 Flash para a metade de alto volume e baixo risco do seu tráfego, e roteie os turnos difíceis para outro lugar. A 0,14 $ e 0,28 $ você pode se dar ao luxo de errar no roteamento.
Troque para o GPT-5.6 se codificação autônoma é a carga de trabalho, sabendo que o precipício de contexto longo vem junto.
E seja qual for sua escolha, meça-a nos seus próprios tickets antes que ela encontre um cliente. O melhor agente de IA para uma fila raramente é o que está no topo do índice, e a camada de helpdesk move a taxa de resolução mais do que a troca de modelo. Veja IA para atendimento ao cliente para o panorama completo.
Perguntas frequentes
Quais são as melhores alternativas ao Grok 4.6 no momento?
Existe uma alternativa mais barata ao Grok 4.6?
Por que o preço do Grok 4.6 dobra em prompts longos?
Qual alternativa ao Grok 4.6 tem a maior janela de contexto?
Posso rodar o Grok 4.6 na AWS ou no Azure?
As alternativas ao Grok 4.6 também cobram por busca na web?
O Grok 4.6 ou o Claude Opus 5 é melhor para suporte ao cliente?
Devo trocar de Grok 4.6 de qualquer forma?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








