
Escolha sua carga de trabalho e depois leia o veredito
A coisa mais útil que posso te dar não é outra tabela de benchmarks. É a resposta para "isso se aplica a mim?". O veredito do Grok 4.6 muda completamente dependendo do que você está construindo.
O que realmente mudou desde o Grok 4.5
A xAI lançou o Grok 4.6 em 12 de agosto de 2026, cerca de cinco semanas depois do Grok 4.5. Cinco semanas é um ritmo rápido, e dá para ver isso no que mudou e no que não mudou.
A história do treinamento é incomumente franca. A xAI diz que rodou uma fase de treinamento suplementar mais longa do que a do 4.5, e depois usou o próprio Grok 4.5 para regenerar as trajetórias de SFT em diferentes níveis de raciocínio e ambientes de agentes, filtrando traços ruins com verificações baseadas em modelo. Em outras palavras, o modelo anterior ensinou este, e a etapa de RL foi direcionada a tarefas agênticas: otimização de kernel, desenvolvimento web, design assistido por computador.
A ficha técnica quase não mudou. Segundo a página do modelo grok-4.6, o contexto permanece em 500.000 tokens, o modelo aceita texto e imagem como entrada e produz texto, com chamadas de função, saídas estruturadas e raciocínio. Os limites de taxa são 150 solicitações por segundo e 50M de tokens por minuto, em us-east-1 e us-west-2.
O que mudou foram as pontuações. A Artificial Analysis o coloca em 61 no Intelligence Index, 5 pontos a mais que o Grok 4.5 e 23 a mais que o Grok 4.3. Cinco pontos em cinco semanas é um salto geracional de verdade, não apenas um aumento no número da versão.
Lendo a tabela de avaliação corretamente

Abaixo está a própria tabela da xAI. Acho ela mais reveladora do que o post de blog em volta dela. Negrito é o vencedor por linha.
| Avaliação | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69,9% | 66,7% | 67,2% | 70,5% |
| DeepSWE v1.1 | 65,9% | 54% | 73% | 70% |
| FrontierCode v1.1 (Extended) | 61,3% | 56,6% | 60,6% | 63,6% |
| APEX-Agents | 57,5% | 47,1% | 56,7% | 59,2% |
| Terminal-Bench v3.0 | 26% | 15,7% | 34,6% | 34,1% |
| APEX-SWE | 56,4% | 53,6% | — | 58,8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15,8% | 12,9% | 2,5% | 11,3% |
Quatro coisas chamam atenção.
O Grok 4.6 vence as linhas de trabalho de conhecimento e perde nas de engenharia de software. Ele leva GDPVal-AA, AA-Briefcase e Harvey LAB de forma clara. Perde no DeepSWE por 7,1 pontos e no Terminal-Bench por 8,6. Para um post de lançamento intitulado em torno de codificação agêntica, é um formato curioso.
O número do Harvey é a célula mais estranha da tabela. O Grok 4.6 marca 15,8% no benchmark de análise jurídica contra os 2,5% do GPT-5.6 Sol. Uma diferença de 6x em uma única avaliação geralmente significa que a avaliação mede algo bem específico, ou que um modelo foi ajustado para esse tipo de tarefa. Eu não construiria um produto jurídico em cima de uma única linha, mas vale a pena saber.
O Terminal-Bench tem dois números de versão ativos e eles discordam completamente. A ficha da xAI reporta 26% na v3.0. A Artificial Analysis reporta 88,4% na v2.1 e chama isso de em linha com os modelos líderes. Ambos são verdade. A v3.0 é a revisão mais difícil. Se você vir um número do Terminal-Bench citado sem a versão, ele não está te dizendo nada.
Os saltos de 4.5 para 4.6 são maiores exatamente onde os agentes vivem. O DeepSWE foi de 54% para 65,9%. O APEX-Agents de 47,1% para 57,5%. O AA-Briefcase de 1313 para 1577. Seja lá o que a etapa de RL agêntico fez, funcionou nas tarefas que rodam por muitos passos.
Mais uma linha de tabela que não está no gráfico da xAI. A Artificial Analysis mede o 𝜏³-Banking, uma avaliação de atendimento ao cliente multiturno com uso de ferramentas, e o Grok 4.6 marca 50,7%. Isso o coloca entre os dois melhores, junto com o Qwen3.8 Max em 51,3%. Vou voltar a esse número, porque estar entre os dois melhores acaba significando menos do que parece.
Velocidade e custo, medidos em vez de alegados
É aqui que o Grok 4.6 faz seu argumento mais forte, e na verdade não é um argumento de benchmark.
O preço de tabela permanece inalterado em relação ao Grok 4.5: $2,00 por 1M de entrada, $0,50 em cache, $6,00 de saída, segundo a página de preços da xAI. Ao ultrapassar 200 mil tokens de prompt, toda taxa dobra para $4,00 / $1,00 / $12,00. Manter o preço estável ao longo de uma geração é incomum na fronteira, e a Artificial Analysis diz isso explicitamente.
A comparação que importa é com modelos a dois pontos do índice. O Claude Opus 5 custa $5/$25. O GPT-5.6 Sol custa $5/$30. O Grok 4.6 empata com o Sol a um quinto da taxa de saída, e a taxa de saída domina o custo em trabalhos pesados em raciocínio.
Medido em vez de listado, na página do Grok 4.6 no OpenRouter, o quadro se mantém:
| Medida | xAI padrão | xAI (ZDR) |
|---|---|---|
| Entrada efetiva paga | $0,7249/M | $0,7812/M |
| Saída efetiva paga | $6,125/M | $6,116/M |
| Taxa de acerto de cache | 90,3% | 88,0% |
| Throughput (média 3 dias) | 94 tok/s | 92 tok/s |
| Latência (média 3 dias) | 0,62s | 0,96s |
| Taxa de erro em chamadas de ferramenta | 0,08% | 0,02% |
| Taxa de erro em saída estruturada | 4,00% | 0,00% |
Duas delas merecem um segundo olhar. O preço efetivo de entrada é $0,72, não $2, porque o tráfego real acerta o cache 90% das vezes. E a taxa de erro de saída estruturada de 4,00% no endpoint padrão contra 0,00% no endpoint ZDR é uma diferença operacional real, não um artefato de arredondamento. Se você está fixando esquemas JSON para chamadas de ferramenta, teste os dois.
A Artificial Analysis colocou a conta de todo o índice em $1.068,47 para avaliar o Grok 4.6, dando $0,84 por tarefa, o mesmo que o Kimi K3 com inteligência um pouco menor. Ele gerou 72M de tokens fazendo isso, contra uma mediana de 71M, então é um pouco mais verboso, mas não de forma exagerada.
A única linha que se moveu contra os compradores é a entrada em cache, e a comunidade percebeu isso em questão de horas:
"Seems the cache read pricing almost doubled from $0.30 in Grok 4.5 to $0.50 in Grok 4.6. In my experience in heavy coding sessions most pricing is just cache read and cache write like 80% of my token bill."
É uma observação justa e a conta está certa. É um aumento de 67% no item que domina sessões longas de agentes. Também ainda é um cache read de $0,50 em um modelo que empata com o GPT-5.6 Sol, então eu chamaria isso de um retrocesso real dentro de um negócio que ainda é excelente. Nosso guia de preços da xAI tem a tabela completa.
O que quem está realmente testando está dizendo
Benchmarks são um dado de entrada. Abaixo está como foi o primeiro dia de uso real. Escolhi relatos com números, em vez de impressões.
O dado mais útil que encontrei foi um teste direto, cara a cara, através da mesma funcionalidade na mesma base de código:
"Tested both DS v4 pro 0813 and Grok 4.6 (all from openrouter) on Codex cli. Worked on a same new feature development on my project. Deepseek 4 pro: Worked for 12m 02s, cost $0.12, has bug. Grok 4.6: Worked for 3m 18s, cost $1.41, no bug."
Isso é 3,6x mais rápido e 11,75x mais caro, com um resultado funcional contra um quebrado. É um único teste de uma pessoa, então trate como um sinal, não como uma conclusão, mas captura o trade-off real contra um modelo barato de pesos abertos como o DeepSeek V4 Flash melhor do que qualquer pontuação de índice.
O tema da velocidade se repetiu:
"I used to be a Claude user. Since trying Grok 4.5 and especially Grok 4.6, I don't want to go back to Claude any more (I have early access to 4.6). Grok is 3x+ faster than Claude and I can't tell the diff in engineering work quality. As an engineer, speed is important to me."
E um engenheiro descreveu a mudança de fluxo de trabalho com precisão, que é o tipo de detalhe que me faz confiar em um relato:
"My go-to workflow was Sol for planning and Grok for building. But my in my first tests with Grok 4.6, I found it quite good and I'll start using it for both; assuming it's as good at is shows at benchmarks it's unbeatable at cost/time."
Também houve ceticismo, e ele foi principalmente sobre se o índice está medindo a coisa certa:
"I haven't tried so it's pure speculation based on benchmarks, but I'd assume Grok 4.6 is around Opus 4.8 in real world use, but clearly below Opus 5."
Essa é uma suposição razoável. Paridade no índice e paridade no uso real são afirmações diferentes, e a resposta honesta um dia após o lançamento é que ninguém tem horas suficientes de uso ainda. O que posso dizer é que o argumento de preço por unidade de inteligência não depende de resolver esse debate.
A linha que o post de lançamento deixou de fora

A tabela de avaliação da xAI tem dez linhas e nenhuma delas é sobre estar errado. A Artificial Analysis mede exatamente isso, e esses são os números que eu colocaria no topo da página se estivesse escrevendo o post de lançamento.
Precisão do AA-Omniscience: 48,2%. Taxa de não alucinação: 65,7%.
Leia a segunda com cuidado, porque é fácil interpretar mal como "alucina 34% das vezes". É a taxa de evitar uma alucinação entre as respostas que não estavam corretas. Então, quando o Grok 4.6 não sabe algo, ele diz isso cerca de duas em três vezes, e inventa uma resposta na outra vez. O benchmark existe justamente porque recusar-se a responder não deveria ser penalizado da mesma forma que estar confiantemente errado.
Para um agente de código, uma resposta errada é pega por um teste. Para um agente voltado ao cliente, uma resposta errada é enviada.
Eu construo agentes de IA na eesel, e já vi esse exato padrão de falha em produção mais de uma vez. Um caso em que penso com frequência: uma equipe europeia de telemática veicular usando o Zendesk, fazendo cerca de 200 tickets por mês e crescendo em direção a 2.000, descobriu que seu agente confirmava alegremente suporte para marcas de carro que não estavam em lugar nenhum do banco de dados deles. A IA não tinha dado defeito. A central de ajuda deles dizia "damos suporte a todos os modelos", e o modelo acreditou nisso. O engenheiro deles resumiu as primeiras semanas como tentativa e erro, que é a descrição mais honesta de implantação de modelo bruto que já ouvi.
Isso é uma taxa de não alucinação de 65,7% encontrando uma base de conhecimento escrita para humanos. Nada no treinamento do Grok 4.6 conserta isso. O que conserta é limitar de onde o modelo pode extrair informações, e controlar o que ele tem permissão para enviar.
Então, você deveria colocar o Grok 4.6 por trás de uma fila de suporte?
Pergunta justa. A resposta honesta tem duas partes, e elas apontam para direções diferentes.
Como engine, é uma escolha legitimamente boa. 50,7% no 𝜏³-Banking é top dois entre tudo que a Artificial Analysis testou, e o 𝜏³-Banking é o benchmark público mais próximo do que um agente de suporte realmente faz: multiturno, usando ferramentas, voltado ao cliente. Uma taxa de erro em chamadas de ferramenta de 0,08% e 94 tok/s significam que ele não vai travar no meio de uma conversa. A $2/$6, a economia unitária da automação de tickets de suporte parece boa.
Como produto, não é um. Estar entre os dois melhores em atendimento ao cliente significa que ele resolve mais ou menos metade dessas conversas. A outra metade é onde vive o trabalho de verdade: saber quando parar, quando transferir para um humano, qual macro disparar, qual consulta de pedido rodar, e o que nunca prometer. Nada disso é uma capacidade do modelo. É design de escalonamento, escopo de recuperação, e um limite de pontuação de confiança que você ajustou com seu próprio histórico.
Digo isso como alguém cuja equipe perde negócios exatamente por esse raciocínio. Vários clientes da eesel saíram para construir diretamente sobre uma API de modelo de fronteira, e essa é a alternativa competitiva mais comum que vemos de equipes técnicas. Às vezes funciona. O que normalmente os traz de volta não é a qualidade do modelo, é o segundo mês: ninguém quer assumir regras de triagem de tickets, deriva de voz de marca, permissões da base de conhecimento, e um rodízio de plantão para um chatbot.
Se você está escolhendo um modelo esta semana, o Grok 4.6 pertence à lista curta junto com o Claude Opus 5 e o GPT-5.6. Se você está decidindo como responder aos clientes, o modelo é a decisão menos interessante que você vai tomar.
Quer um modelo de fronteira no seu helpdesk sem o segundo mês?

Essa é a parte que uma API bruta não consegue te dar. Antes que a eesel responda um único ticket ao vivo, ela reproduz seu agente sobre seus próprios tickets históricos e mostra o que ele teria dito, com seus dados, com sua base de conhecimento e suas lacunas incluídas. Assim, a pergunta dos 65,7% deixa de ser um benchmark e vira um número que você realmente mediu, na sua fila, antes de qualquer cliente vê-lo. Conecte um helpdesk, veja a simulação, depois decida. Experimente a eesel, grátis.
Veredito
Compre se você está rodando sessões agênticas longas de trabalho de conhecimento, pesquisa, análise ou tarefas pesadas em documentos, e o custo importa. As melhores pontuações da tabela em GDPVal-AA e AA-Briefcase a $2/$6, concluindo tarefas na metade dos turnos do Claude Opus 5, é uma combinação difícil de contestar. Compre também se a velocidade bruta muda seu fluxo de trabalho. Vários engenheiros relataram independentemente 3x, e um mediu 3m 18s contra 12m 02s na mesma tarefa.
Pule se sua carga de trabalho é engenharia de software autônoma ou operações pesadas em terminal. DeepSWE 65,9% contra os 73% do Sol, e Terminal-Bench v3.0 em 26% contra 34,6%, não são decisões apertadas, e esses são os próprios números publicados pela xAI.
Tenha cuidado se ele for colocado na frente de clientes. É um dos dois melhores modelos no benchmark de atendimento ao cliente, e mesmo assim falha em metade dessas conversas, com uma taxa de não alucinação de 65,7% por baixo disso. Isso não é um problema do Grok, todo modelo de fronteira tem uma versão dessa linha. É uma razão pela qual a camada de helpdesk importa mais do que a escolha do modelo.
Minha avaliação geral: a melhor relação preço-inteligência na fronteira em agosto de 2026, rotulado erroneamente como um lançamento de código quando sua verdadeira força é trabalho de conhecimento. Cinco pontos de ganho no índice em cinco semanas com preços estáveis é a história, e o aumento na taxa de cache é o asterisco.
Se você quer o conjunto de comparação mais completo, comece com alternativas ao Grok 4.5 e leia a análise do Claude Opus 5 em seguida.
Para a matemática dos tokens por si só, a tabela de preços da xAI vai mais fundo do que esta análise.
Perguntas frequentes
O Grok 4.6 é bom? Qual é a conclusão desta análise do Grok 4.6?
Como o Grok 4.6 se compara ao Grok 4.5?
Quanto custa rodar o Grok 4.6?
O Grok 4.6 alucina?
O Grok 4.6 é bom para atendimento ao cliente?
Onde posso usar o Grok 4.6?
Qual é a janela de contexto do Grok 4.6?
Quais alternativas devo comparar com o Grok 4.6?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








