Análise do Grok 4.6: o que a tabela de avaliação diz quando você lê as linhas perdedoras

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edição August 12, 2026

Verificado por especialista
Ilustração desenhada à mão com o logotipo do Grok e um cartão de avaliação mostrando classificações de estrelas mistas em várias categorias

Escolha sua carga de trabalho e depois leia o veredito

A coisa mais útil que posso te dar não é outra tabela de benchmarks. É a resposta para "isso se aplica a mim?". O veredito do Grok 4.6 muda completamente dependendo do que você está construindo.

O que realmente mudou desde o Grok 4.5

A xAI lançou o Grok 4.6 em 12 de agosto de 2026, cerca de cinco semanas depois do Grok 4.5. Cinco semanas é um ritmo rápido, e dá para ver isso no que mudou e no que não mudou.

A história do treinamento é incomumente franca. A xAI diz que rodou uma fase de treinamento suplementar mais longa do que a do 4.5, e depois usou o próprio Grok 4.5 para regenerar as trajetórias de SFT em diferentes níveis de raciocínio e ambientes de agentes, filtrando traços ruins com verificações baseadas em modelo. Em outras palavras, o modelo anterior ensinou este, e a etapa de RL foi direcionada a tarefas agênticas: otimização de kernel, desenvolvimento web, design assistido por computador.

A ficha técnica quase não mudou. Segundo a página do modelo grok-4.6, o contexto permanece em 500.000 tokens, o modelo aceita texto e imagem como entrada e produz texto, com chamadas de função, saídas estruturadas e raciocínio. Os limites de taxa são 150 solicitações por segundo e 50M de tokens por minuto, em us-east-1 e us-west-2.

O que mudou foram as pontuações. A Artificial Analysis o coloca em 61 no Intelligence Index, 5 pontos a mais que o Grok 4.5 e 23 a mais que o Grok 4.3. Cinco pontos em cinco semanas é um salto geracional de verdade, não apenas um aumento no número da versão.

Lendo a tabela de avaliação corretamente

Uma ilustração de uma pessoa examinando as duas linhas curtas de um cartão de avaliação enquanto três linhas mais longas ficam acima delas
Uma ilustração de uma pessoa examinando as duas linhas curtas de um cartão de avaliação enquanto três linhas mais longas ficam acima delas

Abaixo está a própria tabela da xAI. Acho ela mais reveladora do que o post de blog em volta dela. Negrito é o vencedor por linha.

AvaliaçãoGrok 4.6 HighGrok 4.5 HighGPT-5.6 Sol MaxFable 5 Max
AA Intelligence Index61566162
GDPVal-AA v21753152617281741
CursorBench v3.269,9%66,7%67,2%70,5%
DeepSWE v1.165,9%54%73%70%
FrontierCode v1.1 (Extended)61,3%56,6%60,6%63,6%
APEX-Agents57,5%47,1%56,7%59,2%
Terminal-Bench v3.026%15,7%34,6%34,1%
APEX-SWE56,4%53,6%58,8%
AA-Briefcase1577131315021574
Harvey LAB (Vals)15,8%12,9%2,5%11,3%

Quatro coisas chamam atenção.

O Grok 4.6 vence as linhas de trabalho de conhecimento e perde nas de engenharia de software. Ele leva GDPVal-AA, AA-Briefcase e Harvey LAB de forma clara. Perde no DeepSWE por 7,1 pontos e no Terminal-Bench por 8,6. Para um post de lançamento intitulado em torno de codificação agêntica, é um formato curioso.

O número do Harvey é a célula mais estranha da tabela. O Grok 4.6 marca 15,8% no benchmark de análise jurídica contra os 2,5% do GPT-5.6 Sol. Uma diferença de 6x em uma única avaliação geralmente significa que a avaliação mede algo bem específico, ou que um modelo foi ajustado para esse tipo de tarefa. Eu não construiria um produto jurídico em cima de uma única linha, mas vale a pena saber.

O Terminal-Bench tem dois números de versão ativos e eles discordam completamente. A ficha da xAI reporta 26% na v3.0. A Artificial Analysis reporta 88,4% na v2.1 e chama isso de em linha com os modelos líderes. Ambos são verdade. A v3.0 é a revisão mais difícil. Se você vir um número do Terminal-Bench citado sem a versão, ele não está te dizendo nada.

Os saltos de 4.5 para 4.6 são maiores exatamente onde os agentes vivem. O DeepSWE foi de 54% para 65,9%. O APEX-Agents de 47,1% para 57,5%. O AA-Briefcase de 1313 para 1577. Seja lá o que a etapa de RL agêntico fez, funcionou nas tarefas que rodam por muitos passos.

Mais uma linha de tabela que não está no gráfico da xAI. A Artificial Analysis mede o 𝜏³-Banking, uma avaliação de atendimento ao cliente multiturno com uso de ferramentas, e o Grok 4.6 marca 50,7%. Isso o coloca entre os dois melhores, junto com o Qwen3.8 Max em 51,3%. Vou voltar a esse número, porque estar entre os dois melhores acaba significando menos do que parece.

Velocidade e custo, medidos em vez de alegados

É aqui que o Grok 4.6 faz seu argumento mais forte, e na verdade não é um argumento de benchmark.

O preço de tabela permanece inalterado em relação ao Grok 4.5: $2,00 por 1M de entrada, $0,50 em cache, $6,00 de saída, segundo a página de preços da xAI. Ao ultrapassar 200 mil tokens de prompt, toda taxa dobra para $4,00 / $1,00 / $12,00. Manter o preço estável ao longo de uma geração é incomum na fronteira, e a Artificial Analysis diz isso explicitamente.

A comparação que importa é com modelos a dois pontos do índice. O Claude Opus 5 custa $5/$25. O GPT-5.6 Sol custa $5/$30. O Grok 4.6 empata com o Sol a um quinto da taxa de saída, e a taxa de saída domina o custo em trabalhos pesados em raciocínio.

Medido em vez de listado, na página do Grok 4.6 no OpenRouter, o quadro se mantém:

MedidaxAI padrãoxAI (ZDR)
Entrada efetiva paga$0,7249/M$0,7812/M
Saída efetiva paga$6,125/M$6,116/M
Taxa de acerto de cache90,3%88,0%
Throughput (média 3 dias)94 tok/s92 tok/s
Latência (média 3 dias)0,62s0,96s
Taxa de erro em chamadas de ferramenta0,08%0,02%
Taxa de erro em saída estruturada4,00%0,00%

Duas delas merecem um segundo olhar. O preço efetivo de entrada é $0,72, não $2, porque o tráfego real acerta o cache 90% das vezes. E a taxa de erro de saída estruturada de 4,00% no endpoint padrão contra 0,00% no endpoint ZDR é uma diferença operacional real, não um artefato de arredondamento. Se você está fixando esquemas JSON para chamadas de ferramenta, teste os dois.

A Artificial Analysis colocou a conta de todo o índice em $1.068,47 para avaliar o Grok 4.6, dando $0,84 por tarefa, o mesmo que o Kimi K3 com inteligência um pouco menor. Ele gerou 72M de tokens fazendo isso, contra uma mediana de 71M, então é um pouco mais verboso, mas não de forma exagerada.

A única linha que se moveu contra os compradores é a entrada em cache, e a comunidade percebeu isso em questão de horas:

Hacker News

"Seems the cache read pricing almost doubled from $0.30 in Grok 4.5 to $0.50 in Grok 4.6. In my experience in heavy coding sessions most pricing is just cache read and cache write like 80% of my token bill."

É uma observação justa e a conta está certa. É um aumento de 67% no item que domina sessões longas de agentes. Também ainda é um cache read de $0,50 em um modelo que empata com o GPT-5.6 Sol, então eu chamaria isso de um retrocesso real dentro de um negócio que ainda é excelente. Nosso guia de preços da xAI tem a tabela completa.

O que quem está realmente testando está dizendo

Benchmarks são um dado de entrada. Abaixo está como foi o primeiro dia de uso real. Escolhi relatos com números, em vez de impressões.

O dado mais útil que encontrei foi um teste direto, cara a cara, através da mesma funcionalidade na mesma base de código:

Hacker News

"Tested both DS v4 pro 0813 and Grok 4.6 (all from openrouter) on Codex cli. Worked on a same new feature development on my project. Deepseek 4 pro: Worked for 12m 02s, cost $0.12, has bug. Grok 4.6: Worked for 3m 18s, cost $1.41, no bug."

Isso é 3,6x mais rápido e 11,75x mais caro, com um resultado funcional contra um quebrado. É um único teste de uma pessoa, então trate como um sinal, não como uma conclusão, mas captura o trade-off real contra um modelo barato de pesos abertos como o DeepSeek V4 Flash melhor do que qualquer pontuação de índice.

O tema da velocidade se repetiu:

Hacker News

"I used to be a Claude user. Since trying Grok 4.5 and especially Grok 4.6, I don't want to go back to Claude any more (I have early access to 4.6). Grok is 3x+ faster than Claude and I can't tell the diff in engineering work quality. As an engineer, speed is important to me."

E um engenheiro descreveu a mudança de fluxo de trabalho com precisão, que é o tipo de detalhe que me faz confiar em um relato:

Hacker News

"My go-to workflow was Sol for planning and Grok for building. But my in my first tests with Grok 4.6, I found it quite good and I'll start using it for both; assuming it's as good at is shows at benchmarks it's unbeatable at cost/time."

Também houve ceticismo, e ele foi principalmente sobre se o índice está medindo a coisa certa:

Hacker News

"I haven't tried so it's pure speculation based on benchmarks, but I'd assume Grok 4.6 is around Opus 4.8 in real world use, but clearly below Opus 5."

Essa é uma suposição razoável. Paridade no índice e paridade no uso real são afirmações diferentes, e a resposta honesta um dia após o lançamento é que ninguém tem horas suficientes de uso ainda. O que posso dizer é que o argumento de preço por unidade de inteligência não depende de resolver esse debate.

A linha que o post de lançamento deixou de fora

Uma ilustração de um agente de suporte olhando para duas bolhas de fala igualmente confiantes, uma sólida e outra vazia com um ponto de interrogação dentro
Uma ilustração de um agente de suporte olhando para duas bolhas de fala igualmente confiantes, uma sólida e outra vazia com um ponto de interrogação dentro

A tabela de avaliação da xAI tem dez linhas e nenhuma delas é sobre estar errado. A Artificial Analysis mede exatamente isso, e esses são os números que eu colocaria no topo da página se estivesse escrevendo o post de lançamento.

Precisão do AA-Omniscience: 48,2%. Taxa de não alucinação: 65,7%.

Leia a segunda com cuidado, porque é fácil interpretar mal como "alucina 34% das vezes". É a taxa de evitar uma alucinação entre as respostas que não estavam corretas. Então, quando o Grok 4.6 não sabe algo, ele diz isso cerca de duas em três vezes, e inventa uma resposta na outra vez. O benchmark existe justamente porque recusar-se a responder não deveria ser penalizado da mesma forma que estar confiantemente errado.

Para um agente de código, uma resposta errada é pega por um teste. Para um agente voltado ao cliente, uma resposta errada é enviada.

Eu construo agentes de IA na eesel, e já vi esse exato padrão de falha em produção mais de uma vez. Um caso em que penso com frequência: uma equipe europeia de telemática veicular usando o Zendesk, fazendo cerca de 200 tickets por mês e crescendo em direção a 2.000, descobriu que seu agente confirmava alegremente suporte para marcas de carro que não estavam em lugar nenhum do banco de dados deles. A IA não tinha dado defeito. A central de ajuda deles dizia "damos suporte a todos os modelos", e o modelo acreditou nisso. O engenheiro deles resumiu as primeiras semanas como tentativa e erro, que é a descrição mais honesta de implantação de modelo bruto que já ouvi.

Isso é uma taxa de não alucinação de 65,7% encontrando uma base de conhecimento escrita para humanos. Nada no treinamento do Grok 4.6 conserta isso. O que conserta é limitar de onde o modelo pode extrair informações, e controlar o que ele tem permissão para enviar.

Então, você deveria colocar o Grok 4.6 por trás de uma fila de suporte?

Pergunta justa. A resposta honesta tem duas partes, e elas apontam para direções diferentes.

Como engine, é uma escolha legitimamente boa. 50,7% no 𝜏³-Banking é top dois entre tudo que a Artificial Analysis testou, e o 𝜏³-Banking é o benchmark público mais próximo do que um agente de suporte realmente faz: multiturno, usando ferramentas, voltado ao cliente. Uma taxa de erro em chamadas de ferramenta de 0,08% e 94 tok/s significam que ele não vai travar no meio de uma conversa. A $2/$6, a economia unitária da automação de tickets de suporte parece boa.

Como produto, não é um. Estar entre os dois melhores em atendimento ao cliente significa que ele resolve mais ou menos metade dessas conversas. A outra metade é onde vive o trabalho de verdade: saber quando parar, quando transferir para um humano, qual macro disparar, qual consulta de pedido rodar, e o que nunca prometer. Nada disso é uma capacidade do modelo. É design de escalonamento, escopo de recuperação, e um limite de pontuação de confiança que você ajustou com seu próprio histórico.

Digo isso como alguém cuja equipe perde negócios exatamente por esse raciocínio. Vários clientes da eesel saíram para construir diretamente sobre uma API de modelo de fronteira, e essa é a alternativa competitiva mais comum que vemos de equipes técnicas. Às vezes funciona. O que normalmente os traz de volta não é a qualidade do modelo, é o segundo mês: ninguém quer assumir regras de triagem de tickets, deriva de voz de marca, permissões da base de conhecimento, e um rodízio de plantão para um chatbot.

Se você está escolhendo um modelo esta semana, o Grok 4.6 pertence à lista curta junto com o Claude Opus 5 e o GPT-5.6. Se você está decidindo como responder aos clientes, o modelo é a decisão menos interessante que você vai tomar.

Quer um modelo de fronteira no seu helpdesk sem o segundo mês?

A visão de relatórios da eesel AI mostrando volume de tarefas, eventos de gatilho por tipo, e uso de aprovação por ferramenta
A visão de relatórios da eesel AI mostrando volume de tarefas, eventos de gatilho por tipo, e uso de aprovação por ferramenta

Essa é a parte que uma API bruta não consegue te dar. Antes que a eesel responda um único ticket ao vivo, ela reproduz seu agente sobre seus próprios tickets históricos e mostra o que ele teria dito, com seus dados, com sua base de conhecimento e suas lacunas incluídas. Assim, a pergunta dos 65,7% deixa de ser um benchmark e vira um número que você realmente mediu, na sua fila, antes de qualquer cliente vê-lo. Conecte um helpdesk, veja a simulação, depois decida. Experimente a eesel, grátis.

Veredito

Compre se você está rodando sessões agênticas longas de trabalho de conhecimento, pesquisa, análise ou tarefas pesadas em documentos, e o custo importa. As melhores pontuações da tabela em GDPVal-AA e AA-Briefcase a $2/$6, concluindo tarefas na metade dos turnos do Claude Opus 5, é uma combinação difícil de contestar. Compre também se a velocidade bruta muda seu fluxo de trabalho. Vários engenheiros relataram independentemente 3x, e um mediu 3m 18s contra 12m 02s na mesma tarefa.

Pule se sua carga de trabalho é engenharia de software autônoma ou operações pesadas em terminal. DeepSWE 65,9% contra os 73% do Sol, e Terminal-Bench v3.0 em 26% contra 34,6%, não são decisões apertadas, e esses são os próprios números publicados pela xAI.

Tenha cuidado se ele for colocado na frente de clientes. É um dos dois melhores modelos no benchmark de atendimento ao cliente, e mesmo assim falha em metade dessas conversas, com uma taxa de não alucinação de 65,7% por baixo disso. Isso não é um problema do Grok, todo modelo de fronteira tem uma versão dessa linha. É uma razão pela qual a camada de helpdesk importa mais do que a escolha do modelo.

Minha avaliação geral: a melhor relação preço-inteligência na fronteira em agosto de 2026, rotulado erroneamente como um lançamento de código quando sua verdadeira força é trabalho de conhecimento. Cinco pontos de ganho no índice em cinco semanas com preços estáveis é a história, e o aumento na taxa de cache é o asterisco.

Se você quer o conjunto de comparação mais completo, comece com alternativas ao Grok 4.5 e leia a análise do Claude Opus 5 em seguida.

Para a matemática dos tokens por si só, a tabela de preços da xAI vai mais fundo do que esta análise.

Perguntas frequentes

O Grok 4.6 é bom? Qual é a conclusão desta análise do Grok 4.6?
É um modelo de fronteira de verdade e, agora, a melhor relação preço-inteligência no topo da tabela. Ele marca 61 no Artificial Analysis Intelligence Index, empatado com o GPT-5.6 Sol, a $2/$6 contra os $5/$30 do Sol. A ressalva nesta análise do Grok 4.6 é que suas vitórias se concentram em trabalho de conhecimento, não em engenharia de software pura. Se você está escolhendo um modelo para colocar por trás de uma fila de suporte, a lógica de seleção do nosso guia sobre o melhor agente de IA para atendimento ao cliente importa mais do que a pontuação do índice.
Como o Grok 4.6 se compara ao Grok 4.5?
Ele ganha 5 pontos no Intelligence Index, de 56 para 61, cerca de cinco semanas depois que o Grok 4.5 foi lançado. Os maiores saltos estão nas avaliações agênticas: o DeepSWE vai de 54% para 65,9%, o APEX-Agents de 47,1% para 57,5%, e o AA-Briefcase de 1313 para 1577. Os preços por token permanecem idênticos. Para os números do modelo anterior, veja nossa análise do Grok 4.5 e o detalhamento de preços do Grok 4.5.
Quanto custa rodar o Grok 4.6?
$2,00 por 1M de tokens de entrada, $0,50 em cache, e $6,00 de saída, segundo a página de preços da xAI, dobrando para $4/$1/$12 acima de 200 mil tokens de prompt. A Artificial Analysis gastou $1.068,47 avaliando-o em todo o índice, a $0,84 por tarefa. A tabela completa está no nosso guia de preços da xAI, e para equipes de suporte o número que realmente importa é o custo por resolução.
O Grok 4.6 alucina?
Sim, e o post de lançamento não menciona isso. A Artificial Analysis mediu uma precisão de AA-Omniscience de 48,2% e uma taxa de não alucinação de 65,7%, o que significa que aproximadamente um terço de suas respostas incorretas são invenções confiantes em vez de admitir que não sabe. Essa é toda a razão pela qual um modelo bruto precisa de um limite de recuperação. Nosso guia sobre prevenir alucinações no suporte e o artigo sobre manter um agente de suporte honesto cobrem os dois a solução.
O Grok 4.6 é bom para atendimento ao cliente?
No papel, é um dos dois melhores modelos testados em atendimento ao cliente multiturno, com 50,7% no 𝜏³-Banking. Mas leia de novo: estar entre os dois melhores significa que ele ainda falha em metade dessas conversas. O Grok 4.6 é um motor razoável, mas não é um produto de suporte sozinho, e é por isso que regras de escalonamento e um limite de pontuação de confiança fazem mais pela taxa de resolução do que a troca de modelo. Veja IA para atendimento ao cliente para o quadro completo.
Onde posso usar o Grok 4.6?
Ele foi lançado simultaneamente na API da xAI, no Grok Build e no Cursor, além de OpenRouter, Vercel e Cloudflare. Cursor e Grok Build ofereceram o dobro do uso incluído na semana de lançamento. Nossas páginas de preços do Cursor e análises do Cursor cobrem esse lado, e o Grok Bot cobre o produto de agentes separado da xAI.
Qual é a janela de contexto do Grok 4.6?
500.000 tokens, sem mudança em relação ao Grok 4.5, segundo a página do modelo grok-4.6. O detalhe é que toda taxa dobra assim que uma solicitação ultrapassa 200 mil, então a janela de contexto realmente utilizável ao preço de tabela é de 200 mil. Threads de tickets longos raramente chegam perto disso, mas uma base de conhecimento inteira enfiada em um prompt sim, o que é um argumento a favor da recuperação em vez da força bruta.
Quais alternativas devo comparar com o Grok 4.6?
O Claude Opus 5 lidera o índice com 63, o Claude Fable 5 fica em 62, e o GPT-5.6 Sol empata com o Grok em 61. Abaixo disso, o Kimi K3 iguala seu $0,84 por tarefa, e o Qwen3.8 Max se saiu melhor em ferramentas de atendimento ao cliente. Comece com alternativas ao Grok 4.5 ou a lista mais ampla de alternativas à xAI.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Ilustração desenhada à mão de três pessoas comparando fichas de pontuação de modelos ao lado de uma balança pesando custo contra uma lista de verificação
Trending

Alternativas ao Grok 4.6: 7 modelos comparados pela forma da fatura

O Grok 4.6 custa 2 $/6 $, e dobra cada tarifa assim que uma solicitação ultrapassa 200 mil tokens. Verifiquei o que sete alternativas realmente cobram, e quais removem esse precipício em vez de apenas movê-lo.

Alicia Kirana UtomoAlicia Kirana UtomoAug 13, 2026
Ilustração de um colega de equipe de IA em um laptop sendo revisado por dois colegas segurando uma lista de verificação e uma lupa, com a marca Grok à esquerda
Trending

Análise do Grok Bot: o que realmente funciona no beta inicial

O Grok Bot dá a cada colega de equipe de IA um computador na nuvem e credenciais reais. Passei por todas as páginas da documentação e pela primeira semana de relatos de usuários para ver o que realmente funciona.

Rama Adi NugrahaRama Adi NugrahaAug 13, 2026
Ilustração editorial com o logo do Grok, barras de benchmark e uma etiqueta de preço representando uma análise do Grok 4.5
Trending

Análise do Grok 4.5: benchmarks, preços e o veredito

O Grok 4.5 da xAI foi lançado em 8 de julho com uma pontuação #4 no Intelligence Index e o melhor resultado de uso agentico de ferramentas do ranking. Aqui está a análise real, os benchmarks, os preços e quem deveria realmente usá-lo.

Rama Adi NugrahaRama Adi NugrahaJul 9, 2026
Ilustração de duas pessoas revisando uma pilha de camadas de custo, assentos em cima e consumo de tokens embaixo, com o logotipo do Grok à esquerda
Trending

Preços do Grok Bot em 2026: o plano de US$ 200 e o medidor sem limite

O Grok Bot é vendido por US$ 200 por mês ou US$ 120 por assento, mas o preço anunciado é só a taxa de entrada. A documentação diz que ainda não há teto de gastos, e o medidor roda semanalmente.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 13, 2026
Preços do Grok 4.6 em 2026: cada tarifa e o que as equipes realmente pagam
Trending

Preços do Grok 4.6 em 2026: cada tarifa e o que as equipes realmente pagam

O Grok 4.6 tem preço de tabela de US$ 2,00 de entrada e US$ 6,00 de saída por milhão de tokens. O preço efetivo de entrada medido pela OpenRouter é de US$ 0,74. Aqui está cada item da fatura e por qual porta você deveria comprar.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 13, 2026
Ilustração de um colega de IA a trabalhar numa secretária ao lado de dois colegas, com ícones de ferramentas por cima e o logótipo do Grok à esquerda
Trending

Grok Bot explicado: o que os colegas de IA sempre ativos da xAI realmente fazem

O Grok Bot dá a cada colega de IA o seu próprio computador na nuvem e faz login nas suas ferramentas reais. Eis como funciona, quanto custa, e onde o design falha.

Alicia Kirana UtomoAlicia Kirana UtomoAug 12, 2026
Ilustração em linha de um desenvolvedor e um agente de suporte conversando por ondas de voz, ao lado do logotipo da Grok
Trending

Preço do Grok Voice Think Fast 2.0: o que $0.08/min custa

Grok Voice Think Fast 2.0 custa $0.08 por minuto de áudio, 60% acima do 1.0. O alias grok-voice-latest muda para ele hoje, então aqui está a matemática real por chamada.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Ilustração em linha de um agente de suporte com fone de ouvido ao lado do logo do Grok, com uma forma de onda de voz em um balão de fala
Trending

Grok Voice Think Fast 2.0: o que mudou e quanto custa

O Grok Voice Think Fast 2.0 alcança 82,9% no índice speech-to-speech da Artificial Analysis e responde em 0,70s. Também custa 60% a mais por minuto, e o alias padrão passa a apontar para ele em 5 de agosto.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração de um desenvolvedor trabalhando com painéis de imagem, vídeo e documentos, com o logo da Qwen
Trending

Análise do Qwen 3.7 Flash: um modelo de visão de $0,03 com uma pegadinha

Qwen 3.7 Flash é o modelo de visão mais barato que você pode comprar. Investiguei as faixas de preço, o único benchmark independente, e o que ninguém está contando.

Rama Adi NugrahaRama Adi NugrahaJul 31, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis