
A tabela de 60 segundos
Todos os números abaixo vêm das próprias páginas publicadas pelos fornecedores, verificados em 3 de agosto de 2026. Onde um dado não está publicado, eu deixei assim indicado em vez de pegar um número emprestado de um agregador.
| Qwen 3.8 Max | Kimi K3 | |
|---|---|---|
| ID do modelo | qwen3.8-max | kimi-k3 |
| Laboratório | Alibaba | Moonshot AI |
| Lançamento | 2 ago 2026 (GA) | 16 jul 2026 |
| Parâmetros totais | 2,4T | 2,8T |
| Parâmetros ativos | 95B | Não publicado |
| Entrada / 1M | $2.00 | $3.00 |
| Saída / 1M | $6.00 | $15.00 |
| Entrada em cache / 1M | $0.25 implícito, $0.17 leitura explícita | $0.30 |
| Janela de contexto | 1.000.000 | 1.048.576 |
| Sobretaxa de contexto longo | Nenhuma | Nenhuma |
| Saída máxima | 131.072 | Não publicado |
| Orçamento máximo de raciocínio | 262.144 | Não publicado |
| Modalidades de entrada | Texto, imagem, vídeo | Texto, imagem, vídeo |
| Controle de raciocínio | low / medium / xhigh, xhigh por padrão | Somente max |
| Pesos abertos | Prometido, não lançado | Lançado em 27 jul 2026 |
| Licença | Não publicada | Listada como "other" |
| Ficha do modelo | Nenhuma | No Hugging Face |
| Corte de conhecimento | Não publicado | Não publicado |
| Limite de taxa (nível superior) | 15K RPM / 2M TPM | Não publicado |
| Chat para consumidores | Qwen Studio, gratuito | Kimi.com, gratuito a $199/mês |
Três linhas fazem a maior parte do trabalho aqui. O Qwen publica uma contagem de parâmetros ativos e a Moonshot não, o que importa porque são os parâmetros ativos que determinam sua latência e sua conta, não os totais. O Qwen é mais barato em todos os indicadores. E o Kimi é o único dos dois que você realmente pode baixar.
O que é o Qwen 3.8 Max
Qwen é a família de modelos da Alibaba, e Max é a linha principal proprietária acima dos níveis mais baratos Plus e Turbo. O Qwen 3.8 Max foi lançado em dois atos: um preview em 19 de julho na World AI Conference com uma afirmação verbal de estar na fronteira e nenhum número publicado, seguido por um post de lançamento de 5.000 palavras em 2 de agosto trazendo tudo o que o preview havia deixado de fora.
A arquitetura, conforme descrita pela Alibaba: 2,4 trilhões de parâmetros totais com 95 bilhões ativos, um design esparso de Mixture-of-Experts construído sobre a base do Qwen 3.5. A história mais ampla da família está na minha análise do Qwen, e a visão geral do Qwen cobre os níveis mais antigos.
O raciocínio é controlado por reasoning_effort, que aceita low, medium e xhigh, com xhigh como padrão. A Alibaba também ativa preserve_thinking por padrão "para a melhor experiência pronta para uso". Guarde esse detalhe, porque ele reaparece como um problema de custo mais adiante.
O que é o Kimi K3
O Kimi K3 é o modelo principal da Moonshot AI, e sua história técnica é mais incomum que a do Qwen. Ele tem 2,8 trilhões de parâmetros totais, que a Moonshot descreve como a ativação de 16 de 896 especialistas sob um framework Stable LatentMoE, além de dois componentes inéditos: o Kimi Delta Attention, um mecanismo híbrido de atenção linear, e o Attention Residuals, um substituto direto para conexões residuais padrão que a Moonshot publicou como open source separadamente. Afirma ter uma eficiência de escalonamento cerca de 2,5 vezes melhor que o Kimi K2.5.
A Moonshot é incomumente franca em seu próprio post de lançamento sobre onde ele se posiciona:
"While its overall performance still trails the most powerful proprietary models, Claude Fable 5 and GPT 5.6 Sol, Kimi K3 demonstrated frontier-level performance across our evaluation suite, consistently outperforming other tested models."
Compare isso com o posicionamento do preview da Alibaba, que buscou "atrás apenas do Fable 5" antes mesmo de publicar uma única pontuação. Dois laboratórios, dois níveis de conforto muito diferentes com suas próprias evidências. Minhas análises mais profundas estão na análise do Kimi K3 e na análise do Qwen 3.8 Max.
Uma coisa que o K3 não oferece é um controle de raciocínio. reasoning_effort aceita apenas max, nada mais, com low e high listados como "em breve". Não existe uma SKU mais barata sem raciocínio. Um modelo, um preço, sempre pensando.
Benchmarks: nenhum mediu o outro
É aqui que a maioria das comparações lado a lado trapaceia silenciosamente. A Alibaba publicou um gráfico de dezesseis painéis em 2 de agosto. A Moonshot publicou o seu em julho. Nenhum dos gráficos contém o outro modelo.


Existe, porém, uma forma de conectar os dois, e quase ninguém se dá ao trabalho. Ambos os gráficos compartilham os mesmos modelos de referência: Claude Fable 5, Claude Opus 4.8, GPT-5.6 Sol. Então onde os dois laboratórios reportam a mesma pontuação para o mesmo modelo de referência no mesmo benchmark, os dois harnesses estão se comportando de forma equivalente, e seus próprios números podem ser comparados entre si. Onde as pontuações de referência divergem, não podem.

Aplicando esse teste aos dois gráficos, sobrevivem exatamente três linhas:
| Benchmark | Concordância de referência compartilhada | Qwen 3.8 Max | Kimi K3 | Vencedor |
|---|---|---|---|---|
| TerminalBench-2.1 | Fable 5 84.6, Opus 4.8 84.6, Sol 88.8 em ambos | 86.6 | 88.3 | Kimi, por 1.7 |
| CharXiv (RQ, com Python) | Fable 5 93.5, Opus 4.8 89.9, Sol 89.1 em ambos | 93.5 | 91.3 | Qwen, por 2.2 |
| JobBench | Fable 5 57.4, Opus 4.8 48.4 em ambos; Sol 45.4 vs 46.5 | 53.4 | 52.9 | Qwen, por 0.5 |
Ou seja: uma vitória clara para cada um em uma avaliação próxima de codificação e outra de raciocínio com gráficos, e um empate estatístico em trabalho agêntico de conhecimento. Essa é toda a comparação direta defensável que existe. Quem te mostrar uma tabela de quinze linhas declarando um vencedor misturou números de dois harnesses diferentes.
E o motivo para ser rigoroso quanto a isso está bem ali, na quarta linha que tive de descartar. No FrontierSWE, o gráfico da Alibaba coloca o GPT-5.6 Sol em 88.8; o da Moonshot o coloca em 71.3. Mesmo modelo, mesmo benchmark, uma diferença de 17,5 pontos. Seja qual for o gráfico correto, um dos dois está medindo algo que o outro não está, e essa lacuna é maior do que a margem que qualquer um dos laboratórios afirma ter sobre o outro.
As notas de rodapé da Alibaba também valem a leitura. Ela revela que seis de seus benchmarks de codificação são internos e não publicados, que as pontuações dos concorrentes foram retiradas de harnesses mistos em vez de reexecutadas, que os resultados do Fable 5 "podem envolver fallbacks", e que várias linhas são avaliadas por modelos rivais: gemini-3.1-pro-preview avalia o PLawBench, o Claude Opus 4.6 avalia o PaperBench. O gráfico da Moonshot traz sua própria versão do mesmo aviso.
A única leitura independente disponível é a da Artificial Analysis, que pontuou o Kimi K3 com 57 em seu Intelligence Index, quarto entre 189 modelos avaliados, com uma velocidade de saída de cerca de 62 tokens por segundo. Em sua avaliação privada de trabalho de conhecimento de longo prazo, o K3 alcançou um Elo de 1547, que o mesmo resumo situa em +732 acima do Kimi K2.6.
A tabela de preços diz Qwen. A conta diz empate.
O Qwen é mais barato em todos os indicadores publicados. A entrada custa um terço a menos, a saída 60% a menos, e sua leitura de cache implícita é de $0,25 contra a taxa de acerto de cache de $0,30 do Kimi. Com contagens de tokens idênticas, não há discussão.
As contagens de tokens não são idênticas. Um desenvolvedor que rodou a mesma construção de um app web nos dois modelos, cada um no harness próprio do seu fornecedor, publicou a contabilidade:
"* Kimi K3: 9532k input (9172k cached), 114k output - cost $5.5
Qwen 3.8 Max: 18020k input (17836k cached), 114k output - cost $6.3"

Esses $6,30 são anteriores à disponibilidade geral, então foram cobrados sob as condições do preview, não pela tabela publicada em 2 de agosto. Refazendo essas mesmas contagens de tokens com as tarifas atuais, o Qwen chega a cerca de $5,51 (0,184M de entrada sem cache a $2, 17,836M em cache a $0,25, 0,114M de saída a $6). O Kimi chega a $5,54. Uma tarifa de saída 60% mais barata, quase totalmente anulada por precisar de 1,9 vezes mais tokens de entrada.
Esse é o número que realmente decide sua conta, e ele não aparece em nenhuma das duas páginas de preços. O Qwen ativa o raciocínio xhigh por padrão com preserve_thinking habilitado, e os tokens de raciocínio são cobrados como saída. O Kimi também roda sempre no máximo, e sua própria comunidade foi direta sobre a consequência:
"The shift from "value" models to "intelligent, huge and slow" models coming from China is an interesting change in strategy. My main issue with GLM 5.2 and Kimi 3 is that they're extremely token hungry and thus feel slow(er) to use."
Nenhum dos dois é mais a opção econômica. Ambos estão na mesma faixa de preço do Claude Sonnet, e o DeepSeek V3.2 continua uma ordem de grandeza abaixo dos dois. O enquadramento de "modelo chinês barato" pertence à geração anterior.
Insira seus próprios volumes, incluindo quanto da sua entrada está em cache e o quanto mais verboso você espera que o Qwen seja:
Mova o controle de verbosidade além de 1,9x e o Kimi vence em custo apesar de cobrar mais do que o dobro por token de saída. Esse ponto de cruzamento, não o preço de tabela, é o que sua equipe financeira vai observar daqui a três meses.
Pesos abertos: a única diferença clara
Ambos os modelos foram anunciados como abertos. Só um deles é.
A Moonshot disse que os pesos estariam disponíveis até 27 de julho de 2026, e estiveram. O repositório do Kimi K3 mostra um checkpoint modificado pela última vez em 27 de julho, com um índice safetensors totalizando 2.779.931.837.184 parâmetros, o que confirma a afirmação de 2,8T de fora para dentro, e não a partir de um comunicado de imprensa. Já passou de 837.000 downloads e 9.700 curtidas, e já existem quantizações feitas pela comunidade. A licença aparece listada apenas como "other", então vale ler antes de construir um negócio em cima dela.
O Qwen 3.8 Max ainda está esperando. O post de lançamento da Alibaba promete os pesos no Hugging Face e no ModelScope "na próxima semana" três vezes distintas, a página inicial do qwen.ai marca o lançamento como "Open-Source", e não há repositório, licença ou data. A partir de 2 de agosto, "próxima semana" significa a semana de 9 de agosto.
Duas ressalvas antes de se empolgar. Primeiro, um checkpoint de 8 bits com 2,78 trilhões de parâmetros é um artefato de data center, não algo que se roda em uma estação de trabalho, então "aberto" aqui significa auditável e autoalojável em grande escala, não local. Se a execução local for realmente o requisito, os modelos de linguagem pequenos são a categoria honesta. Segundo, a comunidade de modelos locais no Hacker News deixou claro que interpretou o anúncio do Qwen como uma resposta de calendário:
"I assume that this announcement has been prompted by that of Moonshot AI, which has just announced a 2.8T parameter open-weights LLM, Kimi K3, to be published on Huggingface by 27 July. Now the response of Alibaba is that they will also publish soon a big open weights LLM, the 2.4T parameter Qwen 3.8."
O que os desenvolvedores que testaram os dois realmente dizem
Benchmarks medem capacidade. Produção mede capacidade dividida por paciência. Nas threads de lançamento, os relatos práticos favorecem o Kimi, e quase nenhum deles é sobre inteligência.
A frase mais afiada na thread de preview do Qwen foi uma comparação direta:
"The few tests I ran were by no means comprehensive, but while kimi felt like the real deal qwen seems a bit of a benchmark princess."
Um desenvolvedor que testou quatro modelos de ponta lado a lado ao longo de vários dias chegou a uma conclusão mais equilibrada:
"Having tested K3, Qwen 3.8 max preview, Fable and Sol for the past few days, I partially agree. Don't trust the benchmarks, and the Chinese models really are slow and token-inefficient. However they do seem very close to SOTA [...] if I had to find an alternative, I could live with both K3 and Qwen3.8 just fine."
E um relato foi além do que eu iria com base em uma única carga de trabalho, mas é o veredito mais repetido na thread e vale a pena ler como um ponto de dados, não como uma conclusão:
"In my limited anecdotal experience, Kimi K3 is a bit better than Opus 4.8 and Qwen3.8 Max is disastrously bad. It can reason fine, but the moment it tries to do something it gets stuck into long second-guessing loops with no progress."
Vale contrabalançar isso com o lado do Kimi, onde o entusiasmo foi alto no dia do lançamento e um desenvolvedor não conseguiu diferenciá-lo do modelo principal da Anthropic em um teste às cegas:
"I've been playing around with it for the past few hours, and I think it's an amazing model. I'm not sure I could tell the difference between this and Fable in a blind test."
Se essa dispersão incomoda, a rota mais segura é uma lista curta em vez de uma escolha única. A minha para esse lado da comparação é alternativas ao Qwen. O panorama de alternativas ao Kimi K3 cobre pelo outro lado, e existe uma lista mais específica de alternativas ao Qwen 3.8 Max só para esse modelo.
Algumas coisas simplesmente não são publicadas para nenhum dos dois modelos. Nenhum corte de conhecimento. Nenhuma ficha de sistema. Nenhuma avaliação de segurança do lado do Qwen, e nenhum artigo de arquitetura do lado do Kimi até que o relatório técnico saia. Se o setor de compras perguntar, a resposta hoje é que isso não existe.
Onde um modelo de ponta termina e o trabalho de suporte começa
Essa é a parte que mais me preocupa, porque é onde vejo equipes perderem um trimestre inteiro.

Nenhum desses modelos conhece sua política de reembolso. Nenhum leu seus últimos 7.000 tickets. Nenhum sabe que o cliente que está escrevendo para você tem um plano enterprise e já escalou o caso duas vezes. Uma pontuação de benchmark não é um agente de suporte, e a distância entre essas duas coisas é onde a maioria dos projetos de automação de suporte com IA empaca silenciosamente.
É também por isso que escolher um helpdesk com IA é um exercício diferente de escolher um modelo, e por isso a automação de tickets vive ou morre com base na recuperação de dados, não no raciocínio bruto.
Passei meu tempo na eesel construindo a camada de agentes, e o modo de falha que continuo vendo é pior do que "a IA não sabe". É a invenção confiante. A história das marcas de carro no início deste artigo é o exemplo mais claro que tenho: o modelo não errou na linguagem, errou no escopo, porque a central de ajuda dizia "suportamos todos os modelos" e ele levou isso ao pé da letra. O resumo que aquela equipe fez sobre como acertaram a configuração foi "tentativa e erro no início". Um modelo de 2,8 trilhões de parâmetros teria feito a mesma afirmação, só que com mais fluência.
O controle que resolve isso surgiu em uma ligação com um líder de suporte que gerencia 7.000 tickets por mês, e não tem nada a ver com a escolha do modelo:
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
a CX lead at a 7,000-ticket-a-month DTC brand
Essa é uma decisão de produto, não uma decisão de modelo. É por isso que a eesel AI executa uma simulação sobre tickets históricos antes de qualquer coisa ir ao ar, para que você veja primeiro a taxa de resolução e as respostas reais em conversas passadas de verdade.
É também por isso que as respostas são roteadas por confiança, gerando rascunho para um humano ou escalando em vez de adivinhar, e por isso a classificação de tickets roda como uma etapa própria em vez de ser encaixada em um único prompt gigante.
O que torna a leitura estratégica desta comparação um pouco anticlimática: construa de forma que dê para trocar o motor. A camada de modelo fica melhor e mais barata a cada poucas semanas. O Kimi K3 chegou dezessete dias antes do Qwen, o GPT-5.6 cortou seu nível mais barato em 80% em uma única tarde, e o que liderar o gráfico em setembro não está em nenhum dos dois gráficos hoje.
Essa é a mesma razão pela qual eu não me prenderia ao Gemini também, por melhores que pareçam os números deste mês. O mesmo vale para o Grok. O GLM 5.2 é o outro modelo principal chinês exatamente nessa mesma faixa, e eu leria seu caso de negócio com o mesmo dar de ombros.
Então, qual você deveria escolher?
Se você está lançando algo e quer uma única resposta:
- Loops longos de agentes onde a eficiência de tokens decide a conta: Kimi K3. Fez o mesmo trabalho com aproximadamente metade dos tokens de entrada, e essa diferença compensa sua tabela de preços mais alta.
- Trabalho intenso em gráficos, documentos e vídeo: Qwen 3.8 Max. Vence no CharXiv com um harness comparável, e a Alibaba documenta entrada de vídeo com limites concretos que a Moonshot não iguala em seu próprio material de lançamento.
- Qualquer coisa que você precise autoalojar ou auditar: Kimi K3, e não há debate. Os pesos existem, a contagem de parâmetros bate a partir do checkpoint, e os do Qwen ainda são uma promessa.
- Um controle de raciocínio que dá para baixar: Qwen 3.8 Max, o único dos dois com níveis de esforço
lowemedium. O Kimi roda no máximo ou nem roda. - Menor custo por token, ponto final: Qwen, em todos os indicadores. Só meça o custo por tarefa concluída antes de planejar um orçamento em cima disso.
- Qualquer coisa voltada para o cliente: nenhum dos dois sozinho. Escolha primeiro a camada e deixe que ela escolha o modelo. As contas estão no meu detalhamento de custo de agentes, e a lista curta está em melhores agentes de IA.
O que eu não faria é tratar nenhum dos dois gráficos como definitivo. Três linhas são toda a sobreposição honesta entre eles, seis dos benchmarks de codificação da Alibaba são avaliações internas não publicadas, e nenhum terceiro reexecutou nada disso.
Espere que ambas as tabelas de preços mudem antes que números independentes surjam. Por isso mantenho o detalhamento de preços do Kimi K3 como uma página viva, e o mesmo vale para preços do Qwen 3.8 Max. A comparação Qwen 3.8 Max vs GPT-5.6 também precisará ser refeita junto com esta.
Experimente a eesel
Se você chegou até aqui porque quer um modelo que resolve tickets em vez de vencer gráficos, esse é exatamente o propósito da eesel AI. Ela se conecta ao Zendesk, Freshdesk, Gorgias e mais de 100 outras ferramentas, aprende com sua central de ajuda e seus tickets anteriores, e começa a gerar rascunhos em poucos minutos.

O diferencial é a rampa de confiança, não o motor. Simule com base no seu histórico real de tickets, leia os números, comece no modo rascunho e vá para o modo autônomo só quando gostar do que vir. Você herda cada avanço de ponta, seja Kimi, Qwen ou o que for lançado em setembro, sem precisar reconfigurar nada. Experimente a eesel grátis, sem cartão de crédito.
Perguntas frequentes
O Qwen 3.8 Max é melhor que o Kimi K3?
Qual é mais barato, o Qwen 3.8 Max ou o Kimi K3?
O Kimi K3 é open source e os pesos do Qwen 3.8 Max já foram lançados?
Qual é a janela de contexto do Qwen 3.8 Max em comparação ao Kimi K3?
Qual é melhor para programação, Qwen 3.8 Max ou Kimi K3?
Posso rodar o Qwen 3.8 Max ou o Kimi K3 localmente?
O Qwen 3.8 Max e o Kimi K3 suportam visão?
Posso usar o Qwen 3.8 Max ou o Kimi K3 para atendimento ao cliente?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








