Análise do Kimi K3: o modelo de fronteira aberto da Moonshot, testado

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edição July 21, 2026

Verificado por especialista
Ilustração editorial de um modelo de linguagem grande raciocinando sobre um longo fluxo de documentos

Resumo

O Kimi K3 é o modelo mais novo da Moonshot AI, lançado em 16 de julho de 2026: um modelo aberto de 2,8 trilhões de parâmetros com visão nativa e uma janela de contexto de 1 milhão de tokens. A Moonshot o apresenta como o primeiro modelo aberto na escala de 3 trilhões de parâmetros, e os benchmarks sustentam o hype mais do que se esperaria. Ele fica logo abaixo do Claude Fable 5 e do GPT-5.6 Sol, mas à frente do Claude Opus 4.8 e do GPT-5.5 na maioria das tarefas, e vence claramente alguns benchmarks de codificação e agênticos.

Duas coisas me surpreenderam. Primeiro, o preço: com US$ 3 / US$ 15 por milhão de tokens, o K3 não é mais a jogada baratíssima que o antigo Kimi K2 era, seu preço está no nível do tier Sonnet da Claude. Segundo, "aberto" vem com um asterisco: os pesos não estavam disponíveis no lançamento e devem sair até 27 de julho de 2026.

Eu construo agentes de IA na eesel, onde passamos anos colocando modelos como este em filas de suporte ao vivo, então aqui está a parte que os gráficos de benchmark deixam de fora: uma pontuação de fronteira não é um agente de suporte. O K3 é um motor genuinamente forte. Transformá-lo em algo que responde com segurança aos seus clientes é um trabalho diferente, e é o que realmente importa se você está lendo isto para escolher um modelo para suporte.

O que é o Kimi K3?

O Kimi K3 é o carro-chefe da Moonshot AI, o laboratório chinês por trás do anterior modelo de pesos abertos Kimi K2. A Moonshot descreve o K3 como "o primeiro modelo aberto de classe 3T do mundo, projetado para inteligência de fronteira em codificação de longo horizonte, trabalho de conhecimento e raciocínio."

O que chama atenção é que a Moonshot é incomumente honesta sobre onde o K3 se posiciona. O blog de lançamento diz claramente que "embora seu desempenho geral ainda fique atrás dos modelos proprietários mais poderosos, Claude Fable 5 e GPT 5.6 Sol, o Kimi K3 demonstrou desempenho de nível de fronteira em todo o nosso conjunto de avaliação, superando consistentemente os outros modelos testados." É raro ver um laboratório abrir liderando com aquilo que seu modelo não é, e isso torna o resto das alegações mais fácil de confiar.

Há uma pegadinha que vale a pena sinalizar desde já. A Moonshot chama isso de um modelo aberto, mas no lançamento era só API. O blog oficial diz que "os pesos completos do modelo serão lançados até 27 de julho de 2026," e, na semana de lançamento, o repositório no HuggingFace ainda retornava um 404. Então, se o seu plano era fazer auto-hospedagem no primeiro dia, esse plano espera mais algumas semanas.

Como o Kimi K3 realmente funciona

Se você já construiu com esses modelos antes, a parte interessante do K3 não é a contagem de parâmetros, é como a Moonshot chegou lá sem o custo explodir. Aqui está o pipeline em uma imagem.

Como o Kimi K3 funciona: entrada de texto e imagem alimenta um roteador Stable LatentMoE que escolhe 16 de 896 especialistas, passando pelo Kimi Delta Attention e raciocínio sempre ativo até chegar a uma resposta
Como o Kimi K3 funciona: entrada de texto e imagem alimenta um roteador Stable LatentMoE que escolhe 16 de 896 especialistas, passando pelo Kimi Delta Attention e raciocínio sempre ativo até chegar a uma resposta

Algumas peças estão fazendo o trabalho pesado:

  • Uma mistura de especialistas muito esparsa. O K3 tem 2,8 trilhões de parâmetros no total, mas "ativa efetivamente apenas 16 de 896 especialistas" por token, usando o que a Moonshot chama de framework Stable LatentMoE. O roteamento esparso é como se consegue um modelo enorme que ainda é acessível de rodar, apenas uma fração dele dispara para qualquer token dado.
  • Kimi Delta Attention (KDA). Um mecanismo híbrido de atenção linear que mantém a janela de contexto de 1M tokens prática em vez de ruinosamente cara.
  • Attention Residuals (AttnRes). Um substituto direto para as conexões residuais padrão, que a Moonshot abriu separadamente em github.com/MoonshotAI/Attention-Residuals.
  • Raciocínio sempre ativo. O K3 sempre "pensa", não há um modo mais barato sem raciocínio. O esforço é definido com um campo reasoning_effort que atualmente só aceita max, com níveis mais baixos "em breve".

Somando tudo, a Moonshot alega "uma melhoria aproximada de 2,5x na eficiência geral de escalonamento em comparação com o Kimi K2." Essa é a verdadeira história aqui: não apenas maior, mas muito mais saída por unidade de computação de treinamento. Uma lacuna honesta: o relatório técnico completo e a contagem exata de parâmetros ativos ainda não saíram, então parte do como ainda é uma promessa.

Como o Kimi K3 pontua nos benchmarks

É aqui que o K3 ganha o rótulo de "fronteira". A Moonshot publicou gráficos comparativos diretos contra o Fable 5, o GPT-5.6 Sol, o Opus 4.8 e o GPT-5.5, e testes independentes começaram a corroborá-los.

Gráficos de benchmark do Kimi K3 da Moonshot em agentes gerais e agentes visuais, com o K3 destacado, retirado do blog de lançamento da Moonshot
Gráficos de benchmark do Kimi K3 da Moonshot em agentes gerais e agentes visuais, com o K3 destacado, retirado do blog de lançamento da Moonshot

O padrão é consistente. O K3 geralmente fica um passo atrás do Fable 5 e do GPT-5.6 Sol, mas confortavelmente à frente do nível de carro-chefe anterior. Algumas leituras concretas dos gráficos da Moonshot:

  • Tarefas agênticas na web (BrowseComp): o K3 lidera com 91,2, à frente do GPT-5.6 Sol (90,4) e do Fable 5 (88,0).
  • Automation Bench: o K3 em primeiro com 30,8, superando por pouco o GPT-5.6 Sol (29,7) e o Fable 5 (29,1).
  • SWE Marathon (codificação de longo horizonte): o K3 no topo com 42,0, acima do Opus 4.8 (40,0) e do GPT-5.6 Sol (39,0).
  • GDPval-AA v2 (trabalho de conhecimento): aqui ele cai para terceiro com 1668, atrás do Fable 5 (1760) e do GPT-5.6 Sol (1748).

Testes independentes contam a mesma história. Na Artificial Analysis, o K3 registra um Intelligence Index de 57, classificado em #4 de 189 modelos, e em sua avaliação privada de trabalho de conhecimento de longo horizonte ele "na maioria das vezes supera o Claude Opus 4.8 max e o GPT-5.5 high, enquanto perde para o Claude Fable 5 e o GPT-5.6 Sol." A velocidade de saída é mais comum, cerca de 62 tokens/segundo. Minha opinião: trate o K3 como um forte e confiável número dois, não como um matador de gigantes, e leia qualquer manchete do tipo "supera o Opus 4.8" como algo específico da tarefa, porque em muitas tarefas ele realmente faz isso.

O que mudou do Kimi K2 para o K3

Se você conhecia o Kimi como o modelo chinês barato e capaz, o K3 reescreve duas dessas suposições. Ele é muito maior e muito mais eficiente por unidade de computação, mas também não é mais barato.

O que mudou do Kimi K2 para o K3: o tamanho cresceu de 1 trilhão para 2,8 trilhões de parâmetros, eficiência de escalonamento 2,5x melhor, o preço passou de baratíssimo para premium US$ 3/US$ 15, e os pesos abertos agora chegam semanas após o lançamento
O que mudou do Kimi K2 para o K3: o tamanho cresceu de 1 trilhão para 2,8 trilhões de parâmetros, eficiência de escalonamento 2,5x melhor, o preço passou de baratíssimo para premium US$ 3/US$ 15, e os pesos abertos agora chegam semanas após o lançamento

Aquela linha de preço é a que mudou toda a narrativa. "O Kimi é o matador de fronteira ultrabarato" era uma história da era K2. Com o K3, a Moonshot subiu o preço para o território de carro-chefe e está apostando que a inteligência justifica isso.

Preços do Kimi K3

Vamos colocar os números reais na mesa, porque "modelo aberto acessível" não descreve mais o que você realmente vai pagar. Os preços oficiais da API do K3 são refrescantemente simples: um modelo, um preço, fixo em toda a janela de contexto.

ModeloUnidadeEntrada (acerto de cache)Entrada (erro de cache)SaídaJanela de contexto
kimi-k31M tokensUS$ 0,30US$ 3,00US$ 15,001.048.576 (1M)

Duas coisas que gosto aqui. Não há um nível premium para prompts longos, a janela de 1M tem o mesmo preço do início ao fim, diferente de alguns rivais que cobram mais depois de um limite de tokens. E o desconto de cache de contexto é real: um acerto de cache reduz a entrada para US$ 0,30/M, uma economia de 90%. Para trabalho de documentos longos ou agentes de longo horizonte, onde a maior parte da entrada é um contexto estável e em cache, é aí que o K3 se torna genuinamente competitivo.

Se você estiver usando o aplicativo para consumidores em vez da API, o Kimi cobra quatro níveis de assinatura, batizados com nomes de andamentos musicais, além de um plano gratuito:

NívelMensalAnual (por mês)Inclusões notáveis
GrátisUS$ 0-Chat básico
ModeratoUS$ 19US$ 15Deep Research, Docs/Sheets/Slides, acesso ao Kimi Code
AllegrettoUS$ 39US$ 312x créditos de agente, 5x créditos do Kimi Code
AllegroUS$ 99US$ 795x créditos de agente, agentes paralelos Swarm
VivaceUS$ 199US$ 15910x créditos de agente, concorrência máxima do Swarm

Fonte: preços de assinatura do Kimi. Vale saber: essa página traz um banner dizendo que novos planos estão a caminho e que os benefícios do Kimi chat e do Kimi Code serão divididos em produtos separados, então essa escada de preços pode ficar diferente em breve.

Então, como o US$ 3 / US$ 15 realmente se compara? O único contraste concreto e de fonte primária é o DeepSeek, cujo V4 Flash roda a US$ 0,14 / US$ 0,28 por milhão, cerca de 21x mais barato na saída do que o K3. O DeepSeek ainda é a verdadeira opção de fronteira econômica; o K3 não está mais competindo nesse eixo. A leitura da comunidade na semana de lançamento foi mais direta, como um comentarista colocou no Hacker News, a mudança é de "é totalmente barato" para um modelo que custa aproximadamente o que o nível Sonnet do Claude custa. A vantagem de preço do K3 não é a taxa por token em destaque, é a janela fixa de 1M somada ao desconto de cache de 90%.

O que as pessoas realmente pensam

A semana de lançamento de um modelo de fronteira aberto é barulhenta, e a reação ao K3 se dividiu claramente entre empolgação com a capacidade e ceticismo com o custo. O sinal mais útil veio de pessoas que realmente o rodaram em trabalho real.

As opiniões sobre paridade em codificação foram os elogios mais fortes:

Hacker News

"Estou brincando com ele nas últimas horas, e acho que é um modelo incrível. Não tenho certeza se conseguiria notar a diferença entre este e o Fable em um teste cego. A cota no plano Kimi Coding de US$ 100 parece se alinhar razoavelmente com o que recebo do plano Anthropic de US$ 200 quando uso principalmente o Fable."

Há também um momento emocional genuíno sobre um modelo aberto trocando socos com os laboratórios fechados:

LinkedIn

"O Kimi K3 foi lançado oficialmente! Olhem esse jogo em voxel criado com este prompt básico: 'Voxel star wars pod-racers run'. Os modelos chineses preencheram a lacuna! Estamos entrando em uma nova fase da IA."

O hype pré-lançamento tinha colocado a régua ainda mais alta:

"O K3 é um animal diferente. Os rumores dizem que o Kimi K3 é um modelo muito maior, no mesmo nível do Claude Opus 4.7."

E o lado mais calmo o posicionou mais ou menos onde os números o colocam, um pouco abaixo do topo absoluto:

Hacker News

"Hmm, o Fable só saiu de verdade há 2 semanas, e o GPT-5.6 Sol há apenas 1 semana. Sim, o Kimi K3 parece um pouco abaixo dos dois, mas acima de todos os outros modelos. Então eu diria que está algumas semanas atrás, não meses agora..."

A maior reclamação não foi a qualidade, foi o custo, além de uma queixa recorrente de que o K3 consome mais tokens que o Fable para terminar a mesma tarefa. Essa questão de eficiência de tokens é a que realmente decide sua fatura, e vale a pena acompanhá-la conforme os testes independentes amadurecem.

O que o Kimi K3 consegue construir

A vitrine de lançamento é genuinamente divertida, e é a demonstração mais clara da codificação de longo horizonte que a Moonshot está vendendo. Em uma única execução autônoma de 48 horas, o K3 projetou um chip (Nangate 45nm, 4mm², simulado a mais de 8.700 tokens/segundo de decodificação). Ele também construiu o "MiniTriton," um compilador de GPU semelhante ao Triton com sua própria IR, igualando ou superando o torch.compile em algumas cargas de trabalho. E gerou jogos 3D jogáveis a partir de prompts únicos:

Um jogo de mundo aberto em 3D gerado pelo Kimi K3 a partir de um único prompt, mostrando um cavaleiro a cavalo em uma paisagem outonal, retirado do blog do Kimi K3 da Moonshot
Um jogo de mundo aberto em 3D gerado pelo Kimi K3 a partir de um único prompt, mostrando um cavaleiro a cavalo em uma paisagem outonal, retirado do blog do Kimi K3 da Moonshot

A reação da comunidade ao compilador de GPU resumiu o clima, partes iguais de espanto e "me mostre as provas":

Hacker News

"Alguém viu no post do blog que ele conseguiu codificar um compilador de GPU inteiro do zero? Parece que ele até superou o triton em alguns kernels de GPU. Isso simplesmente me parece insano. Fico imaginando se vão abrir o código disso e mostrar quantos tokens custou."

Demonstrações como essas são reais, e também são as execuções de melhor caso, fortemente estruturadas, que qualquer laboratório mostra no lançamento. A lacuna entre "fez isso uma vez em uma sandbox" e "faz isso de forma confiável para o meu caso de uso" é todo o jogo, o que me leva à parte com que mais me importo.

Uma pontuação de benchmark não é um agente de suporte

Aqui está a coisa que todo post de lançamento de modelo ignora, e é a que importa se você chegou aqui tentando escolher um modelo para atendimento ao cliente. Um 57 no Intelligence Index diz que o motor bruto é forte. Não diz nada sobre se ele vai responder com segurança aos seus clientes.

Uma pontuação de benchmark não é um agente de suporte: um modelo de fronteira puro te dá um número alto, uma chave de API e um prompt em branco, enquanto um colega de equipe pronto para suporte é treinado na sua central de ajuda e nos tickets anteriores, usa roteamento baseado em confiança, é testado em tickets reais antes de entrar no ar, e vive dentro do seu helpdesk
Uma pontuação de benchmark não é um agente de suporte: um modelo de fronteira puro te dá um número alto, uma chave de API e um prompt em branco, enquanto um colega de equipe pronto para suporte é treinado na sua central de ajuda e nos tickets anteriores, usa roteamento baseado em confiança, é testado em tickets reais antes de entrar no ar, e vive dentro do seu helpdesk

Eu construo agentes de IA na eesel, e a coisa que aprendemos da forma mais difícil é que a qualidade do modelo é talvez um terço do problema. Já vimos bots que soam confiantes darem respostas erradas silenciosamente, e é exatamente por isso que agora simulamos toda implantação contra os tickets históricos de uma empresa antes de ela sequer falar com um cliente. Uma chave de API do K3 pura não te dá nada disso. Para ir de um ótimo modelo a um colega de equipe em quem você confiaria na fila, você ainda precisa treiná-lo na sua base de conhecimento, envolvê-lo em roteamento que escala quando há incerteza, e colocá-lo onde sua equipe já trabalha. Essa é a lacuna, e é a mesma lacuna seja o modelo subjacente o K3, o Claude Opus, ou qualquer outro.

Experimente o eesel

Se você está lendo uma análise do Kimi K3 porque quer uma IA melhor na sua fila de suporte, o modelo é a parte fácil. O eesel é a camada que transforma um modelo de fronteira em um agente de suporte de verdade: ele treina na sua central de ajuda e nos tickets anteriores, rascunha ou resolve completamente respostas dentro do seu helpdesk já existente e, crucialmente, permite que você simule tudo isso contra o seu histórico real de tickets para que você veja a taxa de resolução e o custo antes de entrar no ar.

Visão geral do painel do helpdesk da eesel AI
Visão geral do painel do helpdesk da eesel AI

Como o eesel é agnóstico em relação ao modelo, você consegue acompanhar a fronteira, rodando com qualquer modelo de ponta que for o melhor naquele mês, sem reescrever prompts ou ficar de babá de uma API pura. E o preço é construído para a economia de suporte: baseado em uso, sem taxas por assento, então um mês agitado não te penaliza por ter uma equipe maior. Você pode experimentar o eesel de graça e simular nos seus próprios tickets em poucos minutos.

Perguntas Frequentes

O que é o Kimi K3?
O Kimi K3 é o modelo mais novo da Moonshot AI, lançado em 16 de julho de 2026. É um modelo mixture-of-experts de 2,8 trilhões de parâmetros com visão nativa e uma janela de contexto de 1 milhão de tokens, apresentado como o primeiro modelo aberto na escala de 3 trilhões de parâmetros. Se você está avaliando modelos para trabalho de suporte, nosso panorama dos melhores agentes de IA é um ponto de partida melhor do que um único modelo.
Quanto custa o Kimi K3?
A API do Kimi K3 custa US$ 3,00 por 1 milhão de tokens de entrada (erro de cache), US$ 0,30 em um acerto de cache, e US$ 15,00 por 1 milhão de tokens de saída, valor fixo em toda a janela de contexto de 1M. O aplicativo para consumidores acrescenta quatro níveis de assinatura, de US$ 19 a US$ 199 por mês. Esse é o preço do nível Sonnet, não a pechincha pela qual o Kimi K2 era conhecido.
O Kimi K3 é de código aberto?
A Moonshot o chama de "o primeiro modelo aberto de classe 3T do mundo", mas os pesos não estavam disponíveis no lançamento. A Moonshot diz que os pesos completos serão lançados até 27 de julho de 2026, junto com um relatório técnico. Até lá, é só API. Para equipes que precisam rodar agentes em produção, um modelo de API que ainda não pode ser auto-hospedado é algo a se planejar com antecedência.
Como o Kimi K3 se compara ao Claude Fable 5 e ao GPT-5.6?
Nos próprios benchmarks da Moonshot e em testes independentes da Artificial Analysis, o K3 fica logo abaixo do Claude Fable 5 e do GPT-5.6 Sol, mas supera o Claude Opus 4.8 e o GPT-5.5 na maioria das tarefas. Ele lidera claramente alguns benchmarks agênticos e de codificação. Entenda-o como um forte número dois, não como o novo modelo líder.
Posso usar o Kimi K3 para suporte ao cliente?
Você pode chamá-lo pela API, mas um modelo puro não é um agente de suporte. Ele precisa ser treinado na sua central de ajuda e nos tickets anteriores, envolvido em um roteamento baseado em confiança, e testado antes de responder a clientes reais. É exatamente isso que o eesel resolve, e é agnóstico em relação ao modelo, então roda em modelos de fronteira como este sem que você precise gerenciar prompts. Veja como pensamos sobre prevenir alucinações de IA no suporte.
O que o Kimi K3 realmente consegue construir?
A vitrine de lançamento da Moonshot mostrou o K3 projetando de forma autônoma um chip ao longo de 48 horas, escrevendo um compilador de GPU que superou o Triton em alguns kernels, e gerando jogos 3D jogáveis a partir de um único prompt. Demonstrações impressionantes, embora o contraponto justo da comunidade tenha sido "mostrem a conta de tokens".

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Ilustração representando o modelo de linguagem grande Kimi K3 da Moonshot AI
Trending

Kimi K3 explicado: o modelo de fronteira aberto da Moonshot

Um guia direto sobre o Kimi K3, o modelo aberto de 2,8 trilhões de parâmetros da Moonshot AI: o que é, como se sai, quanto custa e se vale a pena migrar para ele.

Alicia Kirana UtomoAlicia Kirana UtomoJul 17, 2026
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab em análise
Trending

Análise do Inkling: o modelo aberto da Thinking Machines vale a pena?

Uma análise honesta do Inkling: no que o primeiro modelo de pesos abertos da Thinking Machines Lab é realmente bom, onde o preço e os benchmarks decepcionam, e quem deveria realmente usá-lo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Banner principal da análise do PromptQL com o logo do PromptQL sobre um fundo índigo
Trending

Análise do PromptQL (2026): o agente de dados da Hasura, testado

Uma análise prática do PromptQL: como o agente de dados da Hasura separa planejamento de execução, quanto custa e se a promessa de confiabilidade se sustenta.

Alicia Kirana UtomoAlicia Kirana UtomoJul 10, 2026
Banner principal da análise do Gemini 3.5 Pro em azul Google
Trending

Análise do Gemini 3.5 Pro: o estado honesto do carro-chefe do Google

Uma análise honesta do Gemini 3.5 Pro: ele ainda não foi lançado. Veja o que o Google confirmou, por que está atrasado, os benchmarks que realmente existem e o que usar hoje.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab
Trending

Inkling explicado: o modelo de IA de pesos abertos da Thinking Machines

O que o Inkling realmente é: o primeiro modelo de pesos abertos da Thinking Machines Lab, seus benchmarks reais, quanto custa rodá-lo e se ele tem algo a ver com uma fila de suporte.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustração comparando as melhores alternativas ao modelo de linguagem de grande porte Kimi K3
Trending

As 8 melhores alternativas ao Kimi K3 em 2026

O Kimi K3 é um modelo de fronteira de verdade, mas não é o mais barato e os pesos chegam atrasados. Aqui estão as 8 melhores alternativas ao Kimi K3, com preços reais de API.

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026
Ilustração de capa da análise do ChatGPT for Work na cor turquesa do ChatGPT
Trending

Análise do ChatGPT for Work: vale a pena em 2026?

Uma análise prática do ChatGPT for Work: quanto custam os planos Business e Enterprise, o que faz o novo agente ChatGPT Work e onde ele se encaixa (e onde não se encaixa).

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Ilustração editorial com o logo do Grok, barras de benchmark e uma etiqueta de preço representando uma análise do Grok 4.5
Trending

Análise do Grok 4.5: benchmarks, preços e o veredito

O Grok 4.5 da xAI foi lançado em 8 de julho com uma pontuação #4 no Intelligence Index e o melhor resultado de uso agentico de ferramentas do ranking. Aqui está a análise real, os benchmarks, os preços e quem deveria realmente usá-lo.

Rama Adi NugrahaRama Adi NugrahaJul 9, 2026
Ilustração editorial representando uma comparação de modelos de IA como alternativas ao Inkling
Trending

8 melhores alternativas ao Inkling em 2026

O Inkling é aberto e interessante, mas é caro para um modelo de pesos abertos e não é o modelo mais inteligente que você pode usar. Aqui estão as 8 alternativas que eu realmente experimentaria, com preços reais e onde cada uma vence.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis