
Resumo
O Kimi K3 é o modelo mais novo da Moonshot AI, lançado em 16 de julho de 2026: um modelo aberto de 2,8 trilhões de parâmetros com visão nativa e uma janela de contexto de 1 milhão de tokens. A Moonshot o apresenta como o primeiro modelo aberto na escala de 3 trilhões de parâmetros, e os benchmarks sustentam o hype mais do que se esperaria. Ele fica logo abaixo do Claude Fable 5 e do GPT-5.6 Sol, mas à frente do Claude Opus 4.8 e do GPT-5.5 na maioria das tarefas, e vence claramente alguns benchmarks de codificação e agênticos.
Duas coisas me surpreenderam. Primeiro, o preço: com US$ 3 / US$ 15 por milhão de tokens, o K3 não é mais a jogada baratíssima que o antigo Kimi K2 era, seu preço está no nível do tier Sonnet da Claude. Segundo, "aberto" vem com um asterisco: os pesos não estavam disponíveis no lançamento e devem sair até 27 de julho de 2026.
Eu construo agentes de IA na eesel, onde passamos anos colocando modelos como este em filas de suporte ao vivo, então aqui está a parte que os gráficos de benchmark deixam de fora: uma pontuação de fronteira não é um agente de suporte. O K3 é um motor genuinamente forte. Transformá-lo em algo que responde com segurança aos seus clientes é um trabalho diferente, e é o que realmente importa se você está lendo isto para escolher um modelo para suporte.
O que é o Kimi K3?
O Kimi K3 é o carro-chefe da Moonshot AI, o laboratório chinês por trás do anterior modelo de pesos abertos Kimi K2. A Moonshot descreve o K3 como "o primeiro modelo aberto de classe 3T do mundo, projetado para inteligência de fronteira em codificação de longo horizonte, trabalho de conhecimento e raciocínio."
O que chama atenção é que a Moonshot é incomumente honesta sobre onde o K3 se posiciona. O blog de lançamento diz claramente que "embora seu desempenho geral ainda fique atrás dos modelos proprietários mais poderosos, Claude Fable 5 e GPT 5.6 Sol, o Kimi K3 demonstrou desempenho de nível de fronteira em todo o nosso conjunto de avaliação, superando consistentemente os outros modelos testados." É raro ver um laboratório abrir liderando com aquilo que seu modelo não é, e isso torna o resto das alegações mais fácil de confiar.
Há uma pegadinha que vale a pena sinalizar desde já. A Moonshot chama isso de um modelo aberto, mas no lançamento era só API. O blog oficial diz que "os pesos completos do modelo serão lançados até 27 de julho de 2026," e, na semana de lançamento, o repositório no HuggingFace ainda retornava um 404. Então, se o seu plano era fazer auto-hospedagem no primeiro dia, esse plano espera mais algumas semanas.
Como o Kimi K3 realmente funciona
Se você já construiu com esses modelos antes, a parte interessante do K3 não é a contagem de parâmetros, é como a Moonshot chegou lá sem o custo explodir. Aqui está o pipeline em uma imagem.

Algumas peças estão fazendo o trabalho pesado:
- Uma mistura de especialistas muito esparsa. O K3 tem 2,8 trilhões de parâmetros no total, mas "ativa efetivamente apenas 16 de 896 especialistas" por token, usando o que a Moonshot chama de framework Stable LatentMoE. O roteamento esparso é como se consegue um modelo enorme que ainda é acessível de rodar, apenas uma fração dele dispara para qualquer token dado.
- Kimi Delta Attention (KDA). Um mecanismo híbrido de atenção linear que mantém a janela de contexto de 1M tokens prática em vez de ruinosamente cara.
- Attention Residuals (AttnRes). Um substituto direto para as conexões residuais padrão, que a Moonshot abriu separadamente em github.com/MoonshotAI/Attention-Residuals.
- Raciocínio sempre ativo. O K3 sempre "pensa", não há um modo mais barato sem raciocínio. O esforço é definido com um campo
reasoning_effortque atualmente só aceitamax, com níveis mais baixos "em breve".
Somando tudo, a Moonshot alega "uma melhoria aproximada de 2,5x na eficiência geral de escalonamento em comparação com o Kimi K2." Essa é a verdadeira história aqui: não apenas maior, mas muito mais saída por unidade de computação de treinamento. Uma lacuna honesta: o relatório técnico completo e a contagem exata de parâmetros ativos ainda não saíram, então parte do como ainda é uma promessa.
Como o Kimi K3 pontua nos benchmarks
É aqui que o K3 ganha o rótulo de "fronteira". A Moonshot publicou gráficos comparativos diretos contra o Fable 5, o GPT-5.6 Sol, o Opus 4.8 e o GPT-5.5, e testes independentes começaram a corroborá-los.

O padrão é consistente. O K3 geralmente fica um passo atrás do Fable 5 e do GPT-5.6 Sol, mas confortavelmente à frente do nível de carro-chefe anterior. Algumas leituras concretas dos gráficos da Moonshot:
- Tarefas agênticas na web (BrowseComp): o K3 lidera com 91,2, à frente do GPT-5.6 Sol (90,4) e do Fable 5 (88,0).
- Automation Bench: o K3 em primeiro com 30,8, superando por pouco o GPT-5.6 Sol (29,7) e o Fable 5 (29,1).
- SWE Marathon (codificação de longo horizonte): o K3 no topo com 42,0, acima do Opus 4.8 (40,0) e do GPT-5.6 Sol (39,0).
- GDPval-AA v2 (trabalho de conhecimento): aqui ele cai para terceiro com 1668, atrás do Fable 5 (1760) e do GPT-5.6 Sol (1748).
Testes independentes contam a mesma história. Na Artificial Analysis, o K3 registra um Intelligence Index de 57, classificado em #4 de 189 modelos, e em sua avaliação privada de trabalho de conhecimento de longo horizonte ele "na maioria das vezes supera o Claude Opus 4.8 max e o GPT-5.5 high, enquanto perde para o Claude Fable 5 e o GPT-5.6 Sol." A velocidade de saída é mais comum, cerca de 62 tokens/segundo. Minha opinião: trate o K3 como um forte e confiável número dois, não como um matador de gigantes, e leia qualquer manchete do tipo "supera o Opus 4.8" como algo específico da tarefa, porque em muitas tarefas ele realmente faz isso.
O que mudou do Kimi K2 para o K3
Se você conhecia o Kimi como o modelo chinês barato e capaz, o K3 reescreve duas dessas suposições. Ele é muito maior e muito mais eficiente por unidade de computação, mas também não é mais barato.

Aquela linha de preço é a que mudou toda a narrativa. "O Kimi é o matador de fronteira ultrabarato" era uma história da era K2. Com o K3, a Moonshot subiu o preço para o território de carro-chefe e está apostando que a inteligência justifica isso.
Preços do Kimi K3
Vamos colocar os números reais na mesa, porque "modelo aberto acessível" não descreve mais o que você realmente vai pagar. Os preços oficiais da API do K3 são refrescantemente simples: um modelo, um preço, fixo em toda a janela de contexto.
| Modelo | Unidade | Entrada (acerto de cache) | Entrada (erro de cache) | Saída | Janela de contexto |
|---|---|---|---|---|---|
kimi-k3 | 1M tokens | US$ 0,30 | US$ 3,00 | US$ 15,00 | 1.048.576 (1M) |
Duas coisas que gosto aqui. Não há um nível premium para prompts longos, a janela de 1M tem o mesmo preço do início ao fim, diferente de alguns rivais que cobram mais depois de um limite de tokens. E o desconto de cache de contexto é real: um acerto de cache reduz a entrada para US$ 0,30/M, uma economia de 90%. Para trabalho de documentos longos ou agentes de longo horizonte, onde a maior parte da entrada é um contexto estável e em cache, é aí que o K3 se torna genuinamente competitivo.
Se você estiver usando o aplicativo para consumidores em vez da API, o Kimi cobra quatro níveis de assinatura, batizados com nomes de andamentos musicais, além de um plano gratuito:
| Nível | Mensal | Anual (por mês) | Inclusões notáveis |
|---|---|---|---|
| Grátis | US$ 0 | - | Chat básico |
| Moderato | US$ 19 | US$ 15 | Deep Research, Docs/Sheets/Slides, acesso ao Kimi Code |
| Allegretto | US$ 39 | US$ 31 | 2x créditos de agente, 5x créditos do Kimi Code |
| Allegro | US$ 99 | US$ 79 | 5x créditos de agente, agentes paralelos Swarm |
| Vivace | US$ 199 | US$ 159 | 10x créditos de agente, concorrência máxima do Swarm |
Fonte: preços de assinatura do Kimi. Vale saber: essa página traz um banner dizendo que novos planos estão a caminho e que os benefícios do Kimi chat e do Kimi Code serão divididos em produtos separados, então essa escada de preços pode ficar diferente em breve.
Então, como o US$ 3 / US$ 15 realmente se compara? O único contraste concreto e de fonte primária é o DeepSeek, cujo V4 Flash roda a US$ 0,14 / US$ 0,28 por milhão, cerca de 21x mais barato na saída do que o K3. O DeepSeek ainda é a verdadeira opção de fronteira econômica; o K3 não está mais competindo nesse eixo. A leitura da comunidade na semana de lançamento foi mais direta, como um comentarista colocou no Hacker News, a mudança é de "é totalmente barato" para um modelo que custa aproximadamente o que o nível Sonnet do Claude custa. A vantagem de preço do K3 não é a taxa por token em destaque, é a janela fixa de 1M somada ao desconto de cache de 90%.
O que as pessoas realmente pensam
A semana de lançamento de um modelo de fronteira aberto é barulhenta, e a reação ao K3 se dividiu claramente entre empolgação com a capacidade e ceticismo com o custo. O sinal mais útil veio de pessoas que realmente o rodaram em trabalho real.
As opiniões sobre paridade em codificação foram os elogios mais fortes:
"Estou brincando com ele nas últimas horas, e acho que é um modelo incrível. Não tenho certeza se conseguiria notar a diferença entre este e o Fable em um teste cego. A cota no plano Kimi Coding de US$ 100 parece se alinhar razoavelmente com o que recebo do plano Anthropic de US$ 200 quando uso principalmente o Fable."
Há também um momento emocional genuíno sobre um modelo aberto trocando socos com os laboratórios fechados:
"O Kimi K3 foi lançado oficialmente! Olhem esse jogo em voxel criado com este prompt básico: 'Voxel star wars pod-racers run'. Os modelos chineses preencheram a lacuna! Estamos entrando em uma nova fase da IA."
O hype pré-lançamento tinha colocado a régua ainda mais alta:
"O K3 é um animal diferente. Os rumores dizem que o Kimi K3 é um modelo muito maior, no mesmo nível do Claude Opus 4.7."
E o lado mais calmo o posicionou mais ou menos onde os números o colocam, um pouco abaixo do topo absoluto:
"Hmm, o Fable só saiu de verdade há 2 semanas, e o GPT-5.6 Sol há apenas 1 semana. Sim, o Kimi K3 parece um pouco abaixo dos dois, mas acima de todos os outros modelos. Então eu diria que está algumas semanas atrás, não meses agora..."
A maior reclamação não foi a qualidade, foi o custo, além de uma queixa recorrente de que o K3 consome mais tokens que o Fable para terminar a mesma tarefa. Essa questão de eficiência de tokens é a que realmente decide sua fatura, e vale a pena acompanhá-la conforme os testes independentes amadurecem.
O que o Kimi K3 consegue construir
A vitrine de lançamento é genuinamente divertida, e é a demonstração mais clara da codificação de longo horizonte que a Moonshot está vendendo. Em uma única execução autônoma de 48 horas, o K3 projetou um chip (Nangate 45nm, 4mm², simulado a mais de 8.700 tokens/segundo de decodificação). Ele também construiu o "MiniTriton," um compilador de GPU semelhante ao Triton com sua própria IR, igualando ou superando o torch.compile em algumas cargas de trabalho. E gerou jogos 3D jogáveis a partir de prompts únicos:

A reação da comunidade ao compilador de GPU resumiu o clima, partes iguais de espanto e "me mostre as provas":
"Alguém viu no post do blog que ele conseguiu codificar um compilador de GPU inteiro do zero? Parece que ele até superou o triton em alguns kernels de GPU. Isso simplesmente me parece insano. Fico imaginando se vão abrir o código disso e mostrar quantos tokens custou."
Demonstrações como essas são reais, e também são as execuções de melhor caso, fortemente estruturadas, que qualquer laboratório mostra no lançamento. A lacuna entre "fez isso uma vez em uma sandbox" e "faz isso de forma confiável para o meu caso de uso" é todo o jogo, o que me leva à parte com que mais me importo.
Uma pontuação de benchmark não é um agente de suporte
Aqui está a coisa que todo post de lançamento de modelo ignora, e é a que importa se você chegou aqui tentando escolher um modelo para atendimento ao cliente. Um 57 no Intelligence Index diz que o motor bruto é forte. Não diz nada sobre se ele vai responder com segurança aos seus clientes.

Eu construo agentes de IA na eesel, e a coisa que aprendemos da forma mais difícil é que a qualidade do modelo é talvez um terço do problema. Já vimos bots que soam confiantes darem respostas erradas silenciosamente, e é exatamente por isso que agora simulamos toda implantação contra os tickets históricos de uma empresa antes de ela sequer falar com um cliente. Uma chave de API do K3 pura não te dá nada disso. Para ir de um ótimo modelo a um colega de equipe em quem você confiaria na fila, você ainda precisa treiná-lo na sua base de conhecimento, envolvê-lo em roteamento que escala quando há incerteza, e colocá-lo onde sua equipe já trabalha. Essa é a lacuna, e é a mesma lacuna seja o modelo subjacente o K3, o Claude Opus, ou qualquer outro.
Experimente o eesel
Se você está lendo uma análise do Kimi K3 porque quer uma IA melhor na sua fila de suporte, o modelo é a parte fácil. O eesel é a camada que transforma um modelo de fronteira em um agente de suporte de verdade: ele treina na sua central de ajuda e nos tickets anteriores, rascunha ou resolve completamente respostas dentro do seu helpdesk já existente e, crucialmente, permite que você simule tudo isso contra o seu histórico real de tickets para que você veja a taxa de resolução e o custo antes de entrar no ar.

Como o eesel é agnóstico em relação ao modelo, você consegue acompanhar a fronteira, rodando com qualquer modelo de ponta que for o melhor naquele mês, sem reescrever prompts ou ficar de babá de uma API pura. E o preço é construído para a economia de suporte: baseado em uso, sem taxas por assento, então um mês agitado não te penaliza por ter uma equipe maior. Você pode experimentar o eesel de graça e simular nos seus próprios tickets em poucos minutos.
Perguntas Frequentes
O que é o Kimi K3?
Quanto custa o Kimi K3?
O Kimi K3 é de código aberto?
Como o Kimi K3 se compara ao Claude Fable 5 e ao GPT-5.6?
Posso usar o Kimi K3 para suporte ao cliente?
O que o Kimi K3 realmente consegue construir?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.







