
O que o Xiaomi MiMo V2.6 realmente é
Eu construo integrações e APIs para viver, então meu primeiro instinto diante de qualquer lançamento assim é pular a página de marketing e ler o model card. O card do MiMo V2.6 se sustenta.
O MiMo V2.6 é uma família de modelos de linguagem de pesos abertos e nativamente omnimodais da equipe MiMo da Xiaomi, lançada em 22 de setembro de 2026. "Nativamente omnimodal" faz trabalho de verdade nessa frase: o mesmo modelo processa texto, imagens, vídeo e áudio, em vez de acoplar um adaptador de visão a um modelo de texto depois do fato. Cada checkpoint da família vem com uma janela de contexto de 1 milhão de tokens.
O lema do lançamento é "Scaling Reinforcement Learning Toward Self-Improvement", e a Xiaomi enquadra toda a série como um passo em um caminho de auto-aperfeiçoamento recursivo: escalar computação de RL em tarefas complexas e verificáveis e deixar o modelo continuar empurrando sua própria fronteira de capacidade. É o tipo de frase que normalmente me faz revirar os olhos, mas o relatório técnico tem metodologia concreta o suficiente por trás para soar como engenharia, não como um press release.

Se você quiser a versão de um parágrafo da arquitetura: o Pro é um modelo esparso de mistura de especialistas com uma espinha dorsal de atenção híbrida: 70 camadas que intercalam atenção local de janela deslizante (janela de 128) com atenção global, 384 especialistas roteados dos quais 8 disparam por token, um codificador visual de 681 milhões de parâmetros, codificadores de áudio dedicados, e um decodificador de previsão multi-token de 5 camadas que prevê vários tokens por passagem para acelerar a decodificação. Você não precisa se preocupar com nada disso para usá-lo, mas isso explica como um modelo de "um trilhão de parâmetros" continua barato de rodar: apenas 42 bilhões desses parâmetros estão ativos em um determinado token.
A família de modelos, do Flash a um Pro de um trilhão de parâmetros
O MiMo V2.6 não é um único modelo, são quatro checkpoints voltados para quatro trabalhos diferentes. É daí que vem boa parte da confusão online, então vale a pena deixar isso claro.

| Modelo | Arquitetura | Parâmetros totais | Parâmetros ativos | Contexto | Melhor para |
|---|---|---|---|---|---|
| MiMo V2.6 Pro | MoE esparso | 1,02T | 42B | 1M | O trabalho agêntico mais exigente e de longo horizonte |
| MiMo V2.6 Flash | MoE esparso | 309B | 15B | 1M | O melhor equilíbrio entre inteligência, velocidade e custo |
| MiMo V2.6 Pro UltraSpeed | Mesmo checkpoint do Pro, build de velocidade | ~1T | 42B | 1M | Qualidade nível Pro quando você precisa de saída rápida |
| MiMo V2.6 Distill-Qwen-9B | Denso (SFT do Qwen3.5-9B) | 9B | 9B | n/a | Pesquisa de RL agêntica aberta e em GPU única |
Algumas coisas valem a pena destacar. O Pro é anunciado como o modelo mais capaz da Xiaomi até hoje. O Flash é o que a maioria das pessoas realmente vai escolher, já que oferece o equilíbrio que a maioria das cargas de trabalho quer. O UltraSpeed é o mesmo checkpoint do Pro servido a uma velocidade de saída cerca de 10 vezes maior (o blog da Xiaomi afirma até 20 vezes), o que importa muito se você estiver transmitindo respostas para um usuário esperando do outro lado. E a destilação de 9B é um ajuste fino supervisionado do Qwen3.5-9B sobre dados gerados pelo MiMo, lançado como ponto de partida para pesquisa aberta em vez de um modelo de produção.
O salto geracional é a verdadeira história aqui. O carro-chefe anterior, MiMo V2.5 Pro, pontuou 19,0 no benchmark de codificação DeepSWE v1.1. O V2.6 Pro pontua 71,9 na mesma tabela. No Terminal Bench 4.0, foi de 1,5 para 34,9. Esses não são ganhos incrementais, são o tipo de salto que só se vê quando um laboratório muda sua abordagem de treinamento, que é exatamente o que a Xiaomi diz que aconteceu.
Os benchmarks com os quais a Xiaomi se destaca, e os que não
Todo lançamento de modelo escolhe a dedo seus gráficos, então fui direto à tabela de avaliação do model card, que compara o MiMo V2.6 com o Claude Opus 5, o GPT-5.6 Sol e o Claude Fable 5. Aqui está a divisão honesta.

Onde o Pro claramente lidera a fronteira fechada segundo os números da Xiaomi:
| Benchmark | MiMo V2.6 Pro | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|
| AutomationBench v1.0.6 | 53,1 | 50,3 | 45,8 |
| Terminal Bench 2.1 | 89,9 | 89,1 | 88,8 |
| Agents' Last Exam | 31,6 | 31,6 | 30,8 |
| MiMo Visual Coding | 72,3 | 70,0 | 73,4 |
E onde ele fica atrás, o que a Xiaomi, para seu mérito, publica bem ao lado das vitórias:
| Benchmark | MiMo V2.6 Pro | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|
| DeepSWE v1.1 | 71,9 | 74,0 | 73,0 |
| ProgramBench | 26,5 | 37,0 | 25,0 |
| Terminal Bench 4.0 | 34,9 | 49,0 | 39,9 |
| ExploitBench | 47,9 | 70,0 | 78,5 |
O padrão é consistente e, acho, crível: o MiMo V2.6 Pro está ombro a ombro com a fronteira em tarefas agênticas gerais e uso de ferramentas, e fica atrás nos benchmarks mais difíceis de codificação de longo horizonte e de exploração. Quando a Xiaomi ampliou a comparação em seu blog de lançamento para incluir o GPT-6 Astra, o DeepSeek V4.1 Flash e o GLM 5.3, o mesmo padrão se manteve: o Pro fica perto do topo do grupo no AutomationBench e no Terminal Bench 2.1, e atrás do GPT-6 Astra no Terminal Bench 4.0 (59,6) e no ExploitGym.
Um número merece um destaque. O Pro registra um impressionante 94,0 no CyberGym (o Flash é ainda mais alto, com 95,1), onde o V2.5 Pro anterior alcançava 40,0. Cibersegurança é claramente uma área em que a Xiaomi treinou pesado, embora o ExploitBench, mais adversarial, conte uma história mais modesta, então eu trataria o resultado do CyberGym como impressionante em vez de definitivo.
O número independente que importa mais do que qualquer tabela isolada
Benchmarks isolados têm ruído. O índice agregado da Artificial Analysis é o que eu realmente acompanho, porque ele reúne muitas avaliações em uma única pontuação comparável e, crucialmente, a coloca em gráfico contra o custo.

O MiMo V2.6 Pro atinge um Intelligence Index de 46, o modelo de pesos abertos líder na tabela, ficando no que a Artificial Analysis literalmente chama de "quadrante mais atraente". A fronteira fechada pontua mais alto em inteligência bruta (GPT-6 Astra, Opus 5 e Fable 5.1 ficam todos na faixa de 50 baixa a média), mas fazem isso a 3 a 8 $ por tarefa. O MiMo consegue seu 46 por cerca de 0,13 $.
Essa relação preço-inteligência é todo o argumento de venda, e é por isso que esse lançamento mexeu com muita gente. Como um comentarista colocou na thread de lançamento, o modelo "caiu no quadrante mais verde de inteligência versus velocidade da AA" mantendo o preço idêntico ao da geração anterior. Quando você consegue de 85 a 90% da inteligência de fronteira por um quarentavo do custo, a conta muda para muitos casos de uso.
Como realmente executá-lo: pesos, API e preço
Essa é a parte com que mais me importo, porque uma pontuação de benchmark é inútil se você não conseguir colocar o modelo na sua stack. O MiMo V2.6 é surpreendentemente fácil de acessar, seja você quiser hospedar por conta própria ou apenas chamar um endpoint.
Os pesos são abertos sob licença MIT, que é tão permissiva quanto possível (uso comercial permitido, quase sem restrições). Você pode baixar o Pro, o Flash e a destilação de 9B do Hugging Face e do ModelScope, e a Xiaomi disponibiliza um checkpoint em FP8 para que você não seja forçado à precisão total.
Em relação ao hardware, seja realista sobre o que o Pro precisa. O próprio comando de lançamento do model card roda o Pro em dois nós com paralelismo de tensor de 16 vias, então isso é um cluster de GPU multi-nó, não algo que você monta em uma estação de trabalho sobressalente. O Flash é muito mais acessível, em um único nó de 8 GPUs, e a destilação de 9B roda em uma única GPU, com quantizações GGUF da comunidade já disponíveis para llama.cpp, LM Studio e Ollama. Se você acompanhou nossos textos sobre modelos de IA personalizados, nada disso vai surpreender você: pesos abertos são gratuitos, mas a conta de servir é real.
Se você preferir pular a infraestrutura por completo, o MiMo V2.6 está hospedado na própria plataforma de API da Xiaomi, no MiMo Studio e Desktop, e na OpenRouter. Aqui estão os preços da OpenRouter, por milhão de tokens, verificados na semana de lançamento:
| Modelo | Entrada / 1M | Saída / 1M | Contexto |
|---|---|---|---|
| MiMo V2.6 Flash | 0,14 $ | 0,28 $ | 1M |
| MiMo V2.6 Pro | 0,435 $ | 0,87 $ | 1M |
| MiMo V2.6 Pro UltraSpeed | 4,35 $ | 8,70 $ | 1M |
Duas coisas se destacam. O Flash, a 0,14 $ de entrada / 0,28 $ de saída, é barato para um modelo omnimodal com contexto de 1M. E o UltraSpeed é exatamente 10 vezes mais rápido e mais caro que o Pro, então é um prêmio deliberado para trabalho sensível à latência, não um modelo melhor. Para a maioria das equipes, o Flash é a escolha padrão sensata, e o Pro é para onde você escala quando uma tarefa realmente precisa disso.
O que as pessoas disseram depois de testar
Benchmarks são a história da Xiaomi. Eu queria a história dos usuários, então li a discussão do lançamento, e a reação dominante não foi sobre as pontuações. Foi sobre quão abertamente a Xiaomi treinou o modelo.
"I really like how transparent they've been about the training of this model. The realtime dashboard they shared during training was an incredible learning and teaching tool for me, and they've been unusually comprehensive in sharing details about their methodology... and benchmark scores (even the stuff they didn't do well on)."
"The best thing they did is being open about all the setbacks they had to deal with. They logged every restart with a reason, talked about dropping a cyber dataset after it degraded coding benchmarks. Also published real time training loss, benchmark scores after every checkpoint and running cost estimates."
Esse detalhe sobre descartar um conjunto de dados de cibersegurança porque ele prejudicava as pontuações de codificação é o tipo de coisa que laboratórios quase nunca admitem publicamente, e é uma grande parte do motivo pelo qual o lançamento conquistou boa vontade mesmo entre os céticos. A leitura técnica mais afiada da thread veio de um usuário veterano do MiMo que fez a própria contagem das tabelas:
"Mimo 2.6 pro, the 1T model leads Kimi K3, a 2.8T param model in 14 out of 15 benchmarks (and the last one is near tie)!! Good to see they also kept the price the same, and landed in the greenest quadrant of the intelligence vs speed of AA."
Não foi só elogio. A preocupação recorrente, aquela que acompanha todo modelo aberto forte que sai da China, é o "benchmaxxing": pontuações ótimas, trabalho real decepcionante. Um comentarista foi direto sobre a geração anterior:
"No chinese lab has caught up yet. They've tried to fake it by distilling and overfitting on benchmarks to make their models look better than they are, the 'best' models available from chinese labs right now (GLM 5.3 and Kimi K3) fall apart completely when you try to do real work with them."
O contrapeso veio de pessoas que já usavam a linha em produção. A opinião de um engenheiro de software sobre a conta de valor é a que eu continuo pensando:
"I been using MiMo-V2.5 to do most of my work as software engineer... I been VERY happy with ROI. The model is very powerful!... The cost is unbelievably low, and the quality of intelligence I get is equivalent to when I was working mostly with Anthropic models (late last year/early this year)... but when I add cost of M-token in the ROI math, Jeez! MiMo is an order of magnitude better."
Vale notar que essa última citação é sobre o V2.5, que várias pessoas também chamaram de "rápido, mas burro" para tarefas mais difíceis, então o verdadeiro teste do V2.6 é se ele fecha essa lacuna no uso diário, não só nos gráficos. No X, o lançamento foi lido principalmente como uma alfinetada no Grok 4.7, que foi lançado no mesmo dia, com reações que iam de "Melhor que o Grok 4.7" a um mais comedido "vamos esperar pelo desempenho em testes reais primeiro."
Onde o MiMo V2.6 se encaixa na corrida dos modelos abertos
Dando um passo atrás, o MiMo V2.6 é mais um ponto de dados em uma tendência cada vez mais difícil de ignorar: modelos de pesos abertos de laboratórios chineses continuam chegando perto da fronteira enquanto rodam em hardware muito mais barato. DeepSeek V4.1 Flash, GLM 5.3, Qwen 3.8 Max e agora o MiMo V2.6 estão todos trocando golpes na mesma faixa de inteligência que antes pertencia só aos modelos fechados.
Há um impulso estratégico real por trás dos benchmarks, e um comentarista formulou isso bem:
"Chinese models are increasingly closer to the frontier, while being able to run on much cheaper hardware than what US frontier models run on... the rest of the world is going to see the risks and the availability of good enough open weight models for their purposes and be more likely to lean in favor of self-hosted Chinese models or local inference clouds."
Essa é a verdadeira história competitiva: não "o MiMo bate o Opus em uma tabela", mas "dá para conseguir inteligência boa o suficiente, no seu próprio hardware, a um preço que faz a fronteira fechada parecer um luxo". Para muitas equipes, a resposta agora é sim. Se você quiser um panorama mais amplo do que existe por aí, nosso resumo dos melhores agentes de IA open source é uma boa próxima leitura, e nossa análise do DeepSeek e nossa análise do Kimi K3 cobrem seus rivais abertos mais próximos.
O que isso significa se você está colocando IA em uma fila de suporte
Aqui é onde tenho que ser honesto sobre meu próprio viés, porque passei os últimos anos ajudando a colocar IA em filas de suporte reais, e o lançamento do MiMo V2.6 confirma algo que aprendemos da maneira mais difícil: o modelo não é mais o gargalo.

MiMo V2.6, DeepSeek, Qwen, Claude, GPT: qualquer um deles consegue escrever uma resposta fluente e de aparência correta para uma pergunta de cliente. Essa era a parte assustadora há alguns anos. Isso já está resolvido. O que nenhum deles faz de fábrica é o trabalho de verdade: ler seu centro de ajuda específico e tickets antigos, seguir sua política de reembolso em vez de uma inventada que soa plausível, consultar um pedido, marcar e rotear o ticket, saber quando escalar para um humano e, o mais importante, ser testado antes de responder a um cliente real.
Esse último ponto é aquele em que eu não abriria mão. Já vimos modelos confiantes darem respostas erradas em filas reais, e é exatamente por isso que todo rollout que fazemos é simulado contra tickets históricos primeiro, para que você veja como ele teria lidado com milhares das suas próprias conversas passadas antes de tocar em uma ao vivo. Uma pontuação de benchmark de 46 no índice AA não te diz nada sobre como um modelo vai lidar com sua política de devolução esquisita em um caso extremo. Uma simulação sobre seus últimos 5.000 tickets, sim.
Então, se você está animado com o MiMo V2.6 (e deveria estar, é um ótimo motor), a pergunta certa não é "qual modelo", mas "o que envolve o modelo". O modelo agora é uma commodity. O sistema ao redor dele é o produto.
Experimente a eesel
Todo o ponto deste texto é que um modelo aberto como o MiMo V2.6 é infraestrutura, capacidade bruta que você ainda precisa transformar em algo que faça um trabalho. A eesel é a camada que transforma um modelo em um colega de equipe funcional. Você contrata um agente de IA para helpdesk pronto para trabalhar, que se conecta ao helpdesk que você já usa (Zendesk, Freshdesk, Gorgias, Help Scout e mais de 1000 integrações), treina com seus tickets antigos e seu centro de ajuda, e começa a redigir ou enviar respostas, sem precisar de gestão de modelo.

O diferencial é o que os próprios benchmarks do MiMo não conseguem te dar: antes de um agente da eesel responder a um único cliente real, você simula ele no seu histórico real de tickets e vê a taxa de resolução exata e as respostas que você teria recebido. E como a eesel é uma plataforma de colegas de equipe, a mesma conta também roda um redator de blog com IA, então, se você gostou do que o MiMo faz pela engenharia, o lado da escrita também tem um colega de equipe. Para desenvolvedores, a eesel expõe o mesmo colega de equipe por meio de uma CLI, API e MCP públicas, para que uma pessoa, um script ou um agente de codificação possam pilotá-lo pelo terminal.
Você pode começar de graça, sem cartão de crédito e sem ligação de vendas, e ter um colega de equipe no ar em minutos. O modelo ficou barato. Fazer com que ele realmente faça o trabalho ainda é a parte interessante.
Perguntas frequentes
O que é o Xiaomi MiMo V2.6?
Quanto custa o Xiaomi MiMo V2.6?
O Xiaomi MiMo V2.6 é melhor que o DeepSeek ou o Kimi K3?
Posso hospedar o Xiaomi MiMo V2.6 eu mesmo?
Devo usar o Xiaomi MiMo V2.6 para o atendimento ao cliente?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








