Preços do Xiaomi MiMo V2.6: todos os planos, modelos e custos de API em 2026

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edição September 23, 2026

Verificado por especialista
Ilustração de preços e custos de API do Xiaomi MiMo V2.6

A resposta curta: o que o Xiaomi MiMo V2.6 realmente custa

Passei dois anos observando páginas de preços de IA, e a maioria dos lançamentos de modelos enterra o número que você realmente veio buscar. A Xiaomi fez o oposto: abriu o código de toda a família MiMo V2.6 em 22 de setembro de 2026, sob a MIT, e manteve os preços da API estáveis em relação à geração anterior.

Então há realmente dois preços a considerar. Há o zero, se você baixar os pesos e rodá-los no seu próprio hardware. E há o preço por token da API, se preferir que outra pessoa hospede as GPUs. Aqui está a lista completa de preços hospedados, do OpenRouter, verificada no dia do lançamento:

Escala de preços da API do MiMo V2.6 mostrando o custo por milhão de tokens do Flash, Pro e Pro UltraSpeed
Escala de preços da API do MiMo V2.6 mostrando o custo por milhão de tokens do Flash, Pro e Pro UltraSpeed

Cada variante traz a mesma janela de contexto de 1M de tokens e é nativamente omnimodal (texto, imagem, vídeo, áudio), então você não paga um adicional pelo contexto longo ou pelas modalidades extras. Isso é incomum, e é uma grande parte do motivo pelo qual os preços soam agressivos.

As quatro variantes e para que cada uma serve

O MiMo V2.6 não é um modelo com um único preço. É uma família de quatro checkpoints, e escolher o errado é a forma mais rápida de pagar a mais. Veja como eles se comparam.

MiMo V2.6 Pro ($0,435 entrada / $0,87 saída)

O Pro é o carro-chefe: um modelo de mistura esparsa de especialistas com 1,02 trilhão de parâmetros totais e 42B ativos. É o que lidera os benchmarks de pesos abertos, e o que você quer para trabalho agêntico genuíno, programação de longo alcance, uso de ferramentas em múltiplas etapas. A $0,435 de entrada / $0,87 de saída, é mais barato que a maioria dos modelos fechados de ponta com os quais compete, o que resume toda a história deste lançamento.

MiMo V2.6 Flash ($0,14 entrada / $0,28 saída)

O Flash é o checkpoint de eficiência: 309B no total, 15B ativos, descrito pela Xiaomi como o melhor equilíbrio entre inteligência, eficiência e custo. A $0,14 de entrada / $0,28 de saída, custa um terço do Pro e, pelos próprios números da Xiaomi, perde surpreendentemente pouco. No AutomationBench marca 52,3 contra 53,1 do Pro. Para a maioria dos trabalhos de alto volume e bem delimitados, o Flash é a escolha de melhor custo-benefício.

MiMo V2.6 Pro UltraSpeed ($4,35 entrada / $8,70 saída)

O UltraSpeed é confuso até você perceber que não está comprando mais inteligência. É exatamente o mesmo checkpoint do Pro, servido a aproximadamente 10x a velocidade de saída (cerca de 116 tokens por segundo). A Xiaomi cobra 10x a tarifa do Pro por isso. Então é um imposto puro de latência: pague apenas quando a velocidade for realmente o gargalo, como um agente de chat ao vivo que um cliente está observando digitar. Para um trabalho em lote que roda da noite para o dia, é 10x dinheiro desperdiçado.

MiMo V2.6 Distill-Qwen-9B (apenas pesos gratuitos)

O distill de 9B é um ajuste fino supervisionado denso do Qwen3.5-9B sobre dados gerados pelo MiMo. Não está na API paga; existe como um ponto de partida pequeno, de GPU única, para inferência local e pesquisa aberta. Já existem quantizações GGUF da comunidade para llama.cpp, LM Studio e Ollama, então é o que dá para rodar numa workstation.

O desconto de cache que a maioria não percebe

Os preços de tabela acima não são o que os usuários intensos realmente pagam. O MiMo V2.6 Pro lista os tokens de leitura de cache a cerca de $0,0036 por milhão, um desconto de 99% sobre a tarifa de entrada de $0,435. O parceiro de benchmark da Xiaomi resumiu assim:

"Despite the improvement, it retains the same attractive pricing at $0.435 per 1M input tokens (with a 99% cache-hit discount) and $0.87 per 1M output tokens."

Por que isso importa para o preço? Porque qualquer carga de trabalho real envia o mesmo contexto repetidamente. Um agente de programação relê o mesmo repositório. Um agente de suporte relê as mesmas políticas e macros a cada ticket. Uma vez que esse contexto está em cache, você paga centavos pelos tokens de entrada. Se o seu caso de uso reutiliza prompts, seu preço de entrada efetivo fica bem abaixo do de tabela, e essa diferença é onde o custo total do MiMo realmente se distancia da ponta.

Como os preços do MiMo V2.6 se comparam à ponta do mercado

Esta é a comparação para a qual o lançamento foi construído. No Índice de Inteligência da Artificial Analysis, o MiMo V2.6 Pro marcou 46, o melhor modelo de pesos abertos, empatando com o lançamento do Grok 4.7 no mesmo dia e ficando logo atrás dos líderes fechados.

Gráfico de barras do Índice de Inteligência da Artificial Analysis com o MiMo V2.6 Pro em 46, extraído de Xiaomi MiMo
Gráfico de barras do Índice de Inteligência da Artificial Analysis com o MiMo V2.6 Pro em 46, extraído de Xiaomi MiMo

A pontuação sozinha não conta toda a história do preço, porém. O gráfico que importa para o custo é o de inteligência versus custo por tarefa, em que o MiMo V2.6 Pro cai no "quadrante mais atraente", em verde, a cerca de $0,13 por tarefa, enquanto o Claude Opus 5 e o GPT-6 Astra ficam na extremidade de $3 a $8 do mesmo eixo.

Gráfico de dispersão do Índice de Inteligência da Artificial Analysis contra o custo por tarefa, com o MiMo V2.6 Pro na fronteira de Pareto, extraído de Xiaomi MiMo
Gráfico de dispersão do Índice de Inteligência da Artificial Analysis contra o custo por tarefa, com o MiMo V2.6 Pro na fronteira de Pareto, extraído de Xiaomi MiMo

Contra o campo aberto, é igualmente afiado. O Flash iguala os níveis mais baratos como o DeepSeek V4.1 Flash, e o Pro de 1,02T supera o muito maior Kimi K3, de 2,8T, enquanto o lidera na maioria das tabelas. Um comentarista do Hacker News, que havia usado o modelo intensamente, resumiu a conta de valor assim:

Hacker News

"Mimo 2.6 pro, the 1T model leads Kimi K3, a 2.8T param model in 14 out of 15 benchmarks (and the last one is near tie)!! Good to see they also kept the price the same, and landed in the greenest quadrant of the intelligence vs speed of AA."

Aviso justo, porque um post sobre preços deve ser honesto quanto ao teto: o MiMo fica atrás dos melhores modelos fechados nas tabelas mais difíceis. No Terminal Bench 4.0 marca 34,9 contra 59,6 do GPT-6 Astra, e no ExploitBench fica em 47,9 contra mais de 70 do GPT-5.6 Sol e do Claude. Se o seu trabalho vive nessas fronteiras, o preço barato do token não é toda a decisão. Para tudo o mais, a relação custo-benefício é difícil de contestar.

Exemplos práticos: quanto você realmente pagaria

Preços de tabela por milhão de tokens são abstratos. Aqui está o que três cargas de trabalho realistas custam no MiMo V2.6, para que os números façam sentido.

  • Um desenvolvedor solo no Flash. Digamos que você consome 20M de tokens de entrada e 5M de saída por mês programando com o Flash. Isso é 20 × $0,14 + 5 × $0,28 = $4,20 por mês. Erro de arredondamento.
  • Uma equipe pequena rodando um agente de programação no Pro. 300M de entrada, 80M de saída por mês no Pro: 300 × $0,435 + 80 × $0,87 = $200,10 por mês, antes de qualquer desconto de cache. Com reutilização intensa de prompts, a conta real fica bem abaixo disso.
  • Uma carga de trabalho de suporte de alto volume no Flash. 10.000 tickets por mês, cerca de 8K de entrada e 1K de saída cada, então 80M de entrada e 10M de saída: 80 × $0,14 + 10 × $0,28 = $14 por mês em tokens brutos.

Esse último número é o que vale a pena parar para pensar. Dez mil conversas de suporte por $14 em tokens de modelo. Se esse fosse o custo real do suporte com IA, todo mundo já teria lançado isso há anos. Não é, e a lacuna entre "$14 em tokens" e "um agente de suporte que funciona" é exatamente o ponto da próxima seção.

Pesos gratuitos não são gratuitos de rodar

O MiMo V2.6 é genuinamente aberto sob a MIT, então "simplesmente hospede você mesmo" é um conselho real, não marketing. Mas os pesos serem gratuitos não torna rodá-los gratuito. A conta de hardware é o item oculto.

Árvore de decisão comparando auto-hospedar o MiMo V2.6 nas suas próprias GPUs contra pagar pela API hospedada
Árvore de decisão comparando auto-hospedar o MiMo V2.6 nas suas próprias GPUs contra pagar pela API hospedada

Veja o que cada variante precisa, segundo as fichas do modelo:

  • Pro (1,02T / 42B ativos): o lançamento de referência com SGLang usa um cluster de 2 nós, 16 GPUs (tensor-paralelo 16). É um compromisso sério de hardware.
  • Flash (309B / 15B ativos): roda em um único nó de 8 GPUs.
  • Distill-Qwen-9B: pequeno o bastante para uma única GPU, e já existem quantizações GGUF para ferramentas locais.

Todos os checkpoints são distribuídos em FP8, o que mantém a pegada de memória razoável, mas a leitura honesta é esta: a auto-hospedagem só vence a API quando você tem volume alto e constante e GPUs ociosas para preencher. Para volume intermitente ou baixo, a API hospedada a $0,14 a $0,87 por milhão de tokens é quase sempre mais barata do que manter um cluster aquecido. Faça as contas da sua própria utilização antes de assumir que "pesos gratuitos" significa "gratuito".

A parte que a etiqueta de preço nunca mostra

Aqui eu preciso dar um passo atrás, porque construo e opero IA para helpdesk profissionalmente, e a conversa sobre preços quase sempre ignora a conta real.

O custo em tokens do MiMo V2.6, ou do DeepSeek, ou do Qwen, ou de qualquer um deles, é a menor linha do orçamento de um sistema em produção. A parte cara é tudo o que envolve o modelo.

Gráfico de barras empilhadas mostrando os tokens do modelo como uma fatia minúscula do custo total de um sistema de suporte com IA ao vivo
Gráfico de barras empilhadas mostrando os tokens do modelo como uma fatia minúscula do custo total de um sistema de suporte com IA ao vivo

Passamos os últimos anos colocando agentes de IA em filas de suporte ao vivo, e a lição recorrente é que um modelo puro, por mais barato e inteligente que seja, não é um agente de suporte. Para ir de "$14 em tokens" a "um agente em que confio com um cliente", é preciso conectá-lo ao seu helpdesk, alimentá-lo com sua base de conhecimento e tickets passados, ensinar suas políticas, dar a ele ações que pode executar com segurança e, acima de tudo, testá-lo antes de colocá-lo no ar. Já vimos bots de fala confiante darem respostas erradas silenciosamente, e é exatamente por isso que todo lançamento deveria ser simulado contra tickets históricos primeiro.

Nada disso aparece numa página de preços do OpenRouter. É a diferença entre um modelo e um colega de equipe que funciona, e é onde mora o verdadeiro custo do suporte com IA.

Experimente a eesel

Um modelo como o MiMo V2.6 é um motor. A eesel é o colega de equipe que você contrata para dirigi-lo. A eesel é uma plataforma de colegas de equipe com IA, e o agente de helpdesk com IA é um colega de suporte pronto para trabalhar: ele se conecta ao seu helpdesk em minutos, já lê seus tickets passados e sua base de conhecimento, e você pode simulá-lo em milhares das suas conversas históricas reais antes que ele responda a um único cliente ao vivo. Em vez de cobrar por assento a preço fixo, a eesel fatura por uso, então o custo acompanha o trabalho realmente feito.

Visão geral do painel de helpdesk com IA da eesel
Visão geral do painel de helpdesk com IA da eesel

E se você vive num terminal, a eesel tem uma CLI pública mais um servidor MCP, então o mesmo colega de equipe e workspace que você gerencia no painel pode ser conduzido por scripts ou por agentes de programação como Claude Code, Codex e Cursor. É a forma amigável a agentes de operar a eesel: uma pessoa opera manualmente, um script automatiza, ou um agente de IA chama, tudo contra o mesmo colega de helpdesk. É essa camada que transforma um modelo barato e capaz em algo que de fato resolve tickets. Experimente grátis.

Perguntas frequentes

Quanto custa o Xiaomi MiMo V2.6?
Os pesos podem ser baixados gratuitamente sob uma licença MIT. Na API hospedada via OpenRouter, o MiMo V2.6 Flash custa $0,14 de entrada / $0,28 de saída por milhão de tokens, o Pro custa $0,435 / $0,87, e o Pro UltraSpeed custa $4,35 / $8,70. Essas tarifas são uma fração dos modelos fechados de ponta, embora a conta real de um sistema em produção também inclua o trabalho em torno do modelo, que nosso detalhamento de custos explica.
Qual é a forma mais barata de executar o Xiaomi MiMo V2.6?
Para volumes baixos, a API Flash a $0,14 de entrada / $0,28 de saída por milhão de tokens é a rota mais barata e sem complicações. Se você tem GPUs ociosas e volume alto e constante, hospedar você mesmo os pesos gratuitos elimina totalmente a conta por token, mas você assume o custo do cluster. Para a maioria das equipes que comparam opções, nosso panorama dos melhores agentes de IA de código aberto cobre os prós e contras.
O Xiaomi MiMo V2.6 é gratuito?
Os pesos do modelo são realmente gratuitos e abertos sob a MIT, então você pode baixar o Pro, o Flash e o distill de 9B e executá-los comercialmente sem custo de licença. "Gratuito", porém, cobre apenas os pesos; você ainda paga pelos tokens da API hospedada ou pelo hardware de GPU para hospedá-los você mesmo. Veja o melhor modelo de IA para tickets de suporte para entender como isso funciona na prática.
Como os preços do Xiaomi MiMo V2.6 se comparam ao DeepSeek e ao Kimi K3?
O MiMo V2.6 Flash iguala os níveis abertos mais baratos a $0,14 / $0,28, e o MiMo V2.6 Pro, a $0,435 / $0,87, fica bem abaixo da maioria dos preços de ponta enquanto lidera o índice de pesos abertos da Artificial Analysis com 46 pontos. Ele troca golpes de custo por tarefa com o DeepSeek V4.1 Flash e supera o muito maior Kimi K3 nas mesmas tabelas.
O que é o MiMo V2.6 Pro UltraSpeed e por que custa 10x mais?
O UltraSpeed serve exatamente o mesmo checkpoint do Pro a aproximadamente 10x a velocidade de saída (cerca de 116 tokens por segundo), e a Xiaomi cobra 10x a tarifa do Pro por isso: $4,35 de entrada / $8,70 de saída por milhão de tokens. Você paga pela latência, não pela inteligência, então só faz sentido para cargas de trabalho interativas ou em tempo real de agentes de IA em que a velocidade é o gargalo.
O Xiaomi MiMo V2.6 oferece desconto de cache?
Sim. O MiMo V2.6 Pro lista os tokens de leitura de cache a cerca de $0,0036 por milhão, um desconto de 99% sobre a tarifa de entrada de $0,435. Contexto repetido (prompts de sistema, documentos longos) fica muito barato assim que é armazenado em cache. Cargas de trabalho que reutilizam o mesmo prompt têm um preço de entrada efetivo bem abaixo do preço de tabela, o que importa muito para o uso de helpdesk com IA, em que as mesmas políticas são lidas a cada ticket.
Devo usar o Xiaomi MiMo V2.6 para atendimento ao cliente?
O MiMo V2.6 é um motor forte e barato, mas um modelo puro não é um agente de suporte. Ele ainda precisa ler seus tickets, seguir suas políticas, executar ações no seu helpdesk e ser testado antes de responder a um cliente real. Essa lacuna é o que a eesel preenche, e você pode simulá-lo em tickets passados antes de colocá-lo no ar.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Ilustração da análise do Xiaomi MiMo V2.6
Trending

Análise do Xiaomi MiMo V2.6: a fronteira aberta barata vale a pena?

Uma análise prática do Xiaomi MiMo V2.6: o que os benchmarks realmente dizem, a conta de custo-benefício que o torna interessante, quem deveria usá-lo e onde ele ainda fica atrás.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 24, 2026
Ilustração do modelo de pesos abertos Xiaomi MiMo V2.6
Trending

Xiaomi MiMo V2.6: especificações, benchmarks e como usar o modelo aberto

O MiMo V2.6 da Xiaomi é uma família de modelos omnimodais de pesos abertos, com contexto de 1M de tokens e licença MIT. Aqui estão as especificações reais, os benchmarks e os preços da API.

Rama Adi NugrahaRama Adi NugrahaSep 23, 2026
Ilustração de uma equipe analisando o Gemini 3.8 Flash, com um medidor de velocidade, um foguete e uma marca de verificação como veredito
Trending

Análise do Gemini 3.8 Flash: rápido, prolixo e não é o upgrade que o número sugere

Uma análise prática do Gemini 3.8 Flash: onde ele se destaca, onde falha, a pegadinha dos 13 segundos que ninguém mencionou, e se vale a pena migrar do 3.7 Flash.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Ilustração de um robô veloz programando em um laptop enquanto uma pessoa observa, representando o Gemini 3.8 Flash
Trending

Gemini 3.8 Flash: o que é, benchmarks honestos e minha análise

O Google lançou o Gemini 3.8 Flash em 2 de setembro de 2026, três semanas depois do 3.7. Mesmo preço, notas melhores e uma linha nas letras pequenas que muda a resposta.

Alicia Kirana UtomoAlicia Kirana UtomoSep 3, 2026
Ilustração de uma equipe avaliando alternativas de modelos de IA ao Xiaomi MiMo V2.6
Alternatives

As 8 melhores alternativas ao Xiaomi MiMo V2.6 em 2026

O MiMo V2.6 é agora o melhor modelo aberto mais barato, mas não é a única opção. Aqui estão as 8 melhores alternativas ao Xiaomi MiMo V2.6, abertas e fechadas.

Rama Adi NugrahaRama Adi NugrahaSep 23, 2026
Ilustração de duas pessoas analisando gráficos e mostradores de velocidade em torno de uma centelha do Gemini, representando os preços do Gemini 3.8 Flash
Trending

Preços do Gemini 3.8 Flash: cada tarifa, o custo oculto e a pegadinha

O Gemini 3.8 Flash custa US$ 0,75/US$ 3,75 por 1 milhão de tokens, exatamente o mesmo que o 3.7 Flash. Mas o preço de tabela esconde uma taxa de verbosidade, e os dois valores dobram em 1º de janeiro de 2027.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Preços do DeepSeek V4 Flash: o que você vai realmente pagar
Trending

Preços do DeepSeek V4 Flash: o que você vai realmente pagar

O DeepSeek V4 Flash é listado a $0.14 de entrada e $0.28 de saída por milhão de tokens. Usuários reais publicaram taxas combinadas abaixo de um centavo. Veja o que decide qual delas te espera.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Um avaliador olhando para um cartão de veredito com dois seletores de esforço rotulados como baixo e máximo, ao lado da baleia da DeepSeek
Trending

Análise do DeepSeek V4 Flash: um modelo, duas personalidades

Uma análise do DeepSeek V4 Flash baseada nos números que ambos os placares publicam. A execução barata e a execução inteligente são os mesmos pesos, e isso muda o veredito.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
DeepSeek V4 Flash: specs, preços e para que serve na prática
Trending

DeepSeek V4 Flash: specs, preços e para que serve na prática

DeepSeek V4 Flash custa $0,14 de entrada e $0,28 de saída por milhão de tokens, e supera o próprio nível caro da DeepSeek. Isto é o que a tabela de preços não conta.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis