MiniMax M3.1 Flash: especificações, preços e como testar a preview

Rama Adi
Escrito por

Rama Adi

Katelin Teen
Revisado por

Katelin Teen

Última edição September 28, 2026

Verificado por especialista
Ilustração de um foguete decolando, representando o lançamento do modelo MiniMax M3.1 Flash

Um modelo que chegou antes do próprio comunicado

A maioria dos lançamentos de modelo é um post de blog, um gráfico de benchmarks e um model card, tudo de uma vez. O M3.1 Flash fez o contrário. Apareceu no seletor de modelos do MiniMax Code, ao lado do M3 e do M2.7, e a comunidade o encontrou ali antes de a MiniMax dizer qualquer coisa. O desenvolvedor que revelou a novidade notou na hora o novo menu de raciocínio:

"🚨重磅!MiniMax M3.1-Flash 预览版疑似已上线 MiniMax Code!推理等级单独成菜单:low / medium / high / xhigh / max。目前还没有官方公告,属于先露在产品里的灰度上线。" (Tradução: "Grande novidade! A preview do MiniMax M3.1-Flash parece estar no ar no MiniMax Code. Os níveis de raciocínio têm menu próprio: low / medium / high / xhigh / max. Ainda sem anúncio oficial, é um rollout cinza/gradual mostrado primeiro no produto.")

O lançamento também veio com um certo suspiro. A MiniMax vem lançando modelos de vídeo e música em ritmo acelerado, a série M (texto) tinha ficado quieta, e a resposta mais curtida sob o post de lançamento soou como impaciência afetuosa:

"You finally remembered the M series"

Há também uma história por trás do hype. Por dias antes, desenvolvedores testaram à exaustão um modelo stealth gratuito chamado "Space Bunny" e tentaram adivinhar o que era; a resposta veio poucos dias antes do lançamento:

"Confirmed, Space Bunny Alpha is Minimax M3.1"

Então a empolgação é real, mas o "lançamento" é uma preview escalonada, que aparece primeiro no produto. Se você está decidindo se vai construir em cima dele, essa distinção importa mais que o hype: uma preview de rollout cinza sem preço e sem pesos não é o mesmo compromisso que um modelo GA.

O que o MiniMax M3.1 Flash realmente é

Tirando o teatro do lançamento, a documentação da plataforma é clara sobre a substância. Na tabela de modelos suportados, o M3.1 Flash é descrito como um "frontier multimodal coding model with 1M context window and tunable thinking depth", feito para raciocínio agêntico, uso de ferramentas, programação e execução de tarefas estruturadas. Ele aceita texto, imagens e vídeo como entrada.

O contexto de 1M é a especificação principal e é um salto real dentro da série M, não um arredondamento de marketing. Toda a família M2 chegava a 204.800 tokens; a geração M3, incluindo o M3.1 Flash, é um salto limpo de cinco vezes.

Gráfico de barras comparando as janelas de contexto dos modelos MiniMax: a família M2.x com 204.800 tokens contra o MiniMax M3 e o M3.1 Flash com 1.000.000 de tokens
Gráfico de barras comparando as janelas de contexto dos modelos MiniMax: a família M2.x com 204.800 tokens contra o MiniMax M3 e o M3.1 Flash com 1.000.000 de tokens

Isto é o que a documentação afirma e o que não afirma:

AtributoMiniMax M3.1 Flash
Id do modeloMiniMax-M3.1-Flash-Preview
Janela de contexto1.000.000 de tokens
Modalidades de entradaTexto, imagem, vídeo
RaciocínioLigado por padrão, ajustável via effort, não pode ser desativado
DisponibilidadeSomente Token Plan + MiniMax Code
Pesos abertosNenhum (sem card no Hugging Face)
Número de parâmetrosNão informado
Throughput (tps)Não informado
Preço por tokenNão publicado

Essa tabela é deliberadamente honesta sobre as lacunas. Não há número de parâmetros informado, número oficial de tokens por segundo nem suíte de benchmarks específica para o M3.1 Flash. Se uma página diz que o modelo tem "428B parâmetros" ou cita uma pontuação de benchmark, está pegando emprestado do M3 original, não citando o M3.1 Flash. Prefiro apontar a lacuna a disfarçá-la.

O único controle que o define: effort

O único recurso que a documentação destaca para o M3.1 Flash e não para o M3 é a profundidade de raciocínio ajustável. O modelo sempre raciocina antes de responder, e você controla o quanto ele pensa com uma configuração effort que aceita low, medium, high, xhigh e max. Se você omitir, o padrão é max.

Um seletor mostrando os cinco níveis de effort de low a max, com max marcado como padrão, setas para mais rápido e menos tokens versus raciocínio mais profundo, e uma nota de que o raciocínio não pode ser desligado
Um seletor mostrando os cinco níveis de effort de low a max, com max marcado como padrão, setas para mais rápido e menos tokens versus raciocínio mais profundo, e uma nota de que o raciocínio não pode ser desligado

O detalhe que pega as pessoas: você não pode desligar o raciocínio. Se enviar thinking: {"type": "disabled"} ou effort: "none", a API retorna um 400 com a mensagem requires adaptive thinking (docs). Se precisar de menor latência ou menos tokens de saída, você reduz o effort para low; não existe modo sem raciocínio. É uma opinião de design de verdade, e vale saber antes de plugá-lo em um caminho sensível à latência. Para um modelo "Flash", usar max como padrão é uma escolha um pouco surpreendente, e significa que o comportamento barato e rápido que o nome sugere é algo que você precisa ativar.

Ele é mesmo rápido?

A MiniMax não publicou um número de throughput, então os únicos dados reais de velocidade até agora vêm de desenvolvedores que testaram no primeiro dia. A medição mais citada colocou a velocidade de decodificação numa faixa sólida, mas não líder da categoria:

"MiniMax-M3.1-flash-preview is hanging around 90 - 110 t/s range for decode. It's fast, love seeing it, def faster than MiMo-v2.6-flash but not as fast as deepseek-v4.1-flash"

Esse é o posicionamento honesto: rápido, à frente de alguns concorrentes da categoria flash, atrás de outros. E nem todo mundo acha que a velocidade bruta de decodificação é o que se deve comemorar:

"Decode speed is not equivalent to fast. The model is slow for the quality in my opinion, numbers dropping soon!"

Acho que esse cético tem um ponto que vale guardar. Um modelo que usa max de effort por padrão e não consegue parar de pensar vai parecer mais lento em tarefas reais do que um número de tokens por segundo sugere, porque gera muitos tokens de raciocínio antes da resposta. A pergunta útil não é "quantos tokens por segundo", e sim "quanto tempo até eu receber uma resposta correta que posso entregar", e esse é um benchmark que ninguém rodou ainda no M3.1 Flash.

A arquitetura por baixo

A documentação não repete os detalhes internos do M3.1 Flash, então o justo é tratar a arquitetura como herdada da geração M3 e não como uma especificação confirmada do M3.1 Flash. A linha M3 introduziu a MiniMax Sparse Attention (MSA), um design de atenção esparsa que torna um contexto de um milhão de tokens prático em vez de ruinosamente lento.

A própria comparação da MiniMax com a atenção padrão de consulta agrupada (GQA) é a ilustração mais clara de por que a atenção esparsa importa nesse tamanho de contexto:

Comparação de eficiência da MiniMax entre MSA e GQA, mostrando redução de 28,4x nos FLOPs de atenção por token, prefilling 14,2x mais rápido e decodificação 7,6x mais rápida com 1M de tokens, conforme compartilhado pela MiniMax
Comparação de eficiência da MiniMax entre MSA e GQA, mostrando redução de 28,4x nos FLOPs de atenção por token, prefilling 14,2x mais rápido e decodificação 7,6x mais rápida com 1M de tokens, conforme compartilhado pela MiniMax

Com um milhão de tokens, o gráfico da MiniMax mostra a MSA reduzindo o cálculo de atenção por token em cerca de 28 vezes e acelerando a decodificação em ~7,6 vezes em relação à atenção padrão. São números da geração M3; como o M3.1 Flash tem a mesma janela de 1M, quase certamente usa a mesma arquitetura, mas eu não os citaria como especificação medida do M3.1 Flash até a MiniMax publicar uma.

Quanto custa

É aqui que o M3.1 Flash fica realmente incomum: não há preço por token em lugar nenhum. Ele não está na tabela pay-as-you-go, e a própria documentação da MiniMax diz que ele está disponível por ora apenas pelo Token Plan e pelo MiniMax Code. Então o custo real é a sua assinatura dividida pelo quanto você usa.

Este é o Token Plan, uma cota compartilhada entre texto, imagem e voz:

PlanoMensalAnual (2 meses grátis)~Tokens M3 / mêsGeração de vídeo
PlusUS$ 20US$ 220~1,7BNenhuma
MaxUS$ 50US$ 550~5,1B3 clipes/dia
UltraUS$ 120US$ 1.320~12,5B5 clipes/dia

Há também uma opção de Credits pré-pagos (US$ 5 por 5.000, US$ 25 por 25.000, US$ 100 por 100.000, válidos por um ano) e nenhuma camada gratuita de LLM. A cota é renovada em janelas móveis de 5 horas e semanais, e a cota mensal não usada não acumula.

Se você quer ter noção do que uma API pública pode eventualmente cobrar, o irmão de 1M de contexto, o MiniMax M3, está no pay-as-you-go. Essas são as tarifas do M3, não do M3.1 Flash, mas a estrutura provavelmente antecipa o que vem por aí:

MiniMax M3 (camada padrão)EntradaSaídaLeitura de cache
≤ 512K de entradaUS$ 0,30 /MUS$ 1,20 /MUS$ 0,06 /M
> 512K de entradaUS$ 0,60 /MUS$ 2,40 /MUS$ 0,12 /M

Duas coisas estruturais a notar para o futuro: um corte de 512K de entrada que dobra a tarifa acima dele, e uma camada de serviço Priority que custa 1,5x a tarifa padrão. Barato para a categoria, em outras palavras, mas com um adicional de contexto longo embutido.

Como rodá-lo na prática

Para uma preview, o acesso é surpreendentemente amigável para desenvolvedores. O M3.1 Flash fala dois protocolos: um endpoint compatível com a Anthropic em https://api.minimax.io/anthropic (o caminho recomendado pela MiniMax, com blocos de thinking) e um compatível com a OpenAI em https://api.minimax.io/v1. O campo effort fica em lugares diferentes conforme o que você usa: output_config.effort na API da Anthropic, reasoning_effort na da OpenAI.

Por ser compatível com Anthropic e OpenAI, você pode apontar ferramentas agênticas de programação existentes direto para ele. A MiniMax lista Claude Code, Cursor, Codex CLI e outras como suportadas pelo Token Plan, sem precisar de outra API key. Esse é o caso de uso real que a combinação "Flash + preview" persegue: um modelo padrão barato e rápido para programação cotidiana e loops de agentes, rodando dentro das ferramentas em que os desenvolvedores já vivem.

Onde um modelo assim se encaixa

O que me traz de volta ao enquadramento do início. O M3.1 Flash é um motor rápido com uma janela de contexto grande e um seletor de raciocínio. Isso é infraestrutura. É a capacidade bruta, exposta como endpoint, e é genuinamente boa no que faz. Mas um endpoint não conhece a sua empresa, não fica dentro do seu helpdesk e não é dono de um trabalho de ponta a ponta. Você ainda precisa construir tudo isso em volta dele.

Um diagrama de duas camadas: o cartão inferior representa o modelo como motor bruto com 1M de contexto, effort ajustável e um endpoint de API, e o cartão superior representa o colega contratado para fazer o trabalho, que conhece a sua empresa, se conecta às suas ferramentas e entrega o trabalho
Um diagrama de duas camadas: o cartão inferior representa o modelo como motor bruto com 1M de contexto, effort ajustável e um endpoint de API, e o cartão superior representa o colega contratado para fazer o trabalho, que conhece a sua empresa, se conecta às suas ferramentas e entrega o trabalho

Essa distância entre "um modelo capaz" e "trabalho realmente feito" é toda a razão de existir da eesel. A eesel é uma plataforma de colegas de IA: em vez de te entregar um modelo e um editor em branco, você contrata um colega pronto para trabalhar em uma função específica. O time atual inclui um colega de IA para helpdesk que entra na sua fila de suporte existente e um redator de blog com IA que pesquisa e redige posts com a sua voz. Cada um chega já sabendo desempenhar o seu papel e se conecta às ferramentas que você já usa.

Se você vive no terminal, a eesel CLI é a parte que vai parecer mais familiar depois de ler uma página de docs como a da MiniMax. É o mesmo colega do painel, controlado pela linha de comando: você pode conectar um helpdesk, enviar conhecimento, configurar automações e aprovar ações retidas sem nunca abrir a interface. Todo comando imprime JSON, e os erros voltam como objetos estruturados {error, hint, retryable}, de modo que um agente de programação como Claude Code, Cursor ou Codex pode conduzir toda a configuração lendo o campo hint e decidindo o que executar em seguida. Todo workspace também funciona como servidor MCP, então o mesmo agente que chama o M3.1 Flash pode chamar a eesel. O modelo mental é simples: o modelo é o motor que você conecta; o colega é quem você contrata.

Experimente a eesel

Se você está empolgado com o M3.1 Flash porque quer a IA fazendo trabalho de verdade, e não só respondendo chamadas de API, essa última milha é o que a eesel resolve. Aponte-a para os seus tickets antigos e a sua central de ajuda, e o colega de IA para helpdesk começa a redigir respostas reais em minutos; ou dê um tema ao redator de blog com IA e ele pesquisa, redige e ilustra um post completo com a sua voz, do mesmo jeito que este foi feito.

O painel do redator de blog com IA da eesel, redigindo um post de review completo com pesquisa e infográficos gerados junto
O painel do redator de blog com IA da eesel, redigindo um post de review completo com pesquisa e infográficos gerados junto

O melhor é que você pode vê-lo trabalhar antes de se comprometer, já que a eesel roda primeiro contra o seu próprio histórico, e você vê a qualidade nos seus tickets reais, não em uma demo. É grátis para começar, sem cartão de crédito, para você ver por conta própria a diferença entre alugar um modelo e contratar um colega.

Perguntas frequentes

O que é o MiniMax M3.1 Flash?
O MiniMax M3.1 Flash (id completo MiniMax-M3.1-Flash-Preview) é o modelo mais recente da série M da MiniMax: um modelo multimodal de programação com janela de contexto de 1.000.000 de tokens e profundidade de raciocínio ajustável. Chegou como preview dentro do MiniMax Code e do Token Plan em 27 de setembro de 2026 e é voltado para trabalho rápido e cotidiano de programação e agentes. Se você quer um modelo assim fazendo um trabalho de verdade em vez de ficar atrás de uma API, um colega de IA como a eesel é a camada que transforma isso em trabalho.
Quanto custa o MiniMax M3.1 Flash?
Não há preço por token publicado para o MiniMax M3.1 Flash. Por enquanto ele está disponível apenas pelo Token Plan e pelo MiniMax Code, então o custo é a sua assinatura dividida pelo uso: o Token Plan custa US$ 20/mês (Plus), US$ 50/mês (Max) e US$ 120/mês (Ultra). Como referência aproximada, o irmão com 1M de contexto, o MiniMax M3, está no modelo pay-as-you-go a US$ 0,30/US$ 1,20 por milhão de tokens.
O MiniMax M3.1 Flash é open source ou está no Hugging Face?
Não. Diferente do MiniMax M3, que tem pesos abertos, a preview do M3.1 Flash não tem model card no Hugging Face, pesos para download nem relatório técnico até 28 de setembro de 2026. É uma preview fechada, vinculada ao produto, apenas dentro do MiniMax Code e do Token Plan.
Como o M3.1 Flash difere do MiniMax M3?
Ambos são modelos multimodais de programação com 1M de contexto. A diferença que a documentação de fato explicita é a profundidade de raciocínio ajustável: o M3.1 Flash expõe um controle de effort com cinco níveis (de low a max) e é posicionado como a camada preview "Flash", mais rápida, enquanto o M3 é o modelo principal, com velocidade de saída declarada de ~100+ tokens/segundo.
É possível desligar o raciocínio no MiniMax M3.1 Flash?
Não. O raciocínio está sempre ativo e não pode ser desativado: enviar effort: "none" ou thinking: disabled retorna um erro 400. Para reduzir latência e uso de tokens, você diminui o nível de effort em vez de desligar o raciocínio.

Share this article

Rama Adi

Article by

Rama Adi

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Ilustração desenhada à mão de um desenvolvedor diante de um laptop com resultados de busca do Exa e dados estruturados se espalhando
Trending

Exa Agent Ultra: o que faz, como funciona e quanto custa

Um olhar direto sobre o Exa Agent Ultra: a API de pesquisa profunda com enxame de subagentes, os resultados de benchmarks, o preço por execução e onde ele se encaixa em pesquisa e suporte.

Rama AdiRama AdiSep 27, 2026
Ilustração do agente de pesquisa profunda da Exa extraindo dados estruturados de toda a web
Trending

Preços do Exa Agent Ultra: quanto a pesquisa profunda realmente custa em 2026

O Exa Agent Ultra não tem preço de tabela. Veja como funciona o custo medido por uso, quanto uma execução real fatura e onde entra o limite de US$ 20 por execução.

Rama AdiRama AdiSep 27, 2026
Banner principal de alternativas ao Grok 4.7 com o logotipo do Grok sobre um fundo abstrato escuro de computação
Trending

Alternativas ao Grok 4.7: 6 modelos que vale a pena comparar em 2026

As melhores alternativas ao Grok 4.7 em 2026, comparadas em preço, contexto, pesos abertos e no que cada uma é realmente boa, além de como saber quando você quer um modelo, afinal.

Kurnia KharismaKurnia KharismaSep 23, 2026
Banner principal da análise do Grok 4.7 com o logotipo do Grok sobre um fundo escuro e abstrato de computação
Trending

Análise do Grok 4.7: o modelo de ponta barato da xAI é realmente bom?

Uma análise prática do Grok 4.7: em que se destaca, onde ainda perde para o Fable 5.1 e o GPT-5.6 Sol, os preços reais, a sobretaxa da variante Fast, e quem deveria realmente usá-lo.

Rama AdiRama AdiSep 23, 2026
Tasklet de um lado e Manus do outro, separados por um divisor verde de VS, num confronto direto entre dois agentes de IA cobrados por crédito.
Trending

Tasklet vs Manus: qual agente de IA realmente faz o trabalho? (2026)

O Tasklet roda automações sempre ativas em toda a sua stack; o Manus constrói um artefato completo a partir de um único prompt. Ambos cobram por crédito. Veja como os dois agentes de IA realmente se diferenciam em 2026.

Kurnia KharismaKurnia KharismaSep 23, 2026
Banner principal dos preços do Grok 4.7 com o logotipo do Grok e uma tabela de custos de tokens da API
Trending

Preços do Grok 4.7: custos de tokens da API, níveis e a taxa Fast

Uma análise completa dos preços do Grok 4.7: as taxas de $2 / $6 por token, o precipício de contexto longo em 200k, os medidores de chamadas de ferramentas que a maioria dos modelos de custo ignora, a taxa Fast, onde é possível comprar de fato, e como ele se compara ao GPT-6 Sol e ao Fable 5.1.

Kurnia KharismaKurnia KharismaSep 23, 2026
Banner de lançamento do Grok 4.7 com o logotipo do Grok em um fundo escuro e abstrato de computação
Trending

Grok 4.7: o que o novo modelo de ponta da xAI realmente muda

Um olhar claro sobre o Grok 4.7: o que há de novo em relação ao Grok 4.6, as especificações, os preços reais e a taxa da variante Fast, como ele se compara ao GPT-5.6 Sol e ao Fable 5.1, e para quem ele serve.

KiraKiraSep 23, 2026
O Grok Bot fazendo login nos seus apps de um lado e o Zapier Agents construído sobre uma grade de workflows com 9.000 apps do outro, divididos ao meio.
Trending

Grok Bot vs Zapier Agents: qual agente de IA faz o trabalho? (2026)

O Grok Bot entra nos seus apps e os conduz; o Zapier Agents é construído sobre o maior grafo de conectores de apps e cobra por atividade. Veja como os dois agentes de IA realmente diferem em 2026.

Rama AdiRama AdiSep 23, 2026
Banner principal ilustrado do TypeSafe Jev, o primeiro modelo de IA System One
Trending

TypeSafe Jev: o primeiro modelo System One, explicado

Um guia claro sobre o TypeSafe Jev, o modelo System One que transforma estado não estruturado em decisões tipadas de sim/não, escolha única e pontuação em que o seu código pode confiar.

KiraKiraSep 21, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis