MiniMax M3.1 Flash: especificaciones, precios y cómo probar la preview

Rama Adi
Escrito por

Rama Adi

Katelin Teen
Revisado por

Katelin Teen

Última edición September 28, 2026

Verificado por expertos
Ilustración de un cohete despegando, que representa el lanzamiento del modelo MiniMax M3.1 Flash

Un modelo que llegó antes que su propio comunicado

La mayoría de los lanzamientos son una entrada de blog, un gráfico de benchmarks y una ficha de modelo, todo a la vez. M3.1 Flash hizo lo contrario. Apareció en el selector de modelos de MiniMax Code, junto a M3 y M2.7, y la comunidad lo encontró ahí antes de que MiniMax dijera nada. El desarrollador que lo destapó notó de inmediato el nuevo menú de razonamiento:

"🚨重磅!MiniMax M3.1-Flash 预览版疑似已上线 MiniMax Code!推理等级单独成菜单:low / medium / high / xhigh / max。目前还没有官方公告,属于先露在产品里的灰度上线。" (Traducción: "¡Gran noticia! La preview de MiniMax M3.1-Flash parece estar activa en MiniMax Code. Los niveles de razonamiento tienen su propio menú: low / medium / high / xhigh / max. Todavía no hay anuncio oficial, es un despliegue gris/escalonado que se muestra primero en el producto.")

El despliegue también llegó con cierto suspiro. MiniMax ha estado lanzando modelos de vídeo y música a buen ritmo, la serie M (texto) se había quedado callada, y la respuesta con más likes bajo la publicación del lanzamiento se leyó como impaciencia cariñosa:

"You finally remembered the M series"

El bombo también tiene su trastienda. Durante días antes, los desarrolladores habían estado probando a fondo un modelo sigiloso gratuito llamado "Space Bunny" y adivinando qué era; la respuesta llegó pocos días antes del lanzamiento:

"Confirmed, Space Bunny Alpha is Minimax M3.1"

Así que la emoción es real, pero el "lanzamiento" es una preview escalonada y primero en el producto. Si estás decidiendo si construir sobre él, esa distinción importa más que el bombo: una preview de despliegue gris sin precio y sin pesos no es el mismo compromiso que un modelo GA.

Qué es realmente MiniMax M3.1 Flash

Quitando el teatro del lanzamiento, las docs de la plataforma son claras sobre lo esencial. En la tabla de modelos compatibles, M3.1 Flash se describe como un "frontier multimodal coding model with 1M context window and tunable thinking depth", pensado para razonamiento agéntico, uso de herramientas, programación y ejecución de tareas estructuradas. Acepta texto, imágenes y vídeo como entrada.

El contexto de 1M es la especificación estrella, y es un salto real dentro de la serie M, no un redondeo de marketing. Toda la familia M2 llegaba como máximo a 204.800 tokens; la generación M3, con M3.1 Flash incluido, es un salto limpio de cinco veces.

Gráfico de barras que compara las ventanas de contexto de los modelos MiniMax: la familia M2.x con 204.800 tokens frente a MiniMax M3 y M3.1 Flash con 1.000.000 de tokens
Gráfico de barras que compara las ventanas de contexto de los modelos MiniMax: la familia M2.x con 204.800 tokens frente a MiniMax M3 y M3.1 Flash con 1.000.000 de tokens

Esto es lo que las docs confirman y lo que no:

AtributoMiniMax M3.1 Flash
Id del modeloMiniMax-M3.1-Flash-Preview
Ventana de contexto1.000.000 de tokens
Modalidades de entradaTexto, imagen, vídeo
RazonamientoActivado por defecto, ajustable con effort, no se puede desactivar
DisponibilidadSolo Token Plan + MiniMax Code
Pesos abiertosNinguno (sin ficha en Hugging Face)
Número de parámetrosNo indicado
Rendimiento (tps)No indicado
Precio por tokenNo publicado

Esa tabla es deliberadamente honesta con los huecos. No hay número de parámetros, ni cifra oficial de tokens por segundo, ni suite de benchmarks para M3.1 Flash en concreto. Si una página te dice que el modelo tiene "428B parámetros" o cita una puntuación de benchmark, la está tomando prestada del M3 original, no de M3.1 Flash. Prefiero señalar el vacío antes que maquillarlo.

El único control que lo define: effort

La única característica que las docs destacan para M3.1 Flash y no para M3 es la profundidad de razonamiento ajustable. El modelo siempre razona antes de responder, y tú controlas cuánto piensa con un ajuste effort que acepta low, medium, high, xhigh y max. Si lo omites, por defecto es max.

Un dial con los cinco niveles de effort de low a max, con max marcado como predeterminado, flechas para más rápido y menos tokens frente a razonamiento más profundo, y una nota de que el razonamiento no se puede apagar
Un dial con los cinco niveles de effort de low a max, con max marcado como predeterminado, flechas para más rápido y menos tokens frente a razonamiento más profundo, y una nota de que el razonamiento no se puede apagar

El detalle que suele sorprender: no puedes apagar el razonamiento. Si envías thinking: {"type": "disabled"} o effort: "none", la API devuelve un 400 con el mensaje requires adaptive thinking (docs). Si necesitas menor latencia o menos tokens de salida, bajas effort a low; no hay modo sin razonamiento. Es una opinión de diseño real y conviene conocerla antes de conectarlo a una ruta sensible a la latencia. Para un modelo "Flash", usar max por defecto es una elección algo sorprendente, y significa que el comportamiento barato y rápido que cabría esperar por el nombre hay que activarlo a propósito.

¿Es realmente rápido?

MiniMax no publicó una cifra de rendimiento, así que los únicos datos reales de velocidad vienen de desarrolladores que lo probaron el primer día. La medición más citada situó la velocidad de decodificación en un rango sólido, pero no líder de categoría:

"MiniMax-M3.1-flash-preview is hanging around 90 - 110 t/s range for decode. It's fast, love seeing it, def faster than MiMo-v2.6-flash but not as fast as deepseek-v4.1-flash"

Ese es el posicionamiento honesto: rápido, por delante de algunos rivales de nivel flash y por detrás de otros. Y no todos están convencidos de que la velocidad de decodificación pura sea lo que hay que celebrar:

"Decode speed is not equivalent to fast. The model is slow for the quality in my opinion, numbers dropping soon!"

Creo que ese escéptico tiene un punto que vale la pena retener. Un modelo que usa max de effort por defecto y no puede dejar de pensar se sentirá más lento en tareas reales de lo que sugiere una cifra de tokens por segundo, porque genera muchos tokens de razonamiento antes de la respuesta. La pregunta útil no es "cuántos tokens por segundo", sino "cuánto tarda en llegar una respuesta correcta que pueda publicar", y ese es un benchmark que nadie ha ejecutado aún con M3.1 Flash.

La arquitectura de fondo

Las docs no repiten los detalles internos de M3.1 Flash, así que lo justo es tratar la arquitectura como heredada de la generación M3 y no como una especificación confirmada de M3.1 Flash. La línea M3 introdujo MiniMax Sparse Attention (MSA), un diseño de atención dispersa que hace práctico un contexto de un millón de tokens en lugar de ruinosamente lento.

La propia comparación de MiniMax con la atención estándar de consulta agrupada (GQA) es la ilustración más clara de por qué la atención dispersa importa con esta longitud de contexto:

Comparación de eficiencia de MiniMax entre MSA y GQA: reducción de 28,4x en FLOPs de atención por token, prefilling 14,2x más rápido y decodificación 7,6x más rápida con 1M de tokens, según lo compartido por MiniMax
Comparación de eficiencia de MiniMax entre MSA y GQA: reducción de 28,4x en FLOPs de atención por token, prefilling 14,2x más rápido y decodificación 7,6x más rápida con 1M de tokens, según lo compartido por MiniMax

Con un millón de tokens, el gráfico de MiniMax muestra que MSA reduce el cómputo de atención por token en unas 28 veces y acelera la decodificación ~7,6 veces frente a la atención estándar. Son cifras de la generación M3; como M3.1 Flash tiene la misma ventana de 1M, casi seguro se apoya en la misma arquitectura, pero no las citaría como especificación medida de M3.1 Flash hasta que MiniMax publique una.

Cuánto cuesta

Aquí M3.1 Flash resulta realmente inusual: no hay precio por token en ninguna parte. No está en la tabla de pago por uso, y las propias docs de MiniMax dicen que por ahora solo está disponible mediante el Token Plan y MiniMax Code. Así que su coste real es tu suscripción dividida por cuánto lo uses.

Este es el Token Plan, una cuota compartida entre texto, imagen y voz:

PlanMensualAnual (2 meses gratis)~Tokens M3 / mesGeneración de vídeo
Plus20 $220 $~1,7BNinguna
Max50 $550 $~5,1B3 clips/día
Ultra120 $1.320 $~12,5B5 clips/día

También hay una opción de Credits prepago (5 $ por 5.000, 25 $ por 25.000, 100 $ por 100.000, válidos un año) y ningún nivel gratuito de LLM. La cuota se reinicia en ventanas móviles de 5 horas y semanales, y la cuota mensual no usada no se acumula.

Si quieres una idea de lo que podría cobrar una API pública en el futuro, su hermano de 1M de contexto MiniMax M3 está en pago por uso. Son tarifas de M3, no de M3.1 Flash, pero la estructura probablemente anticipa lo que viene:

MiniMax M3 (nivel estándar)EntradaSalidaLectura de caché
≤ 512K de entrada0,30 $ /M1,20 $ /M0,06 $ /M
> 512K de entrada0,60 $ /M2,40 $ /M0,12 $ /M

Dos cosas estructurales a tener en cuenta: un umbral de 512K de entrada que duplica la tarifa por encima, y un nivel de servicio Priority que cuesta 1,5x la tarifa estándar. Barato para su categoría, en otras palabras, pero con un recargo por contexto largo incorporado.

Cómo ejecutarlo de verdad

Para ser una preview, el acceso es sorprendentemente amigable para desarrolladores. M3.1 Flash habla dos protocolos: un endpoint compatible con Anthropic en https://api.minimax.io/anthropic (la vía recomendada por MiniMax, con bloques de thinking) y uno compatible con OpenAI en https://api.minimax.io/v1. El campo effort simplemente está en un lugar distinto según cuál uses: output_config.effort en la API de Anthropic, reasoning_effort en la de OpenAI.

Como es compatible con Anthropic y OpenAI, puedes apuntar herramientas agénticas de programación existentes directamente a él. MiniMax enumera Claude Code, Cursor, Codex CLI y otras como compatibles mediante el Token Plan, sin necesidad de otra API key. Ese es el caso de uso real que persigue la combinación "Flash + preview": un modelo por defecto barato y rápido para programación cotidiana y bucles de agentes, dentro de las herramientas en las que los desarrolladores ya viven.

Dónde encaja un modelo así

Lo que me devuelve al enfoque del principio. M3.1 Flash es un motor rápido con una ventana de contexto grande y un dial de razonamiento. Eso es infraestructura. Es la capacidad en bruto, expuesta como endpoint, y es genuinamente buena en lo que hace. Pero un endpoint no conoce tu empresa, no está dentro de tu helpdesk y no se hace cargo de un trabajo de principio a fin. Todo eso tienes que construirlo tú alrededor.

Un diagrama de dos capas: la tarjeta inferior representa el modelo como motor en bruto con 1M de contexto, effort ajustable y un endpoint de API, y la tarjeta superior representa al compañero contratado para hacer el trabajo, que conoce tu empresa, se conecta a tus herramientas y entrega el trabajo
Un diagrama de dos capas: la tarjeta inferior representa el modelo como motor en bruto con 1M de contexto, effort ajustable y un endpoint de API, y la tarjeta superior representa al compañero contratado para hacer el trabajo, que conoce tu empresa, se conecta a tus herramientas y entrega el trabajo

Esa brecha entre "un modelo capaz" y "trabajo que realmente se hace" es toda la razón de ser de eesel. eesel es una plataforma de compañeros de IA: en lugar de darte un modelo y un editor en blanco, contratas a un compañero listo para trabajar en una tarea concreta. La plantilla actual incluye un compañero de IA para helpdesk que se une a tu cola de soporte existente y un redactor de blog con IA que investiga y redacta publicaciones con tu voz. Cada uno llega sabiendo ya hacer su rol y se conecta a las herramientas que ya usas.

Si vives en una terminal, la eesel CLI es la parte que más familiar te resultará tras leer una página de docs como la de MiniMax. Es el mismo compañero que en el panel, manejado desde la línea de comandos: puedes conectar un helpdesk, subir conocimiento, configurar automatizaciones y aprobar acciones retenidas sin abrir nunca la interfaz. Cada comando imprime JSON, y los errores llegan como objetos estructurados {error, hint, retryable}, de modo que un agente de programación como Claude Code, Cursor o Codex puede llevar toda la configuración leyendo el campo hint y decidiendo qué ejecutar después. Además, cada workspace funciona como servidor MCP, así que el mismo agente que llama a M3.1 Flash puede llamar a eesel. El modelo mental es simple: el modelo es el motor que conectas; el compañero es a quien contratas.

Prueba eesel

Si M3.1 Flash te entusiasma porque quieres que la IA haga trabajo real y no solo responda llamadas a una API, esa última milla es lo que gestiona eesel. Apúntalo a tus tickets pasados y a tu centro de ayuda, y el compañero de IA para helpdesk empieza a redactar respuestas reales en minutos; o dale un tema al redactor de blog con IA y investiga, redacta e ilustra una publicación completa con tu voz, igual que se hizo esta.

El panel del redactor de blog con IA de eesel, redactando una reseña completa con investigación e infografías generadas junto a ella
El panel del redactor de blog con IA de eesel, redactando una reseña completa con investigación e infografías generadas junto a ella

Lo mejor es que puedes verlo trabajar antes de comprometerte, ya que eesel se ejecuta primero contra tu propio historial y ves la calidad en tus tickets reales, no en una demo. Es gratis para empezar, sin tarjeta de crédito, para que veas por ti mismo la diferencia entre alquilar un modelo y contratar a un compañero.

Preguntas frecuentes

¿Qué es MiniMax M3.1 Flash?
MiniMax M3.1 Flash (id completo MiniMax-M3.1-Flash-Preview) es el último modelo de la serie M de MiniMax: un modelo multimodal de programación con una ventana de contexto de 1.000.000 de tokens y una profundidad de razonamiento ajustable. Llegó como preview dentro de MiniMax Code y del Token Plan el 27 de septiembre de 2026, y está pensado para trabajo rápido y cotidiano de programación y agentes. Si quieres que un modelo así haga un trabajo real en lugar de quedarse detrás de una API, un compañero de IA como eesel es la capa que lo convierte en trabajo.
¿Cuánto cuesta MiniMax M3.1 Flash?
No hay un precio por token publicado para MiniMax M3.1 Flash. Por ahora solo está disponible mediante el Token Plan y MiniMax Code, así que su coste es tu suscripción dividida por el uso: el Token Plan cuesta 20 $/mes (Plus), 50 $/mes (Max) y 120 $/mes (Ultra). Como referencia aproximada, su hermano con 1M de contexto, MiniMax M3, está en pago por uso a 0,30 $/1,20 $ por millón de tokens.
¿MiniMax M3.1 Flash es de código abierto o está en Hugging Face?
No. A diferencia del modelo de pesos abiertos MiniMax M3, la preview de M3.1 Flash no tiene ficha de modelo en Hugging Face, ni pesos descargables, ni informe técnico a 28 de septiembre de 2026. Es una preview cerrada, ligada al producto, solo dentro de MiniMax Code y el Token Plan.
¿En qué se diferencia M3.1 Flash de MiniMax M3?
Ambos son modelos multimodales de programación con 1M de contexto. La diferencia que las docs indican de forma explícita es la profundidad de razonamiento ajustable: M3.1 Flash expone un control de effort con cinco niveles (de low a max) y se posiciona como el nivel preview "Flash", más rápido, mientras que M3 es el modelo estrella con una velocidad de salida declarada de ~100+ tokens/segundo.
¿Se puede desactivar el razonamiento en MiniMax M3.1 Flash?
No. El razonamiento siempre está activo y no se puede desactivar: enviar effort: "none" o thinking: disabled devuelve un error 400. Para reducir latencia y uso de tokens, bajas el nivel de effort en lugar de apagar el razonamiento.

Share this article

Rama Adi

Article by

Rama Adi

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Ilustración dibujada a mano de un desarrollador ante un portátil con resultados de búsqueda de Exa y datos estructurados que se despliegan
Trending

Exa Agent Ultra: qué hace, cómo funciona y cuánto cuesta

Un repaso claro de Exa Agent Ultra: la API de investigación profunda con un enjambre de subagentes, sus resultados en benchmarks, el precio por ejecución y dónde encaja para investigación y soporte.

Rama AdiRama AdiSep 27, 2026
Ilustración del agente de investigación profunda de Exa extrayendo datos estructurados de toda la web
Trending

Precios de Exa Agent Ultra: cuánto cuesta realmente la investigación profunda en 2026

Exa Agent Ultra no tiene precio de lista. Así funciona el costo medido por uso, cuánto factura una ejecución real y dónde entra el tope de 20 $ por ejecución.

Rama AdiRama AdiSep 27, 2026
Banner principal de alternativas a Grok 4.7 con el logotipo de Grok sobre un fondo abstracto oscuro de cómputo
Trending

Alternativas a Grok 4.7: 6 modelos que vale la pena comparar en 2026

Las mejores alternativas a Grok 4.7 en 2026, comparadas por precio, contexto, pesos abiertos y en qué es realmente buena cada una, además de cómo saber si de verdad necesitas un modelo.

Kurnia KharismaKurnia KharismaSep 23, 2026
Banner principal de la reseña de Grok 4.7 con el logo de Grok sobre un fondo oscuro y abstracto de cómputo
Trending

Reseña de Grok 4.7: ¿el modelo económico de xAI es realmente bueno?

Una reseña práctica de Grok 4.7: en qué destaca, dónde todavía pierde frente a Fable 5.1 y GPT-5.6 Sol, los precios reales, el recargo de la variante Fast y quién debería usarlo realmente.

Rama AdiRama AdiSep 23, 2026
Tasklet a un lado y Manus al otro, separados por un divisor verde de VS, en un enfrentamiento entre dos agentes de IA basados en créditos.
Trending

Tasklet vs Manus: ¿qué agente de IA realmente hace el trabajo? (2026)

Tasklet ejecuta automatizaciones siempre activas en todo tu stack; Manus construye todo un artefacto a partir de un solo prompt. Ambos cobran por crédito. Así es como los dos agentes de IA realmente se diferencian en 2026.

Kurnia KharismaKurnia KharismaSep 23, 2026
Banner principal de precios de Grok 4.7 con el logotipo de Grok y una tabla de costes de tokens de la API
Trending

Precios de Grok 4.7: costes de tokens de la API, niveles y el recargo Fast

Un desglose completo de los precios de Grok 4.7: las tarifas de $2 / $6 por token, el precipicio de contexto largo en 200k, los medidores de llamadas a herramientas que la mayoría de modelos de coste pasan por alto, el recargo Fast, dónde se puede comprar realmente y cómo se compara con GPT-6 Sol y Fable 5.1.

Kurnia KharismaKurnia KharismaSep 23, 2026
Banner principal del lanzamiento de Grok 4.7 con el logotipo de Grok sobre un fondo oscuro y abstracto de cómputo
Trending

Grok 4.7: lo que el nuevo modelo puntero de xAI realmente cambia

Un vistazo claro a Grok 4.7: qué hay de nuevo frente a Grok 4.6, las especificaciones, los precios reales y el recargo de la variante Fast, cómo se compara con GPT-5.6 Sol y Fable 5.1, y para quién es.

KiraKiraSep 23, 2026
Grok Bot iniciando sesión en tus apps a un lado y Zapier Agents construido sobre una cuadrícula de flujos de trabajo de 9.000 apps al otro, divididos por la mitad.
Trending

Grok Bot vs Zapier Agents: ¿qué agente de IA hace el trabajo? (2026)

Grok Bot inicia sesión en tus apps y las maneja; Zapier Agents se construye sobre el mayor grafo de conectores de apps y cobra por actividad. Así se diferencian de verdad estos dos agentes de IA en 2026.

Rama AdiRama AdiSep 23, 2026
Banner principal ilustrado de TypeSafe Jev, el primer modelo de IA System One
Trending

TypeSafe Jev: el primer modelo System One, explicado

Una guía clara de TypeSafe Jev, el modelo System One que convierte un estado no estructurado en decisiones tipadas de sí/no, elegir-una y puntuación en las que tu código puede confiar.

KiraKiraSep 21, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis