MiniMax M3.1 Flash : specs, tarifs et comment tester la preview

Rama Adi
Écrit par

Rama Adi

Katelin Teen
Relu par

Katelin Teen

Dernière modification September 28, 2026

Vérifié par un expert
Illustration d'une fusée au décollage, représentant la sortie du modèle MiniMax M3.1 Flash

Un modèle sorti avant son propre communiqué

La plupart des lancements de modèles, c'est un article de blog, un graphique de benchmarks et une fiche de modèle, tout en même temps. M3.1 Flash a fait l'inverse. Il est apparu dans le sélecteur de modèles de MiniMax Code, à côté de M3 et M2.7, et la communauté l'y a trouvé avant que MiniMax ne dise un mot. Le développeur qui a lancé l'info a tout de suite remarqué le nouveau menu de raisonnement :

"🚨重磅!MiniMax M3.1-Flash 预览版疑似已上线 MiniMax Code!推理等级单独成菜单:low / medium / high / xhigh / max。目前还没有官方公告,属于先露在产品里的灰度上线。" (Traduction : « Grosse nouvelle ! La preview de MiniMax M3.1-Flash semble être en ligne dans MiniMax Code. Les niveaux de raisonnement ont leur propre menu : low / medium / high / xhigh / max. Pas encore d'annonce officielle, c'est un déploiement gris/progressif montré d'abord dans le produit. »)

Le déploiement a aussi été accueilli avec un petit soupir. MiniMax enchaîne les modèles vidéo et musique à vive allure, la série M (texte) s'était tue, et la réponse la plus likée sous le post de lancement se lisait comme de l'impatience affectueuse :

"You finally remembered the M series"

Le buzz a aussi son histoire. Pendant des jours, des développeurs ont martelé un modèle furtif gratuit appelé « Space Bunny » en cherchant à deviner ce que c'était, et la réponse est tombée quelques jours avant le lancement :

"Confirmed, Space Bunny Alpha is Minimax M3.1"

L'enthousiasme est donc réel, mais le « lancement » est une preview progressive, d'abord dans le produit. Si vous décidez de construire dessus, cette distinction compte plus que le buzz : une preview en déploiement gris, sans tarif et sans poids, n'est pas le même engagement qu'un modèle en disponibilité générale.

Ce qu'est réellement MiniMax M3.1 Flash

Une fois le théâtre du lancement mis de côté, la documentation de la plateforme est claire sur le fond. Dans le tableau des modèles pris en charge, M3.1 Flash est décrit comme un « frontier multimodal coding model with 1M context window and tunable thinking depth », conçu pour le raisonnement agentique, l'usage d'outils, le code et l'exécution de tâches structurées. Il accepte texte, images et vidéo en entrée.

Le contexte de 1M est la spec phare, et c'est un vrai saut au sein de la série M, pas un arrondi marketing. Toute la famille M2 plafonnait à 204 800 tokens ; la génération M3, M3.1 Flash compris, fait un bond net d'un facteur cinq.

Graphique en barres comparant les fenêtres de contexte des modèles MiniMax : la famille M2.x à 204 800 tokens contre MiniMax M3 et M3.1 Flash à 1 000 000 de tokens
Graphique en barres comparant les fenêtres de contexte des modèles MiniMax : la famille M2.x à 204 800 tokens contre MiniMax M3 et M3.1 Flash à 1 000 000 de tokens

Voici ce que la documentation garantit, et ce qu'elle ne garantit pas :

AttributMiniMax M3.1 Flash
Id du modèleMiniMax-M3.1-Flash-Preview
Fenêtre de contexte1 000 000 de tokens
Modalités d'entréeTexte, image, vidéo
RéflexionActivée par défaut, réglable via effort, impossible à désactiver
DisponibilitéToken Plan + MiniMax Code uniquement
Poids ouvertsAucun (pas de fiche Hugging Face)
Nombre de paramètresNon indiqué
Débit (tps)Non indiqué
Tarif par tokenNon publié

Ce tableau est volontairement honnête sur les blancs. Il n'y a pas de nombre de paramètres indiqué, pas de chiffre officiel de tokens par seconde, et pas de suite de benchmarks spécifique à M3.1 Flash. Si une page vous dit que le modèle fait « 428B paramètres » ou cite un score de benchmark, elle l'emprunte au M3 parent, elle ne cite pas M3.1 Flash. Je préfère signaler le trou plutôt que de le masquer.

Le curseur qui le définit : effort

La seule fonction que la documentation met en avant pour M3.1 Flash et pas pour M3 est la profondeur de réflexion réglable. Le modèle raisonne toujours avant de répondre, et vous contrôlez l'intensité avec un paramètre effort qui accepte low, medium, high, xhigh et max. Si vous l'omettez, la valeur par défaut est max.

Un curseur montrant les cinq niveaux d'effort de low à max, avec max indiqué comme défaut, des flèches pour plus rapide et moins de tokens contre raisonnement plus profond, et une note indiquant que la réflexion ne peut pas être désactivée
Un curseur montrant les cinq niveaux d'effort de low à max, avec max indiqué comme défaut, des flèches pour plus rapide et moins de tokens contre raisonnement plus profond, et une note indiquant que la réflexion ne peut pas être désactivée

Le détail qui piège : vous ne pouvez pas désactiver la réflexion. Envoyez thinking: {"type": "disabled"} ou effort: "none" et l'API renvoie un 400 avec le message requires adaptive thinking (docs). Pour une latence plus basse ou moins de tokens en sortie, vous descendez effort à low ; il n'y a pas de mode sans réflexion. C'est un vrai parti pris de conception, à connaître avant de le brancher sur un chemin sensible à la latence. Pour un modèle « Flash », défaut à max est un choix un peu surprenant : le comportement rapide et économique qu'on attend du nom, il faut l'activer soi-même.

Est-il vraiment rapide ?

MiniMax n'a pas publié de chiffre de débit : les seules données de vitesse réelles viennent donc de développeurs qui l'ont testé dès le premier jour. La mesure la plus citée place la vitesse de décodage dans une fourchette solide mais pas leader de sa catégorie :

"MiniMax-M3.1-flash-preview is hanging around 90 - 110 t/s range for decode. It's fast, love seeing it, def faster than MiMo-v2.6-flash but not as fast as deepseek-v4.1-flash"

C'est le positionnement honnête : rapide, devant certains concurrents de la catégorie flash, derrière d'autres. Et tout le monde n'est pas convaincu que la vitesse de décodage brute soit ce qu'il faut célébrer :

"Decode speed is not equivalent to fast. The model is slow for the quality in my opinion, numbers dropping soon!"

Je pense que ce sceptique a un point à retenir. Un modèle qui utilise max d'effort par défaut et ne peut pas cesser de réfléchir paraîtra plus lent sur des tâches réelles qu'un chiffre de tokens par seconde ne le suggère, car il génère beaucoup de tokens de raisonnement avant la réponse. La bonne question n'est pas « combien de tokens par seconde », mais « combien de temps avant d'obtenir une réponse correcte que je peux livrer », et ce benchmark, personne ne l'a encore lancé sur M3.1 Flash.

L'architecture en dessous

La documentation ne répète pas les détails internes de M3.1 Flash ; le plus honnête est donc de traiter l'architecture comme héritée de la génération M3 plutôt que comme une spec confirmée de M3.1 Flash. La lignée M3 a introduit MiniMax Sparse Attention (MSA), un design d'attention clairsemée qui rend un contexte d'un million de tokens praticable au lieu de ruineusement lent.

La comparaison de MiniMax avec l'attention standard à requêtes groupées (GQA) illustre le mieux pourquoi l'attention clairsemée compte à cette longueur de contexte :

Comparaison d'efficacité MSA contre GQA par MiniMax, montrant une réduction de 28,4x des FLOPs d'attention par token, un prefilling 14,2x plus rapide et un décodage 7,6x plus rapide à 1M de tokens, tel que partagé par MiniMax
Comparaison d'efficacité MSA contre GQA par MiniMax, montrant une réduction de 28,4x des FLOPs d'attention par token, un prefilling 14,2x plus rapide et un décodage 7,6x plus rapide à 1M de tokens, tel que partagé par MiniMax

À un million de tokens, le graphique de MiniMax montre que MSA réduit le calcul d'attention par token d'environ 28 fois et accélère le décodage d'~7,6 fois par rapport à l'attention standard. Ce sont des chiffres de la génération M3 ; comme M3.1 Flash a la même fenêtre de 1M, il s'appuie presque certainement sur la même architecture, mais je m'abstiendrais de les citer comme spec mesurée de M3.1 Flash tant que MiniMax n'en publie pas.

Ce que ça coûte

C'est là que M3.1 Flash devient vraiment atypique : il n'y a aucun tarif par token nulle part. Il n'est pas dans la grille de paiement à l'usage, et la documentation de MiniMax indique qu'il est disponible pour l'instant uniquement via le Token Plan et MiniMax Code. Son coût réel, c'est donc votre abonnement divisé par votre usage.

Voici le Token Plan, un quota partagé entre texte, image et voix :

PlanMensuelAnnuel (2 mois offerts)~Tokens M3 / moisGénération vidéo
Plus20 $220 $~1,7 MdAucune
Max50 $550 $~5,1 Md3 clips/jour
Ultra120 $1 320 $~12,5 Md5 clips/jour

Il existe aussi une option de Credits prépayés (5 $ pour 5 000, 25 $ pour 25 000, 100 $ pour 100 000, valables un an) et aucun palier LLM gratuit. Le quota se réinitialise sur des fenêtres glissantes de 5 heures et hebdomadaires, et le quota mensuel non utilisé ne se reporte pas.

Pour avoir une idée de ce qu'une API publique pourrait facturer un jour, son cousin à 1M de contexte MiniMax M3 est en paiement à l'usage. Ce sont les tarifs de M3, pas de M3.1 Flash, mais la structure préfigure probablement ce qui vient :

MiniMax M3 (palier standard)EntréeSortieLecture du cache
≤ 512K en entrée0,30 $ /M1,20 $ /M0,06 $ /M
> 512K en entrée0,60 $ /M2,40 $ /M0,12 $ /M

Deux points structurels à noter pour plus tard : un seuil à 512K en entrée qui double le tarif au-delà, et un palier de service Priority à 1,5x le tarif standard. Bon marché pour sa catégorie, donc, mais avec un supplément long contexte intégré.

Comment l'utiliser concrètement

Pour une preview, l'accès est étonnamment favorable aux développeurs. M3.1 Flash parle deux protocoles : un endpoint compatible Anthropic sur https://api.minimax.io/anthropic (la voie recommandée par MiniMax, avec blocs de thinking) et un endpoint compatible OpenAI sur https://api.minimax.io/v1. Le champ effort se trouve simplement à un endroit différent selon celui que vous utilisez : output_config.effort sur l'API Anthropic, reasoning_effort sur celle d'OpenAI.

Comme il est compatible Anthropic et OpenAI, vous pouvez pointer directement vos outils de code agentiques existants dessus. MiniMax cite Claude Code, Cursor, Codex CLI et d'autres comme pris en charge via le Token Plan, sans clé d'API séparée. C'est le vrai cas d'usage visé par la combinaison « Flash + preview » : un modèle par défaut rapide et économique pour le code du quotidien et les boucles d'agents, dans les outils où les développeurs vivent déjà.

Où un tel modèle s'insère

Ce qui me ramène au cadrage du début. M3.1 Flash est un moteur rapide avec une grande fenêtre de contexte et un curseur de réflexion. C'est de l'infrastructure. C'est la capacité brute, exposée en endpoint, et elle est vraiment bonne dans ce qu'elle fait. Mais un endpoint ne connaît pas votre entreprise, ne siège pas dans votre helpdesk et ne prend pas en charge un travail de bout en bout. Tout cela, il reste à le construire autour.

Un schéma à deux couches : la carte du bas représente le modèle comme moteur brut avec 1M de contexte, effort réglable et endpoint d'API, et la carte du haut représente le coéquipier embauché pour faire le travail, qui connaît votre entreprise, se branche sur vos outils et livre le travail
Un schéma à deux couches : la carte du bas représente le modèle comme moteur brut avec 1M de contexte, effort réglable et endpoint d'API, et la carte du haut représente le coéquipier embauché pour faire le travail, qui connaît votre entreprise, se branche sur vos outils et livre le travail

Cet écart entre « un modèle capable » et « du travail réellement accompli » est toute la raison d'être d'eesel. eesel est une plateforme de coéquipiers IA : au lieu de vous donner un modèle et un éditeur vide, vous embauchez un coéquipier prêt à travailler pour une mission précise. L'équipe actuelle comprend un coéquipier IA pour helpdesk qui rejoint votre file de support existante, et un rédacteur de blog IA qui fait la recherche et rédige des articles dans votre voix. Chacun arrive sachant déjà faire son rôle et se branche sur les outils que vous utilisez déjà.

Si vous vivez dans un terminal, la CLI eesel est la partie qui vous sera la plus familière après la lecture d'une page de docs comme celle de MiniMax. C'est le même coéquipier que dans le tableau de bord, piloté en ligne de commande : vous pouvez connecter un helpdesk, importer des connaissances, câbler des automatisations et approuver des actions en attente sans jamais ouvrir l'interface. Chaque commande affiche du JSON, et les erreurs reviennent sous forme d'objets structurés {error, hint, retryable}, de sorte qu'un agent de code comme Claude Code, Cursor ou Codex peut piloter toute la configuration en lisant le champ hint et en décidant quoi lancer ensuite. Chaque workspace fait aussi office de serveur MCP : le même agent qui appelle M3.1 Flash peut appeler eesel. Le modèle mental est simple : le modèle est le moteur que vous branchez ; le coéquipier est celui que vous embauchez.

Essayer eesel

Si M3.1 Flash vous enthousiasme parce que vous voulez une IA qui fait du vrai travail, pas seulement qui répond à des appels d'API, ce dernier kilomètre est ce que gère eesel. Pointez-le sur vos anciens tickets et votre centre d'aide, et le coéquipier IA pour helpdesk commence à rédiger de vraies réponses en quelques minutes ; ou donnez un sujet au rédacteur de blog IA et il fait la recherche, rédige et illustre un article complet dans votre voix, exactement comme celui-ci a été réalisé.

Le tableau de bord du rédacteur de blog IA d'eesel, en train de rédiger un article de test complet avec recherche et infographies générées en parallèle
Le tableau de bord du rédacteur de blog IA d'eesel, en train de rédiger un article de test complet avec recherche et infographies générées en parallèle

Le meilleur, c'est que vous pouvez le voir travailler avant de vous engager : eesel tourne d'abord sur votre propre historique, vous voyez donc la qualité sur vos vrais tickets, pas sur une démo. C'est gratuit pour démarrer, sans carte bancaire, pour voir par vous-même la différence entre louer un modèle et embaucher un coéquipier.

Questions fréquentes

Qu'est-ce que MiniMax M3.1 Flash ?
MiniMax M3.1 Flash (id complet MiniMax-M3.1-Flash-Preview) est le dernier modèle de la série M de MiniMax : un modèle de code multimodal avec une fenêtre de contexte de 1 000 000 de tokens et une profondeur de réflexion réglable. Il est sorti en preview dans MiniMax Code et le Token Plan le 27 septembre 2026, et vise le travail rapide du quotidien en code et en agents. Si vous voulez qu'un tel modèle fasse un vrai travail plutôt que de rester derrière une API, un coéquipier IA comme eesel est la couche qui le transforme en travail.
Combien coûte MiniMax M3.1 Flash ?
Aucun tarif par token n'est publié pour MiniMax M3.1 Flash. Pour l'instant, il n'est disponible que via le Token Plan et MiniMax Code : son coût, c'est donc votre abonnement divisé par l'usage. Le Token Plan coûte 20 $/mois (Plus), 50 $/mois (Max) et 120 $/mois (Ultra). Comme repère approximatif, son cousin à 1M de contexte MiniMax M3 est en paiement à l'usage à 0,30 $/1,20 $ par million de tokens.
MiniMax M3.1 Flash est-il open source ou sur Hugging Face ?
Non. Contrairement au modèle à poids ouverts MiniMax M3, la preview M3.1 Flash n'a ni fiche de modèle Hugging Face, ni poids téléchargeables, ni rapport technique au 28 septembre 2026. C'est une preview fermée, liée au produit, uniquement dans MiniMax Code et le Token Plan.
En quoi M3.1 Flash diffère-t-il de MiniMax M3 ?
Les deux sont des modèles de code multimodaux à 1M de contexte. La différence que la documentation énonce réellement est la profondeur de réflexion réglable : M3.1 Flash expose un curseur d'effort à cinq niveaux (de low à max) et se positionne comme la preview « Flash » plus rapide, tandis que M3 est le modèle phare avec une vitesse de sortie annoncée d'environ 100+ tokens/seconde.
Peut-on désactiver la réflexion dans MiniMax M3.1 Flash ?
Non. La réflexion est toujours active et ne peut pas être désactivée : envoyer effort: "none" ou thinking: disabled renvoie une erreur 400. Pour réduire la latence et la consommation de tokens, vous baissez le niveau de effort au lieu de couper la réflexion.

Share this article

Rama Adi

Article by

Rama Adi

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Shadow, illustration de couverture de l'avis sur l'interface IA pour Mac
Trending

Avis sur Shadow (2026) : l'interface IA pour Mac

Mon avis pratique sur Shadow : l'interface IA sans bot pour Mac qui transcrit les réunions directement sur l'appareil, exécute des Skills personnalisées via un raccourci, pour 8 dollars par mois.

KiraKiraJul 8, 2026
Illustration de l'agent de recherche approfondie d'Exa extrayant des données structurées de tout le web
Trending

Tarifs d'Exa Agent Ultra : ce que coûte vraiment la recherche approfondie en 2026

Exa Agent Ultra n'a pas de prix catalogue. Voici comment fonctionne le coût à l'usage, ce que facture une vraie exécution et où le plafond de 20 $ par exécution intervient.

Rama AdiRama AdiSep 27, 2026
Bannière d'illustration des alternatives à Grok 4.7 avec le logo Grok sur un fond abstrait sombre évoquant le calcul informatique
Trending

Alternatives à Grok 4.7 : 6 modèles à comparer en 2026

Les meilleures alternatives à Grok 4.7 en 2026, comparées sur le prix, le contexte, les poids ouverts et ce en quoi chacune excelle vraiment, sans oublier comment savoir si vous avez seulement besoin d'un modèle.

Kurnia KharismaKurnia KharismaSep 23, 2026
Bannière principale de l'avis Grok 4.7 avec le logo Grok sur un arrière-plan sombre et abstrait évoquant le calcul informatique
Trending

Avis Grok 4.7 : le modèle de pointe bon marché de xAI est-il vraiment bon ?

Un avis pratique sur Grok 4.7 : ce en quoi il excelle, où il perd encore face à Fable 5.1 et GPT-5.6 Sol, les vrais prix, la surtaxe de la variante Fast, et qui devrait vraiment l'utiliser.

Rama AdiRama AdiSep 23, 2026
Tasklet d'un côté et Manus de l'autre, séparés par un séparateur vert VS, dans un face-à-face entre deux agents IA facturés au crédit.
Trending

Tasklet vs Manus : quel agent IA fait vraiment le travail ? (2026)

Tasklet fait tourner des automatisations toujours actives sur toute votre pile d'outils ; Manus construit tout un livrable à partir d'un seul prompt. Les deux facturent au crédit. Voici comment ces deux agents IA se différencient réellement en 2026.

Kurnia KharismaKurnia KharismaSep 23, 2026
Bannière des tarifs de Grok 4.7 avec le logo Grok et un tableau des coûts de tokens de l'API
Trending

Tarifs de Grok 4.7 : coûts des tokens de l'API, paliers et la taxe Fast

Un décryptage complet des tarifs de Grok 4.7 : les taux de 2 $ / 6 $ par token, le seuil de contexte long à 200k, les compteurs d'appels d'outils que la plupart des modèles de coût ignorent, la taxe Fast, où l'acheter réellement, et comment il se compare à GPT-6 Sol et Fable 5.1.

Kurnia KharismaKurnia KharismaSep 23, 2026
Bannière de lancement de Grok 4.7 avec le logo Grok sur un fond de calcul sombre et abstrait
Trending

Grok 4.7 : ce que le nouveau modèle de pointe de xAI change vraiment

Un aperçu clair de Grok 4.7 : les nouveautés par rapport à Grok 4.6, les caractéristiques techniques, les prix réels et la taxe de la variante Fast, ses performances face à GPT-5.6 Sol et Fable 5.1, et à qui il s'adresse.

KiraKiraSep 23, 2026
Grok Bot se connectant à vos applications d'un côté et Zapier Agents construit sur une grille de workflows de 9 000 applications de l'autre, séparés au milieu.
Trending

Grok Bot vs Zapier Agents : quel agent IA fait vraiment le travail ? (2026)

Grok Bot se connecte à vos applications et les pilote ; Zapier Agents s'appuie sur le plus grand graphe de connecteurs d'applications et facture à l'activité. Voici comment ces deux agents IA se différencient vraiment en 2026.

Rama AdiRama AdiSep 23, 2026
Bannière principale illustrée de TypeSafe Jev, le premier modèle d'IA System One
Trending

TypeSafe Jev : le premier modèle System One, expliqué

Un guide clair sur TypeSafe Jev, le modèle System One qui transforme un état non structuré en décisions typées oui/non, choix unique et score, sur lesquelles votre code peut s'appuyer.

KiraKiraSep 21, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement