MiniMax M3.1 Flash:スペック、料金、プレビューの試し方

Rama Adi
執筆者

Rama Adi

Katelin Teen
レビュー者

Katelin Teen

最終更新 September 28, 2026

専門家による検証済み
打ち上げられるロケットのイラスト。MiniMax M3.1 Flashモデルのリリースを表している

プレスリリースより先に出たモデル

多くのモデル発表は、ブログ記事、ベンチマーク図、モデルカードが同時に出ます。M3.1 Flashはその逆でした。MiniMax Codeのモデルセレクターに、M3やM2.7と並んで現れ、MiniMaxが何も言う前にコミュニティが見つけました。最初に見つけた開発者は、新しい推論メニューにすぐ気づきました。

"🚨重磅!MiniMax M3.1-Flash 预览版疑似已上线 MiniMax Code!推理等级单独成菜单:low / medium / high / xhigh / max。目前还没有官方公告,属于先露在产品里的灰度上线。" (訳:「大ニュース!MiniMax M3.1-Flashのプレビュー版がMiniMax Codeで公開された模様。推論レベルは独立したメニューになっていて、low / medium / high / xhigh / max。公式発表はまだなく、製品内で先に見えるグレー(段階的)リリース。」)

このロールアウトには、少しため息まじりの反応もありました。MiniMaxは動画や音楽のモデルを速いペースで出し続けていて、M(テキスト)シリーズは静かになっていたため、発表投稿への最多いいねの返信は愛情のこもった焦れったさとして読めました。

"You finally remembered the M series"

盛り上がりには前日譚もあります。数日前から、開発者たちは「Space Bunny」という無料のステルスモデルを使い倒して正体を推測していて、答えは発表の数日前に出ました。

"Confirmed, Space Bunny Alpha is Minimax M3.1"

つまり、盛り上がりは本物ですが、この「ローンチ」は製品内で先行する段階的なプレビューです。これに乗って作るか判断するなら、熱狂よりもこの違いのほうが重要です。価格もウェイトもないグレーロールアウトのプレビューは、GAモデルと同じ約束ではありません。

MiniMax M3.1 Flashの実像

ローンチの演出を取り除くと、プラットフォームのドキュメントは中身についてはっきり書いています。対応モデル表では、M3.1 Flashは「frontier multimodal coding model with 1M context window and tunable thinking depth」と説明され、エージェント的な推論、ツール利用、コーディング、構造化されたタスク実行向けとされています。入力はテキスト、画像、動画です。

1Mコンテキストが目玉スペックで、Mシリーズの中では誇張ではない本物の飛躍です。M2ファミリー全体が204,800トークンで頭打ちだったのに対し、M3.1 Flashを含むM3世代はきれいに5倍です。

MiniMaxモデルのコンテキストウィンドウを比較した棒グラフ:M2.xファミリーは204,800トークン、MiniMax M3とM3.1 Flashは1,000,000トークン
MiniMaxモデルのコンテキストウィンドウを比較した棒グラフ:M2.xファミリーは204,800トークン、MiniMax M3とM3.1 Flashは1,000,000トークン

ドキュメントが明言していることと、していないことは次のとおりです。

項目MiniMax M3.1 Flash
モデルIDMiniMax-M3.1-Flash-Preview
コンテキストウィンドウ1,000,000トークン
入力モダリティテキスト、画像、動画
思考デフォルトでオン、effortで調整可能、無効化不可
提供範囲Token Plan + MiniMax Codeのみ
オープンウェイトなし(Hugging Faceカードなし)
パラメータ数記載なし
スループット(tps)記載なし
トークン単価未公表

この表は空欄について意図的に正直にしています。パラメータ数の記載も、公式のトークン/秒の数値も、M3.1 Flash固有のベンチマークスイートもありません。あるページがこのモデルを「428Bパラメータ」と言ったりベンチマークスコアを挙げたりしていたら、それはM3.1 Flashではなく親モデルM3から借りたものです。穴を取り繕うより、穴があると示すほうがよいと思います。

このモデルを特徴づける1つのつまみ:effort

M3.1 Flashについてドキュメントが強調し、M3には書かれていない唯一の機能が、思考の深さの調整です。モデルは回答の前に必ず推論し、どこまで深く考えるかを、low、medium、high、xhigh、maxを受け付けるeffort設定で制御します。省略するとデフォルトはmaxです。

lowからmaxまでの5段階のeffortレベルを示すダイヤル。maxがデフォルトとして示され、高速・少ないトークンと深い推論を示す矢印、思考はオフにできないという注記がある
lowからmaxまでの5段階のeffortレベルを示すダイヤル。maxがデフォルトとして示され、高速・少ないトークンと深い推論を示す矢印、思考はオフにできないという注記がある

つまずきやすい点はここです。思考はオフにできません。thinking: {"type": "disabled"}やeffort: "none"を送ると、APIはrequires adaptive thinkingというメッセージとともに400を返します(ドキュメント)。レイテンシを下げたい、出力トークンを減らしたい場合はeffortをlowまで下げます。思考なしのモードはありません。これは明確な設計上の意見であり、レイテンシに敏感な経路に組み込む前に知っておくべきです。「Flash」を名乗るモデルで、デフォルトがmax推論というのは少し意外な選択で、名前から期待する安くて速い挙動は、自分から選んで有効にする必要があるということです。

実際に速いのか

MiniMaxはスループットを公表していないため、これまで得られている実測の速度データは、初日に試した開発者からのものだけです。最もよく引用される計測では、デコード速度は堅実だがカテゴリ最速ではない範囲でした。

"MiniMax-M3.1-flash-preview is hanging around 90 - 110 t/s range for decode. It's fast, love seeing it, def faster than MiMo-v2.6-flash but not as fast as deepseek-v4.1-flash"

これが正直な位置づけです。速く、一部のFlash級より上で、他には及ばない。そして、生のデコード速度を称えるべきかどうかについては、全員が納得しているわけではありません。

"Decode speed is not equivalent to fast. The model is slow for the quality in my opinion, numbers dropping soon!"

この懐疑派の指摘には一理あると思います。デフォルトがmax effortで、考えるのをやめられないモデルは、回答の前に大量の推論トークンを生成するため、実際のタスクでは、見出しのトークン/秒の数字が示すより遅く感じられます。本当に知りたいのは「1秒あたり何トークンか」ではなく「出荷できる正しい答えが得られるまでどれだけかかるか」であり、そのベンチマークはM3.1 Flashではまだ誰も実施していません。

その下にあるアーキテクチャ

M3.1 Flashについて、ドキュメントは内部構造を改めて説明していません。そのためアーキテクチャは、確認済みのM3.1 Flashの仕様ではなく、M3世代から引き継いだものとして扱うのが妥当です。M3系列はMiniMax Sparse Attention(MSA)を導入しました。これは100万トークンのコンテキストを、遅すぎて使えないものではなく実用的なものにするスパースアテンション設計です。

この長さのコンテキストでスパースアテンションがなぜ重要かは、標準的なグループドクエリアテンション(GQA)とのMiniMax自身の比較が最も明快に示しています。

MiniMaxによるMSAとGQAの効率比較。1Mトークン時にトークンあたりのアテンションFLOPsが28.4倍削減、プリフィルが14.2倍高速、デコードが7.6倍高速。MiniMax公開の図
MiniMaxによるMSAとGQAの効率比較。1Mトークン時にトークンあたりのアテンションFLOPsが28.4倍削減、プリフィルが14.2倍高速、デコードが7.6倍高速。MiniMax公開の図

100万トークン時、MiniMaxの図では、標準アテンションに比べてMSAがトークンあたりのアテンション計算を約28倍削減し、デコードを約7.6倍高速化しています。これはM3世代の数値です。M3.1 Flashも同じ1Mウィンドウを持つため、ほぼ確実に同じアーキテクチャに依拠していると思いますが、MiniMaxが公表するまでは、M3.1 Flashの実測スペックとして引用するのは控えます。

料金

ここがM3.1 Flashが本当に異例な点です。どこにもトークン単価がありません。従量課金の表にもなく、MiniMax自身のドキュメントも当面はToken PlanとMiniMax Codeでのみ利用可能と述べています。したがって実際のコストは、サブスクリプション料金を利用量で割ったものです。

こちらがToken Planで、テキスト、画像、音声で共有されるクォータです。

プラン月額年額(2か月分無料)月あたりM3トークン(目安)動画生成
Plus$20$220約17億なし
Max$50$550約51億1日3クリップ
Ultra$120$1,320約125億1日5クリップ

前払いのクレジットオプション(5,000は$5、25,000は$25、100,000は$100、有効期間は1年)もあり、無料のLLM枠はありません。クォータは5時間ごとと週ごとのローリングウィンドウでリセットされ、月の未使用分は繰り越されません。

公開APIが最終的にいくらになるかの感触をつかみたいなら、1Mコンテキストの兄弟モデルMiniMax M3が従量課金で提供されています。これはM3の料金でありM3.1 Flashのものではありませんが、この構造が今後の予告になっている可能性が高いです。

MiniMax M3(スタンダード層)入力出力キャッシュ読み取り
入力 ≤ 512K$0.30 /M$1.20 /M$0.06 /M
入力 > 512K$0.60 /M$2.40 /M$0.12 /M

後で覚えておきたい構造上の点が2つあります。512K入力を境にそれ以上は料金が2倍になること、そしてスタンダード料金の1.5倍のPriorityサービス層があることです。つまりこの階層としては安いものの、長いコンテキストの割増があらかじめ組み込まれています。

実際の動かし方

プレビューにしては、アクセスは意外なほど開発者に優しいです。M3.1 Flashは2つのプロトコルに対応しています。https://api.minimax.io/anthropicのAnthropic互換エンドポイント(MiniMaxの推奨経路で、thinkingブロック付き)と、https://api.minimax.io/v1のOpenAI互換エンドポイントです。effortフィールドは、どちらを使うかで置き場所が変わります。AnthropicのAPIではoutput_config.effort、OpenAIのAPIではreasoning_effortです。

AnthropicとOpenAIの両方に互換性があるため、既存のエージェント型コーディングツールをそのまま向けられます。MiniMaxは、Token PlanでClaude Code、Cursor、Codex CLIなどに対応しているとしており、別のAPIキーは不要です。「Flash + プレビュー」の組み合わせが狙う実際のユースケースはこれで、日常のコーディングやエージェントループ向けの安価で高速なデフォルトモデルを、開発者が普段使っているツールの中で動かすことです。

こうしたモデルの位置づけ

ここで冒頭の見方に戻ります。M3.1 Flashは、大きなコンテキストウィンドウと思考ダイヤルを備えた高速なエンジンです。それはインフラです。エンドポイントとして公開された素の能力であり、その役割では本当に優れています。ただし、エンドポイントはあなたの会社を知らず、ヘルプデスクの中にも座っておらず、仕事を最初から最後まで受け持つこともしません。その周りの部分は、結局自分で作る必要があります。

2層の図:下のカードは1Mコンテキスト、調整可能なeffort、APIエンドポイントを備えた素のエンジンとしてのモデル、上のカードは仕事のために採用され、あなたの会社を知り、ツールに接続し、成果物を届けるチームメイト
2層の図:下のカードは1Mコンテキスト、調整可能なeffort、APIエンドポイントを備えた素のエンジンとしてのモデル、上のカードは仕事のために採用され、あなたの会社を知り、ツールに接続し、成果物を届けるチームメイト

「高性能なモデル」と「実際に仕事が片づくこと」の間のこのギャップこそ、eeselが存在する理由のすべてです。eeselはAIチームメイトのプラットフォームです。モデルと空のエディタを渡すのではなく、特定の仕事に向けてすぐ働けるチームメイトを採用します。現在のラインナップは、既存のサポートキューに参加するAIヘルプデスクチームメイトと、あなたの文体で記事をリサーチして下書きするAIブログライターです。どちらも最初から自分の役割のやり方を心得ていて、すでに使っているツールにつながります。

ターミナルで暮らしているなら、MiniMaxのようなドキュメントページを読んだ後に最もなじみ深く感じるのがeesel CLIでしょう。ダッシュボードと同じチームメイトをコマンドラインから操作するもので、UIを一度も開かずに、ヘルプデスクの接続、ナレッジのアップロード、オートメーションの設定、保留中のアクションの承認ができます。すべてのコマンドはJSONを出力し、エラーは構造化された{error, hint, retryable}オブジェクトで返るため、Claude Code、Cursor、Codexのようなコーディングエージェントがhintフィールドを読んで次に何を実行するか判断し、セットアップ全体を進められます。すべてのワークスペースはMCPサーバーとしても機能するので、M3.1 Flashを呼び出している同じエージェントがeeselも呼び出せます。考え方は単純です。モデルは自分で組み込むエンジン、チームメイトは採用する相手です。

eeselを試す

M3.1 Flashに期待しているのが、APIの呼び出しに答えるだけでなく、AIに実際の仕事をさせたいからなら、その最後の一歩を担うのがeeselです。過去のチケットとヘルプセンターを読み込ませれば、AIヘルプデスクチームメイトが数分で実際の返信の下書きを始めます。あるいはAIブログライターにトピックを渡せば、リサーチから下書き、図版まで、あなたの文体で1本の記事を仕上げます。この記事もそうして作られました。

eesel AIブログライターのダッシュボード。リサーチとインフォグラフィックを並行して生成しながら、レビュー記事の全文を下書きしている
eesel AIブログライターのダッシュボード。リサーチとインフォグラフィックを並行して生成しながら、レビュー記事の全文を下書きしている

何より、導入を決める前に動くところを確認できます。eeselはまずあなた自身の履歴に対して動くので、デモではなく実際のチケットで品質を確かめられます。無料で始められ、クレジットカードも不要です。モデルを借りることと、チームメイトを採用することの違いを、ご自身で確かめてください。

よくある質問

MiniMax M3.1 Flashとは何ですか?
MiniMax M3.1 Flash(正式ID MiniMax-M3.1-Flash-Preview)は、MiniMaxのMシリーズ最新モデルです。1,000,000トークンのコンテキストウィンドウと調整可能な思考の深さを備えたマルチモーダルのコーディングモデルで、2026年9月27日にMiniMax CodeとToken Plan内でプレビューとして登場しました。高速な日常のコーディングやエージェント作業向けです。こうしたモデルにAPIの向こう側で待機させるのではなく実際の仕事をさせたいなら、eeselのようなAIチームメイトがそれを仕事に変える層になります。
MiniMax M3.1 Flashの料金はいくらですか?
MiniMax M3.1 Flashにはトークン単価が公表されていません。現時点ではToken PlanとMiniMax Codeでのみ利用可能なため、コストはサブスクリプション料金を利用量で割ったものになります。Token Planは月額$20(Plus)、$50(Max)、$120(Ultra)です。おおまかな目安として、同じ1Mコンテキストの兄弟モデルMiniMax M3は従量課金で100万トークンあたり$0.30/$1.20です。
MiniMax M3.1 Flashはオープンソースですか?Hugging Faceにありますか?
いいえ。オープンウェイトのMiniMax M3とは異なり、M3.1 Flashのプレビューには、2026年9月28日時点でHugging Faceのモデルカードも、ダウンロード可能なウェイトも、技術レポートもありません。MiniMax CodeとToken Plan内だけの、クローズドでプロダクト限定のプレビューです。
M3.1 FlashとMiniMax M3の違いは何ですか?
どちらも1Mコンテキストのマルチモーダルなコーディングモデルです。ドキュメントで実際に明記されている違いは、思考の深さを調整できる点です。M3.1 Flashは5段階(lowからmax)のeffortダイヤルを備え、より高速な「Flash」プレビュー層として位置づけられています。一方M3はフラッグシップで、出力速度は約100+トークン/秒とされています。
MiniMax M3.1 Flashで思考をオフにできますか?
いいえ。思考は常にオンで、無効にはできません。effort: "none"やthinking: disabledを送ると400エラーが返ります。レイテンシやトークン使用量を減らしたい場合は、思考をオフにするのではなくeffortのレベルを下げてください。

Share this article

Rama Adi

Article by

Rama Adi

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Shadow、Mac向けAIインターフェースのレビューカバーイラスト
Trending

Shadowレビュー(2026年):Mac向けAIインターフェース

実際に使ってみたShadowのレビュー。ボット不要でMac上のミーティングをデバイス内で文字起こしし、ショートカットからカスタムSkillsを実行できる、月額8ドルのAIインターフェース。

KiraKiraJul 8, 2026
Exaのディープリサーチエージェントがウェブ全体から構造化データを集めるイラスト
Trending

Exa Agent Ultraの料金:2026年のディープリサーチの実際のコスト

Exa Agent Ultraに定価はありません。従量課金の仕組み、実際の1回の実行でいくら請求されるか、1回あたり20ドルの上限がどこで効くかを解説します。

Rama AdiRama AdiSep 27, 2026
暗く抽象的な計算処理の背景にGrokのロゴを配置したGrok 4.7代替のヒーローバナー
Trending

Grok 4.7の代替: 2026年に比較すべき6つのモデル

2026年におけるGrok 4.7の最良の代替を、価格、コンテキスト、オープンウェイト、それぞれの得意分野で比較。そもそもモデルが必要かどうかの見極め方も解説する。

Kurnia KharismaKurnia KharismaSep 23, 2026
暗く抽象的なコンピュート背景にGrokのロゴを配置したGrok 4.7レビューのヒーローバナー
Trending

Grok 4.7レビュー: xAIの低価格フロンティアモデルは本当に良いのか?

実際に使ってみたGrok 4.7レビュー。得意なこと、Fable 5.1やGPT-5.6 Solにまだ負けている点、実際の料金、Fast版の割増料金、そして誰が実際に使うべきかを解説します。

Rama AdiRama AdiSep 23, 2026
片側にTasklet、もう片側にManus。緑色のVSの仕切りで分けられた、2つのクレジット制AIエージェントの対決。
Trending

Tasklet vs Manus:実際に仕事をこなすAIエージェントはどちらか?(2026年版)

Tasklet はスタック全体で常時稼働の自動化を実行し、Manus は1つのプロンプトから成果物をまるごと作り上げる。どちらもクレジット制で課金する。2026年、この2つのAIエージェントが実際にどう違うのかを解説する。

Kurnia KharismaKurnia KharismaSep 23, 2026
GrokのロゴマークとAPIトークンコスト表が入ったGrok 4.7料金のヒーローバナー
Trending

Grok 4.7の料金:APIトークンコスト、階層、そしてFast課金

Grok 4.7の料金を徹底解説:2ドル/6ドルのトークン単価、20万トークンで発生するロングコンテキストの崖、ほとんどのコストモデルが見落とすツール呼び出し課金、Fast課金、実際にどこで購入できるか、そしてGPT-6 SolやFable 5.1との比較。

Kurnia KharismaKurnia KharismaSep 23, 2026
暗く抽象的なコンピュートを背景に、GrokのロゴをあしらったGrok 4.7ローンチのヒーローバナー
Trending

Grok 4.7: xAIの新しいフロンティアモデルが実際に変えるもの

Grok 4.7を明快に解説: Grok 4.6からの変更点、仕様、実際の料金とFastバリアントの割増、GPT-5.6 SolやFable 5.1とのベンチマーク比較、そして誰に向いているか。

KiraKiraSep 23, 2026
片側でGrok Botがあなたのアプリにサインインし、もう片側でZapier Agentsが9,000個のアプリのワークフローグリッド上に構築されている様子を、中央で分割して示した図。
Trending

Grok Bot vs Zapier Agents:実際に仕事をこなすAIエージェントはどちらか?(2026年)

Grok Botはあなたのアプリにサインインして操作し、Zapier Agentsは最大級のアプリコネクタのグラフの上に構築され、アクティビティ単位で課金される。2026年時点でこの2つのAIエージェントが実際にどう違うのかを解説する。

Rama AdiRama AdiSep 23, 2026
TypeSafe Jev、初のSystem One AIモデルを紹介するイラスト付きヒーローバナー
Trending

TypeSafe Jev: 初のSystem Oneモデルを解説

TypeSafe Jevをわかりやすく解説。System Oneモデルは、非構造化の状態を、コードが信頼できる型付きのYes/No・選択・スコア判定に変換します。

KiraKiraSep 21, 2026

AIチームメイトを採用する準備はできましたか?

数分でセットアップ。クレジットカード不要。

無料で始める