MiniMax M3.1 Flash: Specs, Preise und wie du die Preview testest

Rama Adi
Geschrieben von

Rama Adi

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet September 28, 2026

Expertengeprüft
Illustration einer startenden Rakete als Sinnbild für die Veröffentlichung des Modells MiniMax M3.1 Flash

Ein Modell, das vor seiner eigenen Pressemitteilung erschien

Die meisten Modellstarts bestehen aus einem Blogpost, einem Benchmark-Diagramm und einer Modellkarte, alles auf einmal. M3.1 Flash lief andersherum. Es erschien im Modellauswahlmenü von MiniMax Code, neben M3 und M2.7, und die Community fand es dort, bevor MiniMax ein Wort sagte. Der Entwickler, der es entdeckte, bemerkte sofort das neue Reasoning-Menü:

"🚨重磅!MiniMax M3.1-Flash 预览版疑似已上线 MiniMax Code!推理等级单独成菜单:low / medium / high / xhigh / max。目前还没有官方公告,属于先露在产品里的灰度上线。" (Übersetzung: „Große Neuigkeit! Die Preview von MiniMax M3.1-Flash scheint in MiniMax Code live zu sein. Die Reasoning-Stufen haben ein eigenes Menü: low / medium / high / xhigh / max. Noch keine offizielle Ankündigung, es ist ein gestaffelter Rollout, der zuerst im Produkt sichtbar wird.“)

Der Rollout kam auch mit einem leichten Seufzer an. MiniMax hat zuletzt in hohem Tempo Video- und Musikmodelle veröffentlicht, die M-Serie (Text) war ruhig geworden, und die meistgeliked Antwort unter dem Launch-Post las sich wie liebevolle Ungeduld:

"You finally remembered the M series"

Auch der Hype hat eine Vorgeschichte. Tagelang hatten Entwickler ein kostenloses Stealth-Modell namens „Space Bunny“ ausgereizt und gerätselt, was dahintersteckt. Die Antwort kam wenige Tage vor dem Launch:

"Confirmed, Space Bunny Alpha is Minimax M3.1"

Die Aufregung ist also echt, aber der „Launch“ ist eine gestaffelte Preview, die zuerst im Produkt landet. Wenn du entscheidest, ob du darauf aufbaust, zählt diese Unterscheidung mehr als der Hype: Eine Grey-Rollout-Preview ohne Preis und ohne Gewichte ist nicht dieselbe Verpflichtung wie ein GA-Modell.

Was MiniMax M3.1 Flash tatsächlich ist

Lässt man das Launch-Theater weg, sind die Plattform-Docs bei der Substanz klar. In der Tabelle der unterstützten Modelle wird M3.1 Flash als "frontier multimodal coding model with 1M context window and tunable thinking depth" beschrieben, gebaut für agentisches Reasoning, Tool-Nutzung, Coding und strukturierte Aufgabenausführung. Es nimmt Text, Bilder und Video als Eingabe.

Der 1M-Kontext ist die Kernspezifikation, und er ist ein echter Sprung innerhalb der M-Serie, keine Marketing-Rundung. Die gesamte M2-Familie endete bei 204.800 Tokens; die M3-Generation, M3.1 Flash eingeschlossen, ist ein glatter Faktor fünf.

Balkendiagramm zum Vergleich der Kontextfenster von MiniMax-Modellen: die M2.x-Familie mit 204.800 Tokens gegenüber MiniMax M3 und M3.1 Flash mit 1.000.000 Tokens
Balkendiagramm zum Vergleich der Kontextfenster von MiniMax-Modellen: die M2.x-Familie mit 204.800 Tokens gegenüber MiniMax M3 und M3.1 Flash mit 1.000.000 Tokens

Das legen die Docs fest, und das nicht:

AttributMiniMax M3.1 Flash
Modell-IDMiniMax-M3.1-Flash-Preview
Kontextfenster1.000.000 Tokens
EingabemodalitätenText, Bild, Video
DenkenStandardmäßig an, einstellbar über effort, nicht abschaltbar
VerfügbarkeitNur Token Plan + MiniMax Code
Offene GewichteKeine (keine Hugging-Face-Karte)
ParameterzahlNicht angegeben
Durchsatz (tps)Nicht angegeben
Preis pro TokenNicht veröffentlicht

Die Tabelle ist bewusst ehrlich bei den Lücken. Es gibt keine angegebene Parameterzahl, keinen offiziellen Tokens-pro-Sekunde-Wert und keine Benchmark-Suite speziell für M3.1 Flash. Wenn dir eine Seite sagt, das Modell habe „428B Parameter“ oder einen Benchmark-Score nennt, stammt das vom Eltern-Modell M3 und nicht von M3.1 Flash. Ich weise lieber auf die Lücke hin, als sie zu überdecken.

Der eine Regler, der es definiert: effort

Das einzige Feature, das die Docs für M3.1 Flash hervorheben und nicht für M3, ist die einstellbare Denktiefe. Das Modell denkt immer nach, bevor es antwortet, und du steuerst mit einer effort-Einstellung, wie stark es denkt. Sie akzeptiert low, medium, high, xhigh und max. Lässt du sie weg, gilt max.

Ein Regler mit den fünf Effort-Stufen von low bis max, max als Standard markiert, Pfeile für schneller und weniger Tokens gegenüber tieferem Reasoning und ein Hinweis, dass sich das Denken nicht abschalten lässt
Ein Regler mit den fünf Effort-Stufen von low bis max, max als Standard markiert, Pfeile für schneller und weniger Tokens gegenüber tieferem Reasoning und ein Hinweis, dass sich das Denken nicht abschalten lässt

Das Detail, über das man stolpert: Du kannst das Denken nicht abschalten. Sendest du thinking: {"type": "disabled"} oder effort: "none", gibt die API einen 400 mit der Meldung requires adaptive thinking zurück (Docs). Brauchst du geringere Latenz oder weniger Ausgabe-Tokens, drehst du effort auf low; einen Modus ohne Denken gibt es nicht. Das ist eine echte Design-Entscheidung, und du solltest sie kennen, bevor du das Modell in einen latenzkritischen Pfad einbaust. Bei einem „Flash“-Modell ist max als Standard etwas überraschend, und es heißt, dass das günstige, schnelle Verhalten, das man vom Namen erwartet, erst aktiviert werden muss.

Ist es wirklich schnell?

MiniMax hat keinen Durchsatzwert veröffentlicht, die einzigen echten Geschwindigkeitsdaten stammen also von Entwicklern, die es am ersten Tag getestet haben. Die meistzitierte Messung liegt bei der Decode-Geschwindigkeit in einem soliden, aber nicht führenden Bereich:

"MiniMax-M3.1-flash-preview is hanging around 90 - 110 t/s range for decode. It's fast, love seeing it, def faster than MiMo-v2.6-flash but not as fast as deepseek-v4.1-flash"

Das ist die ehrliche Einordnung: schnell, vor manchen Flash-Konkurrenten, hinter anderen. Und nicht jeder findet, dass die reine Decode-Geschwindigkeit das Richtige zum Feiern ist:

"Decode speed is not equivalent to fast. The model is slow for the quality in my opinion, numbers dropping soon!"

Ich finde, der Skeptiker hat einen Punkt. Ein Modell, das standardmäßig auf max Effort läuft und nicht aufhören kann zu denken, fühlt sich bei echten Aufgaben langsamer an, als eine Tokens-pro-Sekunde-Zahl vermuten lässt, weil es vor der Antwort viele Reasoning-Tokens erzeugt. Die nützliche Frage ist nicht „wie viele Tokens pro Sekunde“, sondern „wie lange, bis ich eine korrekte Antwort habe, die ich ausliefern kann“, und diesen Benchmark hat für M3.1 Flash noch niemand gefahren.

Die Architektur darunter

Die Docs wiederholen die Interna für M3.1 Flash nicht, fair ist es also, die Architektur als von der M3-Generation geerbt zu behandeln und nicht als bestätigte M3.1-Flash-Spezifikation. Die M3-Linie führte MiniMax Sparse Attention (MSA) ein, ein Sparse-Attention-Design, das einen Kontext von einer Million Tokens praktikabel statt ruinös langsam macht.

MiniMax' eigener Vergleich mit Standard-Grouped-Query-Attention zeigt am klarsten, warum Sparse Attention bei dieser Kontextlänge wichtig ist:

MiniMax' Effizienzvergleich MSA gegenüber GQA: 28,4-fach weniger Attention-FLOPs pro Token, 14,2-fach schnelleres Prefilling und 7,6-fach schnelleres Decoding bei 1M Tokens, wie von MiniMax geteilt
MiniMax' Effizienzvergleich MSA gegenüber GQA: 28,4-fach weniger Attention-FLOPs pro Token, 14,2-fach schnelleres Prefilling und 7,6-fach schnelleres Decoding bei 1M Tokens, wie von MiniMax geteilt

Bei einer Million Tokens zeigt MiniMax' Diagramm, dass MSA den Attention-Rechenaufwand pro Token um etwa das 28-Fache senkt und das Decoding ca. 7,6-fach beschleunigt, verglichen mit Standard-Attention. Das sind Zahlen der M3-Generation. Da M3.1 Flash dasselbe 1M-Fenster hat, nutzt es sehr wahrscheinlich dieselbe Architektur, aber ich würde sie erst als gemessene M3.1-Flash-Spezifikation zitieren, wenn MiniMax eine veröffentlicht.

Was es kostet

Hier wird M3.1 Flash wirklich ungewöhnlich: Es gibt nirgends einen Preis pro Token. Es steht nicht in der Pay-as-you-go-Tabelle, und MiniMax' eigene Docs sagen, dass es vorerst nur über den Token Plan und MiniMax Code verfügbar ist. Die echten Kosten sind also dein Abo geteilt durch deine Nutzung.

Hier der Token Plan, ein gemeinsames Kontingent für Text, Bild und Sprache:

PlanMonatlichJährlich (2 Monate gratis)~M3-Tokens / MonatVideogenerierung
Plus20 $220 $~1,7 Mrd.Keine
Max50 $550 $~5,1 Mrd.3 Clips/Tag
Ultra120 $1.320 $~12,5 Mrd.5 Clips/Tag

Es gibt außerdem eine Prepaid-Option mit Credits (5 $ für 5.000, 25 $ für 25.000, 100 $ für 100.000, ein Jahr gültig) und keine kostenlose LLM-Stufe. Das Kontingent wird in rollierenden 5-Stunden- und Wochenfenstern zurückgesetzt, ungenutztes Monatskontingent verfällt.

Wenn du wissen willst, was eine öffentliche API womöglich einmal kostet: Das Schwestermodell MiniMax M3 mit 1M Kontext gibt es nutzungsbasiert. Das sind die Sätze von M3, nicht von M3.1 Flash, aber die Struktur dürfte ein Vorgeschmack sein:

MiniMax M3 (Standardstufe)InputOutputCache-Lesezugriff
≤ 512K Input0,30 $ /M1,20 $ /M0,06 $ /M
> 512K Input0,60 $ /M2,40 $ /M0,12 $ /M

Zwei strukturelle Punkte für später: eine Grenze bei 512K Input, ab der sich der Satz verdoppelt, und eine Priority-Servicestufe zum 1,5-fachen Standardsatz. Also günstig für die Klasse, aber mit eingebautem Aufschlag für langen Kontext.

So nutzt du es tatsächlich

Für eine Preview ist der Zugang überraschend entwicklerfreundlich. M3.1 Flash spricht zwei Protokolle: einen Anthropic-kompatiblen Endpunkt unter https://api.minimax.io/anthropic (MiniMax' empfohlener Weg, mit Thinking-Blöcken) und einen OpenAI-kompatiblen unter https://api.minimax.io/v1. Das effort-Feld sitzt je nach Protokoll an anderer Stelle: output_config.effort in der Anthropic-API, reasoning_effort in der OpenAI-API.

Weil es Anthropic- und OpenAI-kompatibel ist, kannst du bestehende agentische Coding-Tools direkt darauf richten. MiniMax nennt Claude Code, Cursor, Codex CLI und weitere als über den Token Plan unterstützt, ohne separaten API-Key. Das ist der eigentliche Anwendungsfall, auf den die Kombination „Flash + Preview“ zielt: ein günstiges, schnelles Standardmodell für alltägliches Coding und Agent-Loops, in den Tools, in denen Entwickler ohnehin arbeiten.

Wo ein solches Modell hinpasst

Das bringt mich zurück zum Gedanken vom Anfang. M3.1 Flash ist ein schneller Motor mit großem Kontextfenster und einem Denkregler. Das ist Infrastruktur. Es ist die rohe Fähigkeit, als Endpunkt bereitgestellt, und sie ist in dem, was sie tut, wirklich gut. Aber ein Endpunkt kennt dein Unternehmen nicht, sitzt nicht in deinem Helpdesk und verantwortet keine Aufgabe von Anfang bis Ende. All das musst du drumherum noch bauen.

Ein Zwei-Ebenen-Diagramm: Die untere Karte steht für das Modell als rohen Motor mit 1M Kontext, einstellbarem Effort und API-Endpunkt, die obere Karte für das Teammitglied, das für den Job eingestellt wird, dein Unternehmen kennt, sich in deine Tools einklinkt und die Arbeit ausliefert
Ein Zwei-Ebenen-Diagramm: Die untere Karte steht für das Modell als rohen Motor mit 1M Kontext, einstellbarem Effort und API-Endpunkt, die obere Karte für das Teammitglied, das für den Job eingestellt wird, dein Unternehmen kennt, sich in deine Tools einklinkt und die Arbeit ausliefert

Diese Lücke zwischen „einem fähigen Modell“ und „Arbeit, die tatsächlich erledigt wird“ ist der ganze Grund, warum es eesel gibt. eesel ist eine Plattform für KI-Teammitglieder: Statt dir ein Modell und einen leeren Editor zu geben, stellst du ein einsatzbereites Teammitglied für einen bestimmten Job ein. Aktuell gibt es einen KI-Helpdesk-Teammitglied, das sich in deine bestehende Support-Queue einklinkt, und einen KI-Blog-Writer, der Beiträge in deinem Stil recherchiert und entwirft. Jedes kommt schon mit dem Wissen für seine Rolle und bindet sich in die Tools ein, die du bereits nutzt.

Wenn du im Terminal zuhause bist, ist die eesel CLI der Teil, der sich nach dem Lesen einer Docs-Seite wie der von MiniMax am vertrautesten anfühlt. Es ist dasselbe Teammitglied wie im Dashboard, gesteuert über die Kommandozeile: Du kannst einen Helpdesk verbinden, Wissen hochladen, Automatisierungen verdrahten und zurückgehaltene Aktionen freigeben, ohne je die UI zu öffnen. Jeder Befehl gibt JSON aus, und Fehler kommen als strukturierte {error, hint, retryable}-Objekte zurück, sodass ein Coding-Agent wie Claude Code, Cursor oder Codex das gesamte Setup steuern kann, indem er das hint-Feld liest und entscheidet, was er als Nächstes ausführt. Jeder Workspace ist außerdem ein MCP-Server, derselbe Agent, der M3.1 Flash aufruft, kann also auch eesel aufrufen. Das Denkmodell ist einfach: Das Modell ist der Motor, den du verdrahtest; das Teammitglied ist die Person, die du einstellst.

eesel ausprobieren

Wenn dich M3.1 Flash begeistert, weil du KI echte Arbeit erledigen lassen willst und nicht nur API-Aufrufe beantworten, übernimmt eesel diese letzte Meile. Richte es auf deine bisherigen Tickets und dein Help Center, und das KI-Helpdesk-Teammitglied beginnt in Minuten, echte Antworten zu entwerfen. Oder gib dem KI-Blog-Writer ein Thema, und er recherchiert, entwirft und illustriert einen kompletten Beitrag in deinem Stil, genauso wie dieser hier entstanden ist.

Das Dashboard des eesel KI-Blog-Writers beim Entwerfen eines vollständigen Review-Beitrags, mit Recherche und dazu erzeugten Infografiken
Das Dashboard des eesel KI-Blog-Writers beim Entwerfen eines vollständigen Review-Beitrags, mit Recherche und dazu erzeugten Infografiken

Das Beste: Du kannst ihm bei der Arbeit zusehen, bevor du dich festlegst, denn eesel läuft zuerst gegen deine eigene Historie, sodass du die Qualität an deinen echten Tickets siehst und nicht an einer Demo. Der Einstieg ist kostenlos, ohne Kreditkarte, damit du selbst den Unterschied zwischen einem gemieteten Modell und einem eingestellten Teammitglied siehst.

Häufig gestellte Fragen

Was ist MiniMax M3.1 Flash?
MiniMax M3.1 Flash (vollständige ID MiniMax-M3.1-Flash-Preview) ist das neueste Modell der M-Serie von MiniMax: ein multimodales Coding-Modell mit einem Kontextfenster von 1.000.000 Tokens und einstellbarer Denktiefe. Es erschien am 27. September 2026 als Preview in MiniMax Code und im Token Plan und zielt auf schnelle, alltägliche Coding- und Agent-Aufgaben. Wenn du ein solches Modell eine echte Aufgabe erledigen lassen willst, statt es nur hinter einer API zu haben, macht ein KI-Teammitglied wie eesel daraus tatsächliche Arbeit.
Was kostet MiniMax M3.1 Flash?
Für MiniMax M3.1 Flash gibt es keinen veröffentlichten Preis pro Token. Aktuell ist es nur über den Token Plan und MiniMax Code verfügbar, die Kosten sind also dein Abo geteilt durch die Nutzung: Der Token Plan kostet 20 $/Monat (Plus), 50 $/Monat (Max) und 120 $/Monat (Ultra). Als grober Anhaltspunkt: Das Schwestermodell MiniMax M3 mit 1M Kontext kostet nutzungsbasiert 0,30 $/1,20 $ pro Million Tokens.
Ist MiniMax M3.1 Flash Open Source oder auf Hugging Face?
Nein. Anders als das Open-Weight-Modell MiniMax M3 hat die M3.1-Flash-Preview zum Stand 28. September 2026 keine Hugging-Face-Modellkarte, keine herunterladbaren Gewichte und keinen technischen Bericht. Sie ist eine geschlossene, produktgebundene Preview, nur in MiniMax Code und im Token Plan.
Wie unterscheidet sich M3.1 Flash von MiniMax M3?
Beides sind multimodale Coding-Modelle mit 1M Kontext. Der Unterschied, den die Docs tatsächlich nennen, ist die einstellbare Denktiefe: M3.1 Flash bietet einen Effort-Regler mit fünf Stufen (low bis max) und ist als schnellere „Flash“-Preview-Stufe positioniert, während M3 das Flaggschiff mit einer angegebenen Ausgabegeschwindigkeit von ca. 100+ Tokens/Sekunde ist.
Kann man das Denken in MiniMax M3.1 Flash abschalten?
Nein. Das Denken ist immer aktiv und lässt sich nicht deaktivieren: Wer effort: "none" oder thinking: disabled sendet, bekommt einen 400-Fehler. Um Latenz und Token-Verbrauch zu senken, reduzierst du stattdessen die effort-Stufe.

Share this article

Rama Adi

Article by

Rama Adi

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Handgezeichnete Illustration eines Entwicklers am Laptop, von dem Exa-Suchergebnisse und strukturierte Daten ausgehen
Trending

Exa Agent Ultra: Was es kann, wie es funktioniert und was es kostet

Ein verständlicher Blick auf Exa Agent Ultra: die Deep-Research-API mit Subagenten-Schwarm, die Benchmark-Angaben, die Preise pro Durchlauf und wo sie sich für Recherche und Support eignet.

Rama AdiRama AdiSep 27, 2026
Illustration des Deep-Research-Agenten von Exa, der strukturierte Daten aus dem gesamten Web zusammenträgt
Trending

Exa Agent Ultra Preise: Was Deep Research 2026 wirklich kostet

Exa Agent Ultra hat keinen Listenpreis. Hier erfahren Sie, wie die nutzungsbasierte Abrechnung funktioniert, was ein echter Lauf kostet und wo das Limit von 20 $ pro Lauf greift.

Rama AdiRama AdiSep 27, 2026
Grok 4.7 Alternativen Hero-Banner mit dem Grok-Logo vor einem dunklen abstrakten Compute-Hintergrund
Trending

Grok 4.7 Alternativen: 6 Modelle im Vergleich für 2026

Die besten Grok 4.7 Alternativen im Jahr 2026, verglichen nach Preis, Kontext, offenen Gewichten und dem, wofür jedes Modell wirklich gut ist, plus wie Sie erkennen, ob Sie überhaupt ein Modell brauchen.

Kurnia KharismaKurnia KharismaSep 23, 2026
Grok 4.7 Test Hero-Banner mit dem Grok-Logo vor einem dunklen, abstrakten Compute-Hintergrund
Trending

Grok 4.7 im Test: Ist xAIs günstiges Spitzenmodell wirklich gut?

Ein praxisnaher Grok-4.7-Test: Wo es stark ist, wo es gegen Fable 5.1 und GPT-5.6 Sol noch verliert, die echten Preise, die Fast-Variante-Aufpreis und wer es tatsächlich einsetzen sollte.

Rama AdiRama AdiSep 23, 2026
Tasklet auf der einen Seite und Manus auf der anderen, getrennt durch einen grünen VS-Trenner, im direkten Vergleich zweier Credit-basierter KI-Agenten.
Trending

Tasklet vs Manus: Welcher KI-Agent erledigt die Arbeit wirklich? (2026)

Tasklet betreibt durchgehend aktive Automatisierungen über deinen gesamten Stack; Manus baut aus einem einzigen Prompt ein komplettes Ergebnis. Beide rechnen per Credit ab. So unterscheiden sich die beiden KI-Agenten 2026 tatsächlich.

Kurnia KharismaKurnia KharismaSep 23, 2026
Grok 4.7 Preise Hero-Banner mit dem Grok-Logo und einer API-Token-Kostentabelle
Trending

Grok 4.7 Preise: API-Token-Kosten, Stufen und der Fast-Aufschlag

Eine vollständige Aufschlüsselung der Grok 4.7 Preise: die 2-$/6-$-Token-Raten, die Long-Context-Klippe bei 200k, die Tool-Call-Zähler, die die meisten Kostenmodelle übersehen, der Fast-Aufschlag, wo man es tatsächlich kaufen kann, und wie es im Vergleich zu GPT-6 Sol und Fable 5.1 abschneidet.

Kurnia KharismaKurnia KharismaSep 23, 2026
Grok 4.7 Launch-Hero-Banner mit dem Grok-Logo vor einem dunklen, abstrakten Compute-Hintergrund
Trending

Grok 4.7: was xAIs neues Spitzenmodell wirklich ändert

Ein klarer Blick auf Grok 4.7: was sich gegenüber Grok 4.6 ändert, die technischen Daten, die echten Preise inklusive Fast-Aufschlag, wie es im Vergleich zu GPT-5.6 Sol und Fable 5.1 abschneidet, und für wen es sich eignet.

KiraKiraSep 23, 2026
Grok Bot meldet sich auf der einen Seite in deinen Apps an, Zapier Agents ist auf der anderen Seite über ein Workflow-Raster mit 9.000 Apps aufgebaut, in der Mitte geteilt.
Trending

Grok Bot vs Zapier Agents: welcher KI-Agent erledigt die Arbeit? (2026)

Grok Bot meldet sich in deinen Apps an und steuert sie; Zapier Agents bauen auf dem größten App-Connector-Netzwerk auf und rechnen nach Aktivität ab. So unterscheiden sich die beiden KI-Agenten 2026 wirklich.

Rama AdiRama AdiSep 23, 2026
Illustriertes Hero-Banner für TypeSafe Jev, das erste System-One-KI-Modell
Trending

TypeSafe Jev: das erste System-One-Modell, erklärt

Ein verständlicher Leitfaden zu TypeSafe Jev, dem System-One-Modell, das unstrukturierten Zustand in typisierte Ja/Nein-, Auswahl- und Bewertungsentscheidungen verwandelt, auf die Ihr Code sich verlassen kann.

KiraKiraSep 21, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten