senn-techsenn-tech
KI-News
KI-News2026-10-02· Von Franz Senn

MiniMax M3.1 Flash: was das Testvideo zeigt und was davon belegbar ist

WorldofAI hat am 1. Oktober 2026 ein 21-minütiges Video zu MiniMax M3.1 Flash Preview eingestellt, bis zum 2. Oktober rund 36.000 Aufrufe. Der Tester baut damit einen Ego-Shooter im Stil von Call of Duty Zombies, einen macOS-Nachbau samt Minecraft-Klon als eigener App, eine Produktseite für Kopfhörer, eine Landingpage für eine Grafikkarte und ein 3D-Dorfgelände. Sein Urteil: Ein Modell aus der Flash-Klasse liefere Qualität in der Nähe der Spitze und koste ihn als Abonnenten nichts. Für eine Beschaffungsentscheidung brauchbar ist nur die zweite Hälfte dieser Aussage, alles andere steht im Video.

Kontextfenster der M-Serie in TokenM2.7204800 · 204.800M2.7-highspeed204800 · 204.800M31000000 · 1.000.000M3.1 Flash1000000 · 1.000.00001100000
Die Million Token gehören zur M3-Generation und sind keine Sonderansage der Vorschau. Richtwerte für den Durchsatz nennt MiniMax für die anderen Modelle, für M3.1 Flash keins. (Quelle: MiniMax API Docs, Model Invocation)

Was das Video zeigt

Die gezeigten Ergebnisse sind gut, das gehört zuerst drauf. Der Shooter bringt Runden, Barrikaden, ein Kaufmenü, mehrere Räume, eine Taschenlampe und einen Automaten mit Waffenaufwertung. Der macOS-Nachbau hat eine Menüleiste mit Akkumodus, Spotlight, einen funktionierenden App Store, Terminal, Aktivitätsmonitor, eine Musik-App und einen Minecraft-Klon, in dem Blöcke und Licht gesetzt werden und das Crafting funktioniert. In einer Gegenüberstellung mit Claude Fable 5.1 auf mittlerer Denkstufe gibt der Tester eine Stunde Laufzeit gegen zwei Stunden an und nennt „über 150 Token pro Sekunde“. Er schränkt selbst ein, dass er kein gleichwertiges Ergebnis zu Opus behauptet.

Zwei Details an diesem Video sind Vorsicht wert. Die Vergleichsgegner sind aus dem Ton kaum zu rekonstruieren, die automatischen Untertitel verschlucken die Modellnamen, „GBT6 Soul“ ist so ein Artefakt. Und die Zahl von 150 Token pro Sekunde fällt zwischen zwei Spielszenen, gemessen wird sie dort nicht. MiniMax nennt in der Modellübersicht für M3 rund 100 Token pro Sekunde und für M3.1 Flash keine Zahl.

Was die Doku hergibt

Die Modellübersicht von MiniMax beschreibt M3.1 Flash Preview als „frontier multimodal coding model with 1M context window and tunable thinking depth“. Kontextfenster eine Million Token, Eingaben Text, Bild und Video, Ausgabe Text. Die Denktiefe steht im Feld effort, zulässig sind low, medium, high, xhigh und max, und wer das Feld weglässt, bekommt max. Abschalten lässt sich das Denken nicht: thinking: {"type": "disabled"} oder effort: "none" bringt eine Antwort mit Status 400 und dem Text „requires adaptive thinking“. Für einen Latenzpfad ist das der wichtigste Satz im Dokument, serienmäßig läuft ein Flash-Modell hier in der teuersten Stufe.

Verfügbar ist das Modell nach zwei Stellen der Doku ausschließlich über den M Plan und über MiniMax Code. Zu Parameterzahl, Architektur, technischem Bericht und Modellkarte schweigt die Doku. In den Modell-Release-Notes enden die jüngsten Einträge mit H3 vom 31. Juli 2026, Musik vom 16. Juli und M3 vom 1. Juni, zur Vorschau fehlt dort jeder Eintrag. In der Pay-as-you-go-Liste taucht M3.1 Flash nicht auf, M3 schon.

Was unabhängig gemessen ist

Artificial Analysis führt das Modell nicht. Die vollständige Modelliste der Leaderboard-Seite nennt von MiniMax M1, M2, M2.1, M2.5, M2.7 und M3, ein Modell M3.1 kommt darin am 2. Oktober 2026 nicht vor. Das ist die logische Folge des fehlenden Zugangs: ohne öffentliche API keine Messung, ohne Messung keine Zahl außer der des Anbieters. Auch die in Foren kursierenden 90 bis 110 Token pro Sekunde hat kein Prüfstand erzeugt.

Kosten pro Index-Aufgabe in DollarOpus 5.5 (max)5.98Sonnet 5.5 (max)7.67Fable 5.1 (high)3.91Opus 5.5 (medium)1.34MiniMax-M30.51 · Index 2908
Gemessene Kosten je Aufgabe im Intelligenz-Index, mit Opus 5.5 (max) als Preisanker für die teure Klasse. Für M3.1 Flash existiert kein solcher Wert, die Preislücke ist bei MiniMax also belegt, die Qualitätslücke nur für den offenen Zwilling M3. (Quelle: Artificial Analysis LLM Leaderboard)

Gemessen ist der offene Zwilling. MiniMax-M3 steht bei Artificial Analysis mit 29 Punkten im Intelligenz-Index, 87,6 Token pro Sekunde Ausgabe, 0,51 Dollar pro Index-Aufgabe, 428 Milliarden Gesamtparametern bei 23 Milliarden aktiven und der MiniMax Community License, Stand 2. Oktober 2026. Opus 5.5 kommt im selben Messlauf auf 58 Punkte. Der Preisunterschied zwischen den Klassen ist also real, und ein Teil davon ist ein echter Qualitätsunterschied. Zu M3 hatten wir im Juni geschrieben, Details zur Sparse Attention und zum Datenschutz siehe Beitrag zu M3.

„Kostenlos“ heißt hier: Aktion

Der M Plan kostet 22 Dollar (Go), 55 Dollar (Explore) und 132 Dollar (Build) im Monat. In allen drei Stufen ist M3.1 Flash Preview das Textmodell, die Nutzung skaliert mit Faktor 1, 3 und 7,5. Auf den ersten Monat bei monatlicher Zahlung gewährt MiniMax bis 14. Oktober 50 Prozent Nachlass, jährliche Zahlung ist ausgenommen. Die im Video gepriesene Gratisphase stammt aus einer Werbeaktion zum chinesischen Nationalfeiertag: doppelte Tages-Credits beim täglichen Check-in vom 28. September bis 7. Oktober (UTC+8), dazu zurückgesetzte Kontingente der alten Token-Pläne. Beides steht in Presseberichten über die Ankündigung, in der Doku ist davon nichts. Als Anhalt für die Preisordnung bleibt der M3-Eintrag der Pay-as-you-go-Liste: 0,30 Dollar je Million Eingabetoken, 1,20 Dollar je Million Ausgabetoken, oberhalb von 512.000 Eingabetoken jeweils das Doppelte, der Priority-Tier mit dem 1,5-fachen Satz.

Ein EU-Punkt, den kaum jemand nennt

MiniMax veröffentlicht zu seinen Basismodellen die Zusammenfassung der Trainingsinhalte nach Artikel 53 Absatz 1 Buchstabe d der EU-KI-Verordnung und verlinkt sie in seiner Doku. Auf dieser Transparenzseite stehen M3 und H3, für M3.1 Flash Preview fehlt sie am 2. Oktober 2026. Für einen Betreiber in der EU bedeutet das: Die Einordnung, welche Daten in dieses Modell geflossen sind, muss er sich für die Vorschau selbst besorgen, obwohl das Modell nur über ein Abo läuft. Wer Nachweispflichten für KI-Dienste plant, klärt vor dem Testabo, welche Dokumentation es für genau diese Version gibt, siehe Nachweis nach Artikel 4.

Was das für unseren Eigenbetrieb bedeutet

M3.1 Flash kommt als Kandidat für die eigene Strecke nicht infrage, es gibt nichts zum Herunterladen. Ein Blick auf die Organisationsseite von MiniMax auf Hugging Face bestätigt das am 2. Oktober: offene Sprachmodelle sind M3 (inklusive MXFP8-Variante) und M2.7, dazu H3 für Video, ein Repository zur Vorschau existiert nicht.

Für M3 liefert MiniMax eine Self-Hosting-Anleitung, und die entscheidet die Rechnung. Referenzaufbau sind acht B200 auf einem Knoten mit Tensor-Parallelität 8, die MXFP8-Gewichte belegen rund 444 GB, für H200-Systeme rechnet MiniMax mit BF16 und rund 854 GB. Der Support läuft über ein SGLang-Entwicklerbild, der Status heißt im Original „Experimental“, validiert sind Eingaben von 1.000 bis 128.000 Token. MiniMax schreibt ausdrücklich dazu, dass 23 Milliarden aktive Parameter nicht heißen, dass nur 23 Milliarden im Speicher liegen müssen.

Unsere KI-Strecke läuft auf vier RTX 5090 mit zusammen 128 GB Grafikspeicher, beschrieben im Vier-Tage-Test und im Vergleich zweier vLLM-Builds. 444 GB Gewichte gegen 128 GB Speicher sind dieselbe Rechnung wie 854 GB gegen 128 GB: M3 geht in dieser Maschine in keiner Präzision. Wer die Klasse mit vollem Million-Token-Kontext im Eigenbetrieb will, braucht einen anderen Hardwarepfad, siehe offene gegen geschlossene Modelle.

Nebenbefund: unser eigener DNS blockt den Anbieter

Beim Prüfen dieser Quellen ist am 2. Oktober 2026 etwas aufgefallen, das mit MiniMax nichts zu tun hat und trotzdem hierher gehört. platform.minimax.io, www.minimax.io, agent.minimax.io und api.minimax.io beantworten über unseren Technitium-Cluster mit 0.0.0.0. Die Antwort kommt aus einer abonnierten Blockliste, konkret der Spam-Liste von RPiList. Erreichbar sind die Seiten über jeden Resolver, der diese Liste nicht nutzt; für diesen Beitrag haben wir per DNS-over-HTTPS aufgelöst. Für den Betrieb bedeutet das: Meldet jemand, eine KI-Seite sei tot, ist die erste Frage, ob eine Blockliste die Domain enthält, und ob der Anbieter wirklich ausgefallen ist. Ob eine Anbieterdomain auf die Freigabeliste gehört, braucht eine Entscheidung mit Begründung.

Vier Fragen fürs nächste Demo-Video

Ein Video, das ein Modell in die Nähe von Opus rückt, ist eine Beobachtung, kein Ergebnis. Vor jedem Testlauf in unserer Strecke stehen diese vier Fragen im Raum.

  • Gibt es offene Gewichte, und unter welcher Lizenz stehen sie?
  • Gibt es eine unabhängige Messung, auf welcher Index-Fassung und mit welcher Provider-Konfiguration?
  • Was kostet eine unserer typischen Aufgaben in einem Abo, mit der Denkstufe, die der Auftrag braucht?
  • Welche Nachweise liefert der Hersteller für genau diese Modellversion?

Bei M3.1 Flash Preview ist keine davon sauber beantwortet: Gewichte fehlen, eine Messung fehlt, ein Preis pro Aufgabe fehlt, die Trainingsdaten-Zusammenfassung der Version fehlt. Das Modell bleibt auf unserer Beobachtungsliste, und wir wiederholen die Bewertung, sobald MiniMax Gewichte, Preis oder Modellkarte nachliefert.

Weiterführende Quellen

Fragen?
Können wir MiniMax M3.1 Flash selbst hosten?+

Nein. Für die Vorschau gibt es keine Gewichte, der Zugang läuft ausschließlich über den M Plan und über MiniMax Code. Der offene Zwilling MiniMax-M3 läuft im Eigenbetrieb, laut MiniMax auf acht B200 in einem Knoten mit rund 444 GB Gewichten in MXFP8. Das ist eine andere Hardwareklasse als unsere Lane mit vier RTX 5090.

Wenn die Demos so gut sind, warum trotzdem zweifeln?+

Weil eine Demo keine Messung ist und im Moment niemand messen kann. Artificial Analysis führt das Modell in seiner vollständigen Modelliste nicht, in den Modell-Release-Notes von MiniMax steht kein Eintrag dazu, und ohne öffentlichen API-Zugang kommt kein Benchmarker heran. Die Zahl, die für unsere Anwendungsfälle zählt, müssen wir über ein Abo selbst erzeugen.

Stimmt es, dass das Modell kostenlos ist?+

Die kostenlose Phase ist eine Aktion. MiniMax wirbt laut Presseberichten mit doppelten Tages-Credits vom 28. September bis 7. Oktober und hat beim Start die Kontingente der alten Token-Pläne zurückgesetzt. Der Regelpreis des M Plan steht in der Doku: 22, 55 und 132 Dollar im Monat, erste Monatshälfte bis 14. Oktober halbiert. Ein Preis pro Million Token existiert für dieses Modell nicht.