senn-techsenn-tech
KI & Entwicklung
KI & Entwicklung2026-10-07· Von Franz Senn

Mistral Large 4 im Feld der offenen Gewichte: Indexwerte, Preise und die Bytes dahinter

Mistral hat Mistral Large 4 vorgestellt, ein gemischt-expertiges Modell mit rund einer Billion Parameter, und die Veröffentlichung der Gewichte für Ende Oktober angekündigt. Der heise-Beitrag dazu beschreibt das als Anschluss an die Spitze. Wir haben zwei Dinge nachgeprüft: Was sagt eine unabhängige Messstelle über die Qualität, und was die Gewichte wiegen, wenn sie da sind. Dafür haben wir die Checkpoint-Größen der Vergleichsmodelle über die Hugging-Face-API ausgemessen und unsere eigene Inferenz-Lane unter Last gemessen. Der Indexwert ist die einzige Qualitätszahl hier, die nicht vom Hersteller kommt.

Markenzeichen von Mistral AI, gestufte Balken in Gelb, Orange und Rot
Mistral nennt das Modell im Ankündigungstext le Chonk, inoffiziell ML4. Die Markengrafik stammt aus der Commons-Sammlung, alle Herstellerzahlen dieses Beitrags aus der offiziellen Ankündigung und dem Modell-Datenblatt, abgerufen am 7. Oktober 2026. (Quelle: Wikimedia Commons, Datei Mistral AI logo (2025–).svg)

Was Mistral nennt und was gemessen wurde

Die offizielle Ankündigung heißt Introducing Mistral Large 4 und bringt die eigenen Messdiagramme mit. Dort steht das Modell mit rund 1.000 Milliarden Parametern und 49 Milliarden aktiven, im Datenblatt mit 1,05 Billionen und 52 Milliarden. Trainiert sei von Grund auf auf 3.800 Grace Blackwell in den eigenen europäischen Rechenzentren, der Reinforcement-Lauf mit 3.000 GPUs liefere 33 Milliarden Token am Tag, davon rund 16 Milliarden lernbare. Ein erheblicher Teil der Trainingsdaten sei mehrsprachig und umfasse über 160 Sprachen, darunter jede Amtssprache der Europäischen Union.

Auf Coding nennt die Seite DeepSWE v1.1 mit 61,7 Prozent, SWE-Atlas-QnA mit 59,4 Prozent und Terminal-Bench 4 mit 28,3 Prozent, zusammen als Coding-Agent-Index 49,8 Prozent, womit DeepSeek V4 Pro vom 13. August und Qwen3.8 Max überschritten seien. Lakera meldet 93,3 Prozent auf Sicherheitsstufe B3, die Bewertungsmessung KORA 1,691 von 2. Im Cyber-Index von Artificial Analysis will Mistral unter den besten fünf weltweit liegen, mit 82 Prozent beim Nachbau und Patchen einer echten Lücke in offener Software. Die Begründung für den Abstand ist der bemerkenswerteste Satz der Seite: Claude Opus 5.5 und GPT-6 Astra lagen auf demselben Test nahe null, weil sie die Arbeit verweigern.

Den Vergleich mit China stellt Mistral selbst her. In der blinden Human-Evaluation von Surge AI über echte Coding-Aufgaben erhielt Large 4 im Schnitt 3,74 von 5 Punkten, Rang 2 von 5: vor Kimi K3 mit 3,59 und GLM-5.3 mit 3,60, hinter Claude Opus 5 mit 4,22. Auf AutomationBench mit 657 Geschäftsprozessen nennt die Seite 59,9 Prozent und sieht damit Kimi K3, MiMo-V2.6-Pro und DeepSeek V4 Pro geschlagen. Bei der Bildortung (Dense 200) stehen 42 Prozent gegen 41 Prozent für GPT-6 Astra. Alles Herstellerangaben mit eigenen Diagrammen, die wir nicht nachrechnen können. Genannt werden sie hier, weil sie die Größen nennen, die wir messen können: Index, Preis und Bytes.

Anders die Werte von Artificial Analysis, Stand 7. Oktober 2026. Die Vorschau von Large 4 liegt dort beim Intelligence Index v4.3.2 bei 38 Punkten, Rang 64 von 225 Modellen in der Vergleichsklasse, bei einem Klassenmedian von 26. Die Ausgabegeschwindigkeit beträgt 116,1 Token pro Sekunde, die Zeit bis zum ersten Antwort-Token 1,46 Sekunden. Für den Index hat das Modell 200 Millionen Ausgabe-Token produziert, der Median der Klasse liegt bei 81 Millionen. Daraus rechnet Artificial Analysis 1,13 Dollar pro Aufgabe. Als Kontextfenster stehen 524.000 Token gemessen gegenüber einer Million angegeben. Geführt ist es dort als proprietär, weil die Gewichte noch nicht geladen sind.

Die Preiskarte kennt zwei Ebenen: befristete Aktionspreise von 0,68 Dollar je Million Eingabe- und 2,09 Dollar je Ausgabe-Token, dauerhafte Listenpreise von 1,36 und 4,18 Dollar. Der Vergleich mit den offenen Konkurrenzmodellen unten rechnet mit den Listenpreisen.

Intelligence Index, gleiche SkalaMiMo-V2.6-Pro46 · Xiaomi, MITGLM-5.345 · Z.ai, mit AuflagenKimi K344 · Moonshot, mit AuflagenDeepSeek V4.1 Flash39 · MITMistral Large 4 (Vorschau)38 · Gewichte fehlenQwen3.8 27B34 · Apache 2.0Mistral Medium 3.514 · 128 Mrd., modifiziertes MITMistral Small 411 · 119 Mrd., Apache 2.0052
Artificial Analysis Intelligence Index v4.3.2, Werte je Modellseite, abgerufen am 7. Oktober 2026. Large 4 läuft in der proprietären Vergleichsklasse mit einem Median von 26, die kleine offene Klasse hat einen Median von 8. (Quelle: Artificial Analysis)

Vier Modelle aus China auf derselben Skala

Die Tabelle steht auf je einer eigenen Modellseite bei Artificial Analysis. Alle Werte am 7. Oktober 2026 abgerufen.

ModellIndexToken/s$/M Eingabe$/M Ausgabe$ pro AufgabeKontextParameter gesamt/aktivLizenz
MiMo-V2.6-Pro (Xiaomi)4646,50,430,870,131M1,0 Bio / 42 MrdMIT
GLM-5.3 (Z.ai)4577,21,404,402,011M753 Mrd / 40 Mrdeigene, mit Auflagen
Kimi K3 (Moonshot)4443,73,0015,002,001M2,8 Bio / 104 Mrdeigene, mit Auflagen
DeepSeek V4.1 Flash39227,90,301,200,271M552 Mrd / 16 MrdMIT
Mistral Large 4 (Vorschau)38116,11,364,181,13524k1,05 Bio / 52 Mrdnoch keine
Qwen3.8 27B (Alibaba)3447,10,503,001,01256k27 MrdApache 2.0
Mistral Medium 3.514170,01,507,500,50256k128 Mrdmodifiziertes MIT
Mistral Small 411171,30,150,600,02256k119 Mrd / 6,5 MrdApache 2.0

Die Zeilen sagen zwei Dinge. Das Xiaomi-Modell MiMo-V2.6-Pro spielt in derselben Größenklasse wie Large 4, hat 1,0 Billionen Parameter, eine MIT-Lizenz und liegt beim Index acht Punkte vorn. Pro Index-Aufgabe kostet es 0,13 Dollar gegen 1,13 Dollar, also etwa ein Neuntel. Und DeepSeek V4.1 Flash erreicht fast denselben Indexpunkt wie die Large-4-Vorschau, liefert die doppelte Ausgabegeschwindigkeit und kostet pro Aufgabe einen Bruchteil. Mistrals eigene Modelle im mittleren und kleinen Segment, Medium 3.5 und Small 4, sind schnell und billig, liegen beim Index aber weit zurück.

Markenzeichen von Xiaomi
MiMo-V2.6-Pro ist ein Xiaomi-Modell: 1,0 Billionen Parameter, MIT-Lizenz, Index 46 und 0,13 Dollar pro Aufgabe. Der Index-Leader dieser Skala kommt aus China und ist frei nutzbar. (Quelle: Simple Icons, Datei xiaomi.svg)
Logo von DeepSeek
DeepSeek V4.1 Flash hält 39 Indexpunkte bei 227,9 Token pro Sekunde, 510 GB Gewichten und MIT-Lizenz. Das ist das Modell, das wir ohne Lizenzstreit und ohne Anbieterbindung in eigene Infrastruktur stellen dürften. (Quelle: RoadMaster19 / Wikimedia, CC BY 4.0)
Kosten pro Index-Aufgabe in US-CentMistral Small 42MiMo-V2.6-Pro13DeepSeek V4.1 Flash27Mistral Medium 3.550Qwen3.8 27B101Mistral Large 4113 · VorschauKimi K3200GLM-5.32010240
Gewichtete Kosten pro Aufgabe des Intelligence Index in US-Cent, niedriger ist besser. Dafür rechnet die Messstelle Input-, Cache-, Denk- und Antwort-Token der jeweiligen Preisliste über die zehn Teilbewertungen. (Quelle: Artificial Analysis)

Offen ist nicht gleich frei nutzbar

Ein Lizenztext entscheidet, ob wir ein Modell in ein Kundenprojekt stellen. DeepSeek V4.1 Flash und MiMo-V2.6-Pro stehen unter MIT, Qwen3.8 und Mistral Small 4 unter Apache 2.0. Bei GLM-5.3 und Kimi K3 führt Artificial Analysis eigene Lizenztexte mit kommerziellen Auflagen, ebenso beim modifizierten MIT von Mistral Medium 3.5. Für Large 4 gibt es Stand heute keine Lizenzdatei, nur die Ankündigung, dass die Gewichte kommen. Wer das Wort offen hört, prüft die Datei. Bei zwei der vier verglichenen Spitzenmodelle aus China steckt sie volle Absicht in der Klausel, und Mistrals eigenes 128-Milliarden-Modell ist dasselbe Muster.

Was die Gewichte wiegen

Die Frage nach der Machbarkeit entscheidet sich am Grafikkartenspeicher. Wir haben die Größe jedes Release-Repositoriums über die Hugging-Face-API ausgemessen: Summe aller Dateigrößen der Geschwisterdateien, so wie sie zum Download stehen, Stand 7. Oktober 2026. Das ist kein gepresstes Abbild und keine Schätzung, das sind die Bytes, die jemand auf unsere Platte laden würde.

Checkpoint-Größe in GB, selbst gemessenKimi K31561 · 2,8 Bio ParameterGLM-5.3756Mistral Large 3 675B682 · 1 Byte je ParamMiMo-V2.6-Pro574 · RL-ReleaseDeepSeek V4.1 Flash510Large 3 als NVFP4403 · 4-Bitunsere 4 Grafikkarten137 · 127,4 GiBSmall 4 als NVFP471 · voll 242 GBQwen3.8 27B als INT421 · voll 56 GB01700
Eigene Messung am 7. Oktober 2026 über die Hugging-Face-API, Summe aller Dateigrößen des jeweiligen Repositoriums. Alle Größen in GB (10^9 Byte), so wie die Schnittstelle sie ausweist. Die grüne Zeile ist unsere eigene GPU-Ausstattung mit 127,4 GiB, das sind 137 GB. (Quelle: Hugging Face Hub API)

Die grüne Zeile ist der Rand, an dem unsere Planung endet. Kimi K3 braucht das Elffache unseres Grafikkartenspeichers, GLM-5.3 das Fünffache, DeepSeek V4.1 Flash das Dreieinhalbfache. Vom Vorgänger Large 3 haben wir beide Varianten gemessen: 682 GB im Auslieferungsgewicht und 403 GB als NVFP4-Quantisierung, beides noch das Dreifache unserer Box. Für Large 4 gibt es noch nichts zu messen. Unsere Rechnung: 1,05 Billionen Parameter mit 0,5 Byte je Parameter ergeben 525 GB, auf das gemessene NVFP4-Layout des Vorgängers hochskaliert 627 GB. Beides sind Folgerungen aus gemessenen Größen, keine Messwerte. Der Bereich liegt beim Vierfachen unserer Ausstattung.

Was auf unseren Rechnern läuft

Wir betreiben vier RTX 5090 in einem Host mit 91 GB Arbeitsspeicher, zusammen 127,4 GiB Grafikkartenspeicher, gemessen je 32.607 MiB. Darauf läuft ein gemischt-expertes Modell mit 48 Schichten und 512 Experten je Schicht, natives Kontextfenster 262.144 Token, vom Server auf 220.000 begrenzt, KV-Cache in NVFP4. Gebaut ist das auf einer angepinnten vLLM-Fassung mit lokalen Patches, weil der NVFP4-Pfad im Upstream-Zweig einen offenen Fehler auf unserer Generation hat. Der Index dieses Checkpoints deklariert 182,7 GB Gewichtstensoren, die vier Karten stellen 137 GB bereit, und dass es trotzdem läuft, liegt an der Gewichts- und KV-Quantisierung. Ein zweiter Host mit einer Karte bedient als Rückfall ein Modell mit 27 Milliarden Parametern als AWQ-INT4, dessen Repositorium 21,0 GB misst.

Vier Anfragen mit kurzen Prompts und je 200 Token Ausgabe, die Box dabei bei 76 bis 84 Prozent Auslastung: Median 70,8 Token pro Sekunde im Decode, Spanne 66,7 bis 75,4, und Median 0,25 Sekunden bis zum ersten Token. Artificial Analysis misst die Ausgabegeschwindigkeit über die Anbieter-API, wir messen eine Anfrage auf einer ausgelasteten Box. Vergleichbar sind die Zahlen nicht eins zu eins, die Größenordnung aber: Unsere Lane liegt mit 70,8 Token pro Sekunde zwischen GLM-5.3 (77,2) und Qwen3.8 27B (47,1). Die Zeit bis zum ersten Token liegt bei den vier verglichenen Anbieter-APIs zwischen 1,46 Sekunden für Large 4 und 5,56 Sekunden für MiMo-V2.6-Pro, gemessen auf denselben Modellseiten. Der kurze Weg ohne Provider-Warteschlange ist unser eigentlicher Vorteil, nicht die Rechenleistung.

Vom Papier in unsere RechnerGewichte da?Lizenzdatei und Byte-SummePasst es in den RAM?137 GB Grenze, 4x 5090Eigene MessfahrtDecode, TTFT, Replay
Der Prüfplan vor jedem Wechsel einer Lane. Schritt zwei ist bei den jetzigen Größen der Modellklasse die harte Trennscheibe: alles über 137 GB fällt für Eigenbetrieb raus, unabhängig von der Qualität. (Quelle: Eigene Messungen und Betriebspraxis, Oktober 2026)

Kapital und Herkunft

Mistral rahmt Large 4 als den ersten Meilenstein der Produktstraße, die der Series D über 3 Milliarden Euro finanziert ist, und nennt die Runde die größte Eigenkapitalrunde, die ein europäisches Technologieunternehmen je abgeschlossen hat. Abgeschlossen wurde sie Anfang September 2026 bei einer Bewertung über 21 Milliarden Euro post-money. Geführt wurde sie von Samsung Electronics, neben EQT Scaleup Europe Fund und PSG Equity, dazu berichten Medien Nvidia und ASML als Beteiligte. Europäisch sind der Sitz und ein Teil der Investoren.

Wortmarke von Samsung
Samsung Electronics führt die Runde, aus der dieses Modell bezahlt wird. Zum Bild der unabhängigen europäischen KI gehört auch, dass die beiden japanische-südkoreanischen Halbleiterkonzerne ASML und Nvidia in derselben Runde sitzen. (Quelle: Datei via Wikimedia Commons)
Das Modell selbst wird auf Hardware trainiert, die es in dieser Konstellation in Europa nicht zu kaufen gibt, und die Preiskonkurrenz kommt aus China.

Was wir daraus machen

Ende Oktober, wenn die Gewichte stehen, prüfen wir in dieser Reihenfolge: Lizenzdatei aufmachen und lesen, Byte-Summe des Repositoriums messen, dann eine Messfahrt auf unserer Box mit unseren Aufgaben aus dem Betrieb. Bis dahin steht Large 4 für uns in keiner Preis- oder Architekturentscheidung, weil weder die Lizenz noch die Bytes bekannt sind und der Indexwert der Vorschau hinter den freien MIT-Modellen liegt. Wer heute ein offenes Modell für ein Kundenprojekt sucht, findet es in der Apache- und MIT-Klasse bis 40 Milliarden Parameter, die auf eigener Hardware laufen, oder in der API eines MIT-Modells mit geprfter Datenschutzprüfung. Offene Frage bleibt, ob das Kontextfenster nach der Verifizierung bei einer Million Token bleibt oder bei den gemessenen 524.000.

Weiterführende Quellen

Fragen?
Ist Mistral Large 4 zum Start das beste offene Modell aus Europa?+

Nach dem unabhängigen Artificial-Analysis-Index nicht. Die Vorschau liegt bei 38 Punkten, MiMo-V2.6-Pro bei 46, GLM-5.3 bei 45, Kimi K3 bei 44 und DeepSeek V4.1 Flash bei 39. Die Gewichte von Large 4 sind zudem noch nicht veröffentlicht, angekündigt sind sie Ende Oktober 2026. Werte abgerufen am 7. Oktober 2026.

Was kostet eine Aufgabe mit Mistral Large 4 im Vergleich?+

Artificial Analysis berechnet 1,13 Dollar pro Aufgabe des Intelligence Index für die Vorschau von Large 4. MiMo-V2.6-Pro liegt bei 0,13 Dollar, DeepSeek V4.1 Flash bei 0,27 Dollar, GLM-5.3 und Kimi K3 bei je rund 2 Dollar. Die Ausgabe-Token von Large 4 kosten in der Aktion 2,09 und in der Liste 4,18 Dollar pro Million.

Können wir Mistral Large 4 auf eigener Hardware betreiben?+

Nach unserer Rechnung nicht. Das Datenblatt nennt 1,05 Billionen Parameter. Bei 0,5 Byte je Parameter sind das 525 GB, hochgerechnet auf das gemessene NVFP4-Layout des Vorgängers 627 GB. Unsere vier RTX 5090 stellen zusammen 127,4 GiB, das sind 137 GB. Das Modell braucht also mindestens das Dreieinhalbfache unseres Grafikkartenspeichers. Die Bytesummen stammen vom 7. Oktober 2026.