Mistral Large 4 im Feld der offenen Gewichte: Indexwerte, Preise und die Bytes dahinter
Mistral hat Mistral Large 4 vorgestellt, ein gemischt-expertiges Modell mit rund einer Billion Parameter, und die Veröffentlichung der Gewichte für Ende Oktober angekündigt. Der heise-Beitrag dazu beschreibt das als Anschluss an die Spitze. Wir haben zwei Dinge nachgeprüft: Was sagt eine unabhängige Messstelle über die Qualität, und was die Gewichte wiegen, wenn sie da sind. Dafür haben wir die Checkpoint-Größen der Vergleichsmodelle über die Hugging-Face-API ausgemessen und unsere eigene Inferenz-Lane unter Last gemessen. Der Indexwert ist die einzige Qualitätszahl hier, die nicht vom Hersteller kommt.
Was Mistral nennt und was gemessen wurde
Die offizielle Ankündigung heißt Introducing Mistral Large 4 und bringt die eigenen Messdiagramme mit. Dort steht das Modell mit rund 1.000 Milliarden Parametern und 49 Milliarden aktiven, im Datenblatt mit 1,05 Billionen und 52 Milliarden. Trainiert sei von Grund auf auf 3.800 Grace Blackwell in den eigenen europäischen Rechenzentren, der Reinforcement-Lauf mit 3.000 GPUs liefere 33 Milliarden Token am Tag, davon rund 16 Milliarden lernbare. Ein erheblicher Teil der Trainingsdaten sei mehrsprachig und umfasse über 160 Sprachen, darunter jede Amtssprache der Europäischen Union.
Auf Coding nennt die Seite DeepSWE v1.1 mit 61,7 Prozent, SWE-Atlas-QnA mit 59,4 Prozent und Terminal-Bench 4 mit 28,3 Prozent, zusammen als Coding-Agent-Index 49,8 Prozent, womit DeepSeek V4 Pro vom 13. August und Qwen3.8 Max überschritten seien. Lakera meldet 93,3 Prozent auf Sicherheitsstufe B3, die Bewertungsmessung KORA 1,691 von 2. Im Cyber-Index von Artificial Analysis will Mistral unter den besten fünf weltweit liegen, mit 82 Prozent beim Nachbau und Patchen einer echten Lücke in offener Software. Die Begründung für den Abstand ist der bemerkenswerteste Satz der Seite: Claude Opus 5.5 und GPT-6 Astra lagen auf demselben Test nahe null, weil sie die Arbeit verweigern.
Den Vergleich mit China stellt Mistral selbst her. In der blinden Human-Evaluation von Surge AI über echte Coding-Aufgaben erhielt Large 4 im Schnitt 3,74 von 5 Punkten, Rang 2 von 5: vor Kimi K3 mit 3,59 und GLM-5.3 mit 3,60, hinter Claude Opus 5 mit 4,22. Auf AutomationBench mit 657 Geschäftsprozessen nennt die Seite 59,9 Prozent und sieht damit Kimi K3, MiMo-V2.6-Pro und DeepSeek V4 Pro geschlagen. Bei der Bildortung (Dense 200) stehen 42 Prozent gegen 41 Prozent für GPT-6 Astra. Alles Herstellerangaben mit eigenen Diagrammen, die wir nicht nachrechnen können. Genannt werden sie hier, weil sie die Größen nennen, die wir messen können: Index, Preis und Bytes.
Anders die Werte von Artificial Analysis, Stand 7. Oktober 2026. Die Vorschau von Large 4 liegt dort beim Intelligence Index v4.3.2 bei 38 Punkten, Rang 64 von 225 Modellen in der Vergleichsklasse, bei einem Klassenmedian von 26. Die Ausgabegeschwindigkeit beträgt 116,1 Token pro Sekunde, die Zeit bis zum ersten Antwort-Token 1,46 Sekunden. Für den Index hat das Modell 200 Millionen Ausgabe-Token produziert, der Median der Klasse liegt bei 81 Millionen. Daraus rechnet Artificial Analysis 1,13 Dollar pro Aufgabe. Als Kontextfenster stehen 524.000 Token gemessen gegenüber einer Million angegeben. Geführt ist es dort als proprietär, weil die Gewichte noch nicht geladen sind.
Die Preiskarte kennt zwei Ebenen: befristete Aktionspreise von 0,68 Dollar je Million Eingabe- und 2,09 Dollar je Ausgabe-Token, dauerhafte Listenpreise von 1,36 und 4,18 Dollar. Der Vergleich mit den offenen Konkurrenzmodellen unten rechnet mit den Listenpreisen.
Vier Modelle aus China auf derselben Skala
Die Tabelle steht auf je einer eigenen Modellseite bei Artificial Analysis. Alle Werte am 7. Oktober 2026 abgerufen.
| Modell | Index | Token/s | $/M Eingabe | $/M Ausgabe | $ pro Aufgabe | Kontext | Parameter gesamt/aktiv | Lizenz |
|---|---|---|---|---|---|---|---|---|
| MiMo-V2.6-Pro (Xiaomi) | 46 | 46,5 | 0,43 | 0,87 | 0,13 | 1M | 1,0 Bio / 42 Mrd | MIT |
| GLM-5.3 (Z.ai) | 45 | 77,2 | 1,40 | 4,40 | 2,01 | 1M | 753 Mrd / 40 Mrd | eigene, mit Auflagen |
| Kimi K3 (Moonshot) | 44 | 43,7 | 3,00 | 15,00 | 2,00 | 1M | 2,8 Bio / 104 Mrd | eigene, mit Auflagen |
| DeepSeek V4.1 Flash | 39 | 227,9 | 0,30 | 1,20 | 0,27 | 1M | 552 Mrd / 16 Mrd | MIT |
| Mistral Large 4 (Vorschau) | 38 | 116,1 | 1,36 | 4,18 | 1,13 | 524k | 1,05 Bio / 52 Mrd | noch keine |
| Qwen3.8 27B (Alibaba) | 34 | 47,1 | 0,50 | 3,00 | 1,01 | 256k | 27 Mrd | Apache 2.0 |
| Mistral Medium 3.5 | 14 | 170,0 | 1,50 | 7,50 | 0,50 | 256k | 128 Mrd | modifiziertes MIT |
| Mistral Small 4 | 11 | 171,3 | 0,15 | 0,60 | 0,02 | 256k | 119 Mrd / 6,5 Mrd | Apache 2.0 |
Die Zeilen sagen zwei Dinge. Das Xiaomi-Modell MiMo-V2.6-Pro spielt in derselben Größenklasse wie Large 4, hat 1,0 Billionen Parameter, eine MIT-Lizenz und liegt beim Index acht Punkte vorn. Pro Index-Aufgabe kostet es 0,13 Dollar gegen 1,13 Dollar, also etwa ein Neuntel. Und DeepSeek V4.1 Flash erreicht fast denselben Indexpunkt wie die Large-4-Vorschau, liefert die doppelte Ausgabegeschwindigkeit und kostet pro Aufgabe einen Bruchteil. Mistrals eigene Modelle im mittleren und kleinen Segment, Medium 3.5 und Small 4, sind schnell und billig, liegen beim Index aber weit zurück.

Offen ist nicht gleich frei nutzbar
Ein Lizenztext entscheidet, ob wir ein Modell in ein Kundenprojekt stellen. DeepSeek V4.1 Flash und MiMo-V2.6-Pro stehen unter MIT, Qwen3.8 und Mistral Small 4 unter Apache 2.0. Bei GLM-5.3 und Kimi K3 führt Artificial Analysis eigene Lizenztexte mit kommerziellen Auflagen, ebenso beim modifizierten MIT von Mistral Medium 3.5. Für Large 4 gibt es Stand heute keine Lizenzdatei, nur die Ankündigung, dass die Gewichte kommen. Wer das Wort offen hört, prüft die Datei. Bei zwei der vier verglichenen Spitzenmodelle aus China steckt sie volle Absicht in der Klausel, und Mistrals eigenes 128-Milliarden-Modell ist dasselbe Muster.
Was die Gewichte wiegen
Die Frage nach der Machbarkeit entscheidet sich am Grafikkartenspeicher. Wir haben die Größe jedes Release-Repositoriums über die Hugging-Face-API ausgemessen: Summe aller Dateigrößen der Geschwisterdateien, so wie sie zum Download stehen, Stand 7. Oktober 2026. Das ist kein gepresstes Abbild und keine Schätzung, das sind die Bytes, die jemand auf unsere Platte laden würde.
Die grüne Zeile ist der Rand, an dem unsere Planung endet. Kimi K3 braucht das Elffache unseres Grafikkartenspeichers, GLM-5.3 das Fünffache, DeepSeek V4.1 Flash das Dreieinhalbfache. Vom Vorgänger Large 3 haben wir beide Varianten gemessen: 682 GB im Auslieferungsgewicht und 403 GB als NVFP4-Quantisierung, beides noch das Dreifache unserer Box. Für Large 4 gibt es noch nichts zu messen. Unsere Rechnung: 1,05 Billionen Parameter mit 0,5 Byte je Parameter ergeben 525 GB, auf das gemessene NVFP4-Layout des Vorgängers hochskaliert 627 GB. Beides sind Folgerungen aus gemessenen Größen, keine Messwerte. Der Bereich liegt beim Vierfachen unserer Ausstattung.
Was auf unseren Rechnern läuft
Wir betreiben vier RTX 5090 in einem Host mit 91 GB Arbeitsspeicher, zusammen 127,4 GiB Grafikkartenspeicher, gemessen je 32.607 MiB. Darauf läuft ein gemischt-expertes Modell mit 48 Schichten und 512 Experten je Schicht, natives Kontextfenster 262.144 Token, vom Server auf 220.000 begrenzt, KV-Cache in NVFP4. Gebaut ist das auf einer angepinnten vLLM-Fassung mit lokalen Patches, weil der NVFP4-Pfad im Upstream-Zweig einen offenen Fehler auf unserer Generation hat. Der Index dieses Checkpoints deklariert 182,7 GB Gewichtstensoren, die vier Karten stellen 137 GB bereit, und dass es trotzdem läuft, liegt an der Gewichts- und KV-Quantisierung. Ein zweiter Host mit einer Karte bedient als Rückfall ein Modell mit 27 Milliarden Parametern als AWQ-INT4, dessen Repositorium 21,0 GB misst.
Vier Anfragen mit kurzen Prompts und je 200 Token Ausgabe, die Box dabei bei 76 bis 84 Prozent Auslastung: Median 70,8 Token pro Sekunde im Decode, Spanne 66,7 bis 75,4, und Median 0,25 Sekunden bis zum ersten Token. Artificial Analysis misst die Ausgabegeschwindigkeit über die Anbieter-API, wir messen eine Anfrage auf einer ausgelasteten Box. Vergleichbar sind die Zahlen nicht eins zu eins, die Größenordnung aber: Unsere Lane liegt mit 70,8 Token pro Sekunde zwischen GLM-5.3 (77,2) und Qwen3.8 27B (47,1). Die Zeit bis zum ersten Token liegt bei den vier verglichenen Anbieter-APIs zwischen 1,46 Sekunden für Large 4 und 5,56 Sekunden für MiMo-V2.6-Pro, gemessen auf denselben Modellseiten. Der kurze Weg ohne Provider-Warteschlange ist unser eigentlicher Vorteil, nicht die Rechenleistung.
Kapital und Herkunft
Mistral rahmt Large 4 als den ersten Meilenstein der Produktstraße, die der Series D über 3 Milliarden Euro finanziert ist, und nennt die Runde die größte Eigenkapitalrunde, die ein europäisches Technologieunternehmen je abgeschlossen hat. Abgeschlossen wurde sie Anfang September 2026 bei einer Bewertung über 21 Milliarden Euro post-money. Geführt wurde sie von Samsung Electronics, neben EQT Scaleup Europe Fund und PSG Equity, dazu berichten Medien Nvidia und ASML als Beteiligte. Europäisch sind der Sitz und ein Teil der Investoren.
Was wir daraus machen
Ende Oktober, wenn die Gewichte stehen, prüfen wir in dieser Reihenfolge: Lizenzdatei aufmachen und lesen, Byte-Summe des Repositoriums messen, dann eine Messfahrt auf unserer Box mit unseren Aufgaben aus dem Betrieb. Bis dahin steht Large 4 für uns in keiner Preis- oder Architekturentscheidung, weil weder die Lizenz noch die Bytes bekannt sind und der Indexwert der Vorschau hinter den freien MIT-Modellen liegt. Wer heute ein offenes Modell für ein Kundenprojekt sucht, findet es in der Apache- und MIT-Klasse bis 40 Milliarden Parameter, die auf eigener Hardware laufen, oder in der API eines MIT-Modells mit geprfter Datenschutzprüfung. Offene Frage bleibt, ob das Kontextfenster nach der Verifizierung bei einer Million Token bleibt oder bei den gemessenen 524.000.
Weiterführende Quellen
- Artificial Analysis: Mistral Large 4, Index, Geschwindigkeit und Preise der Vorschau (7. Oktober 2026)
- Artificial Analysis: DeepSeek V4.1 Flash · GLM-5.3 · Kimi K3 · MiMo-V2.6-Pro · Qwen3.8 27B
- Artificial Analysis: Mistral Medium 3.5 · Mistral Small 4
- Mistral: offizielle Ankündigung Large 4 mit den eigenen Messdiagrammen, Modell-Datenblatt und Vorschau-Dokumentation
- heise online: Mistral Large 4, Der LLM-Brocken aus der EU
- Mistral: Meldung zur Series D und TechCrunch: Mistral raises 3 billion euros zur Finanzierungsrunde
- Hugging Face: DeepSeek V4.1 Flash · Z.ai GLM-5.3 · Moonshot Kimi K3 · Xiaomi MiMo V2.6 Pro RL · Mistral Large 3 675B NVFP4 · Qwen3.8 27B
- Der eigene AI Stack mit LiteLLM und vLLM, wie unsere Lanes aufgebaut sind
- Sieben Tage lokale KI im Feldtest, Betrieb ohne Cloud-Modelle
- Zwei GB300-Stationen im Paarverbund, die Hardwareklasse jenseits unserer Ausstattung
Ist Mistral Large 4 zum Start das beste offene Modell aus Europa?+
Nach dem unabhängigen Artificial-Analysis-Index nicht. Die Vorschau liegt bei 38 Punkten, MiMo-V2.6-Pro bei 46, GLM-5.3 bei 45, Kimi K3 bei 44 und DeepSeek V4.1 Flash bei 39. Die Gewichte von Large 4 sind zudem noch nicht veröffentlicht, angekündigt sind sie Ende Oktober 2026. Werte abgerufen am 7. Oktober 2026.
Was kostet eine Aufgabe mit Mistral Large 4 im Vergleich?+
Artificial Analysis berechnet 1,13 Dollar pro Aufgabe des Intelligence Index für die Vorschau von Large 4. MiMo-V2.6-Pro liegt bei 0,13 Dollar, DeepSeek V4.1 Flash bei 0,27 Dollar, GLM-5.3 und Kimi K3 bei je rund 2 Dollar. Die Ausgabe-Token von Large 4 kosten in der Aktion 2,09 und in der Liste 4,18 Dollar pro Million.
Können wir Mistral Large 4 auf eigener Hardware betreiben?+
Nach unserer Rechnung nicht. Das Datenblatt nennt 1,05 Billionen Parameter. Bei 0,5 Byte je Parameter sind das 525 GB, hochgerechnet auf das gemessene NVFP4-Layout des Vorgängers 627 GB. Unsere vier RTX 5090 stellen zusammen 127,4 GiB, das sind 137 GB. Das Modell braucht also mindestens das Dreieinhalbfache unseres Grafikkartenspeichers. Die Bytesummen stammen vom 7. Oktober 2026.
senn-tech