senn-techsenn-tech
KI-Hardware
KI-Hardware2026-10-03· Von Franz Senn

Zwei DGX Spark im Eigenversuch: DeepSeek V4-Flash läuft, V4.1-Flash geht nicht rein

Ende September hatten wir zwei DGX Spark von NVIDIA im Haus, geliehen, über die QSFP-Buchsen per Kabel verbunden. Die Frage war eine einzige: Kann so ein Verbund einen unserer offenen Fälle abdecken, also ein großes Modell mit offenen Gewichten im Eigenbetrieb, und was kostet uns das. Wir haben am 28. September 2026 zwei DeepSeek-Modelle mit vLLM aufgerufen. DeepSeek-V4-Flash lief mit gemessenen 63,7 Token pro Sekunde im Einzelnutzerbetrieb. DeepSeek-V4.1-Flash ist am Speicher gescheitert, und die Ursache dahinter betrifft jede Box mit einheitlichem Speicher.

Checkpoint und Speicher in GB4× DGX Spark, zusammen512 · 512DeepSeek-V4.1-Flash, Checkpoint510.3 · 510,33× DGX Spark, zusammen384 · 3842× DGX Spark, zusammen256 · 2562× DGX Spark, nutzbar gemessen186 · 186DeepSeek-V4-Flash, Checkpoint159.6 · 159,60560
Vier Geräte kämen rechnerisch auf 512 GB, der Checkpoint allein sind 510,3 GB. Für Betriebssystem, KV-Cache und Aktivierungen bliebe nichts. Die 186 GB sind unser gemessener Wert aus dem Zwei-Geräte-Aufbau. (Quelle: NVIDIA DGX Spark Specifications, Hugging Face, eigene Messung 28.9.2026)

Was NVIDIA verspricht und welche Einheit dahintersteht

NVIDIA rechnet in Parametern. Auf der Produktseite stehen 128 GB und bis zu 200 Milliarden Parameter für ein Gerät, 256 GB und bis zu 400 Milliarden für zwei Geräte, 512 GB und bis zu 700 Milliarden für vier. ConnectX-7 verbindet maximal vier dieser Boxen. Die Zahl ist eine Kaufhilfe, entscheidend ist eine andere: Wie viele Bytes im Speicher belegt ein Parameter dieses konkreten Modells.

ModellParameterCheckpoint auf FestplatteBytes je Parameter
DeepSeek-V4-Flash284 Mrd.159,6 GB, 46 Safetensors0,56
DeepSeek-V4.1-Flash763 Mrd.510,3 GB, 48 Safetensors0,67

Die beiden Werte kommen aus den Hugging-Face-Repos von DeepSeek, es sind die Dateilängen der Safetensors-Dateien. Bei 0,67 Bytes je Parameter kommen die von NVIDIA beworbenen 400 Milliarden auf 268 GB, also knapp über das, was zwei Geräte an gemeinsamem Speicher haben. Der Sprung von einer Modellgeneration zur nächsten ist bei den neuen MoE-Modellen zugleich ein Sprung in der Byte-Prozentrechnung, und genau die entscheidet über den Einkauf.

Seit dem 2. Oktober auch mit 64 GB

Am 2. Oktober hat NVIDIA eine zweite Ausführung angekündigt: 64 GB LPDDR5X zum Preis von 4.999 US-Dollar, ausschließlich über die OEM-Partner Acer, ASUS, Dell, Gigabyte, HP und MSI, ab 23. Oktober im Handel. Am Rechenwerk und an der Anbindung ändert sich nichts, es bleibt der GB10 mit 273 GB/s und ConnectX-7. Ein einzelnes Gerät soll Modelle bis 100 Milliarden Parameter schaffen, zwei gekoppelte kommen auf 128 GB und sollen bis 200 Milliarden Parameter tragen.

Für unsere Rechnung ist das ein guter Test der Einheiten. Zwei Geräte zu je 64 GB haben zusammen 128 GB, unser gemessener nutzbarer Bereich lag bei 186 GB, und der Checkpoint von DeepSeek-V4-Flash ist 159,6 GB schwer. Die Einsteiger-Kombination hält also exakt das Modell nicht, das wir am 28. September auf zwei großen Geräten gemessen haben, obwohl sie auf dem Papier dieselbe Speichermenge und dieselbe Parameterstufe erreicht. Pro Byte ist sie trotzdem das teurere Geschäft: 4.999 Dollar auf 64 GB sind 78 Dollar je GB, die 128-GB-Ausführung liegt bei 6.950 Dollar und damit bei 54 Dollar je GB.

Der Rechenweg hinter den 63,7 Token pro Sekunde

Beim Erzeugen von Text wandern alle Gewichte, die ein Token braucht, einmal durch den Speicher. DeepSeek-V4-Flash aktiviert 13 Milliarden Parameter, bei 0,56 Bytes sind das 7,3 GB je Token. Ein DGX Spark liefert 273 GB/s auf seinem LPDDR5X-Pool, zwei Geräte theoretisch 546 GB/s. Geteilt ergibt 74,7 Token pro Sekunde als obere Grenze, gemessen haben wir 63,7, also 85 Prozent davon. Ein einzelnes Gerät läge bei 37,4 Token pro Sekunde.

Dass wir der Bandbreitengrenze so nahe kommen, passt zum Befund aus unserem Vergleich der Desktop-Boxen: Diese Geräteklasse ist ein Speicherbandbreiten-Gerät, nicht ein Rechenwerk-Gerät. Das Rechenwerk mit einem PetaFLOP bei FP4 wartet in diesem Pfad die meiste Zeit. Dasselbe Rechenmodell gilt für unsere eigene Strecke, inklusive der Frage, wie viel Bandbreite dort tatsächlich ankommt: Gemessene RAM-Bandbreite der RTX 5090.

Die Zahl aus der Ankündigung von Anfang Oktober passt in dieses Bild. NVIDIA beziffert den Zugewinn zweier gekoppelter Geräte gegenüber einem einzelnen bei Qwen3.8 27B mit bis zu Faktor 1,7 und begründet das mit der doppelten Speicherbandbreite. Bei DeepSeek-V4-Flash stehen unsere gemessenen 63,7 Token pro Sekunde den 37,4 rechnerischen Token pro Sekunde des Einzelgeräts gegenüber, das ist per Definition auch 1,7.

Warum V4.1-Flash nicht reingeht

DeepSeek-V4.1-Flash hat 552 Milliarden Backbone-Parameter. Dazu kommen 196 Milliarden Parameter Engram, zusammen zählt Hugging Face 763 Milliarden. Engram ist ein Nachschlagegedächtnis: Die letzten paar Token werden gehasht, die Hashwerte zeigen in große statische Tabellen, und die gelesenen Zeilen werden über ein Gate in den Zustand eingemischt. Das Modell rechnet also nicht über diese Parameter, es liest sie nur, und die Kapazität wächst damit ohne Kosten pro Token.

Für den Speicherbetrieb ist die Konsequenz unschön. Die vLLM-Doku beschreibt die Tabellen dieses Modells als zwei Engram-Ebenen mit je rund 384 Millionen Zeilen, FP8-Einträge zu 256 Bytes plus Blockskalen, zusammen rund 200 GB. Das sind 39 Prozent des Checkpoints. Und die vLLM-Doku sagt an derselben Stelle, dass Aufbau der Ebenen, Tabellengröße und N-Gramm-Größe vom Checkpoint kommen und nicht vom Betreiber konfigurierbar sind. Wer sparen wollte, indem er die Tabellen verkleinert, kann das nicht.

Rechnen wir das auf unseren Aufbau: 510,3 GB Checkpoint gegen 256 GB gemeinsamen Speicher, davon 186 GB nutzbar. Selbst wenn man die Gewichte des Backbone auf beide Geräte verteilt, bleibt der Nachschlageteil, der irgendwo resident stehen muss. Der nächste Schritt wären vier Geräte mit 512 GB, was NVIDIA auch unterstützt, dann aber über einen Switch. Bei 510,3 GB Checkpoint bliebe für Betriebssystem, KV-Cache und Aktivierungen kein Byte. DeepSeek-V4.1-Flash ist für diese Geräteklasse damit nicht vorgesehen.

Der Offload-Trick funktioniert auf dieser Hardware nicht

vLLM lagert die Engram-Tabellen serienmäßig in gepinnten Hauptspeicher aus, mit Nachschlagen direkt aus dem Kernel über Unified Virtual Addressing und Vorladen über einen zweiten CUDA-Stream. Der Grund ist einleuchtend: Auf einem System mit Grafikkarten ist der teure Speicher der Grafikkartenspeicher, und der wird durch den Auslagerungstrick für den KV-Cache frei. In unserer Lane mit vier RTX 5090 ist das eine echte Entlastung, weil dort zwei getrennte Speicherwelten mit sehr unterschiedlicher Bandbreite und sehr unterschiedlichem Preis pro Byte nebeneinanderliegen.

Der DGX Spark hat diese zwei Welten nicht. NVIDIA bewirbt die 128 GB LPDDR5X als kohärenten einheitlichen Speicher, und genau das ist er: Tabellen, Gewichte, KV-Cache und Aktivierungen liegen auf denselben Bausteinen und teilen sich dieselben 273 GB/s. Der Auslagerungstrick verschiebt hier nur einen Adressbereich in einen anderen, er gibt keinen Speicher frei, und die Nachschlagezugriffe ziehen danach an derselben Bandbreite, an der auch die Gewichte hängen. Eine Technik, die auf der einen Hardwareklasse 200 GB einspart, ist auf der anderen wertlos. Wer eine der neuen Desktop-Boxen gegen ein DeepSeek-Modell der aktuellen Generation rechnet, muss das mitrechnen.

Tabellen auf die SSD und die Datei in 4 Bit, durchgerechnet

Am 3. Oktober haben wir die Dateien des Checkpoints über die Hugging-Face-API nachgezählt, weil wir die 200 GB nicht schätzen wollten. Es sind 96.085 Tensoren in 48 Dateien, 510,3 GB gesamt. Die beiden letzten Dateien sind je 101,5 GB groß, und die Indexdatei nennt ihren Inhalt beim Namen: layers.1.engram.embed.weight und layers.14.engram.embed.weight samt den zugehörigen Skalen. Das sind die Tabellen, 203,0 GB, 39,8 Prozent der Datei. Der Rest, 307,3 GB, ist Gewichtsnetz, Seher und Einbettung.

Die Idee, die Tabellen auf eine SSD zu legen, damit nur das Gewichtsnetz im teuren Speicher liegt, ist damit eine Rechnung mit bekannten Zahlen. Im Speicher blieben 307,3 GB. Drei Geräte haben 384 GB auf dem Papier; nach unserer Messung vom 28. September sind es eher 93 GB je Gerät, also 279 GB für drei Geräte. Das Gewichtsnetz für sich genommen füllt diese 279 GB, ohne KV-Cache, ohne Betriebssystem.

Der zweite Hebel, die Quantisierung, ist an der breitesten Stelle schon gezogen. Die Konfigurationsdatei des Originals trägt expert_dtype fp4, die Experten sind also bereits mit 4 Bit gerechnet, was die 0,67 Bytes je Parameter erklärt. Ein weiteres 4-Bit für dieselben Experten gibt es nicht. Wir haben das quantisierte Build W4A16-Engram-AutoRound vom 14. September 2026 nachgemessen: 451,7 GB statt 510,3 GB. Die Tabellen halbieren sich auf 111,2 GB, die übrigen 46 Dateien wachsen von 7,4 auf 8,2 GB je Datei, weil W4A16 die Aktivierungen in 16 Bit hält. Es sind 58,6 GB weniger, 11,5 Prozent.

Die SSD ist der engere Deckel, noch vor der Kapazität. Ein Tabelleneintrag ist 256 Byte, eine NVMe antwortet in Blöcken von 4 Kilobyte, jede Abfrage zieht also das Sechzehnfache an Bytes nach sich. Selbst 200.000 zufällige Lesevorgänge pro Sekunde, ein Wert, den wir für die eingebaute NVMe nicht gemessen haben, ergäben 0,8 GB/s gegen 273 GB/s im eigenen Speicher. Zu messen wäre das an einem einzelnen Gerät mit Auslagerung auf die interne Platte, ein halber Tag.

Der zweite Deckel: die Verbindung zwischen den Geräten

Pro QSFP-Buchse stehen 200 Gbit/s an, das sind 25 GB/s. Zwei Kabel zwischen zwei Geräten ergeben 50 GB/s, gemessen an 546 GB/s, die in den beiden gemeinsamen Speichern stecken: Faktor elf. Tensorparallelität über Geräte hinweg schickt bei jeder Schicht Aktivierungen über diese Leitung, deshalb ist die zweite Box nicht die verdoppelte Geschwindigkeit, sondern in erster Linie zusätzlicher Speicher. Die Obergrenze von 74,7 Token pro Sekunde gilt nur unter der Annahme, dass die Verteilung perfekt arbeitet. Unser erster Start über zwei Geräte lief mit 2 von 8 Ranks hoch und endete in einer SIGFPE in NCCL; der zweite Versuch mit angepasster Netzwerkkonfiguration brachte die Messung von 63,7.

Ab dem dritten Gerät stellt sich die Frage nach der Verkabelung. Jedes Gerät hat genau zwei QSFP-Buchsen, und NVIDIA beschreibt das Verbinden von drei Geräten deshalb als Ring mit drei Kabeln. Jedes Gerät hängt an beiden Nachbarn, und bei drei Knoten ist der Ring zugleich die vollständige Verbindung, jede Kiste direkt an jeder anderen. In einer Kette mit zwei Kabeln hätten die zwei Endgeräte keine Verbindung zueinander, ein Vermittlungsgerät ist dann nicht dabei. Direkt verkabelt endet der unterstützte Weg bei drei Geräten, vier Geräte gehen nur über einen Switch. Der Ring verdreifacht den Speicher, die Anbindung je Gerät bleibt bei den zwei Buchsen und damit bei 50 GB/s.

Bei den Kosten steht dieselbe Rechnung. Der Verbund lag Anfang September bei 11.258 Euro Straßenpreis, zwei Geräte zu je 5.629 Euro, nachzulesen in unserem Hardware-Vergleich vom 6. September. An den Listenpreisen ist seither viel passiert: Die Founders Edition mit 128 GB steht seit dem 2. Oktober mit 6.950 US-Dollar im Angebot, nach 3.999 US-Dollar zum Start und 4.699 US-Dollar im Frühjahr, im deutschen Handel standen am selben Tag 5.799 Euro. Die kleine Ausführung macht die Rechnung erst interessant: Zwei Geräte zu je 64 GB kosten 9.998 Dollar, bringen dieselben 128 GB Speicher und dieselben 546 GB/s wie zwei große, während ein einzelnes großes Gerät 6.950 Dollar kostet und 273 GB/s mitbringt. Wer Bandbreite kauft und mit 128 GB auskommt, kauft zwei kleine.

Für dasselbe Geld wie das große Paar haben wir in unserer Strecke mehrere Grafikkarten an einem Mainboard, mit getrenntem Grafikkartenspeicher und Hauptspeicher, und damit auch den genannten Offload-Hebel.

Wo V4.1-Flash wirklich weiter ist

Der KV-Cache. DeepSeek nennt 890 Bytes je Token für das globale KV-Cache des Modells, viermal weniger als bei DeepSeek-V4-Flash und 437-mal weniger als bei DeepSeek-V1. Auf eine Million Kontexttoken sind das 0,93 GB statt der 3,7 GB, die V4-Flash mit seiner vierfachen Rate brauchen würde. Für unseren eigentlichen Anwendungsfall, Agenten mit langen Kontexten auf kleiner Hardware, ist das die interessantere Zahl im Datenblatt. Genau um diese beiden Größen, Durchsatz im Decode und Speicherbedarf, ging es auch in unserem Vergleich zweier vLLM-Builds mit quantisiertem KV-Cache an unserer eigenen Lane.

Was wir daraus mitnehmen

DeepSeek-V4-Flash in der aktuellen Mischung ist ein Kandidat für unsere eigene Strecke, 159,6 GB Checkpoint sind eine Zahl, mit der sich rechnen lässt. Wir werden den Aufruf auf unserer Lane mit den vier RTX 5090 fahren und dabei Durchsatz im Decode wie im Parallelbetrieb messen.

Für die Geräteklasse DGX Spark bleibt die Empfehlung: Ein Einzelgerät ist ein Durchsatzpfad für ein Modell, dessen Checkpoint deutlich unter der Hälfte des gemeinsamen Speichers bleibt, plus KV-Cache für die Kontexte, die wir wirklich fahren. Die zweite Box bringt doppelten Speicher und doppelte Bandbreite, was im Decode bis Faktor 1,7 ankommt, was sie nicht bringt, ist ein zweiter Speicherpool.

Und für unsere Bewertungsliste eine Regel, die wir ab jetzt überall durchziehen: Wir rechnen mit den Bytes des Checkpoints und den gemessenen Bytes je Parameter, nicht mit der Parameterangabe aus der Pressemitteilung. Zwischen DeepSeek-V4-Flash und V4.1-Flash wächst die Parameterzahl um Faktor 2,7, die Bytes auf dem Band um Faktor 3,2. Offen bleibt für uns, wie sich ein DGX Spark-Verbund im Parallelbetrieb mit mehreren gleichzeitigen Anfragen verhält, also Token pro Sekunde und Anfrage bei vier und acht gleichzeitigen Sitzungen. Diese Zahl haben wir in unserem Lauf am 28. September nicht sauber erzeugt.

Weiterführende Quellen

Fragen?
Welches DeepSeek-Modell läuft auf zwei DGX Spark?+

DeepSeek-V4-Flash mit 284 Milliarden Parametern und einem Checkpoint von 159,6 GB. Wir haben am 28. September 2026 63,7 Token pro Sekunde im Einzelnutzerbetrieb gemessen, bei einer theoretischen Obergrenze von 74,7 Token pro Sekunde, die sich aus der Speicherbandbreite der beiden Geräte ergibt.

Warum passt DeepSeek-V4.1-Flash nicht auf zwei DGX Spark?+

Der Checkpoint wiegt 510,3 GB, die zwei Geräte bringen zusammen 256 GB einheitlichen Speicher. Davon waren in unserem Aufbau 186 GB für Gewichte und Zwischenspeicher übrig. Allein die Engram-Nachschlagetabellen des Modells belegen rund 200 GB davon, und ihre Größe steht im Checkpoint und ist nicht verkleinerbar.

Lohnt sich ein DGX Spark für uns?+

Als Einzelgerät für einen Durchsatzpfad mit einem Modell, dessen Checkpoint deutlich unter der Hälfte des gemeinsamen Speichers bleibt. Zwei Geräte verdoppeln Speicher und Bandbreite, nur der Verkehr über die Verbindung zwischen ihnen läuft über 50 GB/s gegen 546 GB/s in den gemeinsamen Speichern. Am billigsten zu haben ist das mit zwei Geräten zu je 64 GB, sofern das Modell in 128 GB passt. Für unsere Anforderung bleibt die x86-Lane mit mehreren Grafikkarten die Variante mit mehr Spielraum.