senn-techsenn-tech
KI-Hardware
KI-Hardware2026-10-05· Von Franz Senn

Zwei GB300-Stationen, zwei 400-G-Kupferkabel: Was das zweite Gehäuse wirklich multipliziert

Logo von NVIDIA
Die GB300-Klasse ist als NVIDIA DGX Station lizenziert und wird von ASUS, HP und MSI als Turm gebaut. StorageReview verband erstmals zwei dieser Türme und veröffentlicht Durchsatzwerte für den Paarverbund. (Quelle: Simple Icons, CC0)

StorageReview hatte zwei Stationen der GB300-Klasse gleichzeitig im Labor: den ASUS ExpertCenter Pro ET900N G3 und die HP ZGX Fury AI Station, zwei Türme mit je einem NVIDIA-GB300-Grace-Blackwell-Ultra-Superchip. Brian Beeler verband beide Geräte mit zwei 400-G-Kupferkabeln direkt miteinander und legt, nach eigener Aussage von StorageReview, die ersten Durchsatzwerte für diese Konfiguration vor. Wir schauen genauer hin, weil der Mechanismus hinter den Sprüngen uns von eigener Hardware bekannt ist. Und weil sich die Entscheidung zwischen zwei Cluster-Moden an diesen Kurven ablesen lässt, unabhängig von der Geräteklasse.

Was in den Türmen steckt und wie sie reden

Die Werte stammen von der HP-Produktseite, Stand 5. Oktober 2026. Beide Türme teilen sich diese Technik, die NVIDIA für die DGX Station spezifiziert.

PfadAusführung
CPUNVIDIA Grace, 72 Neoverse-V2-Kerne, LPDDR5x über vier SOCAMM-Module
CPU-Speicher496 GB LPDDR5x mit 396 GB/s
GPUNVIDIA Blackwell Ultra, 252 GB HBM3e mit 7,1 TB/s
Kohärenter Speicher748 GB gesamt, 252 GB HBM plus 496 GB LPDDR5x
Rechenleistungbis zu 20 PFLOPS FP4, mit FP4-Quantisierung im Model-Harness
Netzwerk2x QSFP112 mit je 400 Gb/s an einem ConnectX-8-SuperNIC
Datenträger2x M.2 PCIe Gen5 über die CPU, 2x M.2 PCIe Gen6 über den ConnectX-8
Strom und Bauformdedizierter 200/240-V-Kreis, Turm oder 5U-Einschub, Flüssigkeitskühlung

Der ConnectX-8 ist mehr als eine Netzwerkkarte: Sein eingebauter PCIe-Switch versorgt auch die beiden Gen6-M.2-Plätze. Das wirkt auf den ersten Blick wie eine Randnotiz, bestimmt aber die Verkabelungslogik, denn über denselben Strang laufen Datenträger und Netzwerk.

Das Vorgehen für den Paarverbund steht als nummerierte Spielanleitung bei NVIDIA: Kabel paarrailweise stecken (QSFP0 an QSFP0, QSFP1 an QSFP1), je Strang ein eigenes /24-Netz bei 9000 Bytes MTU, RoCEv2 Punkt-zu-Punkt, dann Validierung auf Linktraining, Ping und RDMA-Schreibtest, am Ende NCCL auf beide Stränge legen. StorageReview gab den Link zu Claude Code und ließ die Anleitung abarbeiten; das Setup lief durch, inklusive NCCL-Bericht. Für die Bewertung heißt das: Die Anleitung ist klein und exakt genug, dass ein Agent sie fehlerfrei umsetzt.

Die NVIDIA-Spielanleitung für zwei StationenZwei 400-G-DACs, railweise gestecktQSFP0 an QSFP0, QSFP1 an QSFP1Je Strang ein eigenes /24RoCEv2 Punkt-zu-Punkt, 9000 Bytes MTUTraining, Ping, RDMA-Testmlx5_0 und mlx5_1 müssen aktiv meldenNCCL auf beide SträngeNCCL_IB_HCA=mlx5_0,mlx5_1
Vier Schritte, gespielt von einem entfernten Rechner per SSH auf beide Stationen. Die Validierung prüft Linktraining, Jumbo-Ping und RDMA-Schreibtest auf beiden Strängen. (Quelle: NVIDIA-Spielanleitung Connect two stations, durchgeführt von StorageReview)

Gemessen hat StorageReview dann einen ehrlichen Fabric: Pro Strang 392 Gb/s GPUDirect-RDMA aus GPU-Speicher zu GPU-Speicher, beides sind 98 Prozent der Nennrate, 1,46 µs Latenz beim 8-Byte-Schreiben. In den NCCL-Kollektiven erreichten Broadcast und einseitiges Send/Receive 98 GB/s, All-Reduce 92 GB/s, All-to-All 80 GB/s, alles gegen die rund 100 GB/s, die zwei QSFP112-Kabel netto tragen. Zum Vergleich: Beim DGX Spark hing der ConnectX-7 hinter zwei PCIe-5.0-x4-Pfaden und kam praktisch auf rund 200 Gb/s. Hier bringt der zweite Turm die vollen 800 Gb/s tatsächlich auf die Waage.

Warum das zweite Gehäuse verdreifacht bis verelffacht

Der Sprung kommt nicht aus dem schnelleren Kabel, sondern daher, wo die Gewichte wohnen. Am Beispiel GLM-5.2 im NVFP4-Checkpoint, rund 433 GB groß: Auf einer einzelnen Station passen nur 252 GB HBM, also liegen etwa 215 GB Experten-Gewichte im LPDDR5x. Jeder Decode-Schritt, der diese Bereiche anfasst, überquert dann den Pfad mit 396 GB/s statt der 7,1 TB/s des HBM. Das ist der Grund, warum eine einzelne Station mit dem Modell nur 139 Ausgabe-Token pro Sekunde bei 32 gleichzeitigen Anfragen liefert. Im Tensor-Parallel-Betrieb über zwei Stationen hält jede der beiden GPUs etwa die Hälfte des Modells im HBM, die Auslagerung entfällt, und das Paar misst 1.525 Token pro Sekunde bei derselben Nebenläufigkeit.

Ausgabe-Token pro Sekunde bei 32 gleichzeitigen Anfragen, kurze PromptsGLM-5.2, 1 Turm139GLM-5.2, 2 Türme1525GLM-5.3, 1 Turm188GLM-5.3, 2 Türme853MiniMax-M3, 1 Turm1041MiniMax-M3, 2 Türme277601600
Gleiche Nebenläufigkeit, kurze Prompts mit 512 Eingangs- und 512 Ausgangs-Tokens. GLM-5.2 und GLM-5.3 lagern auf einem Turm in den LPDDR5x aus, MiniMax-M3 liegt bereits fast vollständig im HBM und skaliert deshalb nur rechenbedingt. (Quelle: StorageReview, Cluster-Messung vom 5. Oktober 2026)

Erwähnenswert bleiben zwei Ehrlichkeiten im Datensatz. Erstens: Die von StorageReview genannte 27-fache Verbesserung bei GLM-5.3 vergleicht 188 Token pro Sekunde einer Station bei 32 Streams gegen 5.018 Token pro Sekunde des Paares bei 256 Streams, das ist kein Vergleich gleicher Nebenläufigkeit. Bei gleichen 32 Streams misst das Paar dort 853, nach 1.301 bei 16 Streams. Zweitens: Jeder Punkt ist ein einzelner Durchlauf, die Kurven haben Dellen (GLM-5.3 bei 32, MiniMax-M3 bei 128), und StorageReview berichtet sie unbereinigt. Bei Tensor-Parallel hängt jede Ebene von einem Kollektiv ab, das vor dem nächsten Schritt durch sein muss; bei hoher Nebenläufigkeit kippen Batching-Entscheidungen, und das sieht man den Kurven an.

Wer ohnehin passt, trennt Prefill und Decode

Für Modelle, die auf einer Station Platz finden, war der Tensor-Parallel-Weg der schlechtere. StorageReview gab jedem Turm eine volle Kopie und trennte die Phasen: Der ASUS-Turm erledigt das Prefill und schiebt den KV-Cache hinüber, der HP-Turm decodiert ohne Unterbrechung. Bei GLM-5.3 Flash brachte das 2.721 statt 828 Token pro Sekunde bei 32 Streams auf dem kurzen Profil, also das 3,3-Fache, und auf dem prefill-lastigen Profil 2.448 statt 1.219, also das Doppelte. Beim DeepSeek V4.1 Flash, dessen Engram-Nachschlagetabellen mit 188,8 GB und weitere 132 GB Expertengewichte im Grace-Speicher lagen, erreichte das Paar 5.248 Ausgabe-Token pro Sekunde bei 256 Streams, der Höchstwert der ganzen Messreihe.

Die Faustregel aus dem Artikel ist auf jede Hardware übertragbar: Passt das Modell nicht in den schnellen Speicher, verteilt man die Gewichte über beide GPUs; passt es, betreibt man zwei volle Kopien und trennt Prefill von Decode. Der Zuwachs erscheint dabei erst ab ausreichender Nachfrage, bei ein und zwei gleichzeitigen Anfragen arbeitet der Decode-Turm allein genauso schnell wie vorher.

Was davon für unsere vier RTX 5090 gilt

Unsere produktive Sprachlane läuft auf einem Host mit vier RTX 5090 und zusammen 127 GiB Grafikkartenspeicher. Zwischen CPU und GPU gibt es dort keinen kohärenten Link, der Ausweichpfad führt über den PCIe-Slot und liegt deutlich unter der Hälfte dieser 396 GB/s. Wir laufen gegen denselben Bruch, zwei Größenordnungen tiefer: Bei uns entscheidet die Quantisierung, ob ein Modell überhaupt läuft, bei der GB300-Klasse entscheidet die Gehäusezahl, ob es schnell läuft. Die Anschaffung selbst ist für uns keine Frage, auf den Herstellerseiten von HP und ASUS steht kein Preis (Stand 5. Oktober 2026), und die Geräteklasse bedient Teams, die keinen Einschub im Rechenzentrum kriegen oder wollen.

Drei Mitnahmen bleiben trotzdem:

  1. Die Regel Tensor-Parallel gegen Prefill/Decode gilt unabhängig von der Geräteklasse und lässt sich gegen unsere Lane-Kurven prüfen, sobald wir zwei GPU-Hosts je Vollkopie betreiben.
  2. Die Zahl, die beim Auslagern über den Durchsatz entscheidet, ist die Bandbreite des Ausweichpfads, nicht die PFLOPS-Zahl auf dem Datenblatt. 7,1 TB/s gegen 396 GB/s ist eine 18-fache Klippe, und genau die macht aus dem zweiten Gehäuse ein Mehrfaches.
  3. Das Fabric-Playbook (Kupfer statt Optik, RoCEv2 Punkt-zu-Punkt, MTU 9000, ein /24 pro Strang, Validierung mit ib_write_bw) ist dokumentiert und agententauglich. Für Tensor-Parallel über Rechner hinweg gehört dazu aber genau dieser Bandbreitenbereich um 100 GB/s; das ist ein eigenes Fabric und kein Aufsatz auf ein Normalnetzwerk.

Weiterführende Quellen

Fragen?
Wie schnell ist die Verbindung zwischen zwei GB300-Stationen wirklich?+

StorageReview maß mit GPUDirect-RDMA 392 Gb/s je der beiden 400-G-Stränge, das sind 98 Prozent der Nennrate, und 1,46 µs Latenz für einen 8-Byte-Schreibvorgang. In den NCCL-Kollektiven erreichten Broadcast und einseitiges Send/Receive 98 GB/s von den rund 100 GB/s, die zwei QSFP112-Kabel netto tragen. Die Messungen stammen vom 5. Oktober 2026.

Bringt ein zweites Gehäuse immer ein Vielfaches?+

Nein. Bei Modellen, die den Grafikspeicher sprengen und in den Arbeitsspeicher auslagern, brachte das zweite Gehäuse das 11-Fache bei 32 gleichzeitigen Anfragen (GLM-5.2). Bei Modellen, die auf eine einzelne Station passen, bringt die Aufteilung von Prefill und Decode 2- bis 3,3-Faches, und bei ein bis zwei gleichzeitigen Anfragen bringt der Paarverbund dort praktisch nichts.

Gelten die Ergebnisse für unsere Hardware?+

Der Mechanismus gilt, die Zahlen nicht. Unser 4x-RTX-5090-Host hat 127 GiB Grafikkartenspeicher und keinen kohärenten Link zwischen CPU und GPU, der Ausweichpfad führt über den PCIe-Slot. Bei uns entscheidet die Quantisierung, ob ein Modell läuft, bei der GB300-Klasse entscheidet die Gehäusezahl, ob es schnell läuft.