senn-techsenn-tech
KI-News
KI-News2026-08-26· Von Franz Senn

Qwen3.8-Flash-Next: 125B-MoE für den lokalen Stack?

Während Qwen3.8-27B gerade in die Eigenbetriebe einzieht, hat Alibaba bereits den nächsten Schritt angekündigt: Qwen3.8-Flash-Next soll die Architektur der kommenden Qwen4-Familie früh zugänglich machen — und ist selbst ein vollwertiges, offenes Modell.

Die angekündigten Spezifikationen

Nach dem Teaser vom 25. August 2026 soll Qwen3.8-Flash-Next folgende Struktur haben:

  • 125 Milliarden Parameter im Hauptmodell
  • 51 Milliarden Parameter in zusätzlichen N-Gram-Embedding-Tabellen
  • 6 Milliarden aktive Parameter pro Token
  • Multimodal, MoE-Architektur
  • Offene Gewichte innerhalb von etwa einem Tag nach der Ankündigung

Keine offiziellen Benchmarks, kein fester Termin — aber die Architektur ist bemerkenswert genug, um sie ernst zu nehmen.

Die N-Gram-Idee

Der Clou sind die 51 Milliarden N-Gram-Embeddings. Das Modell nimmt die letzten Token, bildet einen Hash über ihre N-Gramme und holt aus einer riesigen Lookup-Tabelle Vektoren, die in den Hidden State gemischt werden. Das Hauptmodell muss wiederkehrende lokale Muster nicht mehr selbst erlernen, sondern kann sie direkt nachschlagen. Jeder Token verwendet dabei nur einen winzigen Bruchteil der Tabelle, aber die Tabelle als Ganzes muss im Speicher verfügbar sein.

Speicherbedarf von Qwen3.8-Flash-Next (idealisiert, 4 bpw)125B Hauptgewichte58.2 · 58,2 GiB51B N-Gram-Tabellen23.7 · 23,7 GiBGesamt (4 bpw)82 · 82,0 GiB090
Selbst bei idealer 4-Bit-Quantisierung liegen die Gewichte über 80 GiB — ohne KV-Cache und Overhead. (Quelle: NVIDIA Developer Forums, Diskussion Qwen3.8-Flash-Next)

Hardware-Rechnung für den Eigenbetrieb

Unser 4×-RTX-5090-Host bietet 128 GB VRAM. Die Grobrechnung sagt: bei idealen 4 bpw passen die 176 Milliarden Parameter gerade noch, aber nur wenn die Embedding-Tabellen auch tatsächlich in 4 Bit liegen. In der Praxis werden Embedding-Layer oft in FP16 oder BF16 gehalten, und der KV-Cache kommt obendrauf.

Wahrscheinliches Szenario:

  • FP8 des Hauptmodells: ~62 GiB für die 125B, dazu vielleicht 25–50 GiB für die N-Gram-Tabellen je nach Datentyp, plus KV-Cache.
  • FP8 alles: wahrscheinlich zu knapp für vier 32-GB-Karten, sobald mehrere Anfragen parallel laufen.
  • 4-Bit-Quantisierung: technisch möglich, aber die Qualität der N-Gram-Lookups ist ungewiss.

Das Modell ist also genau an der Grenze dessen, was eine Workstation-Klasse mit vier Karten leisten kann. Wer es produktiv selbst betreiben will, braucht entweder H100/H200 oder eine sehr gute Quantisierungsstrategie.

Was das für unseren Stack bedeutet

Wir werden Qwen3.8-Flash-Next testen, sobald die Gewichte verfügbar sind. Realistisch bleibt Qwen3.8-27B aber die primäre Lane: es passt, es läuft, es liefert. Flash-Next wird eher ein Experimentier-Modell — entweder quantisiert auf demselben 4×-5090-Host oder über die API von Alibaba Cloud, bis die Hardware nachzieht.

Unsere Sicht

Qwen3.8-Flash-Next ist ein Vorbote der Qwen4-Architektur, nicht nur ein Zwischenrelease. Die Kombination aus großem Lookup-Speicher und geringem aktiven Anteil ist ein neuer Kniff im MoE-Design. Für den Mittelstand bleibt aber die alte Regel: erst messen, dann aufrüsten. Die Architektur ist spannend, die Hardware-Rechnung aber nicht trivial.

Weiterführende Quellen

Fragen?
Wann erscheinen die offenen Gewichte von Qwen3.8-Flash-Next?+

Alibaba hat das Modell am 25. August 2026 als Architektur-Vorschau geteasert und offene Gewichte innerhalb von etwa einem Tag angekündigt. Konkrete Benchmarks und ein exaktes Releasedatum lagen zum Zeitpunkt der Ankündigung noch nicht vor.

Was bedeuten 125B plus 51B N-Gram-Embeddings bei nur 6B aktiv?+

Das Hauptmodell hat 125 Milliarden Parameter, dazu kommen 51 Milliarden trainierbare N-Gram-Lookups. Pro Token werden aber nur 6 Milliarden Parameter aktiv geschaltet. Das ist der klassische MoE-Trade-off: viel Kapazität im Hintergrund, wenig Rechenaufwand pro Token. Der Haken: die vollen 176 Milliarden Parameter müssen trotzdem irgendwo gespeichert werden.

Passt das Modell auf unsere 4× RTX 5090?+

Idealisiert gerechnet: 125B plus 51B bei 4 bpw ≈ 82 GiB, also knapp über der Speichermarke der vier Karten (128 GB VRAM). Realistisch dürfte selbst FP8 knapp werden, weil Embedding-Tabellen oft in höherer Präzision gehalten werden und KV-Cache obendrauf kommt. Für den lokalen Stack ist das ein Grenzfall — spannend, aber nicht selbstverständlich.

Was sind N-Gram-Embeddings?+

Das Modell hasht die letzten Token, sucht passende Vektoren in einer großen Lookup-Tabelle und mischt diese in den Hidden State ein. Damit muss das Hauptnetz häufige lokale Muster nicht mühsam rekonstruieren. 51 Milliarden Parameter für diese Tabelle sind allerdings ungewöhnlich groß und stellen die Quantisierung vor neue Fragen.