senn-techsenn-tech
KI-News
KI-News2026-09-22· Von Franz Senn

Warten auf Qwen4: Was Alibaba am 22. September wirklich gesagt hat

Seit dem Vormittag hängt eine Grafik durch die Feeds: vier Kacheln mit den Aufschriften Qwen4-Max, Qwen4-Flash & Qwen4-Plus, Qwen4-27B, darüber „Qwen4 系列 Coming Soon“. Dazu die Behauptung, Alibaba habe auf der Apsara Conference in Hangzhou genau diese Modelle angekündigt, und mehrere davon ließen sich auf lokaler Hardware betreiben. Wir gehen genauso daran wie an jedes Modell, das angeblich gerade erschienen ist: nachmessen, nicht nacherzählen. Stand 22. September, 11 Uhr MESZ, gibt es kein Qwen4-Modell zum Anfassen.

Was belegt ist und was nicht

Die Meldung hat einen harten Kern und eine weiche Kruste. Der Kern steht wörtlich in Alibabas Pressemitteilung vom 22. September: Qwen 4 sei „currently in training“, außerdem ein Fahrplan für Qwen4.5 und Qwen5 mit 5 bis 10 Billionen Parameter. Dazu die angekündigten Nebenprodukte: der Beschleuniger Zhenwu V900, Qwen3.8-LiveTranslate, Qwen-Audio-3.1 in drei Varianten, Qwen-Image-3.1 für das laufende Jahr, die Plattform Qwen Intelligence. Die Fachmedien, die an diesem Tag im Saal saßen (快科技 via NetEase, IT之家), berichten exakt diese Punkte und keine Modellfamilie.

Markenzeichen von Qwen
Qwen ist die Modellfamilie von Alibaba Cloud. Die offene Linie heißt über Qwen3.6 und Qwen3.7 hinweg Qwen3.8; Qwen4 ist davon bisher nur ein Name im Code. (Quelle: Wikimedia Commons, Datei Qwen_Logo.svg)
BehauptungPrüfstelle am 22.09.Ergebnis
Vier Qwen4-Modelle sind angekündigtPressemitteilung von Alibabakeiner der vier Namen kommt vor
Die Modelle sind schon buchbarModellkatalog Model Studio, Stand 22.09.qwen3.8-max, qwen3.7-plus, qwen3.8-flash
Die Gewichte sind downloadbarHugging-Face-API, selbst abgefragt468 Modelle der Qwen-Org, keines mit Qwen4 im Namen
Lokal betreibbareigene Rechnungnichts, wofür es eine Datei gäbe

Woher die Grafik stammt

Die vier Namen tauchen an drei Stellen auf, keine davon ist Alibaba. Ein X-Post vom Messegelände zählt sie im Wortlaut auf (@CuiMao, „Qwen4 全家桶"), ein kleiner Navigations-Aggregator beschreibt eine Folie, die Qwen4 mit „Coming Soon“ markiert (chooseai.net, 83 Aufrufe, der Vorspann maschinell erstellt), und ein Forenthread auf linux.do fasst dieselbe Liste zusammen. Das ist eine Weitergabe über drei Mundstücke, keine Bestätigung.

Der deutlichere Hinweis steckt im Rand. Derselbe Satz über „vier Kernmodelle“ steht als Baustein auf automatisch generierten Weibo-Seiten, die von einem Filmstart, einem Gebrauchtwagenhandel und einem Auftrittsklatsch handeln; SEO-Füllmaterial klebt diesen Satz an jeden beliebigen Kontext. Und die Grafik ist keine Folienfotografie: Sie gibt die X-Aufzählung 1:1 wieder, inklusive des Kategoriefehlers, mit Qwen4-27B eine Größenstufe neben die Tarifstufen Max, Plus und Flash zu setzen. Die API der Hub-Plattform haben wir selbst befragt, Suchwort Qwen4: null Treffer bei der Qwen-Organisation, dafür Test-Fixtures Dritter, die den Architektur-Namen im Repo-Namen tragen.

Die Architektur ist längst da, nur unter anderem Namen

Die Korrektur der Meldung fällt interessanter aus als die Meldung. Was als Qwen4-Architektur gemeint ist, liegt seit 26. August offen im Hub: Qwen3.8-Flash-Next, auf der Modellkarte ausdrücklich eine experimentelle Vorschau der Architektur, die Qwen4 tragen soll. Wir haben config.json selbst gelesen, nicht den Blogartikel: architectures = Qwen4ExpForConditionalGeneration, model_type = qwen4_exp, 512 Experten mit 10 gerouteten pro Token plus einem geteilten, 48 Schichten, davon 36 mit linearer Attention über Gated DeltaNet und 12 mit Qwen Sparse Attention, dazu Gated Residual und die N-Gram-Tabelle. 125 Milliarden Parameter gesamt, 6 aktive pro Token.

Damit ist auch die Frage beantwortet, die in der Diskussion unter der Grafik stand, ob das das Ende des Mixture-of-Experts sei. Nein. Das Modell bleibt beim MoE und legt eine zweite Achse daneben, die N-Gram-Embeddings mit 51 Milliarden Einträgen, von Alibaba damit begründet, dass sich so eine Tabelle leichter auslagern lasse als zusätzliche Experten. Wer Qwen4 für eine Abkehr vom MoE hält, hat den Code nicht gelesen, den es schon gibt.

Was davon auf unsere Karten passt

Unser Inferenz-Host hat vier RTX 5090 mit zusammen 128 GB VRAM, Details in unsere eigene KI-Strecke. Für Qwen4 gibt es darauf keine Rechnung, weil es keine Gewichte gibt. Die Rechnung, die es schon gibt, ist die N-Gram-Tabelle der Architektur: Sie liegt als eigene Datei mit 47,7 GiB im Hub und ist damit größer als unser Aktivanteil an den Hauptgewichten. Der offene Pull-Request sgl-project/sglang#40235 vom 18. September versucht, diese Tabelle dateibasiert in Host-Speicher zu lagern, und meldet für FP8 im Tensor-Rank 4 ohne Begrenzung 71 GiB fest belegten Host-Speicher, bei einem Deckel von 64 GiB noch 49 GiB, bei 32 GiB 15 GiB, bei 24 GiB 6 GiB, um den Preis von 9,2 statt 8,6 ms pro Token.

Host-RAM für die N-Gram-Tabelle, FP8, Tensor-Rank 4ohne Deckel, pinned71 · 71 GiB · 8,62 ms/tokenDeckel 64 GiB49 · 49 GiB · 9,16 ms/tokenDeckel 32 GiB15 · 15 GiB · 9,20 ms/tokenDeckel 24 GiB6 · 6 GiB · 9,12 ms/token080
Der größte Sprung liegt beim ersten Deckel: 71 auf 49 GiB, die Latenz steigt dabei um sechs Prozent. (Quelle: Eigene Auswertung des offenen SGLang-Pull-Requests 40235, Zahlen des Autors)

Dazu zwei Dinge, die uns 2026 schon zweimal erwischt haben. Erstens die Lizenz: Qwen3.8-27B steht auf Apache 2.0, Flash-Next auf der Qwen Community Model License 1.0 und Qwen3.8-2.4T-A95B auf einer eigenen Qwen3.8-Max-Lizenz, also zweimal nicht Apache. Vor jedem kommerziellen Einsatz heißt das, die Datei LICENSE im Repo zu öffnen statt das Banner im Hub zu lesen. Zweitens die Lagerverschiebung: Bei einer Architektur, in der Tabellen, KV-Cache und Aktivanteil um denselben Speicher streiten, wandert das Problem dorthin, wo niemand hinschaut. Bei uns war das der KV-Cache, bei dem Vier-Tage-Test und beim Nachzug über gemietete Cloud.

Worauf wir warten

Wir warten nicht auf die Ankündigung, wir warten auf das Repo. Drei Beobachtungen genügen, und zu keiner brauchen wir eine fremde Meinung:

  • Ein Repo im Hub. Ein Modell mit Qwen4 im Namen unter der Qwen-Organisation macht die Familie zur Tatsache. Bis dahin ist sie ein Gerücht mit gutem Quelltext.
  • Eine Kennung im Katalog. qwen4-max in der Modellübersicht von Model Studio wäre dasselbe Signal von der Verkäuferseite. Der Katalog ist auf Stand 22. September und nennt weiterhin Qwen3.8.
  • Eine publizierte Folie. qwen.ai oder das Qwen-Blog mit dem Familienbild, dann lässt sich über Tarife, Kontextlängen und Lizenzen reden statt über Vermutungen.

Die Konferenz läuft bis 24. September, es kann also noch landen. Der Maßstab bleibt für uns gesetzt: Was auf dem 27B-Segment kommt, muss an Qwen3.8-27B im Eigenbetrieb vorbei, dem ersten Modell in unserer Größenklasse, das bei uns verlässlich liefert. Wird Qwen4 wieder so wie 3.8, wäre das ein gutes Ergebnis und kein Selbstläufer. Gefahren wird bis dahin die gleiche Strecke wie immer: isolierte Umgebung, unsere Aufgaben aus dem Eigenbetriebs-Beitrag, Vergleich gegen die laufende Lane, erst danach ein Wort über Deployment.

Weiterführende Quellen

Fragen?
Ist Qwen4 angekündigt?+

Als Produkt nein. Alibabas eigene Pressemitteilung vom 22. September 2026 hält Qwen 4 für „derzeit in training“ und nennt als Zielgröße 5 bis 10 Billionen Parameter für die Serien Qwen4.5 und Qwen5. Die vier Namen Qwen4-Max, Qwen4-Flash, Qwen4-Plus und Qwen4-27B stehen in keinem von Alibaba veröffentlichten Artefakt, das wir am selben Tag erreichen konnten.

Können wir Qwen4 lokal betreiben?+

Nein, es gibt keine Gewichte. Die Hugging-Face-API liefert auf die Suche nach Qwen4 keinen Treffer unter der Qwen-Organisation. Was auf unseren vier RTX 5090 läuft, ist Qwen3.8-27B unter Apache 2.0, dazu Qwen3.8-Flash-Next als Architektur-Vorschau unter der Qwen Community Model License 1.0.

Ist Qwen4 kein Mixture-of-Experts mehr?+

Doch. Die ausgelegte Architektur liegt offen: 512 Experten, 10 pro Token geroutet plus ein geteilter Experte, 125 Milliarden Gesamt- bei 6 Milliarden aktiven Parametern. Neu ist eine zweite Skalierungsachse daneben, eine N-Gram-Embedding-Tabelle über 51 Milliarden Einträge, deren Auslagerung uns im Betrieb beschäftigt.

Woran erkennen wir den Release?+

An drei Dingen, in dieser Reihenfolge: ein Repo mit Qwen4 im Namen unter der Qwen-Organisation im Hub, eine Modellkennung qwen4-max im Katalog von Model Studio, eine veröffentlichte Folie im Qwen-Blog. Die Konferenz läuft bis 24. September 2026, danach ist der Stand überprüfbar.