KI-Radar Xing4.0-29B-A4B: offenes MoE aus China, 29 Milliarden schwer, 4 wach
Am 16./17. September 2026 hat XingChen-AGI das Modell Xing4.0-29B-A4B hochgeladen: 29 Milliarden Parameter, vier aktive pro Token, 256K nativer Kontext, Apache 2.0. Das Kürzel XingChen steht für die Modellreihe der KI-Forschung von China Telecom, bisher bekannt als TeleChat; die Trainingsberichte tragen dieselben Autorengruppen. Fünf Tage nach Release stehen 18.394 Downloads und 1.177 Likes im Repo, das offizielle GGUF-Repo kam am 20. September nach. Für unsere Testliste ist das ein ernstzunehmender Kandidat. Bei diesem Modell gehört der Lieferkettencheck aber mit auf den Tisch, und den führen wir hier offen.
Die Technik in einer Tabelle
| Größe | Xing4.0-29B-A4B |
|---|---|
| Parameter total / aktiv | 29B / rund 4B pro Token |
| Attention | MLA (Multi-head Latent Attention) |
| Experten | 64 geroutete + 1 geteilter, 4 aktiv |
| Aufbau | 40 Ebenen, Hidden 3584, mHC + MTP |
| Kontext | 256K nativ, erweiterbar auf 512K |
| Lizenz | Apache 2.0 |
| Trainiert auf | Ascend-910C-Cluster, MindSpore |
Die Ascend-Zeile ist die eigentliche Nachricht zwischen den Zeilen. Dieses Modell wurde komplett auf Huaweis NPU-Plattform trainiert, samt angepassten fused Operatoren; nach Anbieterangabe mit 96 Prozent mehr Durchsatz gegenüber dem Auslieferungszustand der Plattform. Der westliche Pfad (NVIDIA-GPUs, CUDA, PyTorch) ist nicht mehr der einzige, auf dem ein Modell dieser Klasse entstehen kann. Für den Betrieb hierzulande ändert das am Ablauf nichts: Ausgeliefert wird in Transformers-Schreibweise, inference-seitig stehen vLLM, SGLang und KTransformers auf der Karte, dazu ein Guide für llama.cpp. Die Karte empfiehlt als Sampling 0,7 bei Thinking-Aufgaben und 0,1 bei faktentreuen; das ist Detailarbeit, aber genau daran erkennt man, ob die Karte von Leuten geschrieben wurde, die das Modell selbst betrieben haben. Hier scheint das so.
Was der Anbieter vorlegt
Die Modellkarte stellt das Modell gegen zwei offene Konkurrenten derselben Gewichtsklasse, gemessen mit dokumentierten Harnesses, aber vom Hersteller selbst:
Auffällig ist das Profil, nicht die Spitze. Ein 4B-aktives MoE, das bei SWE-bench fast mit einem 3B-aktiven MoE gleichzieht und Terminal-Bench klar hinter sich lässt, zielt nachweislich auf Agentenarbeit; die Karte nennt Werkzeugaufruf, Mehrschritt-Planung und Feinabstimmung auf Vertragsprüfung und Tabellenverständnis als Anwendungsfall. Genau das Feld, auf dem wir unsere Eigenbau-Strecke bewegen. Ein Modell, das in dieser Liga in einer Woche auf 18.000 Downloads kommt, muss auf dem Schirm sein, selbst wenn es am Ende auf unserer Liste den Test nicht übersteht.
Zwei Abkürzungen aus der Aufbauzeile verdienen je einen Satz. MTP, Multi-Token Prediction, trainiert das Modell, mehrere Token vorauszusagen; bei der Inferenz zahlt sich das aus, wenn ein spekulativer Decoder diese Voraussagen mitlaufen lässt. Ob und wie die Karte diese Funktion beim Benchmark nutzt, bleibt im Detail unklar; die Footnotes nennen Temperatur, Modalität und Wiederholungen, aber keinen Speculative-Decoding-Parameter. mHC steht für hyperconnected Residualpfade, ein Architektur-Feinschliff aus dem Laborumfeld, ohne unabhängige Wirkungsbehauptung. Beides sind Punkte, die wir im Test selbst anfassen, nicht über die Tabelle beurteilen.
Und was kostet das an Hardware
Offizielle GGUF-Stufe ist IQ4_NL mit 20,1 GB Dateigröße, gemessen an den LFS-Metadaten des GGUF-Repos; die Karte rundet auf rund 18 GB. Gedacht ist das für eine einzelne Consumer-GPU. Für unsere Karten heißt das:
- RTX 5090 (32 GB): Gewichte plus MLA-KV-Cache passen mit Luft. 256K Kontext bleiben ein Versprechen, das wir nachrechnen müssen; MLA komprimiert den KV-Cache stark, aber die MLA-Unterstützung in llama.cpp ist jünger als das Modell.
- 24-GB-Karten: Die 20-GB-Datei sprengt das Budget zusammen mit dem Kontext. Expert-Offload in den RAM, das KTransformers- und cpu-trick-Muster aus der Szene, ist der Ausweg; zum bekannten Preis: PCIe wird der Engpass.
- Unsere Lane: Für 4× RTX 5090 ist die FP8-Variante im Hub der direktere Kandidat; ihre Dateigröße haben wir noch nicht verifiziert, sie steht auf dem Prüfstand vor dem ersten Wort über Einsatz.
Die Herkunftsgeschichte kurz: TeleChat 2.5 und TeleChat 3 haben Trainingsberichte mit Datenmischung und Infrastruktur-Details, offengelegt von einem Staatskonzern; das ist mehr Provenienz, als manche westliche Karte dieser Woche bietet, und zugleich der Grund, warum man die Zahlen trotzdem nicht ungeprüft übernehmen darf. Beides zusammen ergibt keinen Vertrauensvorschuss, aber eine belastbare Grundlage zum Testen.
Dazu eine Einordnung, die im Briefing dieser Woche so nicht stand: Auf den Trend-Repos des Hubs fanden sich fast nur Dauerbrenner, gte-Reranker, Qwen3-8B, e5-Embeddings, dazu Quantisierungsspiegel bestehender Modelle (die GGUF-Mirrors von GLM-4.7-Flash, zuletzt von mradermacher am 17. September aktualisiert). In solchen Wochen misst sich ein echtes Neumodell an 18.000 Downloads; der Rest der Bewegung ist Spiegel-Nachfrage nach Bewährtem. Xing4.0 ist in diesem Bild das einzige Neumodell mit Substanz.
Lieferkette, offen betrachtet
China Telecom ist ein staatlich kontrollierter Konzern. Was das bedeutet und was nicht:
- Lizenz: Apache 2.0. Mehr Rechte braucht Eigenbetrieb nicht; die Gewichte selbst sind rechtlich sauber.
- Datenhoheit: Solange das Modell im eigenen Netz auf eigener Hardware rechnet, verläuft kein Byte nach China. Das ist dasselbe Argument wie bei jedem on-prem Modell, und der Grund, warum wir API-Varianten internationaler Anbieter gar nicht erst einsetzen.
- Restrisiko: Die Herkunft der Trainingsdaten und damit Copyright-Fragen sind bei einem China-Modell, mitten im Wettrennen der offenen Gewichte veröffentlicht, nicht besser und nicht schlechter dokumentiert als bei der Konkurrenz. Überprüfbare Provenienz gibt es bei keinem offenen Gewichts-Release dieser Woche, auch nicht bei westlichen.
- Pflege: Das GitHub-Repo ist fünf Tage alt, 82 Sterne, ein offenes Issue. Ob die Reihe außerhalb der China-Telecom-eigenen Projekte überlebt, entscheidet sich in Quartalen, nicht in Tagen.
Unser Verfahren bleibt deshalb das bewährte: isolierte Testumgebung, unsere 34-Aufgaben-Stichprobe aus dem Eigenbetrieb, Vergleich gegen die laufende Qwen3.8-27B-Lane. Erst danach fällt ein Wort über Einsatz. Wer vor diesem Test schon Produktempfehlungen für das Modell sieht, möge an die erste Woche von TeleChat denken; die Reihe ist jung, und die Karte ist gut geschrieben. Beides zusammen ist keine Qualitätsgarantie, aber ein guter Startpunkt.
Weiterführende Quellen
- Modellkarte XingChen-AGI/Xing4.0-29B-A4B: Architektur, Tabellen, Footnotes zu den Runs
- GGUF-Repo mit IQ4_NL: offizielle Einzel-GPU-Fassung samt llama.cpp-Guide
- GitHub XingChen-AGI/Xing4.0-29B-A4B: Serving-Anleitungen (vLLM, SGLang, KTransformers)
- Training Report of TeleChat3-MoE (arXiv): Vorgänger-Reihe, gleiche Autorengruppe
- FP8-Variante im Hub: für Karten mit richtig Speicher
- Aus dem Haus: MoE am Edge, GLM 5.2 im Radar
Wer steckt hinter Xing4.0-29B-A4B?+
Die KI-Sparte von China Telecom (China Telecom Artificial Intelligence Technology Co., Ltd.), ein staatlich kontrollierter Telekommunikationskonzern. Das Modell führt die TeleChat-Reihe unter neuem Namen fort; die Trainingsberichte zu TeleChat 2.5 und TeleChat 3 liegen als arXiv-Preprints derselben Autorengruppen vor. An der Rechtslage der Gewichte ändert die Herkunft nichts: Sie stehen unter Apache 2.0.
Was heißt 29B-A4B für den Betrieb?+
29 Milliarden Parameter liegen im Speicher, pro Token werden nur rund 4 Milliarden aktiv gerechnet. Ein Lehrbuch-Mixture-of-Experts mit 64 gerouteten plus einem geteilten Experten, vier davon pro Token aktiv. Offizielle GGUF-Stufe ist IQ4_NL mit rund 20 GB: Das passt auf eine 24-GB-Karte, wenn der Rest in den Systemspeicher ausgelagert wird, und mit Luft auf eine RTX 5090 mit 32 GB inklusive KV-Cache.
Sind die Benchmark-Zahlen überprüfbar?+
Nein, sie sind Anbieterangabe. Die Modellkarte nennt SWE-bench Verified 75,00 gegen Qwen3.6-35B-A3B 76,00 und Terminal-Bench 2.1 57,50 gegen 51,50, jeweils mit Harness, Temperatur und Mittelwerten über mehrere Läufe dokumentiert, aber ohne unabhängige Nachmessung. Bei einem drei Tage alten Modell ist das normal; es bedeutet nur, dass bisher niemand außer dem Hersteller selbst gemessen hat.
senn-tech