Qwen3.8-27B im Eigenbetrieb: Lokal auf 4× RTX 5090
Alibaba hat die Gewichte von Qwen3.8-27B am 13./14. August 2026 unter Apache 2.0 veröffentlicht: ein dichtes 28-Milliarden-Parameter-Modell mit 262.144 Token nativem Kontext, multimodal und — für uns entscheidend — selbst hostbar. Wir haben den Cutover am 18. August durchgeführt.
Was vorher lief
Auf unserem Inferenz-Host kipc5090 (192.168.180.3) lief zuvor ein Qwen3.5-122B-A10B-NVFP4 als Mixture-of-Experts. Das klang nach mehr Kapazität, war im Alltag aber nicht schneller oder zielführender: im direkten A/B-Vergleich auf echten Arbeitsaufgaben ergaben sich 33/34 bzw. 19/22 korrekte Lösungen — also ein Unentschieden. Dafür produzierte das 122B-Modell deutlich mehr Reasoning-Token und aktivierte pro Token nur rund 10 Milliarden Parameter statt der 27 Milliarden des neuen dichten Modells.
Die neue Konfiguration
Das Modell läuft als ki_training-qwen38-vllm mit vLLM 0.27.1 und Tensor-Parallel-Größe 4 über alle vier RTX 5090:
command:
- "--model"
- "/models/Qwen3.8-27B-FP8"
- "--served-model-name"
- "thinking"
- "text"
- "nothink"
- "vision"
- "gemma"
- "gemma-4"
- "qwen3.8-27b"
- "--tensor-parallel-size"
- "4"
- "--kv-cache-dtype"
- "fp8_e4m3"
- "--max-model-len"
- "262144"
- "--max-num-seqs"
- "64"
- "--gpu-memory-utilization"
- "0.92"
- "--enable-prefix-caching"
- "--enable-prompt-tokens-details"
- "--enable-auto-tool-choice"
- "--tool-call-parser"
- "qwen3_xml"
- "--reasoning-parser"
- "qwen3"
Die wichtigsten Unterschiede zur vorherigen Lane: der --reasoning-parser qwen3 extrahiert Thinking-Token sauber, der --tool-call-parser qwen3_xml passt zum Qwen-3-XML-Format (nicht zum Coder-Parser des 122B) und --enable-prompt-tokens-details liefert zusammen mit --enable-prefix-caching eine Aufteilung in neue und wiederverwendete Prompt-Token.
Speicher und Durchsatz
Jede der vier Karten zeigt unter Last rund 30,6 GB belegten VRAM. Das passt: die FP8-Gewichte des 27B-Modells belegen etwa 31 GB, der Rest ist KV-Cache und Scheduling-Reserve. Nach vier Tagen Dauerbetrieb lagen bei uns knapp 78 Millionen Prefill-Token und rund 5,9 Millionen generierte Token auf dem Server — das Modell ist also kein Dauerläufer im Leerlauf, sondern wird aktiv genutzt. Gemessen liegt die durchschnittliche Generierungsrate bei etwa 96 Token/s, mit Prompt-Durchsatz-Spitzen von rund 16.000 Token/s. Der Prefix-Cache trifft in etwa 43–45 % der Fälle.
Gateway und Lanes
Über das LiteLLM-Gateway auf 192.168.180.2:4000 sind öffentlich zwei Chat-Lanes erreichbar:
- thinking: Reasoning eingeschaltet, Standard-Route für komplexe Aufgaben.
- nothink: derselbe Endpunkt, aber mit
enable_thinking: false— für Aufgaben, bei denen überflüssiges Denken nur Tokens verbraucht.
Eine dritte interne Lane, thinking-cnc, ist ein Klon von nothink für einen spezifischen Produktions-Agenten, damit dessen Session nicht durch Overthinking blockiert. Vision-Aliasse werden inzwischen ebenfalls über denselben Host bedient; die separate Vision-Karte auf 192.168.180.202 wurde am 19. August ersatzlos gestrichen.
Unsere Sicht
Qwen3.8-27B ist das Modell, das wir für den lokalen Stack erwartet haben: dicht, hostbar, Apache-lizenziert und gut genug, um den vorherigen 122B-MoE zu ersetzen. Der Gewinn liegt weniger in einer höheren Aufgabenlösungsrate als in geringerer Komplexität: eine Lane statt mehrerer, ein Parser statt zwei, ein klarer Upgrade-Pfad. Wer selbst hostet, sollte den Wechsel prüfen — vorausgesetzt, die Hardware passt.
Weiterführende Quellen
Warum ersetzt ein 27B-dichtes Modell einen 122B-MoE?+
Im realen Arbeitsprofil lag der alte Qwen3.5-122B-A10B-NVFP4 im direkten A/B-Vergleich mit Qwen3.8-27B-FP8 unentschieden — bei ähnlicher Aufgabenlösungsrate. Der entscheidende Unterschied: das 27B-Modell produziert 3-11x weniger Reasoning-Token, aktiviert 27 Milliarden statt nur 10 Milliarden Parameter pro Token und vereinfacht die Infrastruktur, weil es auf einer einzigen Host-Lane läuft.
Passt ein 27B-Modell wirklich auf vier RTX 5090 mit 32 GB?+
Ja. Die FP8-Gewichte belegen rund 31 GB, der Rest geht in KV-Cache und Betriebsspielraum. Mit --gpu-memory-utilization 0.92 und fp8_e4m3 KV-Cache bleibt genug Luft für 64 parallele Sequenzen und Kontexte bis 262.144 Token. BF16 würde nicht mehr passen; FP8 ist hier die richtige Präzision.
Welche Endpunkte spricht das Gateway an?+
vLLM meldet sich unter den Aliassen thinking, text, nothink, vision, gemma, gemma-4 und qwen3.8-27b. Über das LiteLLM-Gateway auf 192.168.180.2:4000 sind öffentlich nur thinking und nothink erreichbar; nothink schaltet das Reasoning über chat_template_kwargs explizit aus. Die vision-Familie wurde am 19. August 2026 von der separaten Vision-Karte auf dieselbe 4×-5090-Lane konsolidiert.
Was bedeutet der Wechsel für Datenschutz und Souveränität?+
Nichts ändert sich am Grundsatz: Text, Bilder und Dokumente verlassen das eigene Netz nicht. Im Gegenteil — die Konsolidierung auf einem Host vereinfacht das Logging und das Monitoring. Prompt-Token-Details (--enable-prompt-tokens-details) zeigen sogar transparent, welche Anteile des Prompts aus dem KV-Cache wiederverwendet wurden.
senn-tech