senn-techsenn-tech
KI & Entwicklung
KI & Entwicklung2026-08-30· Von Franz Senn

Qwen3.8-27B im Eigenbetrieb: Lokal auf 4× RTX 5090

Alibaba hat die Gewichte von Qwen3.8-27B am 13./14. August 2026 unter Apache 2.0 veröffentlicht: ein dichtes 28-Milliarden-Parameter-Modell mit 262.144 Token nativem Kontext, multimodal und, für uns entscheidend, selbst hostbar. Wir haben den Cutover am 18. August durchgeführt.

Was vorher lief

Auf unserem Inferenz-Host kipc5090 lief zuvor ein Qwen3.5-122B-A10B-NVFP4 als Mixture-of-Experts. Das klang nach mehr Kapazität, war im Alltag aber nicht schneller oder zielführender: im direkten A/B-Vergleich auf echten Arbeitsaufgaben ergaben sich 33/34 bzw. 19/22 korrekte Lösungen, also ein Unentschieden. Dafür produzierte das 122B-Modell deutlich mehr Reasoning-Token und aktivierte pro Token nur rund 10 Milliarden Parameter statt der 27 Milliarden des neuen dichten Modells.

Die neue Konfiguration

Das Modell läuft als ki_training-qwen38-vllm mit vLLM 0.27.1 und Tensor-Parallel-Größe 4 über alle vier RTX 5090:

command:
  - "--model"
  - "/models/Qwen3.8-27B-FP8"
  - "--served-model-name"
  - "thinking"
  - "text"
  - "nothink"
  - "vision"
  - "gemma"
  - "gemma-4"
  - "qwen3.8-27b"
  - "--tensor-parallel-size"
  - "4"
  - "--kv-cache-dtype"
  - "fp8_e4m3"
  - "--max-model-len"
  - "262144"
  - "--max-num-seqs"
  - "64"
  - "--gpu-memory-utilization"
  - "0.92"
  - "--enable-prefix-caching"
  - "--enable-prompt-tokens-details"
  - "--enable-auto-tool-choice"
  - "--tool-call-parser"
  - "qwen3_xml"
  - "--reasoning-parser"
  - "qwen3"

Die wichtigsten Unterschiede zur vorherigen Lane: der --reasoning-parser qwen3 extrahiert Thinking-Token sauber, der --tool-call-parser qwen3_xml passt zum Qwen-3-XML-Format (nicht zum Coder-Parser des 122B) und --enable-prompt-tokens-details liefert zusammen mit --enable-prefix-caching eine Aufteilung in neue und wiederverwendete Prompt-Token.

Speicher und Durchsatz

Jede der vier Karten zeigt unter Last rund 30,6 GB belegten VRAM. Das passt: die FP8-Gewichte des 27B-Modells belegen etwa 31 GB, der Rest ist KV-Cache und Scheduling-Reserve. Nach vier Tagen Dauerbetrieb lagen bei uns knapp 78 Millionen Prefill-Token und rund 5,9 Millionen generierte Token auf dem Server, das Modell ist also kein Dauerläufer im Leerlauf, sondern wird aktiv genutzt. Gemessen liegt die durchschnittliche Generierungsrate bei etwa 96 Token/s, mit Prompt-Durchsatz-Spitzen von rund 16.000 Token/s. Der Prefix-Cache trifft in etwa 43–45 % der Fälle.

Gateway und Lanes

Über das LiteLLM-Gateway auf Port 4000 sind öffentlich zwei Chat-Lanes erreichbar:

  • thinking: Reasoning eingeschaltet, Standard-Route für komplexe Aufgaben.
  • nothink: derselbe Endpunkt, aber mit enable_thinking: false; für Aufgaben, bei denen überflüssiges Denken nur Tokens verbraucht.

Eine dritte interne Lane, thinking-cnc, ist ein Klon von nothink für einen spezifischen Produktions-Agenten, damit dessen Session nicht durch Overthinking blockiert. Vision-Aliasse werden inzwischen ebenfalls über denselben Host bedient; die separate Vision-Karte auf Port 400002 wurde am 19. August ersatzlos gestrichen.

Unsere Sicht

Qwen3.8-27B ist das Modell, das wir für den lokalen Stack erwartet haben: dicht, hostbar, Apache-lizenziert und gut genug, um den vorherigen 122B-MoE zu ersetzen. Der Gewinn liegt weniger in einer höheren Aufgabenlösungsrate als in geringerer Komplexität: eine Lane statt mehrerer, ein Parser statt zwei, ein klarer Upgrade-Pfad. Wer selbst hostet, sollte den Wechsel prüfen, vorausgesetzt, die Hardware passt.

Weiterführende Quellen

Fragen?
Warum ersetzt ein 27B-dichtes Modell einen 122B-MoE?+

Im realen Arbeitsprofil lag der alte Qwen3.5-122B-A10B-NVFP4 im direkten A/B-Vergleich mit Qwen3.8-27B-FP8 unentschieden, bei ähnlicher Aufgabenlösungsrate. Der entscheidende Unterschied: das 27B-Modell produziert 3-11x weniger Reasoning-Token, aktiviert 27 Milliarden statt nur 10 Milliarden Parameter pro Token und vereinfacht die Infrastruktur, weil es auf einer einzigen Host-Lane läuft.

Passt ein 27B-Modell wirklich auf vier RTX 5090 mit 32 GB?+

Ja. Die FP8-Gewichte belegen rund 31 GB, der Rest geht in KV-Cache und Betriebsspielraum. Mit --gpu-memory-utilization 0.92 und fp8_e4m3 KV-Cache bleibt genug Luft für 64 parallele Sequenzen und Kontexte bis 262.144 Token. BF16 würde nicht mehr passen; FP8 ist hier die richtige Präzision.

Welche Endpunkte spricht das Gateway an?+

vLLM meldet sich unter den Aliassen thinking, text, nothink, vision, gemma, gemma-4 und qwen3.8-27b. Über das LiteLLM-Gateway auf Port 4000 sind öffentlich nur thinking und nothink erreichbar; nothink schaltet das Reasoning über chat_template_kwargs explizit aus. Die vision-Familie wurde am 19. August 2026 von der separaten Vision-Karte auf dieselbe 4×-5090-Lane konsolidiert.

Was bedeutet der Wechsel für Datenschutz und Souveränität?+

Nichts ändert sich am Grundsatz: Text, Bilder und Dokumente verlassen das eigene Netz nicht. Im Gegenteil, die Konsolidierung auf einem Host vereinfacht das Logging und das Monitoring. Prompt-Token-Details (--enable-prompt-tokens-details) zeigen sogar transparent, welche Anteile des Prompts aus dem KV-Cache wiederverwendet wurden.