Lokale KI im Selbstversuch: Eine Woche ohne Cloud-Modelle auf 64 GB
Am 1. Oktober 2026 hat Adrian Twarog auf YouTube ein siebentägiges Experiment veröffentlicht: eine Woche arbeiten, codieren und Agenten betreiben mit lokalen Sprachmodellen statt Cloud-Zugängen. Die Maschine stellte der Sponsor ASUS, ein NUC 16 Pro mit 64 GB Arbeitsspeicher. Gesponsert also, aber brauchbar, weil Twarog zwei Größen durchrechnet, die in Videos dieser Art sonst weggewinkt werden: die Speicherbandbreite des Geräts und den Kontextverbrauch der Coding-Harnesses. Sein Ergebnis nach sieben Tagen: lokale Modelle als Unterbau für Agenten ja, für Codebasen mit zehntausenden Zeilen noch nicht. Dieser Beitrag legt den Feldtest neben unseren eigenen Betrieb, denn die Bruchstellen sind dieselben.
Was er laufen ließ
Modellauswahl über das Leaderboard, das ist ein guter erster Schritt. Ganz oben im Text-Bereich liegt dort Anthropics Claude Fable 5, 1506 Punkte im Stand von ModelCap am 10. August 2026. Die offenen Modelle dahinter brächten den Mini-PC an seine Grenzen, Twarog nennt Kimi K3, GLM 5.2 und Qwen3.8-Max und verwirft sie wegen dreistelliger Gigabyte-Zahlen. Übrig bleiben drei Kandidaten, und alle drei sind sauber belegt:
- Qwen3.8-27B: dichtes 27-Milliarden-Modell, Apache 2.0, Gewichte seit 13. August 2026 auf Hugging Face, native Kontextbreite 262.144 Token laut config.json
- Muse Glimmer: Metas erstes offenes Modell aus den Superintelligence Labs, 30 Milliarden Parameter, Apache 2.0, veröffentlicht am 10. August 2026, gebaut für Agenten auf einem Mac oder einer einzelnen Consumer-Grafikkarte
- GLM-4.7-Flash: Mixture-of-Experts-Modell von Z.ai, 30 Milliarden Parameter, davon rund 3 Milliarden je Token aktiv, erschienen am 19. Januar 2026
Als Laufzeitumgebungen dienen Ollama und LM Studio. Zwei Praxishinweise von ihm sind richtig und werden trotzdem ständig übersehen: beim GGUF-Download auf GPU-Offloading achten, sonst ist das Tempo unbrauchbar, und die Quantisierungsklasse (Q4, Q6, Q8) ist der Handel zwischen Speicherbedarf und Genauigkeit.
Beim Tempo: gemessen nahe am Limit
Twarog misst in LM Studio über die Debug-Anzeige: Qwen3.8-27B rund 12 Token/s, Muse Glimmer rund 6, GLM-4.7-Flash rund 22. Zwei Instanzen GLM-4.7-Flash laufen parallel, und mit kleinen Spezialmodellen holt er über 100 Token/s heraus. An Muse Glimmer fällt ihm noch etwas auf: Ein erheblicher Teil der Reasoning-Token werde dafür draufgebracht, dass das Modell beim Denken erst die eigenen Richtlinien abprüft. Das ist eine Beobachtung, keine Messung, aber wer Agenten mit dem Modell baut, sollte sie nachprüfen.
Tragend wird die Rechnung über die Speicherbandbreite. Der Core Ultra X7 358H unterstützt LPDDR5X bis 9600 MT/s, ASUS bestückt die Geräte je nach Modell mit LPDDR5X-8533, und TechPowerUp maß im Test über 100 GB/s. Ein dichtes 27B-Modell zieht in 4-Bit-Quantisierung rund 14 GB Gewichte je Token durch den Speicher. Ohne jeden Overhead gerechnet bleiben damit 8 bis 11 Token/s, je nach Speicherbestückung. Twarogs gemessene 12 liegen in derselben Größenordnung, die Restdifferenz geht auf Messweise und Cache-Effekte zurück. Festhalten lässt die Grenze: Nach oben gibt diese Hardware bei einem dichten Modell dieser Klasse nichts her, egal welche Runtime.
Interessanter als die Absolutwerte ist der Abstand zum Möglichen: Bei 3 Milliarden aktiven Parametern zieht GLM-4.7-Flash pro Token nur rund 1,5 GB Gewichte durch den Speicher, von den gemessenen gut 100 GB/s aus gerechnet läge die Obergrenze bei etwa 60 Token/s. Gemessen sind 22. Auf dem DGX Spark, dessen 273 GB/s mehr als das Doppelte dieser Bandbreite sind, sind für dieselbe Modellklasse unter llama.cpp mit CUDA 89,3 Token/s dokumentiert. Die Laufzeitumgebung samt Grafikanbindung holt auf der Intel-Maschine also einen deutlich kleineren Teil der Bandbreite heraus. Wer lokale Modelle plant, kauft mit dem Datenblatt auch den Reifegrad des Stacks.
Wo es brach: nicht im Modell, im Harness
Die Coding-Strecke ist die eigentliche Erzählung des Videos. Twarog bindet die lokalen Modelle ohne Umwege über Cloud-Konten ein: VS Code bringt einen eigenen Modell-Verwalter („Manage language models"), dort trägt man den Endpunkt ein, den LM Studio bereitstellt, mit URL und Modellnamen, und die Modelle erscheinen im Chat-Fenster. Trotzdem scheitern die Anfragen zunächst. Der Grund, den er selbst herausfindet: VS Code schickt bei jeder Anfrage seine Werkzeugaufrufe mit, frisst damit das kleine Kontextfenster voll und lässt für den Chat nichts übrig. Zwei Maßnahmen beheben es, Werkzeuge abstellen und Kontext erhöhen.
Ganz anders die Agenten-CLIs. Claude Code braucht in seinem Test über zwei Minuten bis auf ein Hello World, das Modell antwortet nach drei Minuten mit „How can I help you". Twarog sieht sich das Prompt an, das der Harness an das Modell übergibt, und verwirft den Ansatz für kleine lokale Modelle: Der Harness belädt das Modell mit einer Last, die ein 8.000-Fenster nicht trägt. OpenClaw braucht in seinem Test zwei bis drei Minuten für dieselbe Hello-World-Anfrage. Seine Zwischenbilanz, die nach fünf Tagen im Feld mehr wert ist als jede Benchmark-Tabelle: Harness-tauglich sind die kleinen lokalen Modelle noch nicht.
Dieselbe Bruchstelle, in unseren Zahlen
Unsere Hauptstrecke fährt Qwen3.8-Flash-Next auf vier RTX 5090, mit maximal 220.000 Token je Sitzung. Dass wir dort oben sind, ist keine Auslegung für Showzwecke: Ein Agenten-Harness schickt System-Prompt, Werkzeugschemata, Dateiauflistungen und Arbeitsspeicher der Unteragenten bei jedem Durchlauf erneut ins Modell. Bevor die erste echte Entwicklerfrage den Kontext erreicht, sind zehntausende Token weg. Ein Feldtest mit 8.000 Token Default läuft deshalb nicht gegen die Intelligenz des Modells, sondern gegen die Buchhaltung des Harness.
Der Preis von langem Kontext heißt KV-Cache, und der ist bei uns inzwischen die knappste Größe. Seit dem 3. Oktober 2026 fährt unsere Lane den KV-Cache im Format NVFP4; das hält 8,2 volle Sitzungen à 220.000 Token im Pool, mit FP8 waren es 5,2. Der Feldtest zeigt dieselbe Rechenart von der anderen Seite: Qwen3.8-27B könnte nativ 262.144 Token, LM Studio stellte 8.000 bereit. Zwischen diesen beiden Zahlen liegt die gesamte Misere des Harness-Kapitels.
Für Lasten ohne interaktiven Anspruch betreiben wir lokale Modelle längst im Dauerlauf. Ein 0,6-Milliarden-Einbettungsmodell mit eigenem Klassifikationskopf entscheidet bei uns über Spam, gemessene AUC 0,97 auf unserem Korpus, tausende Aufrufe am Tag, kein einziger Token-Preis. Als Reserve läuft ein Qwen3.8-27B in AWQ-Quantisierung als Fallback-Lane mit, wenn die Hauptstrecke ausfällt. Neue Dienste dieser Art bekommen bei uns vorher eine Shadow-Phase: Der Kandidat läuft mit, sagt aber nichts, erst nach einer Urteilsrunde schaltet er ein.
Wo er nach einer Woche selbst landet: hybrid
Am Ende der Woche fährt Twarog Cloud als Orchestrator und die lokalen Modelle als Subagenten für Cron-Jobs, Memory-Pflege und wiederkehrende Prüfschritte, auf einer zweiten Maschine, die nur dem Agenten gehört. Genau diese Arbeitsteilung betreiben wir, nur mit Gateway vorneweg statt mit Kabeln hinter dem Schreibtisch. Der Markt hat die Arbeitsteilung übrigens schon registriert: Auf der Produktseite des NUC 16 Pro steht OpenClaw nebst Hermes Agent als Anwendungsfall, ASUS vermarktet den Mini-PC fürs Agenten-Dauerlaufen.
An seiner Hardware-These von der Zukunft mit „huge RAM allocations in most machines" stimmt die Hälfte. Die Kapazität entscheidet, welches Modell in die Maschine passt, die Bandbreite entscheidet, wie schnell es antwortet. Größere Ausstattungen liefert die Plattform ohnehin: Neben gelöteten LPDDR5X-Varianten führt ASUS Modelle mit gestecktem DDR5 bis 128 GB, sein Wunsch-Speicher wäre also zu haben. Am gemessenen Bandbreitenlimit um 100 GB/s und damit am Tempo des dichten 27B-Modells änderten auch 96 GB nichts. Dass ein Speicher-Upgrade trotzdem teuer wird, zeigt der Blick auf die Preise: NVIDIA hat den Preis des DGX Spark am 23. Februar 2026 mit Verweis auf die Speicherknappheit von 3.999 auf 4.699 US-Dollar erhöht, und Framework hat den Preis seines Desktops seit Februar 2025 in mehreren Schritten angehoben. Die ganze Rechnung steht in unserem Vergleich der Desktop-Boxen.
Was lokal bleibt und was nicht
Der Feldtest beantwortet die Frage mit einer Trennschärfe, die wir aus dem Betrieb bestätigen: Klassifikation, Einbettungen, Cron-Subagenten und die Reserve-Lane laufen auf kleiner Hardware und sollen dort bleiben. Interaktives Agenten-Coding auf großen Codebasen scheitert derzeit an der Multiplikation aus Harness-Kontext und Bandbreitenlimit, und zwar unabhängig davon, dass die offenen Modelle auf den Leaderboards nahe an Claude Fable 5 heranrücken. Twarogs Schluss, bei Codebases mit Zehntausenden Zeilen seien wir „noch nicht dort", ist nach unserer Messlage der ehrlichste Satz des Videos. Für kleine, abgeschlossene Aufgaben, die nachts laufen und niemanden beim Warten stören, ist die Rechnung dagegen heute schon aufgegangen.
Weiterführende Quellen
- Adrian Twarog: I Tried Coding with Local AI Models for 7 Days, YouTube, 1. Oktober 2026
- ASUS NUC 16 Pro, Produktseite mit Tech-Specs
- TechPowerUp-Test des ASUS NUC 16 Pro mit Core Ultra X7 358H und Arc B390
- Intel Core Ultra X7 358H, Produktdatenblatt Intel ARK, Produktnummer 245527 (Seite für Skripte hinter einer Bot-Wall, im Browser erreichbar)
- ModelCap: Arena-Text-Leaderboard, Stand 10. August 2026
- NVIDIA-Forum: Preisanpassung DGX Spark, 23. Februar 2026
Warum scheitern lokale Modelle in Claude Code oder VS Code, obwohl der Chat läuft?+
Coding-Harnesses schicken bei jedem Request ein großes System-Prompt und die Schemata aller Werkzeuge mit. Stand in LM Studio der Kontext auf 8.000 Token, war das Fenster voll, bevor die eigentliche Frage ankam. Twarog schaltete die Werkzeuge ab und erhöhte den Kontext, danach lief der Chat in VS Code.
Welche Modelle liefen auf dem 64-GB-Gerät und wie schnell waren sie?+
Qwen3.8-27B mit rund 12 Token/s, Muse Glimmer von Meta mit rund 6 Token/s und GLM-4.7-Flash mit rund 22 Token/s, jeweils vom Autor in LM Studio gemessen. Die 12 Token/s beim dichten 27B-Modell liegen in Größenordnung des Bandbreitenlimits dieser Geräteklasse: je nach Speicherbestückung rechnerisch 8 bis 11 Token/s in 4-Bit.
Wann lohnt der Betrieb von Agenten mit lokalen Modellen?+
Für wiederkehrende Hintergrundarbeit: Cron-Jobs, Memory-Pflege, Klassifikation, Einbettungen. Für interaktives Agenten-Coding in großen Codebasen nicht, dort bestimmen Harness-Kontext und Speicherbandbreite die Wartezeit. Bei uns laufen deshalb kleine lokale Modelle für die Klassifikation und große offene Modelle für die interaktiven Strecken, neue Dienste vorher im Shadow-Modus.
senn-tech