senn-techsenn-tech
KI & Entwicklung
KI & Entwicklung2026-10-11· Von Franz Senn

Strata: 125-Milliarden-Modell mit 50 bis 60 Tokens pro Sekunde auf einer Karte von 2020

Ein Selbstversuch, der gerade durch die Kanäle geht: Rechner mit AMD RX 6800, 16 GB Grafikkartenspeicher, 64 GB Arbeitsspeicher, die Grafikkarte von 2020. Stand August: Ollama, mehrere Modelle, 3 bis 4 Tokens pro Sekunde, der Agent unbenutzbar. Stand diese Woche: dieselbe Hardware, 50 bis 60 Tokens pro Sekunde, der Agent arbeitet. Dazwischen liegt zwei Wochen Software, ein Backend namens Strata. Ich habe die beiden Beiträge des Autors gelesen, den Stand des Projekts nachgemessen und unsere eigenen Messungen zu derselben Modellfamilie hervorgeholt. Der Selbstversuch ist sauber aufgeschrieben. Die Schlagzeile hält dem trotzdem nur teilweise stand. Inzwischen gibt es einen zweiten Selbstversuch mit demselben Backend, von anderer Hand und auf anderer Hardware.

Zwischen August und heute liegen zwei verschiedene Modelle

Der Autor begann im August mit qwen2.5-coder:14b (32K Kontext, sein Agent verlangt mindestens 64K), dann gpt-oss:20b und qwen3.5:9b-q8_0, die ihm Denkfragen zurückwarfen, dann gemma4:31b über drei Quantisierungsstufen bis auf 13 GB Dateigröße, wobei Ollama durchgehend 19 bis 28 Prozent der Arbeit auf den Prozessor schob und die Kiste instabil wurde. Am Ende stand ein kleineres Mixture-of-Experts-Modell, das zwar in Sekunden antwortete, aber die Werkzeugaufrufe ans CRM nicht korrekt setzte. Seine Bilanz im August: Geschwindigkeit und Qualität sind ein Nullsummenspiel, bei 3 bis 4 Tokens pro Sekunde schläft man am Arbeitsplatz ein.

Für die Einordnung zählt: Das Modell von heute, Qwen3.8-Flash-Next, läuft auf Ollama gar nicht. Die Anfrage, diese Architektur zu unterstützen, steht bei llama.cpp offen (Issue 27741), die bei Ollama auch (Issue 18071), beides am 11. Oktober 2026 nachgesehen. Die Zahl „3 bis 4 gegen 50 bis 60" vergleicht also zwei verschiedene Modelle auf zwei verschiedenen Engines. Der Endwert ist dadurch nicht falscher, nur die Steigerung gehört nicht dem Backend allein.

Wie Strata die Gewichte über Grafikkarte, RAM und SSD legt

Strata (GitHub Niko1221/Strata, MIT-Lizenz) ist ein C++-Engine-Bau mit eigenen Kerneln auf einer eingekauften ggml-Bibliothek, kein llama.cpp-Fork. Der Stand, am 11. Oktober über die GitHub-API gemessen: Repo am 24. September angelegt, neueste Veröffentlichung v0.1.43 vom selben Tag, 21.456 Sterne, 2.020 Forks, 214 namentlich erfasste Mitwirkende. Offen sind 687 Fäden, und das sind 333 Meldungen zuzüglich 354 Merge-Anfragen. Die Kennzahl, die in vielen Übersichten als alleinige Issue-Zahl steht, zählt beides zusammen. Die Engine bedient genau eine Modellfamilie, und diese Familie ist von Haus aus auf Auslagerung gebaut.

Die Modellkarte zu Qwen3.8-Flash-Next nennt die Zahlen: 125 Milliarden Parameter, davon 6 Milliarden pro Token aktiv, 512 Experten je Schicht, gerechnet über alle Schichten 24.576 Experten. Dazu ein 51-Milliarden-N-Gramm-Einbettungsfeld, das die Karte selbst als besser auslagerbar beschreibt als die MoE-Schichten, dazu ein 4-Milliarden-Kopf für spekulatives Entschlüsseln, nativer Kontext 262.144 Tokens.

Wo die Gewichte bei Strata liegenGrafikkarteAttention, Router,gemeinsame Experten, einTeil des KV-Caches und einArbeitsspeicherAlle 24.576 Experten,festgehalten, damit dieKarte nicht darauf wartenProzessorBerechnet die Experten, dienicht auf der Karte liegen,zeitgleich zur KarteSSDLookup-Tabelle; pro Tokenwerden daraus nur wenigekleine Zeilen gelesen
Nach der Projektbeschreibung in docs/HOW_IT_WORKS.md. Pro zusätzlichem GB Grafikkartenspeicher passen rund 700 Experten mehr in den Puffer. (Quelle: Strata, docs/HOW_IT_WORKS.md)

Dass genau diese Achse wirkt, hatte ich im Viertagestest selbst gemessen: Zwei RAM-Riegel mehr, von 62 auf 94 GiB, hoben die Dekodiergeschwindigkeit um 18 Prozent, weil die N-Gramm-Tabelle dieses Modells bei jedem Token aus dem Arbeitsspeicher gelesen wird. Strata macht diesen Hebel zum Prinzip.

Was der Autor selbst optimierte, und was jeder Schritt brachte

Seinem Text nach war es eine Kette von vier Maßnahmen, in dieser Reihenfolge:

  1. --vram-reserve-mib 1500: Der Desktop bekommt 1,5 GB der 16 GB zurück. Die Standbild-Einfrierer des Arbeitsplatzrechners verschwinden, der Durchsatz steigt von 30 bis 40 auf 40 bis 50 Tokens pro Sekunde.
  2. Der PCIe-Slot: Die Karte steckte im unteren Slot, physikalisch x16, elektrisch über den Chipsatz nur x4 angeschlossen. Nach dem Umzug an den direkt an die CPU gebundenen Slot maß er statt rund 3 GB/s rund 12 GB/s Busbandbreite, der Durchsatz kam bei stabil 50 bis 60 an. Das ist der größte Einzelsprung seines Berichts und zunächst ein Kabelproblem, das ihn zu seinem Verdruss erst über Umwege fand.
  3. --draft-vocab en: Das Spekulationsmodell behält nur englisches Vokabular, was Experten-Puffer frei macht. Er taxiert den Gewinn auf etwa ein Prozent und erklärt ihn selbst für nicht messbar.
  4. Kontext von 64K auf 128K: kein für ihn sichtbarer Leistungsverlust. Die erwarteten rund 20 Prozent Verlust bei 256K sind seine Schätzung, kein von ihm gemessener Wert. Für seinen Agenten (Hermes) stellte er fix_max_tokens auf wahr, weil dieser jedes Mal die volle Kontextgröße anfordert.

Der Praxistest danach: Der Agent las Tabellen im ODS-Format, stieß aus deren Inhalt Web-Suchen an und fasste die Ergebnisse zusammen. Genau das war im August an den kleineren Modellen gescheitert. Alle Durchsatzwerte dieser Kette sind selbstberichtet; der Autor publiziert weder Rohdaten noch Screenshots dazu, was man fair mitschreiben muss.

Die Tabellen des Projekts ordnen das ein

Das README führt Geschwindigkeiten je Modellgröße in zwei Tabellen, eine pro Hersteller, 4K-Antworten auf 32K-Prompts, mit dem von ihm gewählten IQ2_XS: NVIDIA RTX 5070 (12 GB) auf 79 Tokens pro Sekunde, AMD RX 9070 XT (16 GB) auf 52. Die alte RX 6800 des Autors liegt über dem Herstellerwert für die aktuelle AMD-Karte. Die Installationsliste führt die RX-6800er-Serie ausdrücklich als unterstützt (Einzelheiten unten in den Fragen). Sein Rechner ist also kein grenzwertig überlisteter Treiberpfad, sondern exakt die Hardwareklasse, für die das Projekt geschrieben wurde.

Ein zweiter Aufbau: zwei Grafikkarten für 984 Dollar

In der Nacht nach unserem Messstand zeigte der YouTube-Kanal Digital Spaceport denselben Backend-Lauf auf anderer Hardware: gebrauchter Dell Precision T5810, zwei RTX 3060 mit je 12 GB, 64 GB Arbeitsspeicher. Die Postenliste seiner Videobeschreibung summiert auf 984 Dollar, der Prozessor mit 7 Dollar darin, und 12 GB sind die Untergrenze der Installationsliste. Der Kanal läuft seit 2008, die Provisionen weist er offen aus. In seiner GPU-Übersicht ist die RTX 3060 die einzige Karte mit exakt 12 GB; die drei billigeren dort, P100, P40 und V100, sind Tesla-Karten, die Strata nur mit seiner experimentellen CUDA-12-Fassung zulässt.

Alle vier Modellgrößen liefen gegen denselben Prompt, eine animierte Grafik, je eine Generation. Das Repo dokumentiert zum Vergleich einen Lauf auf einer einzelnen RTX 3060, Core i7-12700, DDR4-3200, Strata v0.1.41:

Größeeine 3060, Lauf im Repozwei 3060, sein Video
Q2_042,963,3
IQ2_XS45,562
IQ3_XXS26,252,4
IQ3_S20,2nicht gemessen

Tokens pro Sekunde. Sein Arbeitsspeicher ist langsamer, sein Prozessor von 2016, und er liegt trotzdem darüber. Das Verfahren in docs/MULTI_GPU.md erklärt die Richtung: Jede Karte behält den Experten-Puffer für ihre eigenen Schichten, dort als „pipeline (layer) parallelism, not tensor parallelism", ohne NVLink. Kontrolliert ist er nicht: andere Rechner, andere Engine-Fassungen. Belegt ist die Richtung, der Faktor bleibt offen. Dass die Richtung auch billig geht, zeigt dasselbe Dokument: Zwei Tesla P40 hoben den IQ2_XS-Durchsatz von 19,6 auf 34,8 Tokens pro Sekunde, ein einzelner gemessener Bericht.

Auf seiner Methodikseite steht wörtlich, seine Tests seien „by no means scientific", und er stelle sie als „so I do it like this" vor, nicht als „you should do it like this". Von der größten Größe nennt er 53,4 GB Arbeitsspeicher, keinen Durchsatz, und beim Tempo misst er nach eigenem Bekunden ohne ausgereiftes Verfahren.

Die Grenzen nennt das Projekt selbst, offenherzig

  • Eine Anfrage nach der anderen: Standardmäßig beantwortet Strata eine Anfrage, die anderen warten. Das optional einstellbare parallel: 2 macht auf einer 12-GB-Karte jede einzelne Antwort langsamer. Der Autor des Einzelkarten-Tests beschreibt die praktische Folge: Ein kleiner Zusammenfassungsaufruf seines Agenten stellt sich in die Schlange vor die eigentliche Arbeit.
  • Nach jedem Neustart ist der Experten-Puffer leer, die erste große Anfrage dauert wieder von vorn. Auf die erste Nachricht einer Unterhaltung rechnet das Projekt etwa eine Minute je 30.000 Tokens.
  • Eine äußere Sicherheitsprüfung hat das Projekt nach eigener Angabe noch nicht erhalten. 333 offene Meldungen und 354 offene Merge-Anfragen auf ein zwei Wochen altes Repo sind derselbe Befund von der anderen Seite (Korrektur 11.10.: vorher stand hier die Sammelzahl 690 offener Punkte, die beides vermischte).
  • Zwei Fehlerberichte passen exakt auf unsere Verkehrsform und sind am 11. Oktober offen: #606 keilt die Engine nach einer einzigen großen Generierung bei 155K Kontext derart ein, dass jede spätere Anfrage ein einzelnes wiederholtes Zeichen zurückgibt, bei unverändert grüner Health-Meldung. #481 ist ein Deadlock mitten im Stream, bei dem der Stall-Watchdog nicht anspringt. Der für uns unangenehmste Fehler, #528 mit dem vier- bis sechsfachen Preis auf Fortsetzungsgespräche, traf genau unsere Dauerdialog-Last und wurde am 7. Oktober geschlossen.
  • Alle beworbenen Größen liegen bei 2 bis 3 Bit (Q2_0, IQ2_XS, IQ3_*). Die Variante „Coder" behält 256 von 512 Experten je Schicht; das Qualitätsversprechen dazu (91 Prozent des vollen Modells auf SWE-bench Verified) kommt von den Autoren selbst, unbestätigt, und das README vermerkt die Schwäche außerhalb des Englischen. Über keine dieser Größen existiert eine Messung auf deutscher Agenten- oder Mail-Last, unsere nicht eingeschlossen.

Dieselbe Modellfamilie bei uns im Rack

Wir betreiben Qwen3.8-Flash-Next seit Ende August im Haus, die Messungen stehen auf diesem Blog: Unter llama.cpp brachte eine einzelne Anfrage 96,8 Tokens pro Sekunde, acht gleichzeitige zusammen 50,7 (Viertagestest). Auf vLLM mit Expertenparallelität liefert dasselbe Modell 205 Tokens pro Sekunde über 32 gleichzeitige Ströme (Beitrag zum KV-Cache-Patch). Verglichen mit Strata ist das kein Wettstreit, es sind zwei verschiedene Aufgaben: 50 bis 60 Tokens pro Sekunde an einem Schreibtisch, für den niemand Schlange steht, gegen 205 über zwei Dutzend gleichzeitige Agenten im eigenen AI Stack. Strata kann das Bündeln nicht, bei uns liegt genau dort die Last.

Unsere Bewertung vom 4. Oktober, dokumentiert und hier erstmals öffentlich: Urteil WATCH, nicht installiert. Einer der Gründe war falsch, und ich ziehe ihn zurück (Korrektur 11.10. an dieser Stelle). Wir hatten notiert, die schnellen Prozessor-Kernel verlangten AVX-512, das wir auf keiner freien Maschine hätten. Die Installationsliste verlangt AVX2, AVX-512 sei nur „a bit faster"; einen Schnellpfad damit gibt es für eine einzige Größe. Die ausgelieferten Bauformen sind AVX2, und zwei Community-Läufe desselben Repos laufen auf Xeon ohne AVX-512, einer auf genau dem Modell von oben. An unserer Prozessorleistung hätte Strata also nichts gestört.

Die beiden anderen Gründe gelten weiter: Mehrere Grafikkarten teilt Strata in Schichten und Experten auf, Tensor-Parallelität gibt es nicht. Und #606 sowie #481 treffen genau die Verkehrskennung unserer Agenten (lange Prompts, Werkzeug-Aufrufe mitten im Stream, abgebrochene Anfragen). Das ist Hardware- und Topologie-Passung, kein Qualitätsurteil über die Autoren, die ich für ihre Offenheit ausdrücklich lobenswert finde.

Wer das heute schon nutzen kann

Für Einzelschreibtische, deren Daten das Haus nicht verlassen sollen, ist aus dem Selbstversuch eine brauchbare Maschine geworden: eine Grafikkarte von 2020, 64 GB RAM, 80 GB SSD, ein Agent, der Tabellen liest, sucht und zusammenfasst, in Lesegeschwindigkeit. Wer es nachbaut, kalkuliere zwei Dinge ein, die in keiner Tokens-pro-Sekunde-Zahl stecken: einen Slot mit echter Anbindung an die CPU, und die erste Anfrage nach jedem Neustart. Für Mehrplatz-Betrieb, Verlässlichkeit und prüfpflichtige Wege gelten die Anforderungen aus unserem Familienporträt unverändert, und keine davon hat Strata in zwei Wochen erfüllt. Offen und von uns beobachtet bleibt die Architekturfrage: Die offene Unterstützungsanfrage bei llama.cpp zeigt, dass der Ein-Modell-Trick dort herrenlos ist. Sobald die Architektur oben ankommt, beginnt der Wettlauf derselben Modelle unter denselben Engines von vorn, und wir melden uns mit dann gemessenen Zahlen.

Weiterführende Quellen

Fragen?
Sind „3 bis 4 werden 50 bis 60 Tokens pro Sekunde, derselbe Rechner“ ein fairer Vergleich zwischen Ollama und Strata?+

Nein. Im August lief auf Ollama ein anderes Modell, ein 31-Milliarden-Gemma in verschiedenen Quantisierungen. Heute läuft Qwen3.8-Flash-Next auf Strata. Die Unterstützungsanfrage für genau diese Architektur steht bei Ollama und bei llama.cpp offen, Ollama konnte im August gar nicht auf Augenhöhe vergleichen. Die 50 bis 60 Tokens pro Sekunde sind trotzdem selbstberichtete, aber im Detail beschriebene Werte.

Welche Hardware braucht man, um das nachzubauen?+

Das Projekt nennt in seiner Installationsliste: mindestens 12 GB VRAM (NVIDIA RTX 20 bis 50, AMD RX 6800er und 6900er Serie, RX 7800 XT und 7900er, RX 9060 XT und 9070, Radeon AI PRO R9700), mindestens 32 GB Arbeitsspeicher, rund 80 GB Festplatte, Windows oder Linux. Die zwei größten Hebel des Autors kosten nichts: ein Grafikkartenslot, der wirklich an die CPU angebunden ist, und ein VRAM-Puffer für den Rest des Desktops. Wer zwei Karten steckt, braucht kein NVLink: Das Projekt teilt die Schichten auf, jede Karte betreut ihren eigenen Bereich, und es laufen auch Karten in x4- oder x1-Slots.

Kann eine Firma damit zehn Arbeitsplätze statt Cloud-Zugängen bedienen?+

Dafür ist es nicht gebaut. Strata beantwortet standardmäßig eine Anfrage nach der anderen, ein Parallelmodus macht die einzelne Antwort auf 12-GB-Karten langsamer. Eine äußere Sicherheitsprüfung hat das Projekt nach eigener Angabe nie erhalten, und ein offener Fehler keilt die Engine mit gesunder Health-Meldung ein, ohne dass ein Watchdog greift. Für den einzelnen Schreibtisch, dessen Daten das Haus nicht verlassen sollen, ist es dagegen brauchbar geworden. Die Modellkarte selbst empfiehlt für Durchsatz-Szenarios ohnehin vLLM, SGLang oder KTransformers.