senn-techsenn-tech
KI & Entwicklung
KI & Entwicklung2026-10-04· Von Franz Senn

Parakeet Redux: 178 Megabyte Spracherkennung, eine proprietäre Engine

Moondream, das Team hinter den gleichnamigen kleinen Vision-Sprachmodellen, hat am 22. September 2026 zwei Ableger von NVIDIAs Parakeet TDT 0.6B v3 veröffentlicht. Redux presst jedes Gewicht im Encoder auf drei Werte, minus 1, 0 oder plus 1, und belegt damit 177,8 MB statt rund 1,2 GB. Ultra behält die volle Präzision und wurde weiter trainiert. Beide erkennen 25 Sprachen, beide Gewichte stehen unter CC-BY-4.0.

Die Modellkarte von Redux nennt 6,55 Prozent Wortfehlerrate über sieben englische Testmengen gegen 6,26 Prozent des Originals und verbessert sich in der mehrsprachigen FLEURS-Auswertung von 11,62 auf 10,56. Auf dem Papier ist das ein Modell, das auf etwa ein Siebtel der Größe schrumpft und dabei kaum Fehler dazugewinnt. Drei Punkte daran gelten für unsere Umgebung nicht, und einer ist vor jedem Benchmark zu klären.

Was die Quantisierung geändert hat

Ternär heißt, dass kein Gewicht im Encoder mehr als drei Zustände annehmen darf. Die Karte spricht von 1,58 Bit. Im Repo liegen eine model.safetensors mit 177,8 MB, eine config.json, eine ternary.json mit den Masken und ein tokenizer.json, dazu ein Ordner mit den Auswertungsergebnissen. Ein GGUF- oder ONNX-Zweig ist nicht dabei. Tokenizer, Sprachwahl, Interpunktion, Großschreibung und Zahlformat sind die des NVIDIA-Originals.

Die Vergleichszahlen stammen aus der gleichen Messreihe des Anbieters, alle mit der Auswertungspipeline des Open ASR Leaderboards Stand September 2026, Redux im eigenen Photon auf einer NVIDIA-GPU, das Original in NeMo in bf16. Wortfehlerrate in Prozent, unser Delta dazu:

AuswertungOriginalReduxrelativ
Sieben englische Mengen6,266,55+4,6 %
FLEURS, 25 Sprachen11,6210,56−9,1 %
Business-Sprache6,156,96+13,2 %
Rauschen, neun MUSAN-Bedingungen6,729,04+34,5 %
Lange Vorträge, TED-LIUM2,712,51−7,4 %

Das Muster ist klar. Im Mehrsprachigen und auf langen Aufnahmen wird Redux besser, im Englischen bleibt es nah am Original, und im Rauschen zahlt es deutlich drauf. Für eine Sprachanwendung in einer Fertigungsumgebung ist das die schlechteste Spalte der Tabelle.

Die 113× Echtzeit setzen AVX-512 voraus

Alle Geschwindigkeitszahlen der Karte gehören zu Photons eigenen Kerneln, und die x86-Variante verlangt AVX-512 VNNI. Gemessen wurde auf acht Kernen eines AMD EPYC 9575F, Zen 5. Wir haben am 4. Oktober 2026 auf allen fünf AI-Hosts in die CPU-Flags geschaut, read-only über /proc/cpuinfo.

Vier Hosts haben in /proc/cpuinfo kein einziges AVX-512-Flag: .180.1, .180.2, .180.202 und .180.211. Es sind EPYC 7F52 und einer EPYC 7502, CPU-Familie 23 Modell 49, das ist Zen 2. Diese Baureihe kennt AVX-512 nicht. Für diese Maschinen, darunter unsere 64-Kern-Maschine .180.202, gilt die Zahl von 113× nicht. Sie gehört auf eine CPU-Generation, die wir nicht gekauft haben. Die 38× eines MacBook Air M2 sind die andere Zahl, und die hat auf unserer Flotte ebenfalls niemand gemessen.

Die Ausnahme ist .180.3. Der EPYC 8024P dort meldet avx512_vnni und avx512_bf16, dort wäre der schnelle Pfad grundsätzlich möglich. Dessen vier RTX 5090 sind jedoch vollständig mit der produktiven Sprachlane belegt, und .202 ist der Fallback für alle Chat-Lanes. Wer dort ein Spracherkennungsmodell ansiedelt, nimmt der Produktion ihren Ausweg.

Wir haben Redux auf keinem Host installiert. Welche Durchsatz-Zahl auf Zen 2 tatsächlich herauskommt, ist bei uns offen.

Unter den offenen Gewichten liegt ein proprietärer Kernel

Dass die Gewichte unter CC-BY-4.0 stehen, ist korrekt und gilt wie beim NVIDIA-Original. Die offene Frage ist, womit man sie ausführen darf. Gelesen haben wir die PyPI-Metadaten hinter pip install moondream.

Von der Modellkarte bis zur Kernel-Lizenzmoondream 2.6.1keine Lizenzangabekestrel 0.9.2keine Lizenzangabekestrel-kernels 0.7.5proprietaerGewichteCC-BY-4.0
Die Lizenz der Gewichte sagt nichts über die Lizenz der Engine aus, die sie lädt. (Quelle: senn-tech, eigene Messung (PyPI-Metadaten, 04.10.2026))

Das Paket kestrel-kernels in Version 0.7.5 trägt im PyPI-Feld license den ausformulierten Lizenztext, 5 096 Zeichen, dazu den Klassifikator Other/Proprietary License. Er erklärt das Paket und alle mitinstallierten Bausteine für proprietär und vertraulich, lizenziert und nicht verkauft, und zwar nur nach Maßgabe einer gesonderten schriftlichen Vereinbarung. Der Satz, der für uns zählt: If you have not entered into such an Agreement, you have no license to use this software. Dazu kommen Verbote für Reverse Engineering, für das Umschiffen des Containerformats .kstlc und für jede Weitergabe. Der Verbotsparagraph gilt ausdrücklich auch für automatisierte Systeme, KI-Assistenten mit eingeschlossen.

Die Preisseite desselben Anbieters bewirbt Photon derweil mit einem Wort: Free. Beides haben wir am 4. Oktober 2026 gelesen. Das ist kein juristischer Widerspruch, Free meint die Preisliste und der Lizenztext die Erlaubnis. Für uns läuft es auf dasselbe hinaus: Ob wir diese Kernel intern laufen lassen dürfen, steht in einem Dokument, das man erst unterschreiben muss. Modellkarte und Lizenzbadge des Repos sagen dazu nichts. Das gehört in die Beschaffung vor den Test.

Auch die Supportmatrix kennt unsere Karten nicht

Die Produktions-Supportmatrix von Photon listet 102 Konfigurationen. In der Spalte für getestete Hardware stehen durchgehend NVIDIA-Beschleuniger: A10, A40, A100, B200, GH200, H100, H200, drei Jetson-Orin-Varianten, L4, L40S, RTX 30 series, RTX 3090, RTX 4090 und der RTX PRO 6000 Blackwell. In der Präzisionsspalte steht überall BF16. Ein CPU-Ziel kommt in dieser Matrix nicht vor, Apple Silicon auch nicht, und die Parakeet-Zeile nennt TDT 0.6B v3, also das NVIDIA-Original, und nicht das ternäre Redux. Unsere RTX 5090 fehlt vollständig.

Das widerlegt kein Modell. Es bedeutet nur, dass die eine Zahl, die der Anbieter als produktionsreif ausweist, auf einer anderen Karte gilt als der eigenen, während das CPU-Kopfergebnis außerhalb der Matrix liegt.

Deutsch ist der ungünstigste Fall in dieser Tabelle

In der FLEURS-Auswertung steigt die deutsche Wortfehlerrate von 4,13 auf 5,42 Prozent, das sind 31,2 Prozent relativ. Englisch im Vergleich 4,25 auf 4,90, also 15,3 Prozent. Der deutsche Ausschlag ist damit ungefähr doppelt so hoch wie der englische. Mit MUSAN-Rauschen bei 0 dB Abstand stehen für Deutsch 14,45 gegen 19,18, wieder 32,7 Prozent. Die Karte erklärt es selbst: Der akustische Spielraum des ternären Encoders ist kleiner, bei niedrigem Pegel werden häufiger ähnlich klingende Wörter eingesetzt. Auslassungen und Erfindungen nehmen dafür nicht zu.

Ein zweiter Blick lohnt sich, und er fällt unangenehm aus. In NVIDIAs eigener Modellkarte steht im model-index für FLEURS Deutsch ein Wert von 5,04 Prozent für das Original. Redux' 5,42 liegen 7,5 Prozent über der Zahl, die NVIDIA selbst für Deutsch publiziert hat. Wer deutsche Telefongespräche transkribiert, landet bei Redux also bei 5,42 und damit hinter dem öffentlichen Stand des Originals.

Absolutwerte aus zwei Messaufbauten sind nicht dasselbe

NVIDIAs model-index nennt für das Original unter anderem AMI 11,31, GigaSpeech 9,59, Earnings-22 11,42, VoxPopuli 6,14 und SPGISpeech 3,97. Moondream misst dasselbe Original mit der Leaderboard-Pipeline und kommt auf 10,86, 8,05, 10,75, 5,88 und 3,63, also in allen fünf Fällen niedriger. Die Deltas innerhalb einer Karte sind brauchbar, Absolutwerte über Kartengrenzen hinweg sind es nicht. Wer Redux gegen eine Whisper-Zahl aus einem anderen Zusammenhang stellt, vergleicht zwei Aufbauten und zwei Normalisierer.

Was wir daraus machen

Am Gateway .180.2 hängen am 4. Oktober 2026 elf Lanes, von thinking über embed und rerank bis mocr. Eine für Sprache ist nicht dabei. Redux ersetzt bei uns nichts, es wäre eine neue Funktion auf einer Infrastruktur, deren GPU-Platz schon vergeben ist.

Wir lassen es auf der Beobachtungsliste und nennen die drei Bedingungen, bei denen wir neu hinschauen. Erstens eine Lizenz, die Eigenbetrieb auf eigener Hardware abdeckt, ohne an ein Abo gekoppelt zu sein. Zweitens ein offener Runtime-Pfad für das ternäre Paket als GGUF oder ONNX, damit nicht genau ein geschlossener Kernel der einzige Leser der Gewichte ist. Drittens eine eigene Messung auf deutschem Material, weil 31,2 Prozent relativer Zuwachs kein Wert ist, den man ungeprüft in eine Telefonanlage lässt.

Die Rechengrundlagen, die CPU-Flags je Host und die ganze Lizenzkette liegen als Kommandos in unserer Messdatei MESSUNG-2026-10-04-parakeet-redux.md. Bleibt die offene Frage, ob M87 Labs eine Kernel-Lizenz für reinen Eigenbetrieb ausstellt oder ob das 350-Dollar-Team-Abo de facto die Zugangsvoraussetzung ist.

Weiterführende Quellen

Fragen?
Läuft Parakeet Redux auf unserer bestehenden KI-Infrastruktur?+

Auf den vier VM-Hosts nicht auf dem schnellen Pfad: .180.1, .180.2, .180.202 und .180.211 melden in /proc/cpuinfo keine AVX-512-Flags, es sind EPYC der Familie 23 Modell 49, also Zen 2. Die 113× Echtzeit der Modellkarte sind auf einem EPYC 9575F mit AVX-512 VNNI gemessen. Der Host .180.3 hätte avx512_vnni, seine vier RTX 5090 sind aber mit der produktiven Sprachlane belegt. Wir haben Redux nicht installiert; der Wert für Zen 2 ist offen.

Ist der kommerzielle Einsatz von Parakeet Redux erlaubt?+

Die Gewichte stehen unter CC-BY-4.0, wie das NVIDIA-Original auch. Die Kernel der Engine laufen aber unter einer anderen Lizenz: Das PyPI-Paket kestrel-kernels 0.7.5 enthält den vollständigen Text einer proprietären Lizenz von M87 Labs mit dem Satz, dass ohne gesonderte schriftliche Vereinbarung keine Lizenz zur Nutzung bestehe. Die Preisseite des Anbieters bewirbt Photon gleichzeitig als kostenlos. Diese Frage ist vor dem Benchmark zu klären.

Ist Redux für deutsche Sprache gut genug?+

Für saubere Aufnahme vermutlich ja, für rauen Alltagston eher nicht. In der FLEURS-Auswertung des Anbieters steigt die Wortfehlerrate für Deutsch von 4,13 auf 5,42 Prozent, das sind 31,2 Prozent relativ, englisch zum Vergleich 15,3 Prozent. Mit Rauschen nach MUSAN bei 0 dB stehen 14,45 gegen 19,18. NVIDIAs eigener publizierter Deutschwert des Originals ist 5,04, Redux liegt also auch über der Zahl, die man aus dem Original kennt.