Jev im Praxischeck: Ein Modell, das nur Entscheidungen liefert
Am 15. September hat TypeSafe AI mit Jev das erste System-One-Modell vorgestellt: kein Chat, kein Reasoning-Geplauder, sondern typisierte Entscheidungen in Millisekunden. Der Auslöser für diesen Beitrag war ein deutschsprachiges Praxisvideo von Julian Ivanov, das zehn Einsatzfälle durchgeht, zwei damit gebaute Apps zeigt und offen über Grenzen und Datenschutz spricht.
Wir hatten über Jev in der KW38-Rückschau schon berichtet, dort mit Fokus auf die Werbezahl der Woche. Dieser Beitrag ist die ausführliche Einordnung: was das Modell ist, was der erste Monat Praxis bringt und was davon auf eigener Hardware laufen könnte.
Was Jev ist
Drei Fragetypen, mehr nicht. Eine Choice wählt aus höchstens 255 vorgegebenen Optionen, etwa dem zuständigen Team für ein Ticket. Ein Score bewertet auf einer Skala, etwa die Frustriertheit eines Kunden. Ein Noul antwortet Ja oder Nein mit Wahrscheinlichkeit, etwa auf die Frage, ob diese Nachricht eine Erstattung verlangt. Die Doku leitet den Namen von Kahneman her: System 1, das schnelle intuitive Urteil, gegen das langsame Abwägen der großen Reasoning-Modelle. Der Name ist Programm: Jev versteht nur Text, antwortet typisiert und schreibt nichts.
Zugang gibt es über die TypeSafe-API mit Warteliste und seit dem 18. September über OpenRouter unter typesafe/jev-1.13: 0,042 Dollar pro Million Eingabe-Tokens, Ausgabe kostenlos, 32.000 Tokens Kontext, P50-Latenz 0,27 Sekunden. Zu beachten ist der Endpunkt: Es ist die Decisions-API, nicht der OpenAI-kompatible Chat-Endpoint; vorhandene SDKs funktionieren dafür nicht.
Was daran neu ist
Entscheidungsmodelle dieser Art sind so alt wie das maschinelle Lernen: Früher war es ein trainierter Klassifikator pro Anwendungsfall, die Klassenmenge einbetoniert, jede Änderung ein Re-Training. Neu an Jev ist nicht die Idee, sondern die Verallgemeinerung. Die Fragen werden pro Request definiert, das Antwortangebot steht in der Anfrage, ein Training für neue Optionen entfällt. Die Wahrscheinlichkeiten sind mit strikt korrekten Scoring-Regeln trainiert und damit grundsätzlich kalibriert, die Kosten liegen auf Klassifikator-Niveau, während die Qualitätsstufe an die LLMs als Richter heranreicht.
Das mustergültige Zusammenspiel beschreibt der Build-Katalog unter dem Begriff Jev Engineering: ein Sprachmodell schreibt, Jev entscheidet, Code handelt. Wer unsere Eigenbau-Strecke kennt, erkennt die Arbeitsteilung wieder. Wir fahren sie bisher mit zwei Modellen auf eigener Strecke; Jev verfeinert dieselbe Logik um eine dritte, extrem billige Schicht.
Was der erste Monat zeigt
Der Katalog madewithjev.com zählte am 22. September 473 Projekte und 107 Anleitungen, eine Woche nach Launch. Die publizierten Kostenzahlen sind der eigentliche Grund, sich das anzusehen:
Dazu die Richtungsweisungen von unabhängiger Seite: OpenRouters eigener Ori-Eval-Test über die Judge-Modelle der Plattform maß Jev mehr als fünfmal schneller als das nächstschnellste Modell, Every ließ 1.709 Textstellen für weniger als einen Cent bewerten. Das Beispiel aus dem Video, 724 live geschaltete Werbeanzeigen einer halben Minute lang nach Hook, Format und CTA zerlegen, steht in der Liste: 40 Sekunden, neun Cent.
Guardrails und Model-Routing im Support-Bot
Das Muster, das den Support-Bot im Video trägt, ist die Konfidenz als Weiche:
Publizierter Beleg ist ein Betrugsfall-Testlauf: 100 E-Mails, die Jev in 1,42 Sekunden vor klassifizierte; alle Prognosen unter 95 Prozent Confidence gingen an Kimi K3, am Ende 96 von 100 richtig, Gesamtkosten rund 7 Cent. Ein Haken bleibt, und das Video spricht ihn ebenso an wie die Community: Die Rohzahl neben der Entscheidung ist kein verlässliches Versprechen. Zwei unabhängige Messungen, Samuel Sacco am 18. September und 8.000 Urteile von Adil Muhammad Pervez, kommen auf denselben Befund: Die Reihenfolge der Optionen ist vertrauenswürdig, die Kalibrierung der Zahl selbst nicht. Wer Schwellwerte automatisiert, muss sie auf den eigenen Labels nachziehen, sonst hängt die Weiche im Leeren. Das gilt für uns zusätzlich als Guardrail-Frage: Die Jaggedness-Doku listet, was das Modell nicht kann, kein Zählen, keine Datumsfolgen, und adversarial eingeschleuster Text im State kann die Antwort bewegen; unsere Muster dagegen stehen im Beitrag zu Agent-Jacking.
Browser-Automation mit wenig Modell
Ein Eigenbau von Browser Use zeigt das Extrem, in einer Woche auf 17,9 Tausend Sterne: ein Browser-Agent, dem Jev pro Schritt Operation und Element aus der Zahlentabelle der Seite wählt, in einem einzigen Request für beide Entscheidungen, mit einem kleinen Sprachmodell nur als Textlieferant, wenn getippt werden muss. Die Demo sucht einen Flug Zürich nach London in 7,1 Sekunden für 0,0039 Dollar, die Protokollaufrufe im Browser sanken im Median von 1.092 auf 101. Aufschlussreich ist der Misserfolg daneben: Ohne WebMCP, also nur über Klicks, löste der Agent 25 von 49 Aufgaben des WebMCP-Benchmarks; mit WebMCP, wo die Seite selbst ihre Werkzeuge als Optionen anbietet, 49 von 49 bei rund einem Prozent der Vergleichskosten. Die Qualität des Entscheidungsraums schlägt die Qualität des Modells.
Was Jev nicht kann und wo Datenschutz beginnt
Rechnen, zählen, Datumsreihen: Die Grenzen stehen offen in der Doku. Und die Werbung muss sich messen lassen: Die Gegenrechnung von Lindfors auf 24 norwegische Dokumente ergab bei der Standpunktentscheidung Gleichstand mit DeepSeek V4.1 Flash ohne Reasoning und reale Kosten von einem Sechstel bis einem Vierzehntel der Referenz, nicht das beworbene Mehrhundertfache.
Für den Betrieb in Österreich wiegt die Frage hinter der Leistung schwerer: Jev läuft als gehostete US-API, ohne EU-Region, ohne Gewichte, ohne Selbstbetrieb, und ein LiteLLM-Provider existiert nicht. Personenbezogene und NIS2-relevante Vorgänge sind damit tabu, Punkt. Was bleibt, ist der Contract im Haus: Mit dem Python-Adapter lässt sich die typisierte Antwort auf eigene Endpunkte legen, und offen ist das Muster allemal.
Laya, die offene Antwort
Zwei Wochen nach Launch legte Convai Innovations mit Laya nach: Apache 2.0, 421 Millionen Parameter auf ModernBERT-large, Entscheidung in einem Forward-Pass, gemessen 32,8 Millisekunden auf einer T4, gebatcht bis 332 Fragen pro Sekunde, mit multilingualer Variante über 100 Sprachen. Das passt bequem auf eine unserer eigenen Karten, neben der laufenden Inferenz-Lane.
Die Modellkarte ist ehrlich, und das macht sie brauchbar: Auf dem typed-decisions-Benchmark steht die feinabgestimmte Variante mit 0,766 gegen Jevs publiziertes 0,727, beim Brier-Score 0,062 gegen 0,148; die Jev-Zahlen stammen von Dritten, nicht von Convai. Dieselbe Karte benennt die Preise: Das Basis-Checkpoint liegt ohne Feinschliff nahe am Zufall, 0,362 gegen 0,461 für die Mehrheitsklasse, die Wahrscheinlichkeiten sind ohne Temperature-Kalibrierung zu sicher, und bei 77 Optionen auf einmal (Banking77) fällt Laya auf 0,425 gegen Jevs 0,870. Der unabhängige Benchmark-Datensatz von Luni warnt zusätzlich vor Vergleichen über Benchmark-Grenzen hinweg. Laya ist kein fertiges Jev, sondern ein schneller Unterbau, den wir selbst spezialisieren müssten.
Weiterführende Quellen
- TypeSafe: Einführung der System-One-Modelle, Doku zu System One, Jaggedness-Seite zu Jev 1.13
- OpenRouter-Modellseite typesafe/jev-1.13, madewithjev.com mit 473 katalogisierten Bauten, jev-ultrafast auf GitHub
- Lindfors, Gegenmessung vom 18.09.2026, Laya-Modellkarte, Benchmark-Datensatz Luni/laya-jev-benchmark
- Video: Julian Ivanov, Jev, das kann das KI-Modell wirklich
- Aus dem Haus: Eigene KI-Strecke mit LiteLLM und vLLM, Kosten pro KI-Aufgabe, E-Mail-Triage mit KI, Agent-Jacking und Prompt-Injection
Kann Jev Texte schreiben?+
Nein. Jev nimmt Text als Eingabe und antwortet ausschließlich typisiert: eine Choice aus höchstens 255 Optionen, ein Score auf einer Skala oder ein Noul als Ja/Nein mit Wahrscheinlichkeit. Bilder, Audio und Video werden nicht verstanden, und es gibt keine generierte Erklärung dazu. Genau das macht die Antworten maschinenlesbar und die Latenz so niedrig.
Was kostet der Einsatz konkret?+
Gelistet sind 0,042 US-Dollar pro Million Eingabe-Tokens bei kostenlosen Ausgaben, 32.000 Tokens Kontext, kein Free Tier. Im Katalog madewithjev.com median 0,000068 Dollar je Entscheidung über 15 veröffentlichte Läufe. Veröffentlichte Beispiele liegen bei 3,5 Cent für 500 E-Mails oder 9 Cent für 724 Werbeanzeigen. Die unabhängige Gegenmessung von Lindfors sah das Sechs- bis Vierzehnfache der Referenz statt der beworbenen 445-fachen Ersparnis.
Gibt es das Muster auch mit offenen Gewichten?+
Ja, mit Laya von Convai Innovations: Apache 2.0, 421 Millionen Parameter auf ModernBERT-large, eine 512-Token-Datei, die ohne Generierung in einem Forward-Pass um die 33 Millisekunden auf einer einzelnen GPU entscheidet. Die Modellkarte verlangt aber Eigenarbeit: den Feinschliff auf eigene Aufgaben, eine Temperature-Kalibrierung vor vertrauenswürdigen Wahrscheinlichkeiten, und bei mehr als 20 Optionen pro Frage zieht Jev deutlich davon.
senn-tech