senn-techsenn-tech
KI-News
KI-News2026-09-29· Von Franz Senn

Holo4: offene Computer-Use-Modelle, deren bestes Modell nicht kommerziell nutzbar ist

H Company hat am 28. September 2026 die Familie Holo4 veröffentlicht: ein dichtes Modell mit 27 Milliarden Parametern, ein Mixture-of-Experts-Modell mit 35 Milliarden Parametern, drei davon aktiv, und als dritten Kandidaten Holotron4-30B-A3B, intern Holotron 4 Nano, gebaut auf Nvidias Nemotron 3 Nano Omni. Alle drei verarbeiten Bild und Sprache gemeinsam, der Kontext fasst laut Konfigurationsdatei 262.144 Token, und sie bedienen Software über alle offenliegenden Wege: Bildschirm, Code, MCP-Werkzeuge, API. Die Gewichte der Holo4-Modelle liegen auf Hugging Face, in BF16, FP8, NVFP4 und als GGUF. Für das Modell mit den besten Tabellenwerten schließt die Lizenz die kommerzielle Nutzung aus.

Was die Zahlen sind und woher sie kommen

Auf OSWorld 2.0, dem Benchmark für lange Computer-Abläufe, weist H Company für Holo4 27B 61,7 Prozent Teilpunkte aus, dazu 41,5 Prozent erfolgreich abgeschlossene Aufgaben und 1,22 US-Dollar Kosten pro Aufgabe. Gemessen hat das der Anbieter selbst, im eigenen Harness, in einem einzigen Lauf.

OSWorld 2.0 Teilpunkte laut Tabelle im Blogeintrag vom 28. SeptemberOpus 5.581.8 · 81,8 zu 8,48 Dollar je AufgabeGPT-6 Astra73.5 · 73,5 zu 9,07 DollarMuse Spark 1.366.9 · 66,9, Kosten nicht angegebenHolo4 27B61.7 · 61,7 zu 1,22 Dollar, eigene MessungQwen3.8 27B (Basis)48 · 48,0 zu 3,49 Dollar090
Vergleichswerte aus anderen Harness, anderen Anstrengungsstufen und Teilmengen, wie die Fußnote des Blogeintrags einräumt. Quelle: Blogeintrag von H Company. (Quelle: hcompany.ai/newsroom/holo4)

Am Tag nach der Veröffentlichung existiert zu keinem Holo4-Wert eine unabhängige Nachmessung. Was H Company offenlegt, sind alle Agenten-Spuren der Messungen auf trajectories.hcompany.ai. Wer einer Zahl nicht traut, kann dort Schritt für Schritt nachsehen, wie der Agent zu ihr gekommen ist.

Der Vergleich aus dem Ankündigungsposting

Das Ankündigungsposting auf LinkedIn (als bearbeitet markiert) stellt die 61,7 Prozent als Spitzenwert hin, mit dem Zusatz: knapp vor „GPT-6 Sol-Xhigh“ mit 60,5 Prozent, bei rund einem Viertel der Kosten. Dieses Modell mit diesem Wert kommt im verlinkten Blogeintrag an keiner Stelle vor, weder in einer Tabelle noch in einem Punkt des Kosten-Diagramms. Dessen Tabellen führen Opus 5.5 mit 81,8 und GPT-6 Astra mit 73,5 Prozent, und der Einleitungstext des Blogeintrags sagt selbst, dass Holo4 hinter den stärksten geschlossenen Modellen liegt. Der nächstliegende Punkt im Diagramm ist GPT-5.6 Sol mit 66,2 Prozent, gemessen auf einer anderen Teilmenge, übernommen aus der Startgrafik von OpenAI. Die Regel für Ankündigungspostings bleibt: immer die verlinkte Tabelle mitlesen.

Ein zweiter Blick gehört auf die offizielle Rangliste von OSWorld 2.0. Dort löst das beste Modell nach binärer Bewertung 20,6 Prozent der Aufgaben (Opus 4.8, 54,8 Prozent Teilpunkte). Holo4s 41,5 Prozent Erfolg lägen darüber. Direkt vergleichen kann man die Werte nicht, weil H Company den Harness umbaut, unter anderem mit einer Shell direkt auf dem Desktop-Rechner und eigenem Gedächtnis über Hunderte Schritte. Belegbar ist nur: ein offizielles Nachmessen steht aus, und die 61,7 Prozent sind ein Teilpunkte-Wert einer einzigen eigenen Messung.

Was das Feintraining gebracht hat

Basis von Holo4 27B ist Qwen3.8-27B. Dieselbe Basis erreicht im selben Harness auf dem alten OSWorld 84,3 Prozent, Holo4 85,2. Auf dem langen OSWorld 2.0 stehen 48,0 gegen 61,7 Teilpunkte, und in der hauseigenen MCP-Suite springt der Wert von 74,2 auf 89,4 Prozent. Das Muster: Auf dem kurzen, bereits gesättigten Benchmark bringt das Feintraining fast nichts, auf langen Abläufen und beim Werkzeugaufruf bringt es deutlich. Trainiert wurde mit 127 Billionen Token überwachtem Feintraining, davon rund drei Viertel erfolgreiche Agenten-Spuren aus der eigenen Task Factory, die nach Anbieterangaben zehntausend geprüfte Aufgaben aus Produktdokumentationen und Bildschirmfotos gebaut hat. Danach trainierte das Team zwei LoRA-Spezialisten per Reinforcement Learning online, einen für Desktop und Web, einen für Terminal, MCP und API, und fügte beide mit gleichem Gewicht wieder ins Modell ein.

Die AutomationBench-Zahl mit Fußnote

Für Geschäftsautomatisierung über MCP-Werkzeuge nennt H Company 45,4 Prozent auf AutomationBench. Die Fußnote des Eintrags dazu: Von den 600 öffentlichen Aufgaben lagen 480 im eigenen Trainingspool; die 120 herausgehaltenen Aufgaben wertet der Eintrag selbst mit 49,3 Prozent für Holo4 27B. Das private Set des Benchmarks ist für Holo4 noch nicht gemessen. Dem Anbieter ist zugutezuhalten, dass er das selbst hinschreibt. Zitieren sollte man die Zahl trotzdem nur zusammen mit diesem Hinweis.

Welche Lizenz auf welches Gewicht gilt

ModellBasisLizenz der Gewichte
Holo4-27BQwen3.8-27BCC BY-NC 4.0
Holo4-35B-A3BQwen3.6-35B-A3BApache 2.0
Holotron4-30B-A3BNemotron 3 Nano OmniNVIDIA Open Model License

Die Lizenzen stehen im Kopf der Modell-Repos auf Hugging Face, im Posting und im Blogeintrag kommen sie mit keinem Wort vor. Die Basis von Holo4 27B ist Apache-2.0-lizenziert, das Feintraining kommt mit CC BY-NC 4.0, verbietet also kommerzielle Nutzung. Wer mit den 27B-Tabellenwerten einen Piloten plant, plant etwas, das er so nicht betreiben dürfte. Die kommerziell nutzbare Variante ist das Holo4-35B-A3B, und das liegt mit 30,9 Teilpunkten und 12,3 Prozent Erfolg auf OSWorld 2.0 deutlich hinter dem Flaggschiff. Holotron4 Nano (H Company ist Mitglied von Nvidias Nemotron Coalition) verbessert die Nemotron-Basis nach Anbieterangaben auf GUI-Strecken stark, von 21,0 auf 76,3 Prozent auf dem alten OSWorld, bleibt auf OSWorld 2.0 aber bei 7,9 Prozent.

Der Ablauf, den alle drei Modelle bedienen sollenBildschirmfoto und Werkzeugergebnisse sendenModell antwortet mit Klick, Tippen, Code oder AufrufHarness führt den Schritt auf der Maschine ausNeue Beobachtung zurück ans Modellbis zu 500 Schritte je Aufgabe
Ein einziger Modellruf über alle Schnittstellen, der Unterschied zum Chat-Modell sitzt im Ablauf herum. (Quelle: senn-tech, nach Blogeintrag und Modell-Repos)

Was der Betrieb kostet

Die BF16-Gewichte des 27B-Modells belegen rund 55 Gigabyte auf 18 Shard-Dateien; FP8, NVFP4 und GGUF liefert der Anbieter mit, bei beiden Größen. Die 27B-Klasse Qwen3.8 steht bei uns als Reserve-Lane auf einer einzelnen RTX 5090, quantisiert, auf vLLM. Ob derselbe Dienst die Variante mit Bildeingang mit denselben Startparametern ausliefert, haben wir nicht geprüft. Der Preis liegt im Ablauf herum: OSWorld-2.0-Aufgaben bearbeitet der Harness des Anbieters in bis zu 500 Schritten über mehrere Stunden je Aufgabe. Bei 41,5 Prozent Erfolg im Anbieterwert scheitert die Mehrheit der Aufgaben von selbst. Ein produktiver Einsatz braucht dazu denselben Menschen im Loop und dieselbe Kostenobergrenze je Aufgabe wie jeder andere Agenten-Ablauf. Selbst gemessen haben wir noch nichts, ein kommerzieller Test käme wegen der Lizenzen nur mit dem Apache-Modell infrage. Wer prüfen will, ob die Spuren zu den eigenen Anwendungen passen, kann das mit dem 27B-Modell tun, solange daraus nichts kommerziell gebaut wird.

Weiterführende Quellen

Fragen?
Ist Holo4 kommerziell nutzbar?+

Das 27B-Modell nicht, es steht unter CC BY-NC 4.0. Das Holo4-35B-A3B steht unter Apache 2.0, Holotron4-30B-A3B unter der NVIDIA Open Model License; die beiden sind kommerziell nutzbar, auf langen Strecken aber deutlich schwächer. Die Lizenzen stehen in den Modell-Repos auf Hugging Face, im Ankündigungstext kommen sie nicht vor.

Wie belastbar ist der Wert von 61,7 Prozent auf OSWorld 2.0?+

Es ist ein Anbieterwert, gemessen im eigenen Harness, in einem Lauf, als Teilpunktzahl, bei 41,5 Prozent erfolgreich abgeschlossenen Aufgaben. Die Vergleichswerte stammen aus anderen Harness und Teilmengen. Eine Nachmessung durch Dritte gibt es noch nicht; die vollständigen Agenten-Spuren stellt H Company offen.

Warum ist die Veröffentlichung trotzdem einen Blick wert?+

Wegen der offenen Agenten-Spuren, der vier Service-Formate inklusive FP8 und NVFP4 und der Trainingsdokumentation. Das Muster in den Tabellen, großer Zugewinn auf langen Abläufen und keiner auf gesättigten kurzen Benchmarks, lässt sich mit den offen gelegten Umgebungsbausteinen für den eigenen Anwendungsfall nachprüfen.