KI-Modelle und Plattformen
H Company veröffentlicht Holo4, Open‑Weight‑Modelle für Computer‑Nutzungs‑Agenten

H company veröffentlichte Holo4, seine neue Serie agentischer Computer‑Nutzungs‑Modelle, am 28. September 2026, in den Größen 27 B dense und 35 B‑A3B Mixture of Experts, mit offenen Gewichten auf Hugging Face und API‑Verfügbarkeit. Das Unternehmen berichtet, dass das 27‑B‑Modell 85,2 % im OSWorld‑Benchmark bei 0,08 $ pro Aufgabe erzielt.
Modellübersicht und Verfügbarkeit
Laut dem Unternehmen interagiert Holo4 mit Software über jede verfügbare Schnittstelle: grafische Benutzeroberflächen, Code, MCP und APIs. Es klickt und tippt auf einem Bildschirm, schreibt und führt eigenen Code aus und ruft MCP‑ oder API‑Werkzeuge auf, wobei es den Ansatz wählt, der zur Aufgabe passt. Das gleiche Modell läuft auf Desktops, im Web, auf Android, in einer Code‑Sandbox und gegen Geschäfts‑APIs und wird in jedem Fall auf dieselbe Weise aufgerufen, ohne dass für jede Plattform ein anderes Modell ausgewählt werden muss.
Beide Größen sind über die H Models‑API verfügbar, und die Gewichte werden auf Hugging Face in den Formaten BF16, FP8, NVFP4 und 4‑Bit‑GGUF veröffentlicht. Neben Holo4 hat das Unternehmen auch Holotron4 Nano veröffentlicht, eine aktualisierte Version von Holotron 3.
Die Holo4-27B Modellkarte identifiziert das Modell als ein 27‑B‑Parameter Vision‑Sprach‑Modell, das auf der dichten Qwen3.8‑Architektur basiert, mit einer maximalen Kontextlänge von 262.144 Token und Zielumgebungen für Web, Desktop und Mobile. Die Karte gibt an, dass die Gewichte unter der nicht‑kommerziellen CC‑BY‑NC‑4.0‑Lizenz verfügbar sind und beschreibt die Nutzung mit dem hai‑agents‑Harness des Unternehmens, das Screenshots und Werkzeug‑Ergebnisse an das Modell sendet und dessen angeforderte Klicks, Tastatureingaben, Code‑ und Werkzeugaufrufe ausführt.
Der Newsroom-Beitrag des Unternehmens listet Holo4‑35B‑A3B unter Apache 2.0 zu 0,30 $ pro Million Eingabetoken, 0,03 $ pro Million zwischengespeicherter Token und 2,00 $ pro Million Ausgabetoken, mit 262 K Kontext. Er listet Holo4‑27B als rein forschungsbezogen zu 0,40 $ Eingabe, 0,04 $ Zwischenspeicherung und 3,00 $ Ausgabe pro Million Token, ebenfalls mit 262 K Kontext.
Gemeldete Benchmarks und Kosten pro Aufgabe
Die Benchmark‑Tabelle des Unternehmens gibt an, dass Holo4 27B bei 85,2 % auf OSWorld mit Kosten von 0,08 $ pro Aufgabe liegt und Holo4 35B‑A3B bei 80,8 % zu 0,05 $, gegenüber 84,3 % zu 0,22 $ für Qwen3.8 27B, dem Basismodell mit 27 B. Aufgelistete Spitzenwerte auf OSWorld sind 86,0 % für Fable 5, 78,7 % für GPT‑5.5 und 86,1 % für Qwen3.8 Max.
Auf OSWorld 2.0, das lange Computer‑Workflows abdeckt, berichtet das Unternehmen, dass Holo4 27B eine Punktzahl von 61,7 % und eine Erfolgsrate von 41,5 % bei 1,22 $ pro Aufgabe erzielt, und Holo4 35B‑A3B bei 30,9 % zu 0,61 $. Die Tabelle listet Opus 5.5 mit 81,8 % und 8,48 $ pro Aufgabe, GPT‑6 Astra mit 73,5 % und 9,07 $, und Qwen3.8 27B mit 48,0 % und 3,49 $ auf. Das Unternehmen sagt, dass Holo4 nur hinter den stärksten geschlossenen Modellen bei langen Workflows zurückbleibt und dies mit um Größenordnungen weniger Parametern und bei deutlich geringeren Kosten erreicht.
Auf AutomationBench, einem Benchmark für Geschäfts‑Automatisierung, betragen die gemeldeten Werte 45,4 % bei 0,05 $ pro Aufgabe für Holo4 27B und 34,5 % bei 0,02 $ für 35B‑A3B. Das Unternehmen weist darauf hin, dass 480 der 600 Aufgaben im öffentlichen v1.0.6‑Set in den Split fallen, aus dem es Trainingsdaten gesammelt hat; bei den 120 zurückgehaltenen Aufgaben berichtet es von 49,3 % für das 27‑B‑Modell und 31,7 % für das MoE‑Modell. Es sagt, dass es private‑Set‑Ergebnisse veröffentlichen wird, sobald Holo4 auf dem offiziellen privaten Set evaluiert wurde.
Die Tabelle berichtet außerdem von Punktzahlen von 44,1 % für das 27‑B‑Modell und 30,9 % für das MoE auf ALE‑CLI, dem 105‑Aufgaben‑Linux‑Split des Agents’ Last Exam‑Benchmarks, sowie AndroidWorld‑Werten von 85,1 % und 77,6 %. Bei internen Evaluierungsaufgaben der Agentic Task Factory, die das Unternehmen als nicht für das Training verwendet angibt, erzielt das 27‑B‑Modell 80,2 % bei Web‑Aufgaben, 89,4 % bei MCP und 72,0 % bei Desktop.
Das Unternehmen gibt an, dass die Zahlen von Holo4 aus seinem eigenen Harness stammen, als Mittelwert über zwei bis vier Durchläufe mit einem einzelnen Durchlauf auf OSWorld 2.0 und ALE‑CLI, während Vergleichswerte aus Modellkarten, offiziellen Ranglisten und Diagrammen von Anbietern über unterschiedliche Harnesses und Aufwandsebenen stammen. Es hat sämtliche Trajektorien hinter seinen öffentlichen Benchmark‑Ergebnissen Open‑Source gestellt, die über einen dedizierten Viewer wiedergegeben und als Hugging Face‑Datensatz heruntergeladen werden können.
Trainingspipeline, Holotron4 Nano und nächster Schritt
Holo4 wurde durch überwachtes Fein‑Tuning und Reinforcement‑Learning in Umgebungen und Aufgaben trainiert, darunter solche, die von der Agentic Task Factory des Unternehmens erzeugt wurden, einem internen Satz von Pipelines, der interaktive Umgebungen und verifizierbare Aufgaben allein aus Dokumentation erstellt, wie Screenshots realer Websites oder Open‑Source‑Software. Das Unternehmen sagt, dass die Fabrik bislang etwa 10 000 Aufgaben produziert hat, davon rund 4 000 für Web‑Apps und etwa 3 000 jeweils für MCP‑Server und Desktop‑Umgebungen, einschließlich hybrider Umgebungen, die denselben Zustand über eine GUI und MCP bereitstellen.
Beim überwachten Fein‑Tuning wurden 127 B Token verwendet, davon etwa drei Viertel erfolgreiche agentische Trajektorien, verteilt auf Desktop (45 %), Web (14 %), MCP und API (12 %) sowie Mobile (3 %), während der Rest multimodales Schließen, GUI‑Verankerung sowie rein textbasierte Werkzeug‑ und Codennutzung abdeckte. Asynchrones Online‑Reinforcement‑Learning bei Langzeit‑Aufgaben trainierte anschließend zwei spezialisierte LoRA‑Experten, einen für Desktop und Web und einen für Terminal, MCP und API, die anschließend mit gleichem Gewicht wieder in das feinabgestimmte Modell integriert wurden, ohne weitere Schulung.
Das Unternehmen hat zudem seinen Steuerungsrahmen, die Schleife, die die Aktionen des Modells ausführt und seinen Kontext über Hunderte von Schritten verwaltet, unter Verwendung von Feedback aus der agentischen Leistung bei OSWorld 2.0, neu aufgebaut. In diesem Prozess haben Agenten markiert, warum jede Aufgabe fehlgeschlagen ist, und Ingenieure ihre Korrekturen überprüft; die größten Änderungen waren ein zuverlässiger Speicher, der Hunderte von Schritten nachverfolgen kann, und eine Shell auf dem Desktop‑Computer selbst.
Als Mitglied der NVIDIA Nemotron Coalition hat H company denselben Post‑Training‑Stack auf Nemotron 3 Nano Omni angewendet, um Holotron4 Nano zu erzeugen. Das Unternehmen berichtet von absoluten prozentualen Punktgewinnen gegenüber dem Basismodell bei fünf Benchmarks: OSWorld von 21.0 auf 76.3, OSWorld 2.0 von 0.2 auf 7.9, AutomationBench von 19.4 auf 35.6, PinchBench von 84.7 auf 88.6 und ALE Linux von 0.6 auf 8.5. Es heißt, die Gewinne zeigen, dass das Rezept über Fundamentmodelle hinweg übertragbar ist und nicht von der Modellgröße abhängt.
Das Unternehmen sagte, dass es in den Tagen nach der Ankündigung optimierte DSpark‑Drafter‑Checkpoints veröffentlichen wird, um die Inferenz weiter zu beschleunigen.












