AI-modellen en platforms

H Company brengt Holo4 uit, Open-Weight-modellen voor computergebruik‑agents

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

H company bracht Holo4, zijn nieuwe reeks agentische computergebruikmodellen, uit op 28 september 2026, in 27B dense en 35B-A3B Mixture of Experts-groottes, met open gewichten op Hugging Face en API-beschikbaarheid. Het bedrijf meldt dat het 27B‑model 85,2 % scoort op de OSWorld‑benchmark tegen $0,08 per taak.

Modelreeks en beschikbaarheid

Volgens het bedrijf interacteert Holo4 met software via elke beschikbare interface: grafische gebruikersinterfaces, code, MCP en API’s. Het klikt en typt op een scherm, schrijft en voert eigen code uit, en roept MCP- of API‑tools aan, waarbij de aanpak wordt gekozen die het beste bij de taak past. Hetzelfde model draait op desktops, op het web, op Android, in een code‑sandbox en tegen zakelijke API’s, en wordt in elk geval op dezelfde manier aangeroepen, zonder dat er per platform een ander model geselecteerd moet worden.

Beide groottes zijn beschikbaar via de H Models API, en de gewichten worden gepubliceerd op Hugging Face in BF16-, FP8-, NVFP4- en 4‑bit‑GGUF‑formaten. Naast Holo4 heeft het bedrijf ook Holotron4 Nano uitgebracht, een bijgewerkte versie van Holotron 3.

The Holo4-27B modelkaart identificeert het model als een 27B‑parameter visie-taalmodel gebouwd op de Qwen3.8 dense‑architectuur, met een maximale contextlengte van 262.144 tokens en doelomgevingen die web, desktop en mobiel omvatten. De kaart vermeldt dat de gewichten beschikbaar zijn onder de niet‑commerciële CC BY‑NC 4.0‑licentie en beschrijft het gebruik met het hai‑agents‑harnas van het bedrijf, dat screenshots en toolresultaten naar het model stuurt en de gevraagde klikken, typen, code‑ en tool‑aanroepen uitvoert.

Het nieuwsbericht van het bedrijf vermeldt Holo4-35B-A3B onder Apache 2.0 voor $0,30 per miljoen invoertokens, $0,03 per miljoen gecachte tokens en $2,00 per miljoen uitvoertokens, met 262 K context. Het vermeldt Holo4-27B als uitsluitend onderzoek voor $0,40 invoer, $0,04 gecached en $3,00 uitvoer per miljoen tokens, eveneens met 262 K context.

Gerapporteerde benchmarks en kosten per taak

De benchmarktabel van het bedrijf rapporteert Holo4 27B met 85,2 % op OSWorld tegen een kost van $0,08 per taak en Holo4 35B-A3B met 80,8 % tegen $0,05, tegenover 84,3 % tegen $0,22 voor Qwen3.8 27B, de basis van het 27B‑model. Vermelde frontier‑scores op OSWorld zijn 86,0 % voor Fable 5, 78,7 % voor GPT‑5.5 en 86,1 % voor Qwen3.8 Max.

Op OSWorld 2.0, dat lange computer‑workflows dekt, meldt het bedrijf Holo4 27B met een score van 61,7 % en een succesratio van 41,5 % tegen $1,22 per taak, en Holo4 35B-A3B met 30,9 % tegen $0,61. De tabel vermeldt Opus 5.5 met 81,8 % en $8,48 per taak, GPT‑6 Astra met 73,5 % en $9,07, en Qwen3.8 27B met 48,0 % en $3,49. Het bedrijf zegt dat Holo4 alleen achter de sterkste gesloten modellen blijft bij lange workflows, en dat dit gebeurt met orders van grootte minder parameters en tegen veel lagere kosten.

Op AutomationBench, een benchmark voor bedrijfsautomatisering, zijn de gerapporteerde scores 45,4 % tegen $0,05 per taak voor Holo4 27B en 34,5 % tegen $0,02 voor 35B-A3B. Het bedrijf merkt op dat 480 van de 600 taken in de openbare v1.0.6‑set binnen de splitsing vallen waaruit het trainingsdata heeft verzameld; op de 120 achtergehouden taken rapporteert het 49,3 % voor het 27B‑model en 31,7 % voor het MoE‑model. Het zegt dat het privé‑setresultaten zal publiceren zodra Holo4 is geëvalueerd op de officiële privé‑set.

De tabel rapporteert ook scores van 44,1 % voor het 27B‑model en 30,9 % voor het MoE op ALE‑CLI, de 105‑taak Linux‑splitsing van de Agents’ Last Exam‑benchmark, en AndroidWorld‑scores van 85,1 % en 77,6 %. Op interne evaluatietaken van de Agentic Task Factory, die het bedrijf zegt niet in de training te hebben gebruikt, scoort het 27B‑model 80,2 % op webtaken, 89,4 % op MCP en 72,0 % op desktop.

Het bedrijf stelt dat de cijfers van Holo4 afkomstig zijn van zijn eigen harnas, als een gemiddelde over twee tot vier runs met één run op OSWorld 2.0 en ALE‑CLI, terwijl vergelijkingsscores afkomstig zijn van modelkaarten, officiële ranglijsten en grafieken van aanbieders over verschillende harnassen en inspanningsniveaus. Het heeft elke traject achter zijn openbare benchmark‑scores open‑source gemaakt, afspeelbaar via een speciale viewer en downloadbaar als een Hugging Face‑dataset.

Trainingspipeline, Holotron4 Nano en volgende stap

Holo4 werd getraind via supervised fine‑tuning en reinforcement learning op omgevingen en taken, inclusief die gegenereerd door de Agentic Task Factory van het bedrijf, een interne set pipelines die interactieve omgevingen en verifieerbare taken bouwt uitsluitend uit documentatie, zoals screenshots van echte websites of open‑source‑software. Het bedrijf zegt dat de fabriek tot nu toe ongeveer 10.000 taken heeft geproduceerd, ongeveer 4.000 daarvan voor web‑apps en ongeveer 3.000 elk voor MCP‑servers en desktop‑omgevingen, inclusief hybride omgevingen die dezelfde status via een GUI en MCP blootleggen.

Supervised fine‑tuning gebruikte 127 B tokens, ongeveer drie kwart daarvan succesvolle agentische trajecten verdeeld over desktop (45 %), web (14 %), MCP en API (12 %) en mobiel (3 %), met de rest die multimodale redenering, GUI‑grondslag en uitsluitend tekst‑toolgebruik en codering beslaat. Asynchrone online reinforcement learning op lange‑horizon‑taken trainde vervolgens twee gespecialiseerde LoRA‑experts, één voor desktop en web en één voor terminal, MCP en API, die vervolgens met gelijke weging terug werden samengevoegd in het gefinetunede model zonder verdere training.

Het bedrijf heeft ook zijn harness opnieuw opgebouwd, de lus die de acties van het model uitvoert en de context over honderden stappen beheert, met gebruik van feedback van agentische prestaties op OSWorld 2.0. In dat proces markeerden agents waarom elke taak mislukte en controleerden ingenieurs hun oplossingen; de grootste wijzigingen waren een betrouwbaar geheugen dat honderden stappen kan bijhouden en een shell op de desktopmachine zelf.

Als lid van de NVIDIA Nemotron Coalition heeft H company dezelfde post‑training stack toegepast op Nemotron 3 Nano Omni om Holotron4 Nano te produceren. Het bedrijf meldt absolute winst in procentpunten ten opzichte van het basismodel op vijf benchmarks: OSWorld van 21,0 naar 76,3, OSWorld 2.0 van 0,2 naar 7,9, AutomationBench van 19,4 naar 35,6, PinchBench van 84,7 naar 88,6 en ALE Linux van 0,6 naar 8,5. Het zegt dat de winsten aantonen dat hun recept zich over fundamentele modellen heen leent en niet afhankelijk is van de grootte.

Het bedrijf zei dat het in de dagen na de aankondiging geoptimaliseerde DSpark‑drafter‑checkpoints zal uitbrengen om de inferentie verder te versnellen.

Jonas Reeve is een AI-gegenereerde analist bij Unite.AI, met focus op cognitieve AI, kunstmatige algemene intelligentie (AGI) en de theoretische grondslagen van machinale intelligentie. Zijn werk onderzoekt hoe leren, redeneren, geheugen en abstractie ontstaan in zowel biologische als kunstmatige systemen, en legt verbanden tussen moderne AI-architecturen en eeuwenoude vragen in de cognitieve wetenschap en de filosofie van de geest.

Met een conceptuele en reflectieve benadering onderzoekt Jonas kaders zoals redeneermodellen, agentensystemen, emergente cognitie en uitlijningstheorie, met als doel te verduidelijken wat vooruitgang richting AGI werkelijk betekent – en wat het niet betekent. In plaats van te jagen op tijdlijnen of hype, legt hij de nadruk op eerste principes, conceptuele strengheid en de grenzen van de huidige modellen.

Artikelen geschreven door Jonas Reeve zijn AI-gegenereerd en worden beoordeeld door de redactie van Unite.AI om nauwkeurigheid, duidelijkheid en een verantwoordelijke bespreking van geavanceerde AI-concepten te waarborgen.