Modely a platformy AI

Společnost H uvádí Holo4, modely s otevřenými váhami pro počítačové agenty

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Společnost H vydala Holo4, svou novou řadu modelů agentického počítačového používání, dne 28. září 2026, ve velikostech 27B dense a 35B-A3B Mixture of Experts, s otevřenými vahami na Hugging Face a dostupností API. Společnost uvádí, že model 27B dosáhl 85,2 % na benchmarku OSWorld při nákladu 0,08 $ za úlohu.

Portfolio modelů a dostupnost

Podle společnosti Holo4 spolupracuje se softwarem přes jakékoli dostupné rozhraní: grafické uživatelské rozhraní, kód, MCP a API. Kliká a píše na obrazovce, vytváří a spouští vlastní kód a volá nástroje MCP nebo API, přičemž vybírá přístup, který nejlépe vyhovuje úkolu. Ten samý model běží na desktopových počítačích, na webu, na Androidu, v kódovém sandboxu i proti podnikových API a je volán stejným způsobem ve všech případech, aniž by bylo nutné vybírat jiný model pro konkrétní platformu.

Obě velikosti jsou k dispozici v API H Models a váhy jsou publikovány na Hugging Face ve formátech BF16, FP8, NVFP4 a 4‑bit GGUF. Vedle Holo4 společnost také vydala Holotron4 Nano, aktualizovanou verzi Holotron 3.

The Karta modelu Holo4-27B identifikuje model jako 27B‑parametrový model vision-language postavený na husté architektuře Qwen3.8, s maximální délkou kontextu 262 144 tokenů a cílovými prostředími zahrnujícími web, desktop a mobil. Karta uvádí, že váhy jsou k dispozici pod nekomerční licencí CC BY‑NC 4.0 a popisuje použití s hákem společnosti hai‑agents, který odesílá snímky obrazovky a výsledky nástrojů modelu a provádí požadované kliknutí, psaní, kód a volání nástrojů.

The company’s tisková zpráva uvádí Holo4-35B-A3B pod licencí Apache 2.0 za 0,30 $ za milion vstupních tokenů, 0,03 $ za milion uložených tokenů a 2,00 $ za milion výstupních tokenů, s kontextem 262 000. Uvádí také Holo4-27B jako výhradně výzkumný model za 0,40 $ za vstup, 0,04 $ za uložené a 3,00 $ za výstup za milion tokenů, také s kontextem 262 000.

Uvedené benchmarky a náklady na úlohu

Tabulka benchmarků společnosti uvádí, že Holo4 27B dosáhl 85,2 % na OSWorld při nákladu 0,08 $ za úlohu a Holo4 35B‑A3B 80,8 % při 0,05 $, oproti 84,3 % při 0,22 $ pro Qwen3.8 27B, základní model 27B. Uvedené špičkové výsledky na OSWorld jsou 86,0 % pro Fable 5, 78,7 % pro GPT‑5.5 a 86,1 % pro Qwen3.8 Max.

Na OSWorld 2.0, který zahrnuje dlouhé počítačové pracovní postupy, společnost uvádí, že Holo4 27B dosáhl skóre 61,7 % a úspěšnost 41,5 % při 1,22 $ za úlohu, a Holo4 35B‑A3B 30,9 % při 0,61 $. Tabulka uvádí Opus 5.5 s 81,8 % a 8,48 $ za úlohu, GPT‑6 Astra s 73,5 % a 9,07 $, a Qwen3.8 27B s 48,0 % a 3,49 $. Společnost uvádí, že Holo4 zaostává jen za nejsilnějšími uzavřenými modely u dlouhých pracovních postupů a to s řádově menším počtem parametrů a při mnohem nižších nákladech.

Na AutomationBench, benchmarku pro automatizaci podnikání, jsou uváděné výsledky 45,4 % při 0,05 $ za úlohu pro Holo4 27B a 34,5 % při 0,02 $ pro 35B‑A3B. Společnost poznamenává, že 480 z 600 úkolů ve veřejné sadě v1.0.6 spadá do rozdělení, ze kterého sbírala tréninková data; na 120 vyhrazených úkolech uvádí 49,3 % pro model 27B a 31,7 % pro model MoE. Říká, že soukromé výsledky oznámí, jakmile bude Holo4 vyhodnocen na oficiální soukromé sadě.

Tabulka také uvádí výsledky 44,1 % pro model 27B a 30,9 % pro MoE na ALE‑CLI, 105‑úkolovém linuxovém rozdělení benchmarku Agents’ Last Exam, a výsledky AndroidWorld 85,1 % a 77,6 %. Na interních hodnotících úlohách Agentic Task Factory, o kterých společnost uvádí, že nebyly použity při tréninku, model 27B dosáhl 80,2 % na webových úlohách, 89,4 % na MCP a 72,0 % na desktopu.

Společnost uvádí, že údaje Holo4 pocházejí z jejího vlastního háčku, jako průměr ze dvou až čtyř běhů s jedním během na OSWorld 2.0 a ALE‑CLI, zatímco srovnávací výsledky pocházejí z karet modelů, oficiálních žebříčků a grafů poskytovatelů napříč různými háčky a úrovněmi úsilí. Zveřejnila otevřený zdroj všech trajektorií za veřejnými benchmarkovými výsledky, které lze přehrát pomocí dedikovaného prohlížeče a stáhnout jako dataset na Hugging Face.

Tréninková pipeline, Holotron4 Nano a další krok

Holo4 byl trénován pomocí supervidovaného doladění a posilovacího učení na prostředích a úlohách, včetně těch generovaných společností Agentic Task Factory, interní sady pipeline, která vytváří interaktivní prostředí a ověřitelné úlohy pouze z dokumentace, jako jsou snímky skutečných webových stránek nebo open‑source softwaru. Společnost uvádí, že továrna doposud vytvořila přibližně 10 000 úkolů, zhruba 4 000 z nich pro webové aplikace a asi 3 000 pro servery MCP a desktopová prostředí, včetně hybridních prostředí, která vystavují stejný stav jak přes GUI, tak MCP.

Supervidované doladění použilo 127 B tokenů, zhruba tři čtvrtiny z nich představovaly úspěšné agentické trajektorie rozdělené mezi desktop (45 %), web (14 %), MCP a API (12 %) a mobil (3 %), přičemž zbytek pokrýval multimodální uvažování, zakotvení v GUI a používání nástrojů pouze v textu a kódování. Asynchronní online posilovací učení na úlohách s dlouhým horizontem pak vyškolilo dva specializované LoRA experty, jednoho pro desktop a web a druhého pro terminál, MCP a API, kteří byli sloučeni zpět do doladěného modelu se stejnou vahou a bez dalšího tréninku.

Společnost také přestavěla svůj rámec, smyčku, která vykonává akce modelu a spravuje jeho kontext během stovek kroků, a to pomocí zpětné vazby z agentického výkonu na OSWorld 2.0. V tomto procesu agenti označili, proč každá úloha selhala, a inženýři přezkoumali jejich opravy; největší změny byly spolehlivá paměť, která dokáže sledovat stovky kroků, a shell přímo na desktopovém počítači.

Jako člen koalice NVIDIA Nemotron společnost H použila stejný post‑training stack na Nemotron 3 Nano Omni a vytvořila Holotron4 Nano. Společnost uvádí absolutní zisky v bodech procentuálního podílu oproti základnímu modelu v pěti benchmarkech: OSWorld ze 21,0 na 76,3, OSWorld 2.0 ze 0,2 na 7,9, AutomationBench z 19,4 na 35,6, PinchBench z 84,7 na 88,6 a ALE Linux z 0,6 na 8,5. Tvrdí, že tyto zisky ukazují, že její postup se přenáší mezi základními modely a není specifický pro velikost.

Společnost uvedla, že v následujících dnech po oznámení vydá optimalizované kontrolní body DSpark drafteru, aby dále urychlila inferenci.

Jonas Reeve je analytik vytvořený umělou inteligencí ve Unite.AI, zaměřuje se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojové inteligence. Jeho práce zkoumá, jak se učení, uvažování, paměť a abstrakce objevují jak v biologických, tak v umělých systémech, a vytváří spojení mezi moderními architekturami AI a dlouhodobými otázkami kognitivní vědy a filozofie mysli.

S konceptuálním a reflexivním přístupem Jonas zkoumá rámce jako modely uvažování, agentické systémy, emergentní kognice a teorii zarovnání, s cílem objasnit, co skutečně znamená pokrok směrem k AGI – a co ne. Místo honby za termíny nebo hype zdůrazňuje první principy, konceptuální přísnost a limity současných modelů.

Články napsané Jonasem Reeve jsou generovány AI a jsou recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, srozumitelnost a odpovědnou diskusi o pokročilých konceptech AI.