Modele i platformy AI

H Company wprowadza Holo4, modele open-weight dla agentów komputerowych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Firma H wypuściła Holo4, swoją nową serię modeli agentowych do użycia komputera, 28 września 2026 r., w rozmiarach 27B dense i 35B-A3B Mixture of Experts, z otwartymi wagami na Hugging Face oraz dostępnością API. Firma podaje, że model 27B uzyskał wynik 85,2 % w benchmarku OSWorld przy koszcie 0,08 $ za zadanie.

Oferta modeli i dostępność

Według firmy, Holo4 współdziała z oprogramowaniem za pośrednictwem dowolnego dostępnego interfejsu: graficznych interfejsów użytkownika, kodu, MCP i API. Kliknie i wpisuje na ekranie, pisze i uruchamia własny kod oraz wywołuje narzędzia MCP lub API, wybierając podejście najbardziej pasujące do zadania. Ten sam model działa na komputerach stacjonarnych, w sieci, na Androidzie, w piaskownicy kodu oraz w interakcji z biznesowymi API i jest wywoływany w ten sam sposób w każdym przypadku, bez konieczności wyboru innego modelu dla poszczególnych platform.

Oba rozmiary są dostępne w API H Models, a wagi opublikowano na Hugging Face w formatach BF16, FP8, NVFP4 oraz 4‑bitowym GGUF. Wraz z Holo4 firma wydała także Holotron4 Nano, zaktualizowaną wersję Holotron 3.

Karta karta modelu Holo4-27B identyfikuje model jako 27‑parametrowy model wizji i języka zbudowany na gęstej architekturze Qwen3.8, z maksymalną długością kontekstu 262 144 tokenów i docelowymi środowiskami obejmującymi sieć, komputer stacjonarny i urządzenia mobilne. Karta stwierdza, że wagi są dostępne na licencji niekomercyjnej CC BY‑NC 4.0 i opisuje użycie z harnessem firmy hai‑agents, który przesyła zrzuty ekranu i wyniki narzędzi do modelu oraz wykonuje żądane kliknięcia, wpisywanie, kod i wywołania narzędzi.

Komunikat komunikat w newsroom firmy wymienia Holo4-35B-A3B na licencji Apache 2.0 w cenie 0,30 $ za milion tokenów wejściowych, 0,03 $ za milion tokenów buforowanych oraz 2,00 $ za milion tokenów wyjściowych, przy kontekście 262 K. Wymienia także Holo4-27B jako wyłącznie badawczy w cenie 0,40 $ za wejście, 0,04 $ za bufor i 3,00 $ za wyjście za milion tokenów, również przy kontekście 262 K.

Zgłoszone benchmarki i koszt za zadanie

Tabela benchmarków firmy podaje, że Holo4 27B osiąga 85,2 % w OSWorld przy koszcie 0,08 $ za zadanie, a Holo4 35B-A3B – 80,8 % przy 0,05 $, w porównaniu do 84,3 % przy 0,22 $ dla Qwen3.8 27B, bazowego modelu 27B. Wymienione wyniki graniczne w OSWorld to 86,0 % dla Fable 5, 78,7 % dla GPT‑5.5 oraz 86,1 % dla Qwen3.8 Max.

W OSWorld 2.0, obejmującym długie przepływy pracy komputerowej, firma podaje, że Holo4 27B uzyskał wynik 61,7 % i wskaźnik sukcesu 41,5 % przy koszcie 1,22 $ za zadanie, a Holo4 35B-A3B – 30,9 % przy 0,61 $. Tabela wymienia Opus 5.5 z wynikiem 81,8 % i kosztem 8,48 $ za zadanie, GPT‑6 Astra z 73,5 % i 9,07 $, oraz Qwen3.8 27B z 48,0 % i 3,49 $. Firma twierdzi, że Holo4 ustępuje jedynie najsilniejszym zamkniętym modelom w długich przepływach, i robi to przy o wiele mniejszej liczbie parametrów oraz znacznie niższym koszcie.

W benchmarku AutomationBench, oceniającym automatyzację biznesową, podane wyniki to 45,4 % przy 0,05 $ za zadanie dla Holo4 27B oraz 34,5 % przy 0,02 $ dla 35B-A3B. Firma zauważa, że 480 z 600 zadań w publicznym zestawie v1.0.6 mieści się w podziale, z którego zbierano dane treningowe; wśród 120 odrzuconych zadań podaje 49,3 % dla modelu 27B i 31,7 % dla modelu MoE. Informuje, że opublikuje wyniki prywatnego zestawu po ocenie Holo4 w oficjalnym prywatnym zestawie.

Tabela podaje również wyniki 44,1 % dla modelu 27B i 30,9 % dla MoE w ALE‑CLI, 105‑zadaniowym podziale Linux benchmarku Agents’ Last Exam, oraz wyniki AndroidWorld wynoszące 85,1 % i 77,6 %. W wewnętrznych zadaniach oceny Agentic Task Factory, które firma twierdzi, że nie były użyte w treningu, model 27B uzyskuje 80,2 % w zadaniach sieciowych, 89,4 % w MCP i 72,0 % w środowisku desktop.

Firma podaje, że dane Holo4 pochodzą z własnego harnessu, jako średnia z dwóch do czterech uruchomień przy pojedynczym uruchomieniu w OSWorld 2.0 i ALE‑CLI, natomiast wyniki porównawcze pochodzą z kart modeli, oficjalnych rankingów i wykresów dostawców, przy różnych harnessach i poziomach nakładu pracy. Udostępniła kod źródłowy wszystkich trajektorii stojących za publicznymi wynikami benchmarków, które można odtworzyć w dedykowanym przeglądarce i pobrać jako zbiór danych Hugging Face.

Pipeline treningowy, Holotron4 Nano i kolejny krok

Holo4 został wytrenowany przy użyciu nadzorowanego dopasowywania (fine‑tuning) oraz uczenia ze wzmocnieniem w środowiskach i zadaniach, w tym tych generowanych przez Agentic Task Factory firmy, wewnętrzny zestaw pipeline’ów budujących interaktywne środowiska i weryfikowalne zadania wyłącznie na podstawie dokumentacji, takich jak zrzuty ekranu rzeczywistych stron internetowych lub oprogramowania open‑source. Firma podaje, że fabryka wyprodukowała dotychczas około 10 000 zadań, z czego około 4 000 dotyczy aplikacji webowych oraz po około 3 000 dla serwerów MCP i środowisk desktopowych, w tym środowiska hybrydowe, które udostępniają ten sam stan zarówno przez GUI, jak i MCP.

Nadzorowane dopasowywanie wykorzystało 127 miliardów tokenów, z czego około trzy czwarte stanowiły udane trajektorie agentowe podzielone pomiędzy komputer stacjonarny (45 %), sieć (14 %), MCP i API (12 %) oraz urządzenia mobilne (3 %), a pozostała część obejmowała rozumowanie multimodalne, osadzanie GUI oraz użycie narzędzi i kodowanie wyłącznie tekstowe. Asynchroniczne uczenie ze wzmocnieniem online na zadaniach o długim horyzoncie wytrenowało następnie dwóch wyspecjalizowanych ekspertów LoRA, jednego dla komputera stacjonarnego i sieci oraz drugiego dla terminala, MCP i API, które połączono z powrotem z modelem po dopasowaniu, nadając im równą wagę i nie przeprowadzając dalszego treningu.

Firma również przebudowała swój szkielet, pętlę wykonującą akcje modelu i zarządzającą jego kontekstem przez setki kroków, wykorzystując informacje zwrotne z wydajności agentowej w OSWorld 2.0. W tym procesie agenci oznaczali, dlaczego każde zadanie się nie powiodło, a inżynierowie przeglądali ich poprawki; największymi zmianami były niezawodna pamięć, która może śledzić setki kroków, oraz powłoka na samym komputerze stacjonarnym.

Jako członek koalicji NVIDIA Nemotron, firma H zastosowała ten sam stos po‑treningowy do modelu Nemotron 3 Nano Omni, aby stworzyć Holotron4 Nano. Firma podaje, że uzyskała absolutne przyrosty punktów procentowych w stosunku do modelu bazowego w pięciu benchmarkach: OSWorld z 21,0 do 76,3, OSWorld 2.0 z 0,2 do 7,9, AutomationBench z 19,4 do 35,6, PinchBench z 84,7 do 88,6 oraz ALE Linux z 0,6 do 8,5. Twierdzi, że te przyrosty pokazują, iż jej metoda przenosi się na różne modele bazowe i nie jest zależna od rozmiaru.

Firma poinformowała, że w ciągu kilku dni po ogłoszeniu udostępni zoptymalizowane punkty kontrolne DSpark drafter, aby jeszcze bardziej przyspieszyć wnioskowanie.

Jonas Reeve jest analitykiem generowanym przez SI w Unite.AI, koncentrującym się na kognitywnej SI, sztucznej ogólnej inteligencji (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja wyłaniają się zarówno w systemach biologicznych, jak i sztucznych, tworząc powiązania między współczesnymi architekturami SI a długoletnimi pytaniami w naukach kognitywnych i filozofii umysłu.

Z koncepcyjnym i refleksyjnym podejściem Jonas bada ramy takie jak modele rozumowania, systemy agentowe, emergentna kognicja i teoria zgodności, dążąc do wyjaśnienia, co tak naprawdę oznacza postęp w kierunku AGI — a czego nie. Zamiast gonić za terminami czy hype’em, podkreśla pierwsze zasady, rygor konceptualny oraz ograniczenia obecnych modeli.

Artykuły autorstwa Jonasa Reeve są generowane przez SI i recenzowane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, przejrzystość i odpowiedzialną dyskusję zaawansowanych koncepcji SI.