Modele și platforme AI

H Company lansează Holo4, modele cu greutate deschisă pentru agenți de utilizare a calculatorului

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Compania H a lansat Holo4, noua sa serie de modele agentice pentru utilizarea calculatorului, pe 28 septembrie 2026, în dimensiunile dense de 27B și Mixture of Experts de 35B-A3B, cu greutăți deschise pe Hugging Face și disponibilitate prin API. Compania raportează că modelul de 27B obține 85,2% la benchmark-ul OSWorld, la un cost de 0,08 $ pe sarcină.

Gama de modele și disponibilitate

Potrivit companiei, Holo4 interacționează cu software-ul prin orice interfață disponibilă: interfețe grafice cu utilizatorul, cod, MCP și API-uri. Face clic și tastează pe ecran, scrie și rulează propriul cod și apelează instrumente MCP sau API, alegând abordarea care se potrivește sarcinii. Același model rulează pe desktopuri, pe web, pe Android, într-un sandbox de cod și împotriva API-urilor de afaceri, fiind invocat în același mod în fiecare caz, fără a fi nevoie să se selecteze un model diferit pentru fiecare platformă.

Ambele dimensiuni sunt disponibile prin API-ul H Models, iar greutățile sunt publicate pe Hugging Face în formatele BF16, FP8, NVFP4 și GGUF pe 4 biți. Alături de Holo4, compania a lansat și Holotron4 Nano, o versiune actualizată a Holotron 3.

Cardul card de model Holo4-27B identifică modelul ca un model de 27B‑parametri model de limbaj vizual construit pe arhitectura densă Qwen3.8, cu o lungime maximă de context de 262.144 de tokeni și medii țintă care acoperă web, desktop și mobil. Cardul precizează că greutățile sunt disponibile sub licența non‑comercială CC BY‑NC 4.0 și descrie utilizarea cu ansamblul hai‑agents al companiei, care trimite capturi de ecran și rezultate ale instrumentelor către model și execută clicurile, tastările, codul și apelurile de instrumente solicitate.

Postarea postare de presă a companiei enumeră Holo4-35B-A3B sub licența Apache 2.0 la 0,30 $ pe milion de tokeni de intrare, 0,03 $ pe milion de tokeni cache și 2,00 $ pe milion de tokeni de ieșire, cu un context de 262 K. De asemenea, enumeră Holo4-27B ca fiind doar pentru cercetare, la 0,40 $ de intrare, 0,04 $ cache și 3,00 $ de ieșire pe milion de tokeni, tot cu 262 K context.

Benchmarkuri raportate și cost pe sarcină

Tabelul de benchmark al companiei raportează Holo4 27B cu 85,2 % la OSWorld și un cost de 0,08 $ pe sarcină, iar Holo4 35B-A3B cu 80,8 % la 0,05 $, comparativ cu 84,3 % la 0,22 $ pentru Qwen3.8 27B, baza modelului de 27 B. Scorurile de frontieră enumerate la OSWorld sunt 86,0 % pentru Fable 5, 78,7 % pentru GPT‑5.5 și 86,1 % pentru Qwen3.8 Max.

Pe OSWorld 2.0, care acoperă fluxuri de lucru lungi pe calculator, compania raportează că Holo4 27B are un scor de 61,7 % și o rată de succes de 41,5 % la 1,22 $ pe sarcină, iar Holo4 35B-A3B are 30,9 % la 0,61 $. Tabelul enumeră Opus 5.5 cu 81,8 % și 8,48 $ pe sarcină, GPT‑6 Astra cu 73,5 % și 9,07 $, și Qwen3.8 27B cu 48,0 % și 3,49 $. Compania afirmă că Holo4 rămâne în urma doar a celor mai puternice modele închise pe fluxuri de lucru lungi și că face acest lucru cu un număr de parametri cu ordine de mărime mai mic și la un cost mult mai redus.

Pe AutomationBench, un benchmark de automatizare a afacerilor, scorurile raportate sunt 45,4 % la 0,05 $ pe sarcină pentru Holo4 27B și 34,5 % la 0,02 $ pentru 35B-A3B. Compania observă că 480 din cele 600 de sarcini din setul public v1.0.6 se încadrează în segmentul din care a colectat datele de antrenament; pe cele 120 de sarcini reținute, raportează 49,3 % pentru modelul de 27 B și 31,7 % pentru modelul MoE. Declară că va publica rezultatele pe setul privat odată ce Holo4 va fi evaluat pe setul privat oficial.

Tabelul raportează, de asemenea, scoruri de 44,1 % pentru modelul de 27 B și 30,9 % pentru MoE la ALE‑CLI, segmentul Linux de 105 sarcini din benchmark-ul Agents’ Last Exam, și scoruri AndroidWorld de 85,1 % și 77,6 %. Pe sarcinile de evaluare interne ale Agentic Task Factory, pe care compania afirmă că nu au fost folosite în antrenament, modelul de 27 B obține 80,2 % la sarcinile web, 89,4 % la MCP și 72,0 % la desktop.

Compania afirmă că cifrele Holo4 provin din propriul său harness, ca medie peste două până la patru rulări cu o singură rulare pe OSWorld 2.0 și ALE‑CLI, în timp ce scorurile de comparație provin din carduri de model, clasamente oficiale și grafice ale furnizorilor, pe diferite harness‑uri și niveluri de efort. A open‑sourcat fiecare traiectorie din spatele scorurilor sale publice de benchmark, reproductibilă printr-un vizualizator dedicat și descărcabilă ca set de date Hugging Face.

Fluxul de antrenament, Holotron4 Nano și pasul următor

Holo4 a fost antrenat prin fine‑tuning supravegheat și învățare prin recompensă pe medii și sarcini, inclusiv cele generate de Agentic Task Factory a companiei, un set intern de pipeline‑uri care construiește medii interactive și sarcini verificabile doar din documentație, cum ar fi capturi de ecran ale site‑urilor reale sau software‑ului open‑source. Compania afirmă că fabrica a produs aproximativ 10 000 de sarcini până acum, dintre care circa 4 000 pentru aplicații web și aproximativ 3 000 pentru servere MCP și medii desktop, inclusiv medii hibride care expun aceeași stare printr‑o interfață grafică și MCP.

Fine‑tuningul supravegheat a folosit 127 B de tokeni, aproximativ trei sferturi dintre ei fiind traiectorii agentice de succes, distribuite pe desktop (45 %), web (14 %), MCP și API (12 %) și mobil (3 %), restul acoperind raționament multimodal, ancorarea GUI și utilizarea exclusivă de instrumente textuale și programare. Învățarea prin recompensă asincronă online pe sarcini pe termen lung a antrenat apoi două experte LoRA specializați, unul pentru desktop și web și unul pentru terminal, MCP și API, care au fost reintegrate în modelul fine‑tuned cu greutate egală și fără antrenament suplimentar.

Compania a reconstruit, de asemenea, ansamblul său, bucla care execută acțiunile modelului și gestionează contextul său pe parcursul a sute de pași, utilizând feedback-ul din performanța agenților pe OSWorld 2.0. În acest proces, agenții au etichetat motivele pentru care fiecare sarcină a eșuat și inginerii au revizuit corecțiile lor; cele mai mari modificări au fost o memorie fiabilă care poate ține evidența a sute de pași și un shell pe mașina desktop în sine.

În calitate de membru al NVIDIA Nemotron Coalition, compania H a aplicat același set de instrumente post-antrenament pe Nemotron 3 Nano Omni pentru a produce Holotron4 Nano. Compania raportează creșteri absolute în puncte procentuale față de modelul de bază pe cinci benchmark-uri: OSWorld de la 21.0 la 76.3, OSWorld 2.0 de la 0.2 la 7.9, AutomationBench de la 19.4 la 35.6, PinchBench de la 84.7 la 88.6 și ALE Linux de la 0.6 la 8.5. Declară că aceste îmbunătățiri arată că rețeta sa se transferă între modele de bază și nu depinde de dimensiune.

Compania a declarat că va publica puncte de control optimizate DSpark drafter în zilele următoare anunțului pentru a accelera și mai mult inferența.

Jonas Reeve este un analist generat de AI la Unite.AI, concentrându‑se pe inteligența cognitivă AI, inteligența artificială generală (AGI) și fundamentele teoretice ale inteligenței mașinilor. Munca sa explorează modul în care învățarea, raționamentul, memoria și abstractizarea apar atât în sistemele biologice, cât și în cele artificiale, stabilind legături între arhitecturile moderne de AI și întrebările de lungă durată din știința cognitivă și filosofia minții.

Printr‑o abordare conceptuală și reflexivă, Jonas examinează cadre precum modele de raționament, sisteme agențiale, cogniție emergentă și teoria aliniamentului, vizând să clarifice ce înseamnă cu adevărat progresul către AGI — și ce nu înseamnă. În loc să urmărească termene limită sau hype‑ul, el pune accent pe principii de bază, rigurozitate conceptuală și limitele modelelor actuale.

Articolele scrise de Jonas Reeve sunt generate de AI și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea, claritatea și discuția responsabilă a conceptelor avansate de AI.