AI-modeller och plattformar
H Company lanserar Holo4, öppna viktmodeller för datoranvändningsagenter

H company släppte Holo4, sin nya serie av agentiska datoranvändningsmodeller, den 28 september 2026, i 27B täta och 35B-A3B Mixture of Experts‑storlekar, med öppna vikter på Hugging Face och API‑tillgänglighet. Företaget rapporterar att 27B‑modellen får 85,2 % på OSWorld‑benchmarken till $0,08 per uppgift.
Modellsortiment och tillgänglighet
Enligt företaget interagerar Holo4 med programvara via alla tillgängliga gränssnitt: grafiska användargränssnitt, kod, MCP och API:er. Den klickar och skriver på en skärm, skriver och kör sin egen kod, och anropar MCP‑ eller API‑verktyg, och väljer det tillvägagångssätt som passar uppgiften. Samma modell körs på stationära datorer, på webben, på Android, i en kod‑sandbox och mot affärs‑API:er, och anropas på samma sätt i varje fall, utan att behöva välja en annan modell per plattform.
Båda storlekarna finns tillgängliga via H Models API, och vikterna publiceras på Hugging Face i formaten BF16, FP8, NVFP4 och 4‑bit GGUF. Samtidigt med Holo4 släppte företaget även Holotron4 Nano, en uppdaterad version av Holotron 3.
The Holo4-27B modellkort identifierar modellen som en 27B‑parameter vision‑språkmodell byggd på den täta Qwen3.8‑arkitekturen, med en maximal kontextlängd på 262 144 token och målmiljöer som omfattar webb, skrivbord och mobil. Kortet anger att vikterna är tillgängliga under den icke‑kommersiella CC BY‑NC 4.0‑licensen och beskriver användning med företagets hai‑agents harness, som skickar skärmdumpar och verktygsresultat till modellen och utför dess begärda klick, skrivning, kod och verktygsanrop.
Företagets pressmeddelande listar Holo4-35B-A3B under Apache 2.0 till $0,30 per miljon inmatningstoken, $0,03 per miljon cachade token och $2,00 per miljon utmatningstoken, med 262 K kontext. Det listar Holo4-27B som enbart forskning till $0,40 per inmatning, $0,04 per cachad och $3,00 per utmatning per miljon token, också med 262 K kontext.
Rapporterade benchmarkresultat och kostnad per uppgift
Företagets benchmark‑tabell rapporterar Holo4 27B med 85,2 % på OSWorld till en kostnad av $0,08 per uppgift och Holo4 35B‑A3B med 80,8 % till $0,05, jämfört med 84,3 % till $0,22 för Qwen3.8 27B, basmodellen på 27B. Listade frontierscore på OSWorld är 86,0 % för Fable 5, 78,7 % för GPT‑5.5 och 86,1 % för Qwen3.8 Max.
På OSWorld 2.0, som omfattar långa datorarbetsflöden, rapporterar företaget Holo4 27B med en poäng på 61,7 % och en framgångsfrekvens på 41,5 % till $1,22 per uppgift, och Holo4 35B‑A3B med 30,9 % till $0,61. Tabellen listar Opus 5.5 med 81,8 % och $8,48 per uppgift, GPT‑6 Astra med 73,5 % och $9,07, och Qwen3.8 27B med 48,0 % och $3,49. Företaget säger att Holo4 bara hamnar efter de starkaste slutna modellerna på långa arbetsflöden, och att detta sker med en mängd gånger färre parametrar och till mycket lägre kostnad.
På AutomationBench, ett benchmark för affärsautomatisering, är de rapporterade resultaten 45,4 % till $0,05 per uppgift för Holo4 27B och 34,5 % till $0,02 för 35B‑A3B. Företaget noterar att 480 av de 600 uppgifterna i den offentliga v1.0.6‑uppsättningen faller inom den delning som träningsdata samlades från; på de 120 håll‑ut‑uppgifterna rapporterar det 49,3 % för 27B‑modellen och 31,7 % för MoE‑modellen. Det säger att de kommer att rapportera resultat för den privata uppsättningen när Holo4 utvärderas på den officiella privata uppsättningen.
Tabellen rapporterar också poäng på 44,1 % för 27B‑modellen och 30,9 % för MoE på ALE‑CLI, den 105‑uppgifts‑Linux‑delen av Agents’ Last Exam‑benchmark, samt AndroidWorld‑poäng på 85,1 % och 77,6 %. På interna utvärderingsuppgifter från Agentic Task Factory som företaget säger inte har använts i träning, får 27B‑modellen 80,2 % på webbuppgifter, 89,4 % på MCP och 72,0 % på stationär dator.
Företaget uppger att Holo4:s siffror kommer från dess egen harness, som ett medelvärde över två till fyra körningar med en enda körning på OSWorld 2.0 och ALE‑CLI, medan jämförelsesiffror hämtas från modellkort, officiella topplistor och leverantörers diagram över olika harnessar och ansträngningsnivåer. De har gjort all trajectory bakom sina offentliga benchmark‑resultat öppen källkod, återuppspelningsbar via en dedikerad visare och nedladdningsbar som ett Hugging Face‑dataset.
Träningspipeline, Holotron4 Nano och nästa steg
Holo4 tränades genom övervakad finjustering och förstärkningsinlärning på miljöer och uppgifter, inklusive de som genererats av företagets Agentic Task Factory, en intern uppsättning pipelines som bygger interaktiva miljöer och verifierbara uppgifter enbart från dokumentation, såsom skärmbilder av riktiga webbplatser eller öppen källkod. Företaget säger att fabriken hittills har producerat cirka 10 000 uppgifter, ungefär 4 000 av dem för webbappar och omkring 3 000 vardera för MCP‑servrar och stationära miljöer, inklusive hybridmiljöer som visar samma tillstånd via ett GUI och MCP.
Övervakad finjustering använde 127 B token, ungefär tre fjärdedelar av dem framgångsrika agentiska trajektorer fördelade på stationär dator (45 %), webb (14 %), MCP och API (12 %) samt mobil (3 %), med resten som täcker multimodal resonemang, GUI‑grundning och enbart textbaserad verktygsanvändning och kodning. Asynkron online‑förstärkningsinlärning på långhorisontella uppgifter tränade sedan två specialiserade LoRA‑experter, en för stationär dator och webb och en för terminal, MCP och API, vilka sedan slogs samman tillbaka i den finjusterade modellen med lika vikt och utan ytterligare träning.
Företaget byggde också om sin ram, loopen som utför modellens handlingar och hanterar dess kontext över hundratals steg, med hjälp av återkoppling från agentprestanda på OSWorld 2.0. I den processen markerade agenter varför varje uppgift misslyckades och ingenjörer granskade deras korrigeringar; de största förändringarna var ett pålitligt minne som kan hålla reda på hundratals steg och ett skal på själva skrivbordsmaskinen.
Som medlem i NVIDIA Nemotron Coalition använde H company samma efterträningsstack på Nemotron 3 Nano Omni för att producera Holotron4 Nano. Företaget rapporterar absoluta procentenhetsskillnader jämfört med basmodellen på fem benchmarkar: OSWorld från 21.0 till 76.3, OSWorld 2.0 från 0.2 till 7.9, AutomationBench från 19.4 till 35.6, PinchBench från 84.7 till 88.6 och ALE Linux från 0.6 till 8.5. Det säger att förbättringarna visar att deras metod överförs mellan grundmodeller och inte är storleksspecifik.
Företaget sade att de kommer att släppa optimerade DSpark drafter‑kontrollpunkter under dagarna efter tillkännagivandet för att ytterligare påskynda inferens.












