Modelli e piattaforme di IA

H Company rilascia Holo4, modelli Open-Weight per agenti di utilizzo del computer

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

H company ha rilasciato Holo4, la sua nuova serie di modelli agentici per l’uso del computer, il 28 settembre 2026, nelle dimensioni dense da 27B e Mixture of Experts da 35B‑A3B, con pesi open su Hugging Face e disponibilità API. L’azienda riferisce che il modello da 27B ottiene l’85,2% sul benchmark OSWorld a $0,08 per task.

Gamma di modelli e disponibilità

Secondo l’azienda, Holo4 interagisce con il software tramite qualsiasi interfaccia disponibile: interfacce grafiche utente, codice, MCP e API. Fa clic e digita su uno schermo, scrive ed esegue il proprio codice, e chiama strumenti MCP o API, scegliendo l’approccio più adatto al compito. Lo stesso modello funziona su desktop, sul web, su Android, in un sandbox di codice e contro API aziendali, ed è invocato allo stesso modo in ogni caso, senza la necessità di selezionare un modello diverso per piattaforma.

Entrambe le dimensioni sono disponibili sull’API H Models e i pesi sono pubblicati su Hugging Face nei formati BF16, FP8, NVFP4 e GGUF a 4 bit. Insieme a Holo4, l’azienda ha anche rilasciato Holotron4 Nano, una versione aggiornata di Holotron 3.

Il scheda modello Holo4-27B identifica il modello come un modello visione‑linguaggio da 27B parametri basato sull’architettura densa Qwen3.8, con una lunghezza massima del contesto di 262,144 token e ambienti target che coprono web, desktop e mobile. La scheda afferma che i pesi sono disponibili sotto licenza non commerciale CC BY-NC 4.0 e descrive l’uso con l’harness hai-agents dell’azienda, che invia screenshot e risultati degli strumenti al modello ed esegue i click, la digitazione, il codice e le chiamate agli strumenti richieste.

Il newsroom post dell’azienda elenca Holo4-35B-A3B sotto licenza Apache 2.0 a $0,30 per milione di token di input, $0,03 per milione di token memorizzati nella cache e $2,00 per milione di token di output, con contesto di 262 K. Elenca Holo4-27B come solo ricerca a $0,40 per input, $0,04 per cache e $3,00 per output per milione di token, anch’esso con contesto di 262 K.

Benchmark segnalati e costo per task

La tabella dei benchmark dell’azienda riporta Holo4 27B all’85,2% su OSWorld con un costo di $0,08 per task e Holo4 35B-A3B all’80,8% a $0,05, contro l’84,3% a $0,22 per Qwen3.8 27B, la base del modello da 27B. I punteggi di frontiera elencati su OSWorld sono 86,0% per Fable 5, 78,7% per GPT‑5.5 e 86,1% per Qwen3.8 Max.

Su OSWorld 2.0, che copre flussi di lavoro informatici lunghi, l’azienda riporta Holo4 27B con un punteggio del 61,7% e un tasso di successo del 41,5% a $1,22 per task, e Holo4 35B-A3B al 30,9% a $0,61. La tabella elenca Opus 5.5 all’81,8% e $8,48 per task, GPT‑6 Astra al 73,5% e $9,07, e Qwen3.8 27B al 48,0% e $3,49. L’azienda afferma che Holo4 è dietro solo i modelli chiusi più forti nei flussi di lavoro lunghi, e che lo fa con un numero di parametri di ordine di grandezza inferiore e a costi molto più bassi.

Su AutomationBench, un benchmark di automazione aziendale, i punteggi segnalati sono il 45,4% a $0,05 per task per Holo4 27B e il 34,5% a $0,02 per 35B-A3B. L’azienda osserva che 480 dei 600 task del set pubblico v1.0.6 rientrano nella suddivisione da cui ha raccolto i dati di addestramento; sui 120 task tenuti da parte, riporta il 49,3% per il modello da 27B e il 31,7% per il modello MoE. Afferma che pubblicherà i risultati su set privati una volta che Holo4 sarà valutato sul set privato ufficiale.

La tabella riporta anche punteggi del 44,1% per il modello da 27B e del 30,9% per il MoE su ALE-CLI, la suddivisione Linux di 105 task del benchmark Agents’ Last Exam, e punteggi AndroidWorld dell’85,1% e 77,6%. Su task di valutazione interni di Agentic Task Factory che l’azienda afferma non siano stati usati per l’addestramento, il modello da 27B ottiene l’80,2% sui task web, l’89,4% su MCP e il 72,0% su desktop.

L’azienda dichiara che i dati di Holo4 provengono dal proprio harness, come media su due‑quattro esecuzioni con una singola esecuzione su OSWorld 2.0 e ALE‑CLI, mentre i punteggi di confronto provengono da model card, classifiche ufficiali e grafici dei fornitori su harness e livelli di sforzo differenti. Ha rilasciato con codice aperto ogni traiettoria dietro i suoi punteggi di benchmark pubblici, riproducibili tramite un visualizzatore dedicato e scaricabili come dataset su Hugging Face.

Pipeline di addestramento, Holotron4 Nano e prossimo passo

Holo4 è stato addestrato tramite fine‑tuning supervisionato e apprendimento per rinforzo su ambienti e compiti, inclusi quelli generati dalla Agentic Task Factory dell’azienda, un insieme interno di pipeline che crea ambienti interattivi e compiti verificabili a partire solo dalla documentazione, come screenshot di siti web reali o software open‑source. L’azienda afferma che la factory ha prodotto circa 10,000 compiti finora, circa 4,000 per app web e circa 3,000 ciascuno per server MCP e ambienti desktop, inclusi ambienti ibridi che espongono lo stesso stato tramite GUI e MCP.

Il fine‑tuning supervisionato ha impiegato 127 B token, circa tre quarti dei quali in traiettorie agentiche di successo suddivise tra desktop (45 %), web (14 %), MCP e API (12 %) e mobile (3 %), con il resto dedicato a ragionamento multimodale, grounding della GUI e uso di strumenti e codifica solo testuale. L’apprendimento per rinforzo online asincrono su compiti a lungo orizzonte ha poi addestrato due esperti LoRA specializzati, uno per desktop e web e uno per terminale, MCP e API, che sono stati reintegrati nel modello fine‑tuned con peso uguale e senza ulteriore addestramento.

L’azienda ha anche ricostruito il suo harness, il ciclo che esegue le azioni del modello e gestisce il suo contesto per centinaia di passaggi, utilizzando il feedback delle prestazioni agentiche su OSWorld 2.0. In questo processo, gli agenti hanno etichettato il motivo per cui ogni compito è fallito e gli ingegneri hanno esaminato le loro correzioni; le modifiche più importanti sono state una memoria affidabile in grado di tenere traccia di centinaia di passaggi e una shell sulla stessa macchina desktop.

In qualità di membro della NVIDIA Nemotron Coalition, H company ha applicato la stessa catena post‑addestramento a Nemotron 3 Nano Omni per produrre Holotron4 Nano. L’azienda segnala guadagni assoluti in punti percentuali rispetto al modello di base su cinque benchmark: OSWorld da 21,0 a 76,3, OSWorld 2.0 da 0,2 a 7,9, AutomationBench da 19,4 a 35,6, PinchBench da 84,7 a 88,6 e ALE Linux da 0,6 a 8,5. Afferma che questi miglioramenti dimostrano che la sua ricetta si trasferisce tra i modelli di base e non è specifica per le dimensioni.

L’azienda ha dichiarato che rilascerà checkpoint ottimizzati per DSpark drafter nei giorni successivi all’annuncio, per accelerare ulteriormente l’inferenza.

Jonas Reeve è un analista generato dall'IA presso Unite.AI, focalizzato su AI cognitiva, intelligenza artificiale generale (AGI) e le fondamenta teoriche dell'intelligenza delle macchine. Il suo lavoro esplora come apprendimento, ragionamento, memoria e astrazione emergano sia nei sistemi biologici sia in quelli artificiali, tracciando collegamenti tra le moderne architetture AI e le domande di lunga data nella scienza cognitiva e nella filosofia della mente.

Con un approccio concettuale e riflessivo, Jonas esamina quadri teorici come i modelli di ragionamento, i sistemi agentici, la cognizione emergente e la teoria dell'allineamento, mirando a chiarire cosa significhi realmente il progresso verso l'AGI — e cosa non significhi. Piuttosto che inseguire scadenze o hype, egli enfatizza i principi primi, il rigore concettuale e i limiti dei modelli attuali.

Gli articoli scritti da Jonas Reeve sono generati dall'IA e revisionati dal team editoriale di Unite.AI per garantire accuratezza, chiarezza e una discussione responsabile dei concetti avanzati di IA.