Model dan platform AI
H Company Merilis Holo4, Model Open-Weight untuk Agen Penggunaan Komputer

H company merilis Holo4, seri baru model agen penggunaan komputer, pada 28 September 2026, dalam ukuran 27B dense dan 35B-A3B Campuran Pakar, dengan bobot terbuka di Hugging Face dan ketersediaan API. Perusahaan melaporkan model 27B mencetak 85.2% pada benchmark OSWorld dengan biaya $0.08 per tugas.
Deretan Model dan Ketersediaan
Menurut perusahaan, Holo4 berinteraksi dengan perangkat lunak melalui antarmuka apa pun yang tersedia: antarmuka pengguna grafis, kode, MCP, dan API. Ia mengklik dan mengetik pada layar, menulis dan menjalankan kode sendiri, serta memanggil alat MCP atau API, memilih pendekatan yang paling sesuai dengan tugas. Model yang sama berjalan di desktop, di web, di Android, dalam sandbox kode, dan melawan API bisnis, dan dipanggil dengan cara yang sama di setiap kasus, tanpa perlu memilih model yang berbeda per platform.
Kedua ukuran tersedia di H Models API, dan bobot dipublikasikan di Hugging Face dalam format BF16, FP8, NVFP4, dan GGUF 4-bit. Selain Holo4, perusahaan juga merilis Holotron4 Nano, versi terbaru dari Holotron 3.
kartu model Holo4-27B mengidentifikasi model tersebut sebagai model visi‑bahasa dengan 27B parameter model visi‑bahasa yang dibangun di atas arsitektur padat Qwen3.8, dengan panjang konteks maksimum 262.144 token dan lingkungan target meliputi web, desktop, dan seluler. Kartu tersebut menyatakan bahwa bobot tersedia di bawah lisensi non‑komersial CC BY‑NC 4.0 dan menjelaskan penggunaan dengan harness hai‑agents milik perusahaan, yang mengirimkan tangkapan layar dan hasil alat ke model serta mengeksekusi klik, pengetikan, kode, dan panggilan alat yang diminta.
The newsroom post perusahaan mencantumkan Holo4-35B-A3B di bawah lisensi Apache 2.0 dengan $0.30 per juta token input, $0.03 per juta token cache, dan $2.00 per juta token output, dengan konteks 262K. Ia mencantumkan Holo4-27B sebagai hanya untuk riset dengan $0.40 input, $0.04 cache, dan $3.00 output per juta token, juga dengan konteks 262K.
Benchmark yang Dilaporkan dan Biaya per Tugas
Tabel benchmark perusahaan melaporkan Holo4 27B mencapai 85.2% pada OSWorld dengan biaya $0.08 per tugas dan Holo4 35B-A3B mencapai 80.8% dengan $0.05, dibandingkan 84.3% dengan $0.22 untuk Qwen3.8 27B, basis model 27B. Skor frontier yang tercantum pada OSWorld adalah 86.0% untuk Fable 5, 78.7% untuk GPT-5.5, dan 86.1% untuk Qwen3.8 Max.
Pada OSWorld 2.0, yang mencakup alur kerja komputer panjang, perusahaan melaporkan Holo4 27B memperoleh skor 61.7% dan tingkat keberhasilan 41.5% dengan $1.22 per tugas, serta Holo4 35B-A3B memperoleh 30.9% dengan $0.61. Tabel tersebut mencantumkan Opus 5.5 dengan 81.8% dan $8.48 per tugas, GPT-6 Astra dengan 73.5% dan $9.07, serta Qwen3.8 27B dengan 48.0% dan $3.49. Perusahaan menyatakan bahwa Holo4 hanya tertinggal dari model tertutup terkuat pada alur kerja panjang, dan melakukannya dengan jumlah parameter yang jauh lebih sedikit serta biaya yang jauh lebih rendah.
Pada AutomationBench, benchmark otomasi bisnis, skor yang dilaporkan adalah 45.4% dengan $0.05 per tugas untuk Holo4 27B dan 34.5% dengan $0.02 untuk 35B-A3B. Perusahaan mencatat bahwa 480 dari 600 tugas dalam set publik v1.0.6 berada dalam pembagian yang menjadi sumber data pelatihan; pada 120 tugas yang ditahan, ia melaporkan 49.3% untuk model 27B dan 31.7% untuk model MoE. Ia menyatakan akan melaporkan hasil set pribadi setelah Holo4 dievaluasi pada set pribadi resmi.
Tabel tersebut juga melaporkan skor 44.1% untuk model 27B dan 30.9% untuk MoE pada ALE-CLI, split Linux 105 tugas dari benchmark Agents’ Last Exam, serta skor AndroidWorld sebesar 85.1% dan 77.6%. Pada tugas evaluasi internal Agentic Task Factory yang dikatakan perusahaan tidak digunakan dalam pelatihan, model 27B mencetak 80.2% pada tugas web, 89.4% pada MCP, dan 72.0% pada desktop.
Perusahaan menyatakan bahwa angka Holo4 berasal dari harness miliknya sendiri, sebagai rata-rata dari dua hingga empat kali jalankan dengan satu kali jalankan pada OSWorld 2.0 dan ALE-CLI, sementara skor perbandingan berasal dari kartu model, papan peringkat resmi, dan bagan penyedia di berbagai harness dan tingkat usaha. Ia telah membuka sumber semua lintasan di balik skor benchmark publiknya, dapat diputar ulang melalui penampil khusus dan dapat diunduh sebagai dataset Hugging Face.
Pipeline Pelatihan, Holotron4 Nano, dan Langkah Selanjutnya
Holo4 dilatih melalui fine-tuning terawasi dan reinforcement learning pada lingkungan dan tugas termasuk yang dihasilkan oleh Agentic Task Factory perusahaan, sekumpulan pipeline internal yang membangun lingkungan interaktif dan tugas dapat diverifikasi hanya dari dokumentasi, seperti tangkapan layar situs web nyata atau perangkat lunak sumber terbuka. Perusahaan menyatakan bahwa pabrik tersebut telah menghasilkan sekitar 10,000 tugas sejauh ini, kira-kira 4,000 di antaranya untuk aplikasi web dan sekitar 3,000 masing‑masing untuk server MCP dan lingkungan desktop, termasuk lingkungan hibrida yang menampilkan keadaan yang sama melalui GUI dan MCP.
Fine-tuning terawasi menggunakan 127B token, sekitar tiga perempatnya merupakan lintasan agen yang berhasil yang terbagi di antara desktop (45%), web (14%), MCP dan API (12%) serta seluler (3%), dengan sisanya mencakup penalaran multimodal, penambatan GUI, serta penggunaan alat dan pengkodean berbasis teks saja. Reinforcement learning daring asinkron pada tugas jangka panjang kemudian melatih dua pakar LoRA khusus, satu untuk desktop dan web serta satu untuk terminal, MCP, dan API, yang kemudian digabung kembali ke dalam model yang telah di‑fine‑tune dengan bobot yang sama dan tanpa pelatihan lanjutan.
Perusahaan juga membangun kembali harness‑nya, yaitu loop yang mengeksekusi aksi model dan mengelola konteksnya selama ratusan langkah, dengan menggunakan umpan balik dari kinerja agen pada OSWorld 2.0. Dalam proses itu, agen menandai mengapa setiap tugas gagal dan insinyur meninjau perbaikan mereka; perubahan terbesar adalah memori yang dapat diandalkan yang dapat melacak ratusan langkah serta sebuah shell pada mesin desktop itu sendiri.
Sebagai anggota NVIDIA Nemotron Coalition, H company menerapkan tumpukan pasca‑pelatihan yang sama pada Nemotron 3 Nano Omni untuk menghasilkan Holotron4 Nano. Perusahaan melaporkan peningkatan poin persentase absolut dibandingkan model dasar pada lima benchmark: OSWorld dari 21,0 menjadi 76,3, OSWorld 2.0 dari 0,2 menjadi 7,9, AutomationBench dari 19,4 menjadi 35,6, PinchBench dari 84,7 menjadi 88,6, dan ALE Linux dari 0,6 menjadi 8,5. Mereka menyatakan bahwa peningkatan tersebut menunjukkan resep mereka dapat diterapkan pada model fondasi lain dan tidak bergantung pada ukuran.
Perusahaan mengatakan bahwa mereka akan merilis checkpoint drafter DSpark yang dioptimalkan dalam beberapa hari setelah pengumuman untuk lebih mempercepat inferensi.












