Mô hình và nền tảng AI
H Company phát hành Holo4, các mô hình mở trọng lượng cho các tác nhân sử dụng máy tính

Công ty H đã phát hành Holo4, loạt mô hình tác nhân sử dụng máy tính mới của mình, vào ngày 28 tháng 9 năm 2026, với các kích thước 27B dense và 35B-A3B Mixture of Experts, có trọng lượng mở trên Hugging Face và khả năng truy cập API. Công ty báo cáo mô hình 27B đạt 85,2% trên bộ chuẩn OSWorld với chi phí $0.08 mỗi tác vụ.
Danh sách mô hình và khả năng sẵn có
Theo công ty, Holo4 tương tác với phần mềm qua bất kỳ giao diện nào có sẵn: giao diện người dùng đồ họa, mã nguồn, MCP và API. Nó nhấp chuột và gõ phím trên màn hình, viết và chạy mã của riêng mình, và gọi các công cụ MCP hoặc API, lựa chọn cách tiếp cận phù hợp với nhiệm vụ. Cùng một mô hình chạy trên máy tính để bàn, trên web, trên Android, trong môi trường sandbox mã và đối với các API doanh nghiệp, và được gọi theo cùng một cách trong mọi trường hợp, mà không cần chọn mô hình khác cho mỗi nền tảng.
Cả hai kích thước đều có sẵn trên H Models API, và trọng lượng được công bố trên Hugging Face ở các định dạng BF16, FP8, NVFP4 và GGUF 4-bit. Cùng với Holo4, công ty cũng đã phát hành Holotron4 Nano, phiên bản cập nhật của Holotron 3.
The thẻ mô hình Holo4-27B xác định mô hình là một mô hình thị giác-ngôn ngữ 27B tham số được xây dựng trên kiến trúc dày đặc Qwen3.8, với độ dài ngữ cảnh tối đa 262.144 token và các môi trường mục tiêu bao gồm web, máy tính để bàn và di động. Thẻ mô hình cho biết trọng lượng có sẵn dưới giấy phép phi thương mại CC BY-NC 4.0 và mô tả việc sử dụng với bộ khung hai-agents của công ty, bộ khung này gửi ảnh chụp màn hình và kết quả công cụ tới mô hình và thực thi các cú nhấp, gõ phím, mã và lời gọi công cụ mà mô hình yêu cầu.
Công ty bài đăng phòng tin liệt kê Holo4-35B-A3B dưới giấy phép Apache 2.0 với giá $0.30 mỗi triệu token đầu vào, $0.03 mỗi triệu token đã lưu và $2.00 mỗi triệu token đầu ra, với ngữ cảnh 262K. Nó liệt kê Holo4-27B chỉ dành cho nghiên cứu với giá $0.40 đầu vào, $0.04 đã lưu và $3.00 đầu ra mỗi triệu token, cũng với ngữ cảnh 262K.
Các chỉ số chuẩn báo cáo và chi phí mỗi tác vụ
Bảng chuẩn của công ty báo cáo Holo4 27B đạt 85,2% trên OSWorld với chi phí $0.08 mỗi tác vụ và Holo4 35B-A3B đạt 80,8% với $0.05, so với 84,3% với $0.22 cho Qwen3.8 27B, nền tảng của mô hình 27B. Các điểm số tiên tiến được liệt kê trên OSWorld là 86,0% cho Fable 5, 78,7% cho GPT-5.5 và 86,1% cho Qwen3.8 Max.
Trên OSWorld 2.0, bộ chuẩn bao phủ các quy trình làm việc máy tính dài, công ty báo cáo Holo4 27B đạt điểm 61,7% và tỷ lệ thành công 41,5% với $1.22 mỗi tác vụ, và Holo4 35B-A3B đạt 30,9% với $0.61. Bảng liệt kê Opus 5.5 đạt 81,8% và $8.48 mỗi tác vụ, GPT-6 Astra đạt 73,5% và $9.07, và Qwen3.8 27B đạt 48,0% và $3.49. Công ty cho biết Holo4 chỉ kém so với các mô hình đóng mạnh nhất trên các quy trình dài, và điều này đạt được với số lượng tham số ít hơn hàng chục lần và chi phí thấp hơn nhiều.
Trên AutomationBench, một bộ chuẩn tự động hoá doanh nghiệp, các điểm số được báo cáo là 45,4% với $0.05 mỗi tác vụ cho Holo4 27B và 34,5% với $0.02 cho 35B-A3B. Công ty lưu ý rằng 480 trong số 600 tác vụ trong bộ công khai v1.0.6 thuộc vào phần mà họ thu thập dữ liệu huấn luyện; trên 120 tác vụ giữ lại, họ báo cáo 49,3% cho mô hình 27B và 31,7% cho mô hình MoE. Họ cho biết sẽ công bố kết quả bộ dữ liệu riêng khi Holo4 được đánh giá trên bộ dữ liệu riêng chính thức.
Bảng cũng báo cáo điểm số 44,1% cho mô hình 27B và 30,9% cho MoE trên ALE-CLI, phần Linux gồm 105 tác vụ của bộ chuẩn Agents’ Last Exam, và điểm số AndroidWorld là 85,1% và 77,6%. Trên các tác vụ đánh giá nội bộ của Agentic Task Factory mà công ty cho biết không được sử dụng trong quá trình huấn luyện, mô hình 27B đạt 80,2% trên các tác vụ web, 89,4% trên MCP và 72,0% trên máy tính để bàn.
Công ty cho biết các số liệu của Holo4 xuất phát từ bộ khung riêng của mình, tính trung bình trên hai đến bốn lần chạy với một lần chạy duy nhất trên OSWorld 2.0 và ALE-CLI, trong khi các điểm số so sánh đến từ thẻ mô hình, bảng xếp hạng chính thức và biểu đồ của các nhà cung cấp qua các bộ khung và mức độ nỗ lực khác nhau. Công ty đã mở nguồn mọi hành trình phía sau các điểm chuẩn công khai của mình, có thể phát lại qua một trình xem chuyên dụng và tải xuống dưới dạng bộ dữ liệu Hugging Face.
Quy trình đào tạo, Holotron4 Nano và bước tiếp theo
Holo4 được đào tạo thông qua tinh chỉnh có giám sát và học tăng cường trên các môi trường và nhiệm vụ, bao gồm những nhiệm vụ được tạo ra bởi Agentic Task Factory của công ty, một tập hợp các pipeline nội bộ xây dựng môi trường tương tác và các nhiệm vụ có thể xác minh chỉ dựa trên tài liệu, chẳng hạn như ảnh chụp màn hình của các trang web thực hoặc phần mềm mã nguồn mở. Công ty cho biết nhà máy đã tạo ra khoảng 10.000 nhiệm vụ cho đến nay, trong đó khoảng 4.000 cho các ứng dụng web và khoảng 3.000 cho mỗi máy chủ MCP và môi trường máy tính để bàn, bao gồm các môi trường hỗn hợp hiển thị cùng một trạng thái qua GUI và MCP.
Tinh chỉnh có giám sát đã sử dụng 127 tỷ token, khoảng ba phần tư trong số đó là các hành trình tác nhân thành công, được chia đều giữa máy tính để bàn (45%), web (14%), MCP và API (12%) và di động (3%), phần còn lại bao gồm suy luận đa phương tiện, định vị GUI và việc sử dụng công cụ chỉ bằng văn bản và lập trình. Học tăng cường trực tuyến bất đồng bộ trên các nhiệm vụ dài hạn sau đó đã đào tạo hai chuyên gia LoRA chuyên biệt, một cho máy tính để bàn và web và một cho terminal, MCP và API, những chuyên gia này được hợp nhất lại vào mô hình đã tinh chỉnh với trọng số bằng nhau và không có đào tạo thêm.
Công ty cũng đã xây dựng lại bộ khung, vòng lặp thực thi các hành động của mô hình và quản lý ngữ cảnh trong hàng trăm bước, sử dụng phản hồi từ hiệu suất tác nhân trên OSWorld 2.0. Trong quá trình đó, các tác nhân đã gắn thẻ lý do mỗi nhiệm vụ thất bại và các kỹ sư đã xem xét các sửa chữa của họ; những thay đổi lớn nhất là một bộ nhớ đáng tin cậy có thể theo dõi hàng trăm bước và một shell trên máy tính để bàn.
Là thành viên của NVIDIA Nemotron Coalition, công ty H đã áp dụng cùng một bộ công cụ hậu đào tạo cho Nemotron 3 Nano Omni để tạo ra Holotron4 Nano. Công ty báo cáo mức tăng tuyệt đối theo điểm phần trăm so với mô hình gốc trên năm tiêu chuẩn: OSWorld từ 21.0 lên 76.3, OSWorld 2.0 từ 0.2 lên 7.9, AutomationBench từ 19.4 lên 35.6, PinchBench từ 84.7 lên 88.6 và ALE Linux từ 0.6 lên 8.5. Công ty cho biết những cải thiện này cho thấy công thức của họ có thể chuyển giao giữa các mô hình nền tảng và không phụ thuộc vào kích thước.
Công ty cho biết sẽ phát hành các checkpoint drafter DSpark được tối ưu hóa trong những ngày sau thông báo để tăng tốc độ suy luận hơn nữa.












