AI 模型与平台
H Company 发布 Holo4,面向计算机使用代理的开放权重模型

H company 于 2026年9月28日发布了 Holo4,其新系列的代理计算机使用模型,提供 27B 密集版和 35B-A3B 专家混合版,权重已在 Hugging Face 开放并提供 API。公司报告称,27B 模型在 OSWorld 基准上得分 85.2%,每任务成本为 $0.08。
模型系列及可用性
据公司称,Holo4 可通过任何可用接口与软件交互:图形用户界面、代码、MCP 和 API。它在屏幕上点击和输入,编写并运行自己的代码,并调用 MCP 或 API 工具,选择最适合任务的方法。同一模型可在桌面、网页、Android、代码沙盒以及业务 API 上运行,调用方式保持一致,无需为不同平台选择不同模型。
两种规模均可通过 H Models API 使用,权重已在 Hugging Face 以 BF16、FP8、NVFP4 和 4 位 GGUF 格式发布。除了 Holo4, 公司还发布了 Holotron4 Nano,这是 Holotron 3 的升级版。
The Holo4-27B 模型卡 将模型标识为 27B 参数的 视觉语言模型,基于 Qwen3.8 密集架构,最大上下文长度为 262,144 token,目标环境覆盖网页、桌面和移动。模型卡声明权重在非商业 CC BY-NC 4.0 许可证下提供,并描述了与公司 hai-agents harness 的使用方式,该 harness 将截图和工具结果发送给模型,并执行其请求的点击、输入、代码和工具调用。
公司在 新闻稿 中列出 Holo4-35B-A3B 使用 Apache 2.0 许可证,费用为每百万输入 token $0.30、每百万缓存 token $0.03、每百万输出 token $2.00,上下文为 262K。它将 Holo4-27B 标为仅限研究使用,费用为每百万输入 token $0.40、每百万缓存 token $0.04、每百万输出 token $3.00,同样为 262K 上下文。
报告的基准成绩与每任务成本
公司在基准表中报告,Holo4 27B 在 OSWorld 上得分 85.2%,每任务成本 $0.08;Holo4 35B-A3B 得分 80.8%,每任务成本 $0.05;相比之下,Qwen3.8 27B(27B 模型的基线)得分 84.3%,每任务成本 $0.22。OSWorld 上列出的前沿得分为:Fable 5 为 86.0%,GPT-5.5 为 78.7%,Qwen3.8 Max 为 86.1%。
在覆盖长计算工作流的 OSWorld 2.0 上,公司报告 Holo4 27B 得分 61.7%,成功率 41.5%,每任务成本 $1.22;Holo4 35B-A3B 得分 30.9%,每任务成本 $0.61。表格列出 Opus 5.5 得分 81.8%,每任务 $8.48,GPT-6 Astra 得分 73.5%,每任务 $9.07,Qwen3.8 27B 得分 48.0%,每任务 $3.49。公司称 Holo4 在长工作流上仅落后于最强的闭源模型,且参数量少了数量级,成本也低得多。
在业务自动化基准 AutomationBench 上,报告的得分为 Holo4 27B 每任务 $0.05 时为 45.4%,35B-A3B 每任务 $0.02 时为 34.5%。公司指出,公共 v1.0.6 集合中的 600 项任务中有 480 项属于其收集训练数据的划分;在 120 项保留任务上,27B 模型得分 49.3%,MoE 模型得分 31.7%。公司表示,一旦 Holo4 在官方私有集合上评估完毕,将公布私有集合的结果。
表格还报告了 ALE-CLI(Agents’ Last Exam 基准的 105 任务 Linux 划分)上,27B 模型得分 44.1%,MoE 得分 30.9%;以及 AndroidWorld 上的得分分别为 85.1% 和 77.6%。在公司称未用于训练的内部 Agentic Task Factory 评估任务中,27B 模型在网页任务上得分 80.2%,在 MCP 上得分 89.4%,在桌面上得分 72.0%。
公司表示,Holo4 的数据来自其自有 harness,取两到四次运行的平均值,在 OSWorld 2.0 和 ALE-CLI 上仅进行一次运行;而对比得分则来源于模型卡、官方排行榜以及不同 harness 和工作量下的供应商图表。公司已开源了所有公开基准得分背后的轨迹,可通过专用查看器回放,并可作为 Hugging Face 数据集下载。
训练流水线、Holotron4 Nano 与下一步
Holo4 通过监督微调和强化学习在包括公司 Agentic Task Factory 生成的环境和任务上进行训练。Agentic Task Factory 是内部的一套流水线,仅凭文档即可构建交互式环境和可验证任务,例如真实网站或开源软件的截图。公司称该工厂迄今已生成约 10,000 项任务,其中约 4,000 项用于网页应用,约 3,000 项用于 MCP 服务器,另约 3,000 项用于桌面环境,包括通过 GUI 和 MCP 暴露相同状态的混合环境。
监督微调使用了 127B token,其中约四分之三是成功的代理轨迹,分别分布在桌面(45%)、网页(14%)、MCP 与 API(12%)以及移动端(3%),其余部分涵盖多模态推理、GUI 定位以及仅文本的工具使用和编码。随后,对长时程任务进行异步在线强化学习,训练出两个专用 LoRA 专家:一个用于桌面和网页,另一个用于终端、MCP 与 API,这两者以相等权重合并回微调模型,且未再进行进一步训练。
该公司还重建了其框架,即在数百步中执行模型动作并管理其上下文的循环,使用了来自 OSWorld 2.0 上代理性能的反馈。在此过程中,代理标记了每个任务失败的原因,工程师审查了他们的修复;最大的改动是一个可靠的记忆体,能够跟踪数百步,以及桌面机器本身的一个外壳。
作为 NVIDIA Nemotron 联盟的成员,H company 将相同的后训练堆栈应用于 Nemotron 3 Nano Omni,以生成 Holotron4 Nano。公司报告称,在五项基准测试上相对于基线模型实现了绝对百分点提升:OSWorld 从 21.0 提升至 76.3,OSWorld 2.0 从 0.2 提升至 7.9,AutomationBench 从 19.4 提升至 35.6,PinchBench 从 84.7 提升至 88.6,ALE Linux 从 0.6 提升至 8.5。公司表示,这些提升表明其方法可跨基础模型迁移,并非受模型规模限制。
公司表示,将在公告后的几天内发布优化的 DSpark 起草器检查点,以进一步加速推理。












