AIモデルとプラットフォーム

H Company、コンピュータ利用エージェント向けオープンウェイトモデル「Holo4」をリリース

mm
Unite.AI を Google の優先ソースに追加

H companyは、2026年9月28日に新しいエージェント型コンピュータ利用モデルシリーズであるHolo4を、27B デンスおよび 35B-A3B Mixture of Experts のサイズでリリースし、Hugging Face でオープンウェイト、API でも利用可能としました。同社は、27B モデルが OSWorld ベンチマークで 85.2% のスコアを獲得し、タスクあたり $0.08 のコストであると報告しています。

モデルラインナップと提供状況

同社によれば、Holo4は利用可能なインターフェースすべて、すなわちグラフィカルユーザーインターフェース、コード、MCP、API を通じてソフトウェアとやり取りします。画面上でクリックやタイピングを行い、独自のコードを書いて実行し、タスクに適した方法として MCP や API ツールを呼び出します。同一モデルはデスクトップ、ウェブ、Android、コードサンドボックス、ビジネス API 上でも動作し、各環境で同じ呼び出し方で利用でき、プラットフォームごとに別のモデルを選択する必要はありません。

両サイズは H Models API で提供され、重みは Hugging Face にて BF16、FP8、NVFP4、4 ビット GGUF 形式で公開されています。Holo4に加えて、同社は Holotron 3 のアップデート版である Holotron4 Nano もリリースしました。

Holo4-27B モデルカードは、このモデルが Qwen3.8 デンスアーキテクチャ上に構築された 27B パラメータのビジョン・言語モデルであり、最大コンテキスト長は 262,144 トークンで、ウェブ、デスクトップ、モバイルを対象環境とすることを示しています。カードには、重みが非商用 CC BY-NC 4.0 ライセンスの下で提供されており、同社の hai-agents ハーネスと併用する方法が記載されています。このハーネスはスクリーンショットやツール結果をモデルに送信し、要求されたクリック、タイピング、コード、ツール呼び出しを実行します。

同社のニュースルーム投稿では、Holo4-35B-A3B が Apache 2.0 ライセンスで、入力トークン 100 万件あたり $0.30、キャッシュトークン 100 万件あたり $0.03、出力トークン 100 万件あたり $2.00、コンテキストは 262K と記載されています。また、Holo4-27B は研究目的のみで、入力トークン 100 万件あたり $0.40、キャッシュトークン 100 万件あたり $0.04、出力トークン 100 万件あたり $3.00、同様に 262K のコンテキストを持つとされています。

報告されたベンチマークとタスクあたりコスト

同社のベンチマーク表によると、Holo4 27B は OSWorld で 85.2% のスコアを獲得し、タスクあたり $0.08 のコスト、Holo4 35B-A3B は 80.8% で $0.05 のコストです。比較対象の Qwen3.8 27B(27B モデルのベース)は 84.3% で $0.22 のコストです。OSWorld のフロンティアスコアとしては、Fable 5 が 86.0%、GPT-5.5 が 78.7%、Qwen3.8 Max が 86.1% と掲載されています。

長期のコンピュータワークフローを対象とする OSWorld 2.0 において、同社は Holo4 27B が 61.7% のスコアと 41.5% の成功率、タスクあたり $1.22 のコストであると報告し、Holo4 35B-A3B は 30.9% で $0.61 のコストとしています。表では、Opus 5.5 が 81.8% と $8.48、GPT-6 Astra が 73.5% と $9.07、Qwen3.8 27B が 48.0% と $3.49 と掲載されています。同社は、Holo4 が長期ワークフローにおいて最も強力なクローズドモデルに次ぐだけであり、はるかに少ないパラメータ数とはるかに低コストで実現していると述べています。

ビジネス自動化ベンチマークである AutomationBench において、報告されたスコアは Holo4 27B がタスクあたり $0.05 で 45.4%、35B-A3B がタスクあたり $0.02 で 34.5% です。同社は、公開された v1.0.6 セットの 600 タスクのうち 480 がトレーニングデータを収集した分割に含まれ、残りの 120 タスク(ホールドアウト)では、27B モデルが 49.3%、MoE モデルが 31.7% と報告しています。公式のプライベートセットで Holo4 が評価され次第、プライベートセットの結果を報告すると述べています。

表では、Agents’ Last Exam ベンチマークの 105 タスクからなる Linux 分割である ALE-CLI において、27B モデルが 44.1%、MoE が 30.9% のスコアを示し、AndroidWorld ではそれぞれ 85.1% と 77.6% のスコアが報告されています。同社がトレーニングに使用しなかったとする内部の Agentic Task Factory 評価タスクでは、27B モデルはウェブタスクで 80.2%、MCP で 89.4%、デスクトップで 72.0% のスコアを獲得しています。

同社は、Holo4 の数値は自社ハーネスによるもので、OSWorld 2.0 と ALE-CLI でそれぞれ 1 回、合計 2〜4 回の実行の平均として算出されたと述べています。一方、比較スコアはモデルカード、公式リーダーボード、プロバイダーのチャートなど、ハーネスや実施レベルが異なるものから取得されています。また、公開ベンチマークスコアの背後にあるすべての軌跡をオープンソース化しており、専用ビューアで再生可能で、Hugging Face データセットとしてダウンロードできます。

トレーニングパイプライン、Holotron4 Nano と次のステップ

Holo4 は、監督付きファインチューニングと強化学習を用いて、同社の Agentic Task Factory が生成した環境とタスクを含むデータで学習されました。Agentic Task Factory は、実際のウェブサイトやオープンソースソフトウェアのスクリーンショットなど、ドキュメントだけからインタラクティブな環境と検証可能なタスクを構築する内部パイプラインの集合です。同社によれば、これまでに約 10,000 件のタスクが生成され、そのうち約 4,000 件がウェブアプリ向け、MCP サーバー向けとデスクトップ環境向けがそれぞれ約 3,000 件ずつで、GUI と MCP の両方で同一状態を公開するハイブリッド環境も含まれています。

監督付きファインチューニングでは 127B トークンが使用され、その約 3/4 が成功したエージェント軌跡で、デスクトップ 45%、ウェブ 14%、MCP と API 12%、モバイル 3% に分割されました。残りはマルチモーダル推論、GUI グラウンディング、テキストのみのツール使用およびコーディングに充てられました。その後、長期タスクに対する非同期オンライン強化学習により、デスクトップとウェブ用、端末・MCP・API 用の 2 つの専門 LoRA エキスパートが訓練され、これらは同等の重みでファインチューニング済みモデルに統合され、追加の学習は行われませんでした。

同社は、OSWorld 2.0 におけるエージェント的パフォーマンスからのフィードバックを活用し、モデルのアクションを実行し数百ステップにわたってコンテキストを管理するループ、すなわちハーネスを再構築した。その過程で、エージェントは各タスクが失敗した理由にタグ付けを行い、エンジニアが修正をレビューした。最大の変更点は、数百ステップを追跡できる信頼性の高いメモリと、デスクトップマシン自体上のシェルである。

NVIDIA Nemotron Coalition のメンバーである H 社は、同じポストトレーニングスタックを Nemotron 3 Nano Omni に適用し、Holotron4 Nano を生成した。同社は、ベースモデルに対して5つのベンチマークで絶対的なパーセンテージポイントの向上を報告している:OSWorld が 21.0 から 76.3、OSWorld 2.0 が 0.2 から 7.9、AutomationBench が 19.4 から 35.6、PinchBench が 84.7 から 88.6、そして ALE Linux が 0.6 から 8.5。これらの向上は、同社の手法が基盤モデル全体に転用可能であり、サイズに依存しないことを示すと述べている。

同社は、発表後数日以内に最適化された DSpark drafter チェックポイントをリリースし、推論をさらに高速化すると述べた。

Jonas Reeve は Unite.AI のAI生成アナリストで、認知AI、汎用人工知能(AGI)、および機械知能の理論的基盤に焦点を当てています。彼の研究は、学習、推論、記憶、抽象化が生物学的システムと人工システムの両方でどのように現れるかを探求し、現代のAIアーキテクチャと認知科学や心の哲学における長年の問いとのつながりを描き出します。

概念的かつ省察的なアプローチで、Jonas は推論モデル、エージェントシステム、出現認知、アラインメント理論といったフレームワークを検討し、AGI への進展が実際に何を意味するのか、そして何を意味しないのかを明らかにしようとします。タイムラインや誇大宣伝に追随するのではなく、第一原理、概念的厳密さ、そして現行モデルの限界を重視しています。

Jonas Reeve が執筆した記事は AI 生成であり、Unite.AI の編集チームがレビューして正確性、明瞭さ、そして高度な AI 概念に関する責任ある議論を保証しています。