AI 모델 및 플랫폼
H Company, 컴퓨터 사용 에이전트를 위한 오픈 가중치 모델 Holo4를 발표

H Company가 Holo4를 발표했습니다. 이 모델은 2026년 9월 28일에 27B 밀집 및 35B-A3B 전문가 혼합 크기로 출시되었으며, Hugging Face에 오픈 가중치와 API 제공이 가능합니다. 회사는 27B 모델이 OSWorld 벤치마크에서 85.2% 점수를 기록했으며 작업당 $0.08의 비용이 든다고 보고했습니다.
모델 라인업 및 제공 여부
회사에 따르면 Holo4는 그래픽 사용자 인터페이스, 코드, MCP 및 API와 같은 사용 가능한 모든 인터페이스를 통해 소프트웨어와 상호 작용합니다. 화면을 클릭하고 입력하며, 자체 코드를 작성·실행하고, MCP 또는 API 도구를 호출하여 작업에 맞는 방식을 선택합니다. 동일한 모델이 데스크톱, 웹, Android, 코드 샌드박스 및 비즈니스 API에서도 실행되며, 각 경우에 동일한 방식으로 호출되므로 플랫폼별로 다른 모델을 선택할 필요가 없습니다.
두 크기 모두 H Models API에서 제공되며, 가중치는 Hugging Face에 BF16, FP8, NVFP4 및 4비트 GGUF 형식으로 공개되었습니다. Holo4와 함께, 회사는 Holotron 3의 업데이트 버전인 Holotron4 Nano도 출시했습니다.
The Holo4-27B 모델 카드는 이 모델을 Qwen3.8 밀집 아키텍처 위에 구축된 27B 파라미터 비전-언어 모델로 정의하며, 최대 컨텍스트 길이는 262,144 토큰이고 대상 환경은 웹, 데스크톱, 모바일을 포함합니다. 카드에는 가중치가 비상업적 CC BY-NC 4.0 라이선스 하에 제공된다고 명시되어 있으며, 회사의 hai-agents 하네스를 사용한 사례를 설명합니다. 이 하네스는 스크린샷 및 도구 결과를 모델에 전달하고, 요청된 클릭, 입력, 코드 및 도구 호출을 실행합니다.
The company’s 보도 자료에 따르면, 회사는 Holo4-35B-A3B를 Apache 2.0 라이선스로 제공하며, 입력 토큰 백만당 $0.30, 캐시 토큰 백만당 $0.03, 출력 토큰 백만당 $2.00, 컨텍스트 262K를 명시했습니다. 또한 Holo4-27B는 연구 전용으로 입력 백만당 $0.40, 캐시 백만당 $0.04, 출력 백만당 $3.00이며, 컨텍스트는 동일하게 262K라고 기록했습니다.
보고된 벤치마크 및 작업당 비용
회사 벤치마크 표에 따르면 Holo4 27B는 OSWorld에서 85.2% 점수를 기록했으며 작업당 비용은 $0.08입니다. Holo4 35B-A3B는 80.8% 점수에 작업당 $0.05이며, 27B 모델인 Qwen3.8 27B는 84.3% 점수에 작업당 $0.22입니다. OSWorld의 최전선 점수는 Fable 5가 86.0%, GPT-5.5가 78.7%, Qwen3.8 Max가 86.1%로 나열됩니다.
OSWorld 2.0(장기 컴퓨터 워크플로우를 다룸)에서 회사는 Holo4 27B가 61.7% 점수와 41.5% 성공률을 기록했으며 작업당 $1.22의 비용이 든다고 보고했습니다. Holo4 35B-A3B는 30.9% 점수에 작업당 $0.61입니다. 표에는 Opus 5.5가 81.8%와 작업당 $8.48, GPT-6 Astra가 73.5%와 $9.07, Qwen3.8 27B가 48.0%와 $3.49로 나와 있습니다. 회사는 Holo4가 장기 워크플로우에서 가장 강력한 폐쇄형 모델들에 뒤처지지만, 파라미터 수가 수십 배 적고 비용도 훨씬 낮다고 밝혔습니다.
비즈니스 자동화 벤치마크인 AutomationBench에서 보고된 점수는 Holo4 27B가 작업당 $0.05에 45.4%, 35B-A3B가 작업당 $0.02에 34.5%입니다. 회사는 공개 v1.0.6 세트의 600개 작업 중 480개가 학습 데이터 수집에 사용된 분할에 포함된다고 언급했으며, 120개의 보류된 작업에 대해 27B 모델은 49.3%, MoE 모델은 31.7%를 기록했다고 보고했습니다. Holo4가 공식 비공개 세트에서 평가되면 비공개 세트 결과를 보고하겠다고 밝혔습니다.
표에는 ALE-CLI(Agents’ Last Exam 벤치마크의 105개 작업 Linux 분할)에서 27B 모델이 44.1%, MoE가 30.9%를 기록했으며, AndroidWorld에서는 각각 85.1%와 77.6% 점수를 보였다고도 나와 있습니다. 회사가 학습에 사용되지 않았다고 밝힌 내부 Agentic Task Factory 평가 작업에서는 27B 모델이 웹 작업에서 80.2%, MCP에서 89.4%, 데스크톱에서 72.0% 점수를 얻었습니다.
회사는 Holo4의 수치가 자체 하네스를 사용해 두세 번 실행한 평균값이며, OSWorld 2.0과 ALE-CLI에서는 각각 한 번 실행한 결과라고 밝힙니다. 반면 비교 점수는 모델 카드, 공식 리더보드 및 다양한 하네스와 노력 수준을 가진 제공자의 차트에서 가져왔습니다. 또한 공개 벤치마크 점수 뒤에 있는 모든 궤적을 오픈소스로 제공했으며, 전용 뷰어를 통해 재생 가능하고 Hugging Face 데이터셋으로 다운로드할 수 있습니다.
훈련 파이프라인, Holotron4 Nano 및 다음 단계
Holo4는 감독된 미세조정과 강화학습을 통해 훈련되었으며, 여기에는 회사의 Agentic Task Factory가 생성한 환경 및 작업도 포함됩니다. 이 내부 파이프라인은 문서만을 기반으로 실시간 인터랙티브 환경과 검증 가능한 작업을 구축하는데, 예를 들어 실제 웹사이트 스크린샷이나 오픈소스 소프트웨어가 있습니다. 회사에 따르면 이 팩토리는 현재까지 약 10,000개의 작업을 생산했으며, 그 중 약 4,000개는 웹 앱용, 각 3,000개는 MCP 서버와 데스크톱 환경용이며, GUI와 MCP를 통해 동일한 상태를 노출하는 하이브리드 환경도 포함합니다.
감독된 미세조정에는 127B 토큰이 사용되었으며, 그 중 약 3/4은 성공적인 에이전트 궤적로, 데스크톱(45%), 웹(14%), MCP 및 API(12%), 모바일(3%)에 분산되었습니다. 나머지는 다중모달 추론, GUI 기반 및 텍스트 전용 도구 사용과 코딩을 포함합니다. 장기 작업에 대한 비동기 온라인 강화학습은 두 개의 특화된 LoRA 전문가를 훈련했는데, 하나는 데스크톱 및 웹용, 다른 하나는 터미널, MCP 및 API용이며, 이들은 동일한 가중치로 미세조정된 모델에 다시 병합되었으며 추가 훈련은 이루어지지 않았습니다.
회사 역시 OSWorld 2.0에서의 에이전트 성능 피드백을 활용해 모델의 행동을 실행하고 수백 단계에 걸친 컨텍스트를 관리하는 루프, 즉 하네스를 재구성했습니다. 이 과정에서 에이전트는 각 작업이 실패한 이유에 태그를 달았고 엔지니어는 그 수정 사항을 검토했습니다; 가장 큰 변화는 수백 단계까지 추적할 수 있는 신뢰성 높은 메모리와 데스크톱 머신 자체에 대한 셸이었습니다.
NVIDIA Nemotron 연합의 회원으로서 H 회사는 동일한 사후 학습 스택을 Nemotron 3 Nano Omni에 적용해 Holotron4 Nano를 만들었습니다. 회사는 다섯 가지 벤치마크에서 기본 모델 대비 절대 퍼센트 포인트 상승을 보고했는데, OSWorld는 21.0에서 76.3으로, OSWorld 2.0은 0.2에서 7.9로, AutomationBench는 19.4에서 35.6으로, PinchBench는 84.7에서 88.6으로, ALE Linux는 0.6에서 8.5로 각각 상승했습니다. 이러한 향상은 해당 레시피가 기반 모델 전반에 걸쳐 적용 가능하며 크기에 의존하지 않음을 보여준다고 밝혔습니다.
회사는 발표 후 며칠 내에 최적화된 DSpark drafter 체크포인트를 공개해 추론 속도를 추가로 가속화할 것이라고 밝혔습니다.












