Modelos e plataformas de IA

H Company lança Holo4, modelos de peso aberto para agentes de uso de computador

mm
Adicione Unite.AI às suas fontes preferidas no Google

A H company lançou Holo4, sua nova série de modelos agentes de uso de computador, em 28 de setembro de 2026, nas versões densas de 27B e Mixture of Experts de 35B-A3B, com pesos abertos no Hugging Face e disponibilidade via API. A empresa relata que o modelo de 27B obtém 85,2% no benchmark OSWorld a $0.08 por tarefa.

Linha de Modelos e Disponibilidade

De acordo com a empresa, o Holo4 interage com software por qualquer interface disponível: interfaces gráficas de usuário, código, MCP e APIs. Ele clica e digita em uma tela, escreve e executa seu próprio código e chama ferramentas MCP ou de API, selecionando a abordagem que melhor se adapta à tarefa. O mesmo modelo funciona em desktops, na web, no Android, em um sandbox de código e contra APIs empresariais, sendo chamado da mesma forma em cada caso, sem necessidade de selecionar um modelo diferente para cada plataforma.

Ambos os tamanhos estão disponíveis na H Models API, e os pesos são publicados no Hugging Face nos formatos BF16, FP8, NVFP4 e GGUF de 4 bits. Juntamente com o Holo4, a empresa também lançou o Holotron4 Nano, uma versão atualizada do Holotron 3.

O cartão de modelo Holo4-27B identifica o modelo como um modelo visão-linguagem de 27B parâmetros construído sobre a arquitetura densa Qwen3.8, com comprimento máximo de contexto de 262.144 tokens e ambientes-alvo que abrangem web, desktop e mobile. O cartão afirma que os pesos estão disponíveis sob a licença não comercial CC BY-NC 4.0 e descreve o uso com o harness hai-agents da empresa, que envia capturas de tela e resultados de ferramentas ao modelo e executa os cliques, digitação, código e chamadas de ferramentas solicitados.

O post de imprensa da empresa lista o Holo4-35B-A3B sob a licença Apache 2.0 a $0.30 por milhão de tokens de entrada, $0.03 por milhão de tokens em cache e $2.00 por milhão de tokens de saída, com contexto de 262K. Ele lista o Holo4-27B como apenas para pesquisa a $0.40 de entrada, $0.04 em cache e $3.00 de saída por milhão de tokens, também com contexto de 262K.

Benchmarks Reportados e Custo por Tarefa

A tabela de benchmarks da empresa relata que o Holo4 27B atinge 85,2% no OSWorld com custo de $0.08 por tarefa e o Holo4 35B-A3B atinge 80,8% a $0.05, contra 84,3% a $0.22 para o Qwen3.8 27B, base do modelo de 27B. As pontuações de fronteira listadas no OSWorld são 86,0% para Fable 5, 78,7% para GPT-5.5 e 86,1% para Qwen3.8 Max.

No OSWorld 2.0, que abrange fluxos de trabalho de computador longos, a empresa relata que o Holo4 27B obtém pontuação de 61,7% e taxa de sucesso de 41,5% a $1.22 por tarefa, e o Holo4 35B-A3B obtém 30,9% a $0.61. A tabela lista Opus 5.5 com 81,8% e $8.48 por tarefa, GPT-6 Astra com 73,5% e $9.07, e Qwen3.8 27B com 48,0% e $3.49. A empresa afirma que o Holo4 fica atrás apenas dos modelos fechados mais fortes em fluxos de trabalho longos, e que isso ocorre com ordens de magnitude menos parâmetros e a um custo muito menor.

No AutomationBench, um benchmark de automação empresarial, as pontuações relatadas são 45,4% a $0.05 por tarefa para o Holo4 27B e 34,5% a $0.02 para o 35B-A3B. A empresa observa que 480 dos 600 tarefas no conjunto público v1.0.6 estão dentro da divisão da qual coletou dados de treinamento; nas 120 tarefas reservadas, relata 49,3% para o modelo de 27B e 31,7% para o modelo MoE. Ela afirma que divulgará os resultados do conjunto privado assim que o Holo4 for avaliado no conjunto privado oficial.

A tabela também relata pontuações de 44,1% para o modelo de 27B e 30,9% para o MoE no ALE-CLI, a divisão Linux de 105 tarefas do benchmark Agents’ Last Exam, e pontuações do AndroidWorld de 85,1% e 77,6%. Em tarefas de avaliação internas da Agentic Task Factory que a empresa afirma não terem sido usadas no treinamento, o modelo de 27B obtém 80,2% em tarefas web, 89,4% em MCP e 72,0% em desktop.

A empresa afirma que os números do Holo4 provêm de seu próprio harness, como média de duas a quatro execuções com uma única execução no OSWorld 2.0 e ALE-CLI, enquanto as pontuações de comparação vêm de cartões de modelo, rankings oficiais e gráficos de provedores em diferentes harnesses e níveis de esforço. Ela disponibilizou como código aberto todas as trajetórias por trás de seus scores de benchmark públicos, reproduzíveis através de um visualizador dedicado e baixáveis como um conjunto de dados do Hugging Face.

Pipeline de Treinamento, Holotron4 Nano e Próximo Passo

O Holo4 foi treinado por meio de fine-tuning supervisionado e aprendizado por reforço em ambientes e tarefas, incluindo aqueles gerados pela Agentic Task Factory da empresa, um conjunto interno de pipelines que cria ambientes interativos e tarefas verificáveis a partir apenas de documentação, como capturas de tela de sites reais ou softwares de código aberto. A empresa afirma que a fábrica produziu cerca de 10.000 tarefas até agora, aproximadamente 4.000 delas para aplicativos web e cerca de 3.000 cada para servidores MCP e ambientes de desktop, incluindo ambientes híbridos que expõem o mesmo estado por meio de uma GUI e do MCP.

O fine-tuning supervisionado utilizou 127 B tokens, cerca de três quartos deles em trajetórias agentes bem-sucedidas distribuídas entre desktop (45%), web (14%), MCP e API (12%) e mobile (3%), com o restante abrangendo raciocínio multimodal, fundamentação em GUI e uso de ferramentas apenas de texto e codificação. O aprendizado por reforço online assíncrono em tarefas de longo horizonte então treinou dois especialistas LoRA especializados, um para desktop e web e outro para terminal, MCP e API, que foram mesclados de volta ao modelo fine-tuned com peso igual e sem treinamento adicional.

A empresa também reconstruiu sua estrutura, o loop que executa as ações do modelo e gerencia seu contexto ao longo de centenas de etapas, usando feedback do desempenho agente em OSWorld 2.0. Nesse processo, os agentes marcaram o motivo de cada tarefa falhar e os engenheiros revisaram suas correções; as maiores mudanças foram uma memória confiável que pode acompanhar centenas de etapas e um shell na própria máquina desktop.

Como membro da NVIDIA Nemotron Coalition, a H company aplicou a mesma pilha pós‑treinamento ao Nemotron 3 Nano Omni para produzir o Holotron4 Nano. A empresa relata ganhos absolutos em pontos percentuais em relação ao modelo base em cinco benchmarks: OSWorld de 21,0 para 76,3, OSWorld 2.0 de 0,2 para 7,9, AutomationBench de 19,4 para 35,6, PinchBench de 84,7 para 88,6 e ALE Linux de 0,6 para 8,5. Ela afirma que os ganhos demonstram que sua receita se transfere entre modelos de base e não depende do tamanho.

A empresa disse que lançará checkpoints otimizados do DSpark drafter nos dias seguintes ao anúncio para acelerar ainda mais a inferência.

Jonas Reeve é um analista gerado por IA na Unite.AI, focado em IA cognitiva, inteligência geral artificial (AGI) e nas fundações teóricas da inteligência de máquinas. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem tanto em sistemas biológicos quanto artificiais, estabelecendo conexões entre arquiteturas modernas de IA e questões de longa data na ciência cognitiva e na filosofia da mente.

Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agentes, cognição emergente e teoria de alinhamento, visando esclarecer o que realmente significa o progresso rumo à AGI — e o que não significa. Em vez de perseguir cronogramas ou exageros, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.

Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos avançados de IA.