Modelos y plataformas de IA
H Company lanza Holo4, modelos de peso abierto para agentes de uso de computadoras

H company lanzó Holo4, su nueva serie de modelos agenticos de uso de computadoras, el 28 de septiembre de 2026, en tamaños de 27B denso y 35B-A3B Mixture of Experts, con pesos abiertos en Hugging Face y disponibilidad de API. La compañía informa que el modelo de 27B obtiene 85.2% en el benchmark OSWorld a $0.08 por tarea.
Gama de modelos y disponibilidad
Según la compañía, Holo4 interactúa con el software a través de cualquier interfaz disponible: interfaces gráficas de usuario, código, MCP y API. Hace clics y escribe en una pantalla, escribe y ejecuta su propio código, y llama a herramientas MCP o API, seleccionando el enfoque que mejor se ajuste a la tarea. El mismo modelo se ejecuta en escritorios, en la web, en Android, en un sandbox de código y contra APIs empresariales, y se invoca de la misma manera en cada caso, sin necesidad de seleccionar un modelo diferente por plataforma.
Ambos tamaños están disponibles en la API H Models, y los pesos se publican en Hugging Face en formatos BF16, FP8, NVFP4 y GGUF de 4 bits. Junto a Holo4, la compañía también lanzó Holotron4 Nano, una versión actualizada de Holotron 3.
La tarjeta del modelo Holo4-27B identifica el modelo como un modelo visión-lenguaje de 27B de parámetros construido sobre la arquitectura densa Qwen3.8, con una longitud máxima de contexto de 262,144 tokens y entornos objetivo que abarcan web, escritorio y móvil. La tarjeta indica que los pesos están disponibles bajo la licencia no comercial CC BY-NC 4.0 y describe su uso con el harness hai-agents de la compañía, que envía capturas de pantalla y resultados de herramientas al modelo y ejecuta los clics, la escritura, el código y las llamadas a herramientas solicitadas.
La publicación de la sala de prensa de la compañía enumera Holo4-35B-A3B bajo Apache 2.0 a $0.30 por millón de tokens de entrada, $0.03 por millón de tokens en caché y $2.00 por millón de tokens de salida, con contexto de 262K. También enumera Holo4-27B como solo de investigación a $0.40 de entrada, $0.04 en caché y $3.00 de salida por millón de tokens, también con contexto de 262K.
Benchmarks reportados y costo por tarea
La tabla de benchmarks de la compañía muestra a Holo4 27B con 85.2% en OSWorld a un costo de $0.08 por tarea y a Holo4 35B-A3B con 80.8% a $0.05, frente a 84.3% a $0.22 para Qwen3.8 27B, la base del modelo de 27B. Los puntajes frontera listados en OSWorld son 86.0% para Fable 5, 78.7% para GPT-5.5 y 86.1% para Qwen3.8 Max.
En OSWorld 2.0, que cubre flujos de trabajo informáticos extensos, la compañía informa que Holo4 27B obtuvo una puntuación del 61.7% y una tasa de éxito del 41.5% a $1.22 por tarea, y que Holo4 35B-A3B alcanzó el 30.9% a $0.61. La tabla enumera a Opus 5.5 con 81.8% y $8.48 por tarea, a GPT-6 Astra con 73.5% y $9.07, y a Qwen3.8 27B con 48.0% y $3.49. La compañía afirma que Holo4 solo se queda atrás de los modelos cerrados más fuertes en flujos de trabajo largos, y que lo hace con órdenes de magnitud menos parámetros y a un costo mucho menor.
En AutomationBench, un benchmark de automatización empresarial, los puntajes reportados son 45.4% a $0.05 por tarea para Holo4 27B y 34.5% a $0.02 para 35B-A3B. La compañía señala que 480 de las 600 tareas del conjunto público v1.0.6 se encuentran dentro del segmento del que se recopilaron los datos de entrenamiento; en las 120 tareas retenidas, informa 49.3% para el modelo de 27B y 31.7% para el modelo MoE. Indica que reportará los resultados del conjunto privado una vez que Holo4 sea evaluado en el conjunto privado oficial.
La tabla también muestra puntajes de 44.1% para el modelo de 27B y 30.9% para el MoE en ALE-CLI, la división Linux de 105 tareas del benchmark Agents’ Last Exam, y puntajes de AndroidWorld de 85.1% y 77.6%. En tareas de evaluación internas de Agentic Task Factory que la compañía afirma no se usaron en el entrenamiento, el modelo de 27B obtiene 80.2% en tareas web, 89.4% en MCP y 72.0% en escritorio.
La compañía afirma que las cifras de Holo4 provienen de su propio harness, como un promedio de dos a cuatro ejecuciones con una única ejecución en OSWorld 2.0 y ALE-CLI, mientras que los puntajes de comparación provienen de tarjetas de modelo, tablas de clasificación oficiales y gráficos de proveedores a través de diferentes harnesses y niveles de esfuerzo. Ha puesto en código abierto cada trayectoria detrás de sus puntajes de benchmark públicos, reproducibles mediante un visor dedicado y descargables como un conjunto de datos de Hugging Face.
Pipeline de entrenamiento, Holotron4 Nano y próximo paso
Holo4 se entrenó mediante ajuste fino supervisado y aprendizaje por refuerzo en entornos y tareas, incluidas aquellas generadas por la Agentic Task Factory de la compañía, un conjunto interno de pipelines que crea entornos interactivos y tareas verificables a partir de la documentación únicamente, como capturas de pantalla de sitios web reales o software de código abierto. La compañía indica que la fábrica ha producido alrededor de 10,000 tareas hasta ahora, aproximadamente 4,000 de ellas para aplicaciones web y cerca de 3,000 cada una para servidores MCP y entornos de escritorio, incluidos entornos híbridos que exponen el mismo estado a través de una GUI y MCP.
El ajuste fino supervisado utilizó 127B de tokens, aproximadamente tres cuartas partes de ellos en trayectorias agenticas exitosas distribuidas entre escritorio (45%), web (14%), MCP y API (12%) y móvil (3%), con el resto cubriendo razonamiento multimodal, anclaje de GUI y uso de herramientas solo de texto y codificación. El aprendizaje por refuerzo en línea asíncrono en tareas de horizonte largo entrenó luego dos expertos LoRA especializados, uno para escritorio y web y otro para terminal, MCP y API, que se fusionaron de nuevo en el modelo ajustado con peso igual y sin entrenamiento adicional.
La empresa también reconstruyó su arnés, el bucle que ejecuta las acciones del modelo y gestiona su contexto durante cientos de pasos, utilizando la retroalimentación del rendimiento agente en OSWorld 2.0. En ese proceso, los agentes etiquetaron por qué falló cada tarea y los ingenieros revisaron sus correcciones; los cambios más importantes fueron una memoria fiable que puede seguir cientos de pasos y una shell en la propia máquina de escritorio.
Como miembro de la Coalición NVIDIA Nemotron, H company aplicó la misma pila posterior al entrenamiento a Nemotron 3 Nano Omni para producir Holotron4 Nano. La empresa informa ganancias absolutas en puntos porcentuales sobre el modelo base en cinco referencias: OSWorld de 21.0 a 76.3, OSWorld 2.0 de 0.2 a 7.9, AutomationBench de 19.4 a 35.6, PinchBench de 84.7 a 88.6 y ALE Linux de 0.6 a 8.5. Afirma que estas mejoras demuestran que su receta se transfiere entre modelos de base y no depende del tamaño.
La empresa dijo que lanzará puntos de control optimizados de DSpark drafter en los días posteriores al anuncio para acelerar aún más la inferencia.












