Modelos y plataformas de IA

H Company lanza Holo4, modelos de peso abierto para agentes de uso de computadoras

mm
Añade Unite.AI a tus fuentes preferidas en Google

H company lanzó Holo4, su nueva serie de modelos agenticos de uso de computadoras, el 28 de septiembre de 2026, en tamaños de 27B denso y 35B-A3B Mixture of Experts, con pesos abiertos en Hugging Face y disponibilidad de API. La compañía informa que el modelo de 27B obtiene 85.2% en el benchmark OSWorld a $0.08 por tarea.

Gama de modelos y disponibilidad

Según la compañía, Holo4 interactúa con el software a través de cualquier interfaz disponible: interfaces gráficas de usuario, código, MCP y API. Hace clics y escribe en una pantalla, escribe y ejecuta su propio código, y llama a herramientas MCP o API, seleccionando el enfoque que mejor se ajuste a la tarea. El mismo modelo se ejecuta en escritorios, en la web, en Android, en un sandbox de código y contra APIs empresariales, y se invoca de la misma manera en cada caso, sin necesidad de seleccionar un modelo diferente por plataforma.

Ambos tamaños están disponibles en la API H Models, y los pesos se publican en Hugging Face en formatos BF16, FP8, NVFP4 y GGUF de 4 bits. Junto a Holo4, la compañía también lanzó Holotron4 Nano, una versión actualizada de Holotron 3.

La tarjeta del modelo Holo4-27B identifica el modelo como un modelo visión-lenguaje de 27B de parámetros construido sobre la arquitectura densa Qwen3.8, con una longitud máxima de contexto de 262,144 tokens y entornos objetivo que abarcan web, escritorio y móvil. La tarjeta indica que los pesos están disponibles bajo la licencia no comercial CC BY-NC 4.0 y describe su uso con el harness hai-agents de la compañía, que envía capturas de pantalla y resultados de herramientas al modelo y ejecuta los clics, la escritura, el código y las llamadas a herramientas solicitadas.

La publicación de la sala de prensa de la compañía enumera Holo4-35B-A3B bajo Apache 2.0 a $0.30 por millón de tokens de entrada, $0.03 por millón de tokens en caché y $2.00 por millón de tokens de salida, con contexto de 262K. También enumera Holo4-27B como solo de investigación a $0.40 de entrada, $0.04 en caché y $3.00 de salida por millón de tokens, también con contexto de 262K.

Benchmarks reportados y costo por tarea

La tabla de benchmarks de la compañía muestra a Holo4 27B con 85.2% en OSWorld a un costo de $0.08 por tarea y a Holo4 35B-A3B con 80.8% a $0.05, frente a 84.3% a $0.22 para Qwen3.8 27B, la base del modelo de 27B. Los puntajes frontera listados en OSWorld son 86.0% para Fable 5, 78.7% para GPT-5.5 y 86.1% para Qwen3.8 Max.

En OSWorld 2.0, que cubre flujos de trabajo informáticos extensos, la compañía informa que Holo4 27B obtuvo una puntuación del 61.7% y una tasa de éxito del 41.5% a $1.22 por tarea, y que Holo4 35B-A3B alcanzó el 30.9% a $0.61. La tabla enumera a Opus 5.5 con 81.8% y $8.48 por tarea, a GPT-6 Astra con 73.5% y $9.07, y a Qwen3.8 27B con 48.0% y $3.49. La compañía afirma que Holo4 solo se queda atrás de los modelos cerrados más fuertes en flujos de trabajo largos, y que lo hace con órdenes de magnitud menos parámetros y a un costo mucho menor.

En AutomationBench, un benchmark de automatización empresarial, los puntajes reportados son 45.4% a $0.05 por tarea para Holo4 27B y 34.5% a $0.02 para 35B-A3B. La compañía señala que 480 de las 600 tareas del conjunto público v1.0.6 se encuentran dentro del segmento del que se recopilaron los datos de entrenamiento; en las 120 tareas retenidas, informa 49.3% para el modelo de 27B y 31.7% para el modelo MoE. Indica que reportará los resultados del conjunto privado una vez que Holo4 sea evaluado en el conjunto privado oficial.

La tabla también muestra puntajes de 44.1% para el modelo de 27B y 30.9% para el MoE en ALE-CLI, la división Linux de 105 tareas del benchmark Agents’ Last Exam, y puntajes de AndroidWorld de 85.1% y 77.6%. En tareas de evaluación internas de Agentic Task Factory que la compañía afirma no se usaron en el entrenamiento, el modelo de 27B obtiene 80.2% en tareas web, 89.4% en MCP y 72.0% en escritorio.

La compañía afirma que las cifras de Holo4 provienen de su propio harness, como un promedio de dos a cuatro ejecuciones con una única ejecución en OSWorld 2.0 y ALE-CLI, mientras que los puntajes de comparación provienen de tarjetas de modelo, tablas de clasificación oficiales y gráficos de proveedores a través de diferentes harnesses y niveles de esfuerzo. Ha puesto en código abierto cada trayectoria detrás de sus puntajes de benchmark públicos, reproducibles mediante un visor dedicado y descargables como un conjunto de datos de Hugging Face.

Pipeline de entrenamiento, Holotron4 Nano y próximo paso

Holo4 se entrenó mediante ajuste fino supervisado y aprendizaje por refuerzo en entornos y tareas, incluidas aquellas generadas por la Agentic Task Factory de la compañía, un conjunto interno de pipelines que crea entornos interactivos y tareas verificables a partir de la documentación únicamente, como capturas de pantalla de sitios web reales o software de código abierto. La compañía indica que la fábrica ha producido alrededor de 10,000 tareas hasta ahora, aproximadamente 4,000 de ellas para aplicaciones web y cerca de 3,000 cada una para servidores MCP y entornos de escritorio, incluidos entornos híbridos que exponen el mismo estado a través de una GUI y MCP.

El ajuste fino supervisado utilizó 127B de tokens, aproximadamente tres cuartas partes de ellos en trayectorias agenticas exitosas distribuidas entre escritorio (45%), web (14%), MCP y API (12%) y móvil (3%), con el resto cubriendo razonamiento multimodal, anclaje de GUI y uso de herramientas solo de texto y codificación. El aprendizaje por refuerzo en línea asíncrono en tareas de horizonte largo entrenó luego dos expertos LoRA especializados, uno para escritorio y web y otro para terminal, MCP y API, que se fusionaron de nuevo en el modelo ajustado con peso igual y sin entrenamiento adicional.

La empresa también reconstruyó su arnés, el bucle que ejecuta las acciones del modelo y gestiona su contexto durante cientos de pasos, utilizando la retroalimentación del rendimiento agente en OSWorld 2.0. En ese proceso, los agentes etiquetaron por qué falló cada tarea y los ingenieros revisaron sus correcciones; los cambios más importantes fueron una memoria fiable que puede seguir cientos de pasos y una shell en la propia máquina de escritorio.

Como miembro de la Coalición NVIDIA Nemotron, H company aplicó la misma pila posterior al entrenamiento a Nemotron 3 Nano Omni para producir Holotron4 Nano. La empresa informa ganancias absolutas en puntos porcentuales sobre el modelo base en cinco referencias: OSWorld de 21.0 a 76.3, OSWorld 2.0 de 0.2 a 7.9, AutomationBench de 19.4 a 35.6, PinchBench de 84.7 a 88.6 y ALE Linux de 0.6 a 8.5. Afirma que estas mejoras demuestran que su receta se transfiere entre modelos de base y no depende del tamaño.

La empresa dijo que lanzará puntos de control optimizados de DSpark drafter en los días posteriores al anuncio para acelerar aún más la inferencia.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en IA cognitiva, inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de máquinas. Su trabajo explora cómo el aprendizaje, el razonamiento, la memoria y la abstracción emergen tanto en sistemas biológicos como artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas históricas de la ciencia cognitiva y la filosofía de la mente.

Con un enfoque conceptual y reflexivo, Jonas examina marcos como modelos de razonamiento, sistemas agente, cognición emergente y teoría de alineación, con el objetivo de aclarar lo que realmente significa el progreso hacia la AGI —y lo que no significa. En lugar de perseguir cronogramas o exageraciones, él enfatiza los principios fundamentales, el rigor conceptual y los límites de los modelos actuales.

Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar precisión, claridad y una discusión responsable de conceptos avanzados de IA.