Modèles et plateformes d’IA
H Company lance Holo4, modèles à poids ouverts pour les agents d’utilisation d’ordinateur

H company a publié Holo4, sa nouvelle série de modèles d’agents d’utilisation d’ordinateur, le 28 septembre 2026, en tailles 27B dense et 35B-A3B Mixture of Experts, avec des poids ouverts sur Hugging Face et une disponibilité via API. L’entreprise indique que le modèle 27B obtient un score de 85,2 % sur le benchmark OSWorld à 0,08 $ par tâche.
Gamme de modèles et disponibilité
Selon l’entreprise, Holo4 interagit avec les logiciels via n’importe quelle interface disponible : interfaces graphiques, code, MCP et API. Il clique et tape sur un écran, écrit et exécute son propre code, et appelle des outils MCP ou API, en choisissant l’approche la plus adaptée à la tâche. Le même modèle fonctionne sur les ordinateurs de bureau, sur le web, sur Android, dans un bac à sable de code et contre les API d’entreprise, et il est invoqué de la même manière dans chaque cas, sans besoin de sélectionner un modèle différent selon la plateforme.
Les deux tailles sont disponibles sur l’API H Models, et les poids sont publiés sur Hugging Face aux formats BF16, FP8, NVFP4 et GGUF 4 bits. En parallèle de Holo4, l’entreprise a également publié Holotron4 Nano, une version mise à jour de Holotron 3.
Le Holo4-27B carte du modèle identifie le modèle comme un modèle vision-langage à 27 B paramètres construit sur l’architecture dense Qwen3.8, avec une longueur maximale de contexte de 262 144 jetons et des environnements cibles couvrant le web, le bureau et le mobile. La carte indique que les poids sont disponibles sous licence non commerciale CC BY-NC 4.0 et décrit l’utilisation avec le harnais hai-agents de l’entreprise, qui envoie des captures d’écran et les résultats d’outils au modèle et exécute ses clics, frappes, code et appels d’outils demandés.
Le publication du newsroom de l’entreprise répertorie Holo4-35B-A3B sous licence Apache 2.0 à 0,30 $ par million de jetons d’entrée, 0,03 $ par million de jetons mis en cache et 2,00 $ par million de jetons de sortie, avec un contexte de 262 K. Elle répertorie Holo4-27B comme uniquement recherche à 0,40 $ d’entrée, 0,04 $ mis en cache et 3,00 $ de sortie par million de jetons, également avec un contexte de 262 K.
Benchmarks rapportés et coût par tâche
Le tableau de référence de l’entreprise indique que Holo4 27B obtient 85,2 % sur OSWorld avec un coût de 0,08 $ par tâche et que Holo4 35B-A3B atteint 80,8 % à 0,05 $, contre 84,3 % à 0,22 $ pour Qwen3.8 27B, la base du modèle 27B. Les scores de pointe répertoriés sur OSWorld sont de 86,0 % pour Fable 5, 78,7 % pour GPT‑5.5 et 86,1 % pour Qwen3.8 Max.
Sur OSWorld 2.0, qui couvre de longs flux de travail informatiques, l’entreprise indique que Holo4 27B obtient un score de 61,7 % et un taux de réussite de 41,5 % à 1,22 $ par tâche, et que Holo4 35B-A3B atteint 30,9 % à 0,61 $. Le tableau répertorie Opus 5.5 à 81,8 % et 8,48 $ par tâche, GPT‑6 Astra à 73,5 % et 9,07 $, et Qwen3.8 27B à 48,0 % et 3,49 $. L’entreprise affirme que Holo4 n’est devancé que par les modèles fermés les plus performants sur les longs flux de travail, et ce avec des paramètres d’ordre de grandeur inférieurs et à un coût bien plus faible.
Sur AutomationBench, un benchmark d’automatisation d’entreprise, les scores rapportés sont de 45,4 % à 0,05 $ par tâche pour Holo4 27B et de 34,5 % à 0,02 $ pour 35B-A3B. L’entreprise indique que 480 des 600 tâches du jeu de données public v1.0.6 appartiennent à la partie à partir de laquelle elle a collecté les données d’entraînement ; sur les 120 tâches retenues, elle rapporte 49,3 % pour le modèle 27B et 31,7 % pour le modèle MoE. Elle précise qu’elle publiera les résultats sur le jeu privé une fois que Holo4 aura été évalué sur le jeu privé officiel.
Le tableau indique également des scores de 44,1 % pour le modèle 27B et de 30,9 % pour le MoE sur ALE‑CLI, la division Linux de 105 tâches du benchmark Agents’ Last Exam, ainsi que des scores AndroidWorld de 85,1 % et 77,6 %. Sur les tâches d’évaluation internes de l’Agentic Task Factory que l’entreprise affirme ne pas avoir utilisées pour l’entraînement, le modèle 27B obtient 80,2 % sur les tâches web, 89,4 % sur MCP et 72,0 % sur le bureau.
L’entreprise indique que les chiffres de Holo4 proviennent de son propre harnais, calculés comme une moyenne sur deux à quatre exécutions avec une exécution unique sur OSWorld 2.0 et ALE‑CLI, tandis que les scores de comparaison proviennent de cartes de modèles, de classements officiels et de graphiques de fournisseurs utilisant différents harnais et niveaux d’effort. Elle a mis en source ouverte chaque trajectoire derrière ses scores de benchmark publics, reproductibles via un visualiseur dédié et téléchargeables comme jeu de données Hugging Face.
Pipeline d’entraînement, Holotron4 Nano et prochaine étape
Holo4 a été entraîné par affinement supervisé et apprentissage par renforcement sur des environnements et des tâches, y compris celles générées par la Agentic Task Factory de l’entreprise, un ensemble interne de pipelines qui crée des environnements interactifs et des tâches vérifiables à partir de la documentation uniquement, comme des captures d’écran de sites web réels ou de logiciels open source. L’entreprise indique que la factory a produit environ 10 000 tâches à ce jour, dont environ 4 000 pour les applications web et environ 3 000 chacune pour les serveurs MCP et les environnements de bureau, incluant des environnements hybrides exposant le même état via une interface graphique et MCP.
L’affinement supervisé a utilisé 127 B jetons, dont environ les trois quarts constituent des trajectoires d’agents réussies réparties entre le bureau (45 %), le web (14 %), MCP et API (12 %) et le mobile (3 %), le reste couvrant le raisonnement multimodal, l’ancrage d’interface graphique et l’utilisation d’outils et de codage uniquement textuels. L’apprentissage par renforcement en ligne asynchrone sur des tâches à long horizon a ensuite entraîné deux experts LoRA spécialisés, l’un pour le bureau et le web et l’autre pour le terminal, MCP et API, qui ont été fusionnés de nouveau dans le modèle affiné avec un poids égal et sans entraînement supplémentaire.
L’entreprise a également reconstruit son harnais, la boucle qui exécute les actions du modèle et gère son contexte sur des centaines d’étapes, en utilisant les retours de la performance agentique sur OSWorld 2.0. Dans ce processus, les agents ont indiqué pourquoi chaque tâche a échoué et les ingénieurs ont examiné leurs correctifs ; les changements les plus importants étaient une mémoire fiable capable de suivre des centaines d’étapes et un shell sur la machine de bureau elle-même.
En tant que membre de la NVIDIA Nemotron Coalition, H company a appliqué la même pile post‑entraînement à Nemotron 3 Nano Omni pour produire Holotron4 Nano. L’entreprise rapporte des gains absolus en points de pourcentage par rapport au modèle de base sur cinq benchmarks : OSWorld de 21.0 à 76.3, OSWorld 2.0 de 0.2 à 7.9, AutomationBench de 19.4 à 35.6, PinchBench de 84.7 à 88.6 et ALE Linux de 0.6 à 8.5. Elle indique que ces gains montrent que sa méthode se transfère aux modèles de fondation et n’est pas dépendante de la taille.
L’entreprise a déclaré qu’elle publierait des points de contrôle optimisés DSpark drafter dans les jours qui suivront l’annonce afin d’accélérer davantage l’inférence.












