Модели и платформы ИИ

Компания H выпускает Holo4, модели с открытыми весами для компьютерных агентов

mm
Добавьте Unite.AI в избранные источники в Google

Компания H выпустила Holo4, новую серию агентных моделей для использования компьютера, 28 сентября 2026 г., в размерах 27 B плотных и 35 B‑A3B «Mixture of Experts», с открытыми весами на Hugging Face и доступностью через API. Компания сообщает, что 27‑B модель набирает 85,2 % в бенчмарке OSWorld при стоимости $0.08 за задачу.

Линейка моделей и доступность

По словам компании, Holo4 взаимодействует с программным обеспечением через любой доступный интерфейс: графические пользовательские интерфейсы, код, MCP и API. Она кликает и вводит текст на экране, пишет и запускает собственный код, а также вызывает инструменты MCP или API, выбирая подходящий подход для задачи. Та же модель работает на настольных компьютерах, в вебе, на Android, в песочнице кода и против бизнес‑API, и вызывается одинаково в каждом случае, без необходимости выбирать другую модель для каждой платформы.

Обе версии доступны через API H Models, а веса опубликованы на Hugging Face в форматах BF16, FP8, NVFP4 и 4‑bit GGUF. Вместе с Holo4 компания также выпустила Holotron4 Nano — обновлённую версию Holotron 3.

В карточка модели Holo4-27B модель определяется как 27‑B параметрическая модель зрительно‑языковая, построенная на плотной архитектуре Qwen3.8, с максимальной длиной контекста 262 144 токенов и целевыми средами, охватывающими веб, настольные компьютеры и мобильные устройства. В карточке указано, что веса доступны по некоммерческой лицензии CC BY‑NC 4.0 и описывается использование с системой hai‑agents компании, которая отправляет скриншоты и результаты инструментов модели и исполняет её запросы на клики, ввод текста, код и вызовы инструментов.

В сообщении в новостном центре компании указаны Holo4-35B-A3B под лицензией Apache 2.0 по цене $0.30 за миллион входных токенов, $0.03 за миллион кэшированных токенов и $2.00 за миллион выходных токенов, с контекстом 262 K. Также указано, что Holo4-27B доступен только для исследований по цене $0.40 за вход, $0.04 за кэш и $3.00 за выход за миллион токенов, также с контекстом 262 K.

Сообщённые бенчмарки и стоимость за задачу

В таблице бенчмарков компании указано, что Holo4 27B достигает 85,2 % в OSWorld при стоимости $0.08 за задачу, а Holo4 35B-A3B — 80,8 % при $0.05, по сравнению с 84,3 % при $0.22 для Qwen3.8 27B, базовой 27‑B модели. На переднем крае OSWorld указаны результаты 86,0 % для Fable 5, 78,7 % для GPT‑5.5 и 86,1 % для Qwen3.8 Max.

В OSWorld 2.0, охватывающем длительные компьютерные рабочие процессы, компания сообщает, что Holo4 27B набирает 61,7 % балл и 41,5 % коэффициент успеха при $1.22 за задачу, а Holo4 35B-A3B — 30,9 % при $0.61. В таблице указаны Opus 5.5 с 81,8 % и $8.48 за задачу, GPT‑6 Astra с 73,5 % и $9.07, а также Qwen3.8 27B с 48,0 % и $3.49. Компания заявляет, что Holo4 отстаёт только от самых сильных закрытых моделей в длительных рабочих процессах и делает это с порядком величины меньшим количеством параметров и гораздо более низкой стоимостью.

В AutomationBench, бенчмарке бизнес‑автоматизации, сообщённые результаты составляют 45,4 % при $0.05 за задачу для Holo4 27B и 34,5 % при $0.02 для 35B-A3B. Компания отмечает, что 480 из 600 задач в публичном наборе v1.0.6 попадают в раздел, из которого собирались обучающие данные; на 120 отложенных задачах она сообщает 49,3 % для модели 27B и 31,7 % для модели MoE. Компания заявляет, что опубликует результаты по закрытому набору, как только Holo4 будет оценена на официальном закрытом наборе.

В таблице также указаны результаты 44,1 % для модели 27B и 30,9 % для MoE на ALE‑CLI, 105‑задачном Linux‑разделе бенчмарка Agents’ Last Exam, а также оценки AndroidWorld в 85,1 % и 77,6 %. По внутренним задачам оценки Agentic Task Factory, которые, по словам компании, не использовались в обучении, модель 27B набирает 80,2 % по веб‑задачам, 89,4 % по MCP и 72,0 % по настольным задачам.

Компания заявляет, что показатели Holo4 получены с помощью собственной системы, в виде среднего значения по двум‑четырём запускам с единственным запуском на OSWorld 2.0 и ALE‑CLI, тогда как сравниваемые результаты берутся из карточек моделей, официальных таблиц лидеров и диаграмм провайдеров, использующих разные системы и уровни усилий. Она открыла исходный код всех траекторий, лежащих в основе публичных бенчмарков, которые можно воспроизвести через специальный просмотрщик и загрузить как набор данных Hugging Face.

Тренировочный конвейер, Holotron4 Nano и следующий шаг

Holo4 была обучена с помощью контролируемой доработки и обучения с подкреплением в средах и задачах, включая те, которые генерируются фабрикой Agentic Task Factory компании — внутренним набором конвейеров, создающих интерактивные среды и проверяемые задачи исключительно из документации, например скриншоты реальных веб‑сайтов или открытого программного обеспечения. Компания сообщает, что фабрика уже создала около 10 000 задач, примерно 4 000 из них для веб‑приложений и около 3 000 для серверов MCP и настольных сред, включая гибридные среды, которые предоставляют одинаковое состояние через GUI и MCP.

Контролируемая доработka использовала 127 B токенов, примерно три четверти из которых представляют успешные агентные траектории, распределённые по настольным (45 %), веб (14 %), MCP и API (12 %) и мобильным (3 %) задачам, а оставшиеся покрывали мультимодальное рассуждение, привязку к GUI и использование только текстовых инструментов и программирование. Асинхронное онлайн‑обучение с подкреплением на задачах с длинным горизонтом затем обучило двух специализированных LoRA‑экспертов: один для настольных и веб‑сред, второй для терминала, MCP и API, которые были объединены обратно в доработанную модель с равным весом и без дальнейшего обучения.

Компания также перестроила свою оболочку, цикл, который исполняет действия модели и управляет её контекстом в течение сотен шагов, используя обратную связь от агентной производительности в OSWorld 2.0. В этом процессе агенты помечали причины неудач каждой задачи, а инженеры проверяли их исправления; крупнейшими изменениями стали надёжная память, способная отслеживать сотни шагов, и оболочка непосредственно на настольном компьютере.

Будучи членом NVIDIA Nemotron Coalition, H company применила тот же пост‑тренировочный стек к Nemotron 3 Nano Omni, чтобы создать Holotron4 Nano. Компания сообщает о абсолютных приростах в процентных пунктах по сравнению с базовой моделью на пяти бенчмарках: OSWorld с 21,0 до 76,3, OSWorld 2.0 с 0,2 до 7,9, AutomationBench с 19,4 до 35,6, PinchBench с 84,7 до 88,6 и ALE Linux с 0,6 до 8,5. Она заявляет, что эти улучшения показывают, что её методика переносится на различные фундаментальные модели и не зависит от их размера.

Компания заявила, что в течение нескольких дней после анонса выпустит оптимизированные DSpark drafter checkpoints, чтобы ещё больше ускорить инференс.

Jonas Reeve является аналитиком, созданным ИИ, в Unite.AI, специализирующимся на когнитивном ИИ, искусственном общем интеллекте (AGI) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, устанавливая связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии разума.

Подходя концептуально и рефлексивно, Jonas исследует такие рамки, как модели рассуждения, агентные системы, возникшее познание и теория выравнивания, стремясь прояснить, что на самом деле означает прогресс в направлении AGI — и чего он не означает. Вместо того чтобы гнаться за сроками или ажиотажем, он подчеркивает фундаментальные принципы, концептуальную строгость и ограничения текущих моделей.

Статьи, написанные Jonas Reeve, генерируются ИИ и проверяются редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение передовых концепций ИИ.