Модели и платформы ИИ
H Company выпускает NeoMME, семейство открытых мультимодальных энкодеров

Исследователи H Company выпустили NeoMME 3 сентября 2026 года, семейство мультимодальных и многоязычных энкодеров с 260 млн и 800 млн параметрами, обученных с нуля и опубликованных под лицензией Apache 2.0. По данным команды, дообученные варианты для поиска находятся на парето‑границе по размеру модели в бенчмарке визуального поиска документов ViDoRe v3.
Согласно посту о релизе, многие современные поисковые системы для визуальных документов адаптированы от предварительно обученных генеративных моделей «зрение‑язык», где отдельно обученный визуальный энкодер генерирует визуальные признаки, которые проектор преобразует во входное пространство причинной языковой модели. Авторы отмечают, что поиск, классификация и маркировка токенов не генерируют текст автрегрессивно, поэтому для этих задач не требуется причинный декодер и связанные с ним параметры и вычислительные затраты. Вместо этого NeoMME пропускает текстовые токены и необработанные патчи изображений через один общий двунаправленный Transformer и не основывается ни на каком существующем предварительно обученном визуальном башне, текстовом энкодере или декодере.
В публикации сравнивается дизайн с двумя более ранними попытками создания энкодеров: ModernBERT, который внес улучшения эффективности в двунаправленные текстовые энкодеры, и ModernVBERT, который применил текстовый энкодер в стиле ModernBERT к поиску визуальных документов, сохранив отдельную предварительно обученную визуальную башню SigLIP2. Авторы пишут, что хотели избавиться от накладных расходов, связанных с переносом компонентов модели «зрение‑язык» в энкодер.
Архитектура и обучение с нуля
Обе версии NeoMME используют одну и ту же архитектуру. Текстовые входы представляются факторизованными токен‑эмбеддингами, а изображения разбиваются на сетку неперекрывающихся патчей размером 32×32 и проецируются небольшим многослойным перцептроном; затем оба типа данных поступают в один и тот же Transformer‑энкодер. Изображения сохраняют своё соотношение сторон и размер, поэтому модель может выделять больше токенов для высокоразрешённой, информационно‑насыщенной страницы документа, чем для более мелкого изображения. Длина контекста составляет 16 384 токена, чего достаточно для до двух стандартных 3840×2160 4K UHD‑изображений. Большинство слоёв используют симметричное скользящее окно внимания, а каждый шестой слой и последний слой применяют глобальное внимание. Стек также включает групповой запрос‑внимание, нормализацию запрос‑ключ, затворное внимание, 2‑D ротационные позиционные эмбеддинги и квадратичные ReLU‑MLP. Для текста команда обучила BPE‑токенизатор с словарём в 131 072 токена с нуля на многоязычном тексте, коде, математике и машинных транскриптах изображений.
NeoMME обучается с нуля как дискретный шумоподавитель текста с маскированным диффузионным процессом. Для примеров только с текстом уровень порчи выбирается равномерно от 0 до 1, и каждый подходящий токен независимо маскируется с этой вероятностью. В мультимодальных примерах уровень порчи находится в диапазоне от 0,3 до 1, при этом патчи изображений остаются видимыми, а модель восстанавливает замаскированный текст; авторы отмечают, что сильная маскировка заставляет модель изучать описания, основанные на изображении, а не полагаться лишь на языковые ухищрения. При предобучении смешиваются многоязычный текст, код, математика, естественные изображения и изображения документов, и каждая модель обрабатывает около 524 млрд упакованных входных токенов, включая 290 млрд из примеров только с текстом. Учитывая, что такой объём текста мал по сравнению с 2 трлн обучающих токенов ModernBERT, авторы пишут, что выбрали оптимизатор NorMuon для повышения эффективности данных.
Тонкая настройка для поиска и результаты бенчмарков
Чтобы оценить базовую модель на последующей задаче, команда дообучила её для визуального поиска документов, используя методологию «страница‑изображение», предложенную в ColPali. Вместо извлечения текстовых фрагментов NeoMME‑Retriever ранжирует скриншоты страниц документов, обходя предобработку OCR и сохраняет макет, графики, таблицы и типографику. К базовой модели добавляются две совместно обучаемые головы: плотная голова, которая усредняет скрытые состояния в нормализованный вектор, и голова позднего взаимодействия, проецирующая каждый токен текста или патч изображения в 128‑мерный нормализованный вектор, сохраняющий детальные соответствия между токенами запроса и регионами изображения. Один проход вперёд возвращает оба представления. Авторы в целом рекомендуют эмбеддинги позднего взаимодействия и конвейер из плотного поиска с последующей переоценкой с помощью позднего взаимодействия для очень больших корпусов.
В бенчмарке ViDoRe v3 публикация сообщает nDCG@10 = 0.523 для NeoMME‑Retriever‑260M, что является наивысшим показателем среди оцениваемых моделей с параметрами строго ниже 800 млн и находится в пределах 0,002 от ColQwen2.5 при использовании примерно в 14 раз меньшего количества параметров. NeoMME‑Retriever‑800M достигает 0,556, что находится в пределах 0,009 от аналогичного по размеру Vultron Retriever Flash, и обе модели находятся на парето‑границе по размеру модели в этом бенчмарке. В сравнительной таблице публикации результаты конкурентов указаны из MTEB, а показатели NeoMME — как собственные оценки команды. На более старых бенчмарках ViDoRe v1 и v2, где используется nDCG@5, указано, что модель 260 M превосходит ColModernVBERT и вдвое более крупный ColSmol‑500M, тогда как модель 800 M опережает ColPali v1.3 при в 3,6 раза меньшем количестве параметров.
карточка модели NeoMME-260M-Retriever указывает 263 млн параметров, скрытый размер 1 024, веса BF16 и плотные эмбеддинги размером 1 024 измерения с точками усечения Matryoshka на 128, 256, 512 и 1 024 измерениях, а также 128‑измерный многовекторный вывод. В карточке также представлены результаты текстового поиска по набору BEIR‑15, где 260 M‑поисковик достигает 0,4881 nDCG@10 при позднем взаимодействии, а модель 800 M — 0,5126.
Сжатие, пропускная способность индексации и доступность
Поскольку хранение при позднем взаимодействии масштабируется линейно с числом векторов эмбеддингов, индексация страниц высокого разрешения обходится дорого: страница 2048×2048 генерирует 4 200 векторов с NeoMME‑Retriever, около 2,1 МБ в формате float32, а публикация сообщает измерённое среднее значение около 1,5 МБ на документ в ViDoRe v3. Команда объединила иерархическое объединение токенов, которое группирует похожие векторы документов и сохраняет среднее каждой кластера, с асимметричной квантизацией, где эмбеддинги документов хранятся в int8 или бинарной точности, а запросные эмбеддинги в реальном времени остаются более точными. В ViDoRe v3 публикация сообщает, что фактор объединения 10 при запросах и документах в int8 уменьшает объём хранения до 39 кБ на страницу, что в 39 раз меньше, при сохранении более 99 % базового nDCG@10. Более агрессивная настройка — фактор объединения 8 с запросами int8 и бинарными документами — использует 6 кБ на страницу, в 255 раз меньше, и сохраняет более 95 % качества поиска.
Команда также измерила пропускную способность кодирования с использованием предварительно обработанных тензоров изображений, подбирая размер пакета отдельно для каждой модели и размера изображения. При входе 2048×2048 на одной видеокарте NVIDIA L40S NeoMME‑Retriever‑260M кодирует около 51 страницы в секунду, почти вдвое быстрее, чем 26 стр/сек у ColModernVBERT, и публикация сообщает, что обе версии NeoMME‑Retriever работают быстрее остальных сравниваемых моделей при меньших разрешениях входных данных.
Все контрольные точки NeoMME выпущены под лицензией Apache 2.0 с реализацией «day‑zero» в Hugging Face Transformers, а демонстрация визуального поиска с генерацией доступна как Hugging Face Space. Для дообучения команда предоставляет отдельные контрольные точки для плотного и позднего взаимодействия, совместимые с Sentence Transformers v6, которая в текущий момент поддерживает одну голову поиска на модель; совместное обучение обеих голов требует класса NeoMMEForRetrieval с пользовательским Trainer.
Сопроводительный технический отчёт, написанный Aurélien Lac и Tony Wu, был отправлен в arXiv 31 августа 2026 года в категории информационного поиска. В благодарностях к публикации авторы описывают NeoMME как побочный проект, созданный при ограниченных ресурсах времени и вычислительных мощностей, и благодарят H Company за поддержку работы и предоставление вычислительных ресурсов, использованных для её обучения.












