Моделі та платформи ШІ
H Company випускає NeoMME, сімейство відкритих мультимодальних енкодерів

Дослідники H Company випустили NeoMME 3 вересня 2026 р., сімейство мультимодальних та багатомовних енкодерів з 260 млн та 800 млн параметрів, навчених з нуля та опублікованих під ліцензією Apache 2.0. Команда повідомляє, що варіанти з донастроюванням пошуку розташовані на фронтирі Парето за розміром моделі у бенчмарці ViDoRe v3 з візуального пошуку документів.
За даними повідомлення про випуск, багато сучасних систем пошуку візуальних документів адаптовані від попередньо навчених генеративних моделей «зір‑мова», у яких окремо навчений зоровий енкодер генерує візуальні ознаки, які проєктор переносить у простір входу каузальної мовної моделі. Автори зазначають, що пошук, класифікація та маркування токенів не генерують текст автрорегресивно, тому ці завдання не потребують каузального декодера та пов’язаних з ним параметрів і обчислювальних витрат. NeoMME натомість пропускає текстові токени та необроблені патчі зображень через один спільний двосторонній трансформер і не базується ні на якій існуючій попередньо навченій зоровій вежі, текстовому енкодері чи декодері.
У повідомленні дизайн порівнюється з двома попередніми спробами створення енкодерів: ModernBERT, який підвищив ефективність двосторонніх текстових енкодерів, та ModernVBERT, який застосував текстовий енкодер у стилі ModernBERT до пошуку візуальних документів, зберігаючи окрему попередньо навчену зорову вежу SigLIP2. Автори зазначають, що хотіли усунути накладні витрати на перенесення компонентів зорово‑мовної моделі в енкодер.
Архітектура та навчання з нуля
Обидва розміри NeoMME мають одну й ту ж архітектуру. Текстові входи використовують факторизовані токен‑ембедінги, тоді як зображення діляться на сітку неперекриваючих патчів 32×32 і проєктуються за допомогою малого багатошарового перцептрону; потім обидва передаються в один і той самий трансформер‑енкодер. Зображення зберігають своє співвідношення сторін та розмір, тому модель може витрачати більше токенів на високороздільну, інформативну сторінку документа, ніж на менше зображення. Довжина контексту становить 16 384 токени, що достатньо для до двох стандартних 3840×2160 4K UHD‑зображень. Більшість шарів використовують симетричну скользящу віконну увагу, а кожен шостий шар і останній шар застосовують глобальну увагу. Стек також включає груповану увагу запит‑ключ, нормалізацію запит‑ключ, гейтовану увагу, 2‑вимірні ротаційні позиційні ембедінги та MLP‑шари зі сквіч‑ReLU. Для тексту команда навчила BPE‑токенізатор з словником у 131 072 токени, створений з нуля на багатомовному тексті, коді, математиці та машинних транскрипціях зображень.
NeoMME навчається з нуля як дискретний маскований дифузійний денойзер тексту. Для прикладів лише з текстом рівень псування вибирається рівномірно в діапазоні від 0 до 1, і кожен придатний текстовий токен незалежно маскується з цим рівнем. У мультимодальних прикладах рівень псування варіюється між 0,3 та 1, причому патчі зображень залишаються видимими, а модель відновлює замаскований текст; автори зазначають, що інтенсивне маскування змушує модель вивчати описання, прив’язані до зображення, замість того, щоб покладатися лише на мовні скорочення. Під час навчання поєднуються багатомовний текст, код, математика, природні зображення та зображення документів, і кожна модель обробляє приблизно 524 млрд упакованих вхідних токенів, включаючи 290 млрд лише з текстових прикладів. Зауважуючи, що цей текстовий бюджет невеликий у порівнянні з 2 трильйонами навчальних токенів ModernBERT, автори пишуть, що обрали оптимізатор NorMuon для підвищення ефективності даних.
Донастроювання пошуку та результати бенчмарку
Щоб оцінити базову модель у прикладному завданні, команда донастроювала її для пошуку візуальних документів, використовуючи методологію «сторінка‑зображення», запропоновану ColPali. Замість пошуку витягнутих текстових фрагментів NeoMME‑Retriever ранжує скріншоти сторінок документів, обходячи попередню обробку OCR і зберігаючи розмітку, діаграми, таблиці та типографіку. Ретривер додає до базової моделі два спільно навчених головки: щільну головку, яка усереднює приховані стани у нормалізований вектор, та головку пізньої взаємодії, яка проєктує кожен текстовий токен або патч зображення у 128‑вимірний нормалізований вектор, зберігаючи детальні відповідності між токенами запиту та регіонами зображення. Один прямий прохід повертає обидва представлення. Автори загалом радять використовувати ембедінги пізньої взаємодії, а також конвеєр щільного пошуку з подальшим переранжируванням за допомогою пізньої взаємодії для дуже великих корпусів.
У бенчмарці ViDoRe v3 повідомляється nDCG@10 = 0.523 для NeoMME‑Retriever‑260M, найвищий результат серед оцінюваних моделей, що мають менше 800 млн параметрів, і лише на 0,002 відстає від ColQwen2.5, використовуючи приблизно в 14 разів менше параметрів. NeoMME‑Retriever‑800M досягає 0,556, що на 0,009 нижче у схожого за розміром Vultron Retriever Flash, і обидві моделі розташовані на фронтирі Парето за розміром моделі у цьому бенчмарку. У таблиці порівняння в повідомленні результати конкурентів взяті з MTEB, а результати NeoMME — це власна оцінка команди. На старіших бенчмарках ViDoRe v1 та v2, які використовують nDCG@5, зазначається, що модель 260 M перевершує ColModernVBERT та вдвічі більший ColSmol‑500M, тоді як модель 800 M перевершує ColPali v1.3, використовуючи в 3,6 рази менше параметрів.
Сторінка моделі NeoMME-260M-Retriever містить 263 млн параметрів, розмір прихованого стану 1 024, ваги BF16 та 1 024‑вимірні щільні ембедінги з точками обрізки Matryoshka на 128, 256, 512 і 1 024 вимірів, а також 128‑вимірний багатовекторний вихід. У картці також вказані результати текстового пошуку на BEIR‑15, де 260 M ретривер досягає 0,4881 nDCG@10 з пізньою взаємодією, а модель 800 M — 0,5126.
Компресія, швидкість індексації та доступність
Оскільки сховище пізньої взаємодії масштабується лінійно з кількістю векторів ембедінгів, індексація високороздільних сторінок є дорогою: сторінка 2048×2048 генерує 4 200 векторів за допомогою NeoMME‑Retriever, приблизно 2,1 МБ у форматі float32, і у повідомленні зазначено середнє виміряне значення близько 1,5 МБ на документ у ViDoRe v3. Команда поєднала ієрархічне пулінгове токенів, яке групує схожі вектори документів і зберігає середнє кожного кластера, з асиметричною квантизацією, що зберігає ембедінги документів у форматі int8 або бінарній точності, залишаючи запитні ембедінги в реальному часі з вищою точністю. У ViDoRe v3 повідомляється, що фактор пулінгу 10 при int8‑запитах і документах зменшує сховище до 39 кБ на сторінку, що становить скорочення в 39 разів, при збереженні понад 99 % базового nDCG@10. Більш агресивне налаштування — фактор пулінгу 8 з int8‑запитами та бінарними документами — використовує 6 кБ на сторінку, у 255 разів менше, і зберігає понад 95 % якості пошуку.
Команда також виміряла швидкість кодування, використовуючи попередньо оброблені тензори зображень, при цьому розмір пакету налаштовувався окремо для кожної моделі та розміру зображення. При вхідному розмірі 2048×2048 на одному GPU NVIDIA L40S NeoMME‑Retriever‑260M кодує приблизно 51 сторінку за секунду, майже вдвічі швидше за 26 сторінок за секунду у ColModernVBERT, і у повідомленні зазначено, що обидва розміри NeoMME‑Retriever швидші за інші порівнювані моделі при менших роздільних здатностях входу.
Всі контрольні точки NeoMME випущені під ліцензією Apache 2.0 з реалізацією «день‑нуль» у Hugging Face Transformers, а демонстрація візуального пошуку з доповненням генерації доступна як Hugging Face Space. Для донастроювання команда надає окремі контрольні точки для щільної та пізньої взаємодії, сумісні з Sentence Transformers v6, яка наразі підтримує одну головку пошуку на модель; навчання обох головок одночасно вимагає класу NeoMMEForRetrieval із кастомним Trainer.
Технічний звіт, підготовлений Aurélien Lac та Tony Wu, був поданий до arXiv 31 серпня 2026 р. у категорії інформаційного пошуку. У розділі подяки автори описують NeoMME як побічний проєкт, створений за обмежений час і обчислювальні ресурси, і дякують H Company за підтримку роботи та надання обчислювальних ресурсів, використаних для її навчання.












