AI 모델 및 플랫폼
H Company, 오픈소스 멀티모달 인코더 패밀리 NeoMME 출시

H Company 연구원들은 2026년 9월 3일에 NeoMME를 공개했으며, 이는 260M 및 800M 파라미터 규모의 멀티모달·다국어 인코더 패밀리로, 처음부터 학습되었으며 Apache 2.0 라이선스로 배포되었습니다. 팀은 파인튜닝된 검색 변형이 ViDoRe v3 시각 문서 검색 벤치마크에서 모델 크기 파레토 프론티어에 위치한다고 보고했습니다.
릴리스 포스트에 따르면, 최근 많은 시각 문서 검색 모델은 사전 학습된 생성형 비전-언어 모델을 기반으로 변형되었으며, 별도로 사전 학습된 비전 인코더가 시각 특징을 생성하고 이를 프로젝터가 인과 언어 모델의 입력 공간으로 매핑합니다. 저자들은 검색, 분류, 토큰 라벨링이 텍스트를 자동 회귀적으로 생성하지 않으므로 인과 디코더나 그에 따른 파라미터·연산 오버헤드가 필요하지 않다고 설명합니다. NeoMME는 대신 텍스트 토큰과 원시 이미지 패치를 하나의 공유 양방향 Transformer를 통해 처리하며, 기존의 사전 학습된 비전 타워, 텍스트 인코더, 텍스트 디코더를 기반으로 하지 않습니다.
이 포스트는 설계를 두 이전 인코더 시도와 비교합니다: 양방향 텍스트 인코더의 효율성을 향상시킨 ModernBERT와, ModernBERT 스타일 텍스트 인코더를 시각 문서 검색에 적용하면서 별도의 사전 학습된 SigLIP2 비전 타워를 유지한 ModernVBERT입니다. 저자들은 비전-언어 모델의 구성 요소를 인코더에 포함시키는 오버헤드를 제거하고자 했다고 밝혔습니다.
아키텍처 및 처음부터 사전 학습
NeoMME의 두 크기는 동일한 아키텍처를 공유합니다. 텍스트 입력은 팩터라이즈드 토큰 임베딩을 사용하고, 이미지는 겹치지 않는 32×32 패치 그리드로 나눈 뒤 작은 다층 퍼셉트론으로 투사합니다; 이후 두 입력 모두 동일한 Transformer 인코더에 들어갑니다. 이미지는 가로세로 비율과 크기를 유지하므로 모델은 작은 이미지보다 해상도가 높고 정보가 밀집된 문서 페이지에 더 많은 토큰을 할당할 수 있습니다. 컨텍스트 길이는 16,384 토큰으로, 최대 두 장의 표준 3840×2160 4K UHD 이미지를 처리할 수 있습니다. 대부분의 레이어는 대칭 슬라이딩 윈도우 어텐션을 사용하고, 매 6번째 레이어와 최종 레이어는 글로벌 어텐션을 사용합니다. 또한 스택에는 그룹화된 쿼리 어텐션, 쿼리-키 정규화, 게이트 어텐션, 2D 로터리 포지션 임베딩, 그리고 제곱 ReLU MLP가 포함됩니다. 텍스트의 경우, 팀은 다국어 텍스트, 코드, 수학, 그리고 기계가 생성한 이미지 전사에 대해 처음부터 131,072 토큰 어휘를 갖는 BPE 토크나이저를 학습했습니다.
NeoMME는 처음부터 이산 마스크 확산 텍스트 디노이저로 사전 학습됩니다. 텍스트 전용 예시에서는 손상 비율을 0과 1 사이에서 균등하게 샘플링하고, 해당 비율에 따라 각 텍스트 토큰을 독립적으로 마스킹합니다. 멀티모달 예시에서는 손상 비율을 0.3에서 1 사이로 설정하며, 이미지 패치는 그대로 두고 모델이 마스크된 텍스트를 복원합니다; 저자들은 강도 높은 마스킹이 모델이 언어 전용 지름길에 의존하지 않고 이미지 기반 설명을 학습하도록 만든다고 설명합니다. 사전 학습은 다국어 텍스트, 코드, 수학, 자연 이미지, 문서 이미지를 혼합하며, 각 모델은 약 5240억 개의 압축 입력 토큰을 처리하는데, 이 중 2900억 개는 텍스트 전용 예시에서 비롯됩니다. 이 텍스트 예산이 ModernBERT의 2조 훈련 토큰에 비해 작다는 점을 언급하며, 저자들은 데이터 효율성을 높이기 위해 NorMuon 옵티마이저를 선택했다고 밝혔습니다.
검색 파인튜닝 및 벤치마크 결과
백본을 하위 작업에 평가하기 위해 팀은 ColPali가 도입한 페이지-이미지 방법론을 사용해 시각 문서 검색을 위해 파인튜닝했습니다. 추출된 텍스트 청크를 검색하는 대신, NeoMME-Retriever는 문서 페이지의 스크린샷을 순위 매겨 OCR 전처리를 생략하고 레이아웃, 차트, 표, 타이포그래피를 보존합니다. 검색기는 백본에 두 개의 공동 학습 헤드를 추가합니다: 은닉 상태를 평균 풀링해 정규화된 벡터로 변환하는 밀집 헤드와, 각 텍스트 토큰 또는 이미지 패치를 128차원 정규화 벡터로 투사해 질의 토큰과 이미지 영역 간의 미세 매치를 유지하는 후기 상호작용 헤드입니다. 하나의 순전파에서 두 표현을 모두 반환합니다. 저자들은 일반적으로 후기 상호작용 임베딩을 권장하며, 매우 큰 코퍼스를 위해 밀집 검색 후 후기 상호작용 재순위 파이프라인을 제안합니다.
ViDoRe v3 벤치마크에서 포스트는 NeoMME-Retriever-260M의 nDCG@10이 0.523이라고 보고했으며, 이는 800M 파라미터 미만 모델 중 가장 높은 점수이며 ColQwen2.5와 0.002 차이 안에 있으면서 파라미터 수는 약 14배 적습니다. NeoMME-Retriever-800M은 0.556에 도달했으며, 이는 비슷한 규모의 Vultron Retriever Flash와 0.009 차이이며 두 모델 모두 벤치마크의 모델 크기 파레토 프론티어에 위치합니다. 포스트의 비교 표는 경쟁 모델 점수를 MTEB에서 가져온 것으로 표시하고, NeoMME 점수는 팀 자체 평가라고 명시합니다. nDCG@5를 사용하는 이전 ViDoRe v1 및 v2 벤치마크에서는 260M 모델이 ColModernVBERT와 두 배 큰 ColSmol‑500M보다 우수하고, 800M 모델은 파라미터가 3.6배 적음에도 불구하고 ColPali v1.3보다 뛰어나다고 보고했습니다.
NeoMME-260M-Retriever 모델 카드에는 263M 파라미터, 숨겨진 차원 1,024, BF16 가중치, 1,024 차원 밀집 임베딩이 있으며 Matryoshka 절단점이 128, 256, 512, 1,024 차원에 설정되어 있고, 128 차원 멀티벡터 출력도 함께 제공됩니다. 카드에는 또한 BEIR-15에서의 텍스트 검색 결과가 보고되어 있는데, 260M 검색기는 후기 상호작용을 사용할 때 nDCG@10이 0.4881이며 800M 모델은 0.5126을 기록했습니다.
압축, 인덱싱 처리량 및 가용성
후기 상호작용 저장은 임베딩 벡터 수에 비례해 선형적으로 증가하므로 고해상도 페이지의 인덱싱 비용이 높습니다: 2048×2048 페이지는 NeoMME-Retriever로 4,200개의 벡터를 생성하며, float32 기준 약 2.1 MB이며, 포스트는 ViDoRe v3 전체 문서당 평균 약 1.5 MB를 측정했다고 보고했습니다. 팀은 유사한 문서 벡터를 군집화하고 각 군집의 평균을 저장하는 계층형 토큰 풀링과, 문서 임베딩을 int8 또는 이진 정밀도로 저장하고 실시간 질의 임베딩은 높은 정밀도를 유지하는 비대칭 양자화를 결합했습니다. ViDoRe v3에서 풀링 팩터 10에 int8 질의와 문서를 적용하면 페이지당 저장 용량이 39 kB로 감소해 39배 압축되며, 기본 nDCG@10의 99% 이상을 유지합니다. 보다 공격적인 설정인 풀링 팩터 8에 int8 질의와 이진 문서를 적용하면 페이지당 6 kB, 즉 255배 작아지면서도 검색 품질의 95% 이상을 유지합니다.
팀은 또한 전처리된 이미지 텐서를 사용해 인코딩 처리량을 측정했으며, 배치 크기는 모델 및 이미지 크기에 따라 별도로 조정했습니다. 하나의 NVIDIA L40S GPU에서 2048×2048 입력을 동일하게 맞추었을 때, NeoMME-Retriever-260M은 초당 약 51 페이지를 인코딩하며, 이는 ColModernVBERT의 26 페이지 초당의 거의 두 배에 해당합니다. 포스트는 두 NeoMME-Retriever 모델 모두 입력 해상도가 낮은 경우 다른 비교 모델보다 빠르다고 보고했습니다.
모든 NeoMME 체크포인트는 Apache 2.0 라이선스로 제공되며 Hugging Face Transformers에 하루 만에 구현된 버전이 포함되고, 시각 검색 강화 생성 데모는 Hugging Face Space에서 이용할 수 있습니다. 파인튜닝을 위해 팀은 Sentence Transformers v6와 호환되는 별도의 밀집 및 후기 상호작용 체크포인트를 제공하는데, 현재 모델당 하나의 검색 헤드만 지원합니다; 두 헤드를 동시에 학습하려면 커스텀 Trainer와 함께 NeoMMEForRetrieval 클래스를 사용해야 합니다.
동봉된 기술 보고서는 Aurélien Lac와 Tony Wu가 작성했으며, 2026년 8월 31일 정보 검색 카테고리로 arXiv에 제출되었습니다. 포스트의 감사 섹션에서 저자들은 NeoMME를 제한된 시간과 연산 자원으로 만든 부수 프로젝트라고 설명하고, 작업을 지원하고 학습에 사용된 연산을 제공해 준 H Company에 감사를 표했습니다.












