एआई मॉडल और प्लेटफ़ॉर्म
H Company ने NeoMME जारी किया, एक ओपन‑सोर्स मल्टीमॉडल एन्कोडर परिवार

H Company के शोधकर्ताओं ने 3 सितंबर, 2026 को NeoMME जारी किया, जो 260M और 800M पैरामीटर वाले मल्टीमॉडल और बहुभाषी एन्कोडर का परिवार है, जिसे शून्य से प्रशिक्षित किया गया और Apache 2.0 लाइसेंस के तहत प्रकाशित किया गया। टीम ने बताया कि फाइन‑ट्यून किए गए रिट्रीवल वेरिएंट ViDoRe v3 विज़ुअल डॉक्यूमेंट रिट्रीवल बेंचमार्क के मॉडल‑साइज़ पैरिटो फ्रंटियर पर स्थित हैं।
रिलीज़ पोस्ट के अनुसार, कई हालिया विज़ुअल डॉक्यूमेंट रिट्रीवर्स प्रीट्रेंड जेनरेटिव विज़न‑लैंग्वेज मॉडल से अनुकूलित किए गए हैं, जिसमें अलग से प्रीट्रेंड विज़न एन्कोडर दृश्य विशेषताएँ उत्पन्न करता है जिन्हें एक प्रोजेक्टर कारणात्मक भाषा मॉडल के इनपुट स्पेस में मैप करता है। लेखकों ने लिखा है कि रिट्रीवल, वर्गीकरण और टोकन लेबलिंग टेक्स्ट को ऑटोरिग्रेसिव रूप से उत्पन्न नहीं करतीं, इसलिए इन कार्यों को कारणात्मक डिकोडर या उसकी पैरामीटर एवं गणना ओवरहेड की आवश्यकता नहीं होती। NeoMME इसके बजाय टेक्स्ट टोकन और कच्चे इमेज पैच को एक साझा द्विदिश ट्रांसफ़ॉर्मर के माध्यम से चलाता है और यह किसी मौजूदा प्रीट्रेंड विज़न टॉवर, टेक्स्ट एन्कोडर या टेक्स्ट डिकोडर पर आधारित नहीं है।
पोस्ट इस डिज़ाइन को दो पहले के एन्कोडर प्रयासों के खिलाफ रखती है: ModernBERT, जिसने द्विदिश टेक्स्ट एन्कोडर्स में दक्षता सुधार लाए, और ModernVBERT, जिसने ModernBERT‑शैली के टेक्स्ट एन्कोडर को विज़ुअल डॉक्यूमेंट रिट्रीवल में लागू किया जबकि एक अलग प्रीट्रेंड SigLIP2 विज़न टॉवर को बरकरार रखा। लेखक लिखते हैं कि उन्होंने विज़न‑लैंग्वेज मॉडल के घटकों को एन्कोडर में ले जाने के ओवरहेड को हटाना चाहा।
आर्किटेक्चर और शून्य से प्री‑ट्रेनिंग
NeoMME के दोनों आकार एक ही आर्किटेक्चर साझा करते हैं। टेक्स्ट इनपुट फैक्टोराइज़्ड टोकन एम्बेडिंग का उपयोग करते हैं, जबकि छवियों को 32×32 के गैर‑ओवरलैपिंग पैचों की ग्रिड में विभाजित किया जाता है और एक छोटे मल्टी‑लेयर परसेप्ट्रॉन से प्रोजेक्ट किया जाता है; दोनों फिर समान ट्रांसफ़ॉर्मर एन्कोडर में प्रवेश करते हैं। छवियों का पहलू अनुपात और आकार बरकरार रहता है, इसलिए मॉडल उच्च‑रिज़ॉल्यूशन, सूचना‑घनी दस्तावेज़ पृष्ठ पर छोटे इमेज की तुलना में अधिक टोकन खर्च कर सकता है। कॉन्टेक्स्ट लंबाई 16,384 टोकन है, जो दो मानक 3840×2160 4K UHD छवियों तक के लिए पर्याप्त है। अधिकांश लेयर्स सममित स्लाइडिंग‑विंडो अटेंशन का उपयोग करती हैं, जबकि हर छठी लेयर और अंतिम लेयर ग्लोबल अटेंशन का उपयोग करती हैं। इस स्टैक में ग्रुप्ड‑क्वेरी अटेंशन, क्वेरी‑की नॉर्मलाइज़ेशन, गेटेड अटेंशन, 2D रोटरी पोज़िशन एम्बेडिंग, और स्क्वेयर्ड‑ReLU MLPs भी शामिल हैं। टेक्स्ट के लिए, टीम ने बहुभाषी टेक्स्ट, कोड, गणित, और मशीन‑उत्पन्न इमेज ट्रांसक्रिप्ट पर शून्य से 131,072‑टोकन शब्दावली के साथ BPE टोकनाइज़र प्रशिक्षित किया।
NeoMME को शून्य से एक डिस्क्रीट मास्क्ड‑डिफ्यूज़न टेक्स्ट डीनॉइज़र के रूप में प्री‑ट्रेन किया गया है। टेक्स्ट‑केवल उदाहरणों के लिए, क्षति दर को 0 से 1 के बीच समान रूप से सैंपल किया जाता है, और प्रत्येक योग्य टेक्स्ट टोकन को स्वतंत्र रूप से उस दर पर मास्क किया जाता है। मल्टीमॉडल उदाहरण 0.3 से 1 के बीच क्षति दरों का उपयोग करते हैं, जहाँ इमेज पैच दृश्यमान रहते हैं जबकि मॉडल मास्क्ड टेक्स्ट को पुनर्निर्मित करता है; लेखक लिखते हैं कि भारी मास्किंग मॉडल को भाषा‑केवल शॉर्टकट्स पर निर्भर रहने के बजाय इमेज‑आधारित विवरण सीखने के लिए मजबूर करता है। प्री‑ट्रेनिंग में बहुभाषी टेक्स्ट, कोड, गणित, प्राकृतिक छवियाँ और दस्तावेज़ छवियों का मिश्रण होता है, और प्रत्येक मॉडल लगभग 524 बिलियन पैक्ड इनपुट टोकन प्रोसेस करता है, जिसमें 290 बिलियन टेक्स्ट‑केवल उदाहरणों से आते हैं। यह नोट करते हुए कि यह टेक्स्ट बजट ModernBERT के 2 ट्रिलियन प्रशिक्षण टोकन की तुलना में छोटा है, लेखक लिखते हैं कि उन्होंने डेटा दक्षता बढ़ाने के लिए NorMuon ऑप्टिमाइज़र चुना।
रिट्रीवल फाइन‑ट्यूनिंग और बेंचमार्क परिणाम
बैकबोन को डाउनस्ट्रीम कार्य पर मूल्यांकन करने के लिए, टीम ने इसे विज़ुअल डॉक्यूमेंट रिट्रीवल के लिए फाइन‑ट्यून किया, जिसमें ColPali द्वारा प्रस्तुत पेज‑इमेज पद्धति का उपयोग किया गया। निकाले गए टेक्स्ट चंक्स को रिट्रीव करने के बजाय, NeoMME‑Retriever दस्तावेज़ पृष्ठों के स्क्रीनशॉट को रैंक करता है, OCR प्री‑प्रोसेसिंग को बायपास करता है और लेआउट, चार्ट, टेबल और टाइपोग्राफी को संरक्षित रखता है। रिट्रीवर बैकबोन में दो संयुक्त रूप से प्रशिक्षित हेड जोड़ता है: एक डेंस हेड जो हिडन स्टेट्स को औसत‑पूल करके एक सामान्यीकृत वेक्टर बनाता है, और एक लेट‑इंटरैक्शन हेड जो प्रत्येक टेक्स्ट टोकन या इमेज पैच को 128‑डायमेंशनल सामान्यीकृत वेक्टर में प्रोजेक्ट करता है, जिससे क्वेरी टोकन और इमेज क्षेत्रों के बीच सूक्ष्म मिलान संरक्षित रहता है। एक फॉरवर्ड पास दोनों प्रतिनिधित्व लौटाता है। लेखक सामान्य रूप से लेट‑इंटरैक्शन एम्बेडिंग की सिफारिश करते हैं, और बहुत बड़े कॉर्पस के लिए डेंस रिट्रीवल के बाद लेट‑इंटरैक्शन री‑रैंकिंग की पाइपलाइन सुझाते हैं।
ViDoRe v3 बेंचमार्क पर, पोस्ट ने NeoMME‑Retriever‑260M के लिए nDCG@10 को 0.523 बताया, जो 800M पैरामीटर से कम वाले मूल्यांकित मॉडलों में सबसे उच्च स्कोर है और ColQwen2.5 से 0.002 के अंतर में है, जबकि यह लगभग 14 गुना कम पैरामीटर उपयोग करता है। NeoMME‑Retriever‑800M 0.556 तक पहुँचता है, जो समान आकार के Vultron Retriever Flash से 0.009 के अंतर में है, और दोनों मॉडल बेंचमार्क के मॉडल‑साइज़ पैरिटो फ्रंटियर पर स्थित हैं। पोस्ट की तुलना तालिका प्रतियोगी स्कोर को MTEB से प्राप्त स्रोत के रूप में और NeoMME स्कोर को टीम के अपने मूल्यांकन के रूप में दर्शाती है। पुराने ViDoRe v1 और v2 बेंचमार्क, जो nDCG@5 का उपयोग करते हैं, पर पोस्ट ने बताया कि 260M मॉडल ColModernVBERT और दो गुना बड़े ColSmol‑500M से बेहतर प्रदर्शन करता है, जबकि 800M मॉडल 3.6 गुना कम पैरामीटर के साथ ColPali v1.3 से बेहतर है।
NeoMME‑260M‑Retriever के मॉडल कार्ड में 263M पैरामीटर, 1,024 का हिडन साइज, BF16 वज़न, और 1,024‑डायमेंशनल डेंस एम्बेडिंग्स को Matryoshka ट्रंकेशन पॉइंट्स 128, 256, 512, और 1,024 डायमेंशन पर दर्शाया गया है, साथ ही 128‑डायमेंशनल मल्टी‑वेक्टर आउटपुट भी है। कार्ड में BEIR‑15 पर टेक्स्ट‑रिट्रीवल परिणाम भी बताए गए हैं, जहाँ 260M रिट्रीवर लेट‑इंटरैक्शन के साथ 0.4881 nDCG@10 स्कोर करता है और 800M मॉडल 0.5126 स्कोर करता है।
संपीड़न, इंडेक्सिंग थ्रूपुट, और उपलब्धता
क्योंकि लेट‑इंटरैक्शन स्टोरेज एम्बेडिंग वेक्टरों की संख्या के साथ रैखिक रूप से स्केल करता है, उच्च‑रिज़ॉल्यूशन पृष्ठों का इंडेक्स बनाना महंगा होता है: 2048×2048 पृष्ठ NeoMME‑Retriever के साथ 4,200 वेक्टर उत्पन्न करता है, लगभग 2.1 MB float32 में, और पोस्ट ने ViDoRe v3 में प्रति दस्तावेज़ लगभग 1.5 MB औसत मापी गई है। टीम ने हाइरार्किकल टोकन पूलिंग को जोड़ा, जो समान दस्तावेज़ वेक्टरों को क्लस्टर करता है और प्रत्येक क्लस्टर का औसत संग्रहीत करता है, साथ ही एसिमेट्रिक क्वांटाइज़ेशन, जो दस्तावेज़ एम्बेडिंग को int8 या बाइनरी प्रिसीजन पर संग्रहीत करता है जबकि ऑन‑द‑फ़्लाई क्वेरी एम्बेडिंग को उच्च प्रिसीजन पर रखता है। ViDoRe v3 पर पोस्ट ने बताया कि int8 क्वेरी और दस्तावेज़ों के साथ पूलिंग फैक्टर 10 स्टोरेज को प्रति पृष्ठ 39 kB तक घटा देता है, जो 39× कमी है, जबकि बेसलाइन nDCG@10 का 99 % से अधिक रखता है। अधिक आक्रामक सेटिंग, पूलिंग फैक्टर 8 के साथ int8 क्वेरी और बाइनरी दस्तावेज़, प्रति पृष्ठ 6 kB उपयोग करती है, जो 255 गुना छोटा है, और रिट्रीवल गुणवत्ता का 95 % से अधिक रखती है।
टीम ने प्री‑प्रोसेस्ड इमेज टेंसर का उपयोग करके एन्कोडिंग थ्रूपुट भी मापा, जिसमें बैच साइज प्रत्येक मॉडल और इमेज साइज के लिए अलग से कैलिब्रेट की गई। एक NVIDIA L40S GPU पर 2048×2048 इनपुट के साथ, NeoMME‑Retriever‑260M लगभग 51 पृष्ठ प्रति सेकंड एन्कोड करता है, जो ColModernVBERT के 26 पृष्ठ प्रति सेकंड से लगभग दो गुना तेज है, और पोस्ट ने बताया कि दोनों NeoMME‑Retriever आकार छोटे इनपुट रिज़ॉल्यूशन पर अन्य तुलना किए गए मॉडलों से तेज हैं।
सभी NeoMME चेकपॉइंट्स Apache 2.0 के तहत जारी किए गए हैं, साथ ही Hugging Face Transformers में डे‑ज़ीरो इम्प्लीमेंटेशन उपलब्ध है, और एक विज़ुअल रिट्रीवल‑ऑगमेंटेड जेनरेशन डेमो Hugging Face Space के रूप में उपलब्ध है। फाइन‑ट्यूनिंग के लिए, टीम अलग‑अलग डेंस और लेट‑इंटरैक्शन चेकपॉइंट्स प्रदान करती है जो Sentence Transformers v6 के साथ संगत हैं, जो वर्तमान में प्रत्येक मॉडल के लिए एक रिट्रीवल हेड का समर्थन करता है; दोनों हेड्स को एक साथ प्रशिक्षित करने के लिए NeoMMEForRetrieval क्लास के साथ एक कस्टम ट्रेनर की आवश्यकता होती है।
साथ में दिया गया तकनीकी रिपोर्ट, Aurélien Lac और Tony Wu द्वारा, 31 अगस्त, 2026 को arXiv में सूचना रिट्रीवल श्रेणी में सबमिट किया गया था। पोस्ट के आभार व्यक्त करने वाले भाग में, लेखक NeoMME को सीमित समय और कंप्यूट के साथ निर्मित एक साइड प्रोजेक्ट के रूप में वर्णित करते हैं, और H Company को काम का समर्थन करने और इसे प्रशिक्षित करने के लिए उपयोग किए गए कंप्यूट प्रदान करने के लिए धन्यवाद देते हैं।












