نماذج ومنصات الذكاء الاصطناعي
شركة H تُصدر NeoMME، عائلة مشفرات متعددة الوسائط مفتوحة المصدر

أصدر باحثو شركة H NeoMME في 3 سبتمبر 2026، عائلة من المشفرات متعددة الوسائط ومتعددة اللغات ذات 260 مليون و800 مليون معامل، تم تدريبها من الصفر ونُشرت تحت رخصة Apache 2.0.
وفقًا منشور الإصدار، تم تكييف العديد من مسترجعات المستندات البصرية الحديثة من نماذج رؤية‑لغة توليدية مُدربة مسبقًا، حيث ينتج مشفر رؤية مُدرب مسبقًا ميزات بصرية يقوم مُسقط بتحويلها إلى مساحة إدخال نموذج لغة سببي. لا تُولِّد الاسترجاع، التصنيف، ووضع العلامات على الرموز نصًا بصورة تلقائية، كما يكتب المؤلفون، لذا لا تتطلب هذه المهام مُفككًا سببيًا أو عبئه من المعاملات والحوسبة. بدلاً من ذلك، يمرّر NeoMME رموز النصوص وقطع الصور الخام عبر محول ثنائي الاتجاه مشترك ولا يعتمد على أي برج رؤية مُدرب مسبقًا، أو مشفر نصوص، أو مفكك نصوص.
يضع المنشور التصميم مقابل جهدي مشفرين سابقين: ModernBERT، الذي جلب تحسينات كفاءة للمشفرات النصية ذات الاتجاهين، وModernVBERT، الذي طبّق مشفر نصي على نمط ModernBERT على استرجاع المستندات البصرية مع الاحتفاظ ببرج رؤية SigLIP2 مُدرب مسبقًا منفصل. يكتب المؤلفون أنهم أرادوا إزالة عبء حمل مكونات نموذج رؤية‑لغة إلى المشفر.
الهندسة والتدريب من الصفر
يتشارك كلا حجمي NeoMME نفس الهندسة. تستخدم مدخلات النص تمثيلات رمزية مُجزأة، بينما تُقسم الصور إلى شبكة من الرقع غير المتداخلة بحجم 32×32 وتُسقط بواسطة شبكة عصبونية متعددة الطبقات صغيرة؛ ثم يدخل كلاهما إلى مشفر Transformer نفسه. تحتفظ الصور بنسبة أبعادها وحجمها، بحيث يمكن للنموذج تخصيص المزيد من الرموز لصفحة مستند عالية الدقة وكثيفة المعلومات مقارنة بصورة أصغر. طول السياق هو 16,384 رمزًا، وهو كافٍ لغاية صورتين قياس 3840×2160 بدقة 4K UHD. تستخدم معظم الطبقات انتباهًا متحركًا متماثلًا بنوافذ منزلقة، بينما كل طبقة سادسة والطبقة النهائية تستخدمان انتباهًا عالميًا. تشمل المجموعة أيضًا انتباهًا مجمعًا للاستعلامات، وتطبيع مفتاح‑استعلام، وانتباهًا مقفلًا، وتمثيلات موضعية دوارة ثنائية الأبعاد، وMLP ذات ReLU مربعة. بالنسبة للنص، درّبت المجموعة مُجزئ BPE مع مفردات 131,072 رمزًا من الصفر على نصوص متعددة اللغات، وشيفرات، ورياضيات، ونصوص صور مُنتجة آليًا.
يُدرب NeoMME من الصفر كمزيل ضوضاء نصي يعتمد على انتشار مقنع مقنَّع. بالنسبة للأمثلة النصية فقط، يُؤخذ معدل الفساد عشوائيًا من نطاق 0 إلى 1، ويُقَنع كل رمز نصي مؤهل بشكل مستقل بهذا المعدل. تستخدم الأمثلة المتعددة الوسائط معدلات فساد بين 0.3 و1، مع ترك رقع الصورة مرئية بينما يُعيد النموذج بناء النص المقنع؛ يكتب المؤلفون أن القناع المكثف يجبر النموذج على تعلم أوصاف مستندة إلى الصورة بدلاً من الاعتماد على اختصارات اللغة فقط. يخلط التدريب نصًا متعدد اللغات، وشيفرات، ورياضيات، وصورًا طبيعية، وصور مستندات، ويعالج كل نموذج حوالي 524 مليار رمز مدخل مُعبأ، بما في ذلك 290 مليار من الأمثلة النصية فقط. مشيرًا إلى أن هذه الميزانية النصية صغيرة مقارنةً بـ 2 تريليون رمز تدريب في ModernBERT، يكتب المؤلفون أنهم اختاروا مُحسّن NorMuon لتحسين كفاءة البيانات.
ضبط الاسترجاع وتحسين النتائج المرجعية
لتقييم العمود الفقري في مهمة لاحقة، قام الفريق بضبطه لاسترجاع المستندات البصرية باستخدام منهجية صفحة‑صورة التي قدمها ColPali. بدلاً من استرجاع قطع النص المستخرجة، يصنّف NeoMME‑Retriever لقطات صفحات المستندات، متجاوزًا مرحلة ما قبل معالجة OCR ومُحافظًا على التخطيط والرسوم البيانية والجداول والطباعة. يضيف المسترجع رأسين مدربين مشتركًا إلى العمود الفقري: رأس كثيف يجمع الحالات المخفية إلى متجه مُطبع، ورأس تفاعل متأخر يُسقط كل رمز نص أو رقعة صورة إلى متجه مُطبع أبعاده 128، محافظًا على التطابقات الدقيقة بين رموز الاستعلام ومناطق الصورة. تُعيد تمريرة أمامية واحدة كلا التمثيلين. يوصي المؤلفون باستخدام تمثيلات التفاعل المتأخر بشكل عام، وسلسلة من الاسترجاع الكثيف يليه إعادة ترتيب بالتفاعل المتأخر للمجموعات الضخمة من المستندات.
على معيار ViDoRe v3، يُبلغ المنشور عن nDCG@10 بقيمة 0.523 لـ NeoMME‑Retriever‑260M، وهو أعلى نتيجة بين النماذج المُقيمة التي تقل عدد معلماتها عن 800 مليون وتُقارب بفارق 0.002 من ColQwen2.5 مع استخدام حوالي 14 مرة أقل من المعلمات. يصل NeoMME‑Retriever‑800M إلى 0.556، بفارق 0.009 من Vultron Retriever Flash بحجم مماثل، وكلا النموذجين يقعان على حدّ Pareto لحجم النموذج في المعيار. تُظهر جدول المقارنة في المنشور أن درجات المنافسين مأخوذة من MTEB وأن درجات NeoMME هي تقييمات الفريق الخاصة. على معايير ViDoRe v1 و v2 القديمة، التي تستخدم nDCG@5، يُبلغ المنشور أن نموذج 260M يتفوق على ColModernVBERT وColSmol‑500M الأكبر ضعفًا، بينما يتفوق نموذج 800M على ColPali v1.3 مع 3.6 مرة أقل من المعلمات.
تُظهر بطاقة النموذج لـ NeoMME‑260M‑Retriever 263 مليون معامل، حجم مخفي 1,024، أوزان BF16، وتمثيلات كثيفة أبعادها 1,024 مع نقاط تقليم Matryoshka عند أبعاد 128،256،512، و1,024، إلى جانب مخرجات متعددة المتجهات بأبعاد 128. تُبلغ البطاقة أيضًا عن نتائج استرجاع النص على BEIR‑15، حيث يحقق المسترجع 260M درجة nDCG@10 بقيمة 0.4881 مع التفاعل المتأخر والنموذج 800M يحقق 0.5126.
الضغط، معدل الفهرسة، والتوافر
نظرًا لأن تخزين التفاعل المتأخر يتدرج خطيًا مع عدد متجهات التضمين، فإن صفحات الدقة العالية تكون مكلفة للفهرسة: صفحة بحجم 2048×2048 تُنتج 4,200 متجهًا باستخدام NeoMME‑Retriever، أي حوالي 2.1 ميغابايت بصيغة float32، ويُبلغ المنشور عن متوسط قياس حوالي 1.5 ميغابايت لكل مستند عبر ViDoRe v3. دمج الفريق تجميع الرموز الهرمي، الذي يُجمّع متجهات المستندات المتشابهة ويخزن متوسط كل مجموعة، مع التكميم غير المتماثل، الذي يخزن تضمينات المستندات بدقة int8 أو ثنائية مع الحفاظ على تضمينات الاستعلام بدقة أعلى أثناء التنفيذ. على ViDoRe v3، يُبلغ المنشور أن عامل التجميع 10 مع استعلامات ومستندات int8 يقلل التخزين إلى 39 كيلوبايت لكل صفحة، أي تخفيض 39×، مع الحفاظ على أكثر من 99٪ من nDCG@10 الأساسي. إعداد أكثر عدوانية، عامل التجميع 8 مع استعلامات int8 ومستندات ثنائية، يستخدم 6 كيلوبايت لكل صفحة، أصغر بـ 255 مرة، ويُحافظ على أكثر من 95٪ من جودة الاسترجاع.
قاس الفريق أيضًا معدل ترميز الصفحات باستخدام موترات صور مُعالجة مسبقًا، مع أحجام دفعات مُعايرة بشكل منفصل لكل نموذج وحجم صورة. عند إدخال 2048×2048 موحد على وحدة معالجة رسومات NVIDIA L40S واحدة، يُشفّر NeoMME‑Retriever‑260M حوالي 51 صفحة في الثانية، أي ما يقرب من ضعف سرعة NeoMME‑Retriever‑800M التي تُعالج 26 صفحة في الثانية، ويُبلغ المنشور أن كلا حجمي NeoMME‑Retriever أسرع من النماذج المقارنة الأخرى عند دقات إدخال أصغر.
جميع نقاط فحص NeoMME تُصدر تحت رخصة Apache 2.0 مع تنفيذ فوري في Hugging Face Transformers، وتتوفر تجربة توليد معززة بالاسترجاع البصري كمساحة Hugging Face. للتدريب الإضافي، يقدم الفريق نقاط فحص كثيفة وتفاعل متأخر منفصلة متوافقة مع Sentence Transformers v6، التي تدعم حاليًا رأس استرجاع واحد لكل نموذج؛ يتطلب تدريب الرأسين معًا فئة NeoMMEForRetrieval مع مدرب مخصص.
التقرير الفني، من تأليف أورليان لاك وتوني وو، قُدِّم إلى arXiv في 31 أغسطس 2026 في فئة استرجاع المعلومات. في شكر المنشور، يصف المؤلفون NeoMME كمشروع جانبي بُني بوقت وحوسبة محدودين، ويشكرون شركة H على دعم العمل وتوفير الحوسبة المستخدمة لتدريبه.












