Modele și platforme AI
H Company lansează NeoMME, o familie de codificatoare multimodale open-source

Cercetătorii de la H Company au lansat NeoMME pe 3 septembrie 2026, o familie de codificatoare multimodale și multilingve cu 260 M și 800 M de parametri, antrenate de la zero și publicate sub licența Apache 2.0. Variantele de recuperare ajustate fin se situează pe frontiera Pareto a dimensiunii modelului în cadrul benchmark-ului de recuperare a documentelor vizuale ViDoRe v3, conform echipei.
Conform postului de lansare, mulți dintre recenții recuperatori de documente vizuale sunt adaptați din modele generative pre-antrenate de tip viziune‑limbaj, în care un codificator de viziune antrenat separat produce caracteristici vizuale pe care un proiector le mapează în spațiul de intrare al unui model de limbaj cauzal. Recuperarea, clasificarea și etichetarea token‑urilor nu generează text autoregresiv, scriu autorii, astfel că aceste sarcini nu necesită un decodor cauzal sau costul său de parametri și calcul. NeoMME, în schimb, procesează token‑urile de text și patch‑urile brute de imagine printr-un singur Transformer bidirecțional partajat și nu se bazează pe niciun turn de viziune, codificator de text sau decodor de text pre‑antrenat.
Postul poziționează designul în raport cu două eforturi anterioare de codificare: ModernBERT, care a adus îmbunătățiri de eficiență codificatoarelor de text bidirecționale, și ModernVBERT, care a aplicat un codificator de text în stil ModernBERT pentru recuperarea de documente vizuale, menținând totodată un turn de viziune SigLIP2 pre‑antrenat separat. Autorii scriu că au dorit să elimine costul suplimentar al includerii componentelor unui model viziune‑limbaj într-un codificator.
Arhitectură și Pre-antrenare de la Zero
Ambele dimensiuni ale NeoMME împărtășesc aceeași arhitectură. Intrările de text utilizează încorporări de tokeni factorizați, în timp ce imaginile sunt împărțite într-o grilă de patch‑uri neîncadrate de 32×32 și proiectate printr-un mic perceptron multilayer; ambele sunt apoi introduse în același codificator Transformer. Imaginile își păstrează raportul de aspect și dimensiunea, astfel încât modelul poate aloca mai mulți tokeni unei pagini de document cu rezoluție înaltă și densitate informațională decât unei imagini mai mici. Lungimea de context este de 16.384 de tokeni, suficientă pentru până la două imagini standard 3840×2160 4K UHD. Majoritatea straturilor folosesc atenție simetrică cu fereastră glisantă, în timp ce fiecare al șaselea strat și stratul final utilizează atenție globală. Stiva include, de asemenea, atenție cu interogări grupate, normalizare interogare‑cheie, atenție cu poartă, încorporări de poziție rotary 2D și MLP-uri cu ReLU pătrat. Pentru text, echipa a antrenat un tokenizer BPE cu un vocabular de 131.072 de tokeni, de la zero, pe texte multilingve, cod, matematică și transcrieri de imagini generate de mașină.
NeoMME este pre‑antrenat de la zero ca un denoisor de text cu difuzie mască discretă. Pentru exemplele doar de text, rata de corupție este eșantionată uniform între 0 și 1, iar fiecare token de text eligibil este mascat independent la acea rată. Exemplele multimodale folosesc rate de corupție între 0,3 și 1, lăsând patch‑urile de imagine vizibile în timp ce modelul reconstruiește textul mascat; autorii scriu că mascarea intensă obligă modelul să învețe descrieri ancorate în imagine, în loc să se bazeze pe scurtături doar lingvistice. Pre‑antrenarea combină texte multilingve, cod, matematică, imagini naturale și imagini de documente, iar fiecare model procesează aproximativ 524 de miliarde de tokeni de intrare împachetați, inclusiv 290 de miliarde din exemple doar de text. Observând că acest buget de text este mic în comparație cu cele 2 trilioane de tokeni de antrenament ale ModernBERT, autorii scriu că au ales optimizerul NorMuon pentru a îmbunătăţi eficienţa datelor.
Ajustarea Fină a Recuperării și Rezultatele Benchmark-ului
Pentru a evalua scheletul pe o sarcină ulterioară, echipa l‑a ajustat fin pentru recuperarea de documente vizuale utilizând metodologia pagină‑imagine introdusă de ColPali. În loc să recupereze fragmente de text extrase, NeoMME‑Retriever ordonează capturi de ecran ale paginilor de document, ocolind preprocesarea OCR și păstrând aspectul, graficele, tabelele și tipografia. Recuperatorul adaugă două capete antrenate în comun scheletului: un cap dens care face media stărilor ascunse într-un vector normalizat și un cap de interacțiune târzie care proiectează fiecare token de text sau patch de imagine într-un vector normalizat de 128 de dimensiuni, păstrând potriviri fine între tokenii de interogare și regiunile imaginii. Un pas înainte returnează ambele reprezentări. Autorii recomandă în general încorporări de interacțiune târzie și un flux de lucru cu recuperare densă urmată de reordonare prin interacțiune târzie pentru corpuri foarte mari.
Pe benchmark‑ul ViDoRe v3, postul raportează un nDCG@10 de 0,523 pentru NeoMME‑Retriever‑260M, cel mai mare scor dintre modelele evaluate cu strict sub 800 M de parametri și la 0,002 de la ColQwen2.5, utilizând aproximativ 14 ori mai puțini parametri. NeoMME‑Retriever‑800M atinge 0,556, la 0,009 de la Vultron Retriever Flash de dimensiune similară, iar ambele modele se află pe frontiera Pareto a dimensiunii modelului din benchmark. Tabelul comparativ al postului marchează scorurile concurenților ca provenind din MTEB și scorurile NeoMME ca evaluări proprii ale echipei. Pe benchmark‑urile mai vechi ViDoRe v1 și v2, care utilizează nDCG@5, postul raportează că modelul de 260 M depășește ColModernVBERT și ColSmol‑500M, de două ori mai mare, în timp ce modelul de 800 M depășește ColPali v1.3 cu 3,6 ori mai puțini parametri.
Fișa de model pentru NeoMME‑260M‑Retriever enumeră 263 M de parametri, o dimensiune ascunsă de 1.024, greutăţi BF16 și încorporări dense de 1.024 de dimensiuni cu puncte de trunchiere Matryoshka la 128, 256, 512 și 1.024 de dimensiuni, alături de ieșirea multi‑vector de 128 de dimensiuni. Fișa raportează, de asemenea, rezultate de recuperare de text pe BEIR‑15, unde recuperatorul de 260 M obţine 0,4881 nDCG@10 cu interacţiune târzie, iar modelul de 800 M obţine 0,5126.
Compresie, Viteză de Indexare și Disponibilitate
Deoarece stocarea prin interacţiune târzie crește liniar cu numărul de vectori de încorporare, paginile cu rezoluție înaltă sunt costisitoare de indexat: o pagină de 2048×2048 produce 4.200 de vectori cu NeoMME‑Retriever, aproximativ 2,1 MB în float32, iar postul raportează o medie măsurată de aproximativ 1,5 MB pe document în cadrul ViDoRe v3. Echipa a combinat pool‑area ierarhică a token‑urilor, care grupează vectorii de documente similari și stochează media fiecărui grup, cu cuantizarea asimetrică, care stochează încorporările de documente la precizie int8 sau binară, menținând încorporările de interogare în timp real la precizie superioară. Pe ViDoRe v3, postul raportează că un factor de pool‑are de 10 cu interogări și documente int8 reduce stocarea la 39 kB pe pagină, o reducere de 39×, păstrând peste 99 % din nDCG@10 de bază. O setare mai agresivă, factor de pool‑are 8 cu interogări int8 și documente binare, folosește 6 kB pe pagină, de 255 de ori mai mică, și păstrează peste 95 % din calitatea recuperării.
Echipa a măsurat, de asemenea, debitul de codare utilizând tensori de imagine preprocesaţi, cu dimensiuni de batch calibrate separat pentru fiecare model și dimensiune de imagine. La o intrare de 2048×2048 pe o singură placă grafică NVIDIA L40S, NeoMME‑Retriever‑260M codifică aproximativ 51 de pagini pe secundă, aproape de două ori mai rapid decât cele 26 de pagini pe secundă ale ColModernVBERT, iar postul raportează că ambele dimensiuni NeoMME‑Retriever sunt mai rapide decât celelalte modele comparate la rezoluții de intrare mai mici.
Toate punctele de control NeoMME sunt lansate sub licența Apache 2.0 cu o implementare de tip day-zero în Hugging Face Transformers, iar o demonstrație de generare augmentată prin recuperare vizuală este disponibilă ca Hugging Face Space. Pentru ajustarea fină, echipa furnizează puncte de control dense și de interacţiune târzie separate, compatibile cu Sentence Transformers v6, care în prezent suportă un cap de recuperare per model; antrenarea simultană a ambelor capete necesită clasa NeoMMEForRetrieval cu un antrenor personalizat.
Raportul tehnic însoțitor, realizat de Aurélien Lac și Tony Wu, a fost trimis la arXiv pe 31 august 2026, în categoria de recuperare a informaţiilor. În mulțumirile postului, autorii descriu NeoMME ca un proiect secundar construit cu timp și resurse de calcul limitate și mulțumesc H Company pentru susținerea lucrării și furnizarea resurselor de calcul utilizate pentru antrenare.












