Modely a platformy AI
Společnost H Company představuje NeoMME, otevřenou multimodální rodinu enkodérů

Výzkumníci ze společnosti H Company vydali NeoMME dne 3. září 2026, rodinu multimodálních a vícejazykových enkodérů s 260 M a 800 M parametry, které byly trénovány od nuly a publikovány pod licencí Apache 2.0. Podle týmu jsou varianty laděné na vyhledávání umístěny na Pareto‑frontě velikosti modelu v benchmarku ViDoRe v3 pro vizuální vyhledávání dokumentů.
Podle příspěvku k vydání je mnoho nedávných vyhledávačů vizuálních dokumentů odvozeno od předtrénovaných generativních modelů vidění‑jazyk, kde samostatně předtrénovaný vizuální enkodér vytváří vizuální rysy, které projektor převádí do vstupního prostoru kauzálního jazykového modelu. Cílení, klasifikace a označování tokenů negenerují text autoregresivně, píší autoři, a proto tyto úlohy nevyžadují kauzální dekodér ani související parametry a výpočetní náročnost. NeoMME místo toho zpracovává textové tokeny a surové obrazové patche jedním sdíleným obousměrným Transformerem a není založeno na žádné existující předtrénované vizuální věži, textovém enkodéru ani textovém dekodéru.
Příspěvek staví design proti dvěma dřívějším snahám o enkodéry: ModernBERT, který přinesl zlepšení efektivity obousměrných textových enkodérů, a ModernVBERT, který použil textový enkodér ve stylu ModernBERT pro vyhledávání vizuálních dokumentů a zároveň zachoval samostatnou předtrénovanou vizuální věž SigLIP2. Autoři uvádějí, že chtěli odstranit režii spojenou s přenášením komponent modelu vidění‑jazyk do enkodéru.
Architektura a trénink od nuly
Obě velikosti NeoMME sdílejí stejnou architekturu. Textové vstupy používají faktorizované tokenové embedování, zatímco obrázky jsou rozděleny na mřížku nepřekrývajících se patchů o rozměrech 32 × 32 a projekovány malým vícevrstvým perceptronem; oba pak vstupují do stejného Transformer enkodéru. Obrázky zachovávají svůj poměr stran a velikost, takže model může věnovat více tokenů vysokému rozlišení a informačně husté stránce dokumentu než menšímu obrázku. Délka kontextu je 16 384 tokenů, což stačí pro až dva standardní 3840 × 2160 4K UHD obrázky. Většina vrstev používá symetrickou pozornost s posuvným oknem, zatímco každá šestá vrstva a poslední vrstva používají globální pozornost. Stack také zahrnuje skupinovou pozornost dotazu, normalizaci dotaz‑klíč, řízenou pozornost, 2D rotační poziční embedování a MLP s kvadratickým ReLU. Pro text tým vytrénoval BPE tokenizér s 131 072‑tokenovým slovníkem od nuly na vícejazykovém textu, kódu, matematice a automaticky vytvořených přepisech obrázků.
NeoMME je předtrénováno od nuly jako diskrétní maskovaný difúzní denoiser textu. U příkladů pouze s textem se míra korupce vzorkuje rovnoměrně mezi 0 a 1 a každý oprávněný textový token je nezávisle maskován s touto pravděpodobností. Multimodální příklady používají míry korupce mezi 0,3 a 1, přičemž obrazové patche zůstávají viditelné, zatímco model rekonstruuje maskovaný text; autoři uvádějí, že silné maskování nutí model učit se popisy zakotvené v obraze místo spoléhání se na čistě jazykové zkratky. Předtrénování kombinuje vícejazykový text, kód, matematiku, přirozené obrázky a dokumentové obrázky a každý model zpracuje přibližně 524 miliard zabalených vstupních tokenů, včetně 290 miliard z příkladů jen s textem. Vzhledem k tomu, že tento textový rozpočet je malý ve srovnání s 2 triliardami tréninkových tokenů ModernBERT, autoři uvádějí, že zvolili optimalizátor NorMuon pro zlepšení datové efektivity.
Doladění pro vyhledávání a výsledky benchmarku
Pro vyhodnocení základního modelu na následné úloze tým doladil model pro vizuální vyhledávání dokumentů pomocí metodiky stránkových obrázků představené projektem ColPali. Místo vyhledávání extrahovaných úryvků textu NeoMME‑Retriever řadí snímky obrazovky stránek dokumentů, čímž obchází předzpracování OCR a zachovává rozvržení, grafy, tabulky a typografii. Vyhledávač přidává k základnímu modelu dvě společně trénovaná hlavičky: hustou hlavičku, která průměruje skryté stavy do normalizovaného vektoru, a hlavičku pozdní interakce, která projekuje každý textový token nebo obrazový patch do 128‑dimenzionálního normalizovaného vektoru, čímž zachovává detailní shody mezi tokeny dotazu a oblastmi obrazu. Jeden průchod vpřed vrací oba reprezentace. Autoři obecně doporučují embeddingy s pozdní interakcí a pipeline hustého vyhledávání následovaného přehodnocením s pozdní interakcí pro velmi rozsáhlé korpusy.
V benchmarku ViDoRe v3 příspěvek uvádí nDCG@10 = 0,523 pro NeoMME‑Retriever‑260M, což je nejvyšší výsledek mezi hodnocenými modely pod 800 M parametry a leží jen 0,002 za modelem ColQwen2.5 při použití přibližně 14‑krát méně parametrů. NeoMME‑Retriever‑800M dosahuje 0,556, což je do 0,009 od modelu Vultron Retriever Flash podobné velikosti, a oba modely leží na Pareto‑frontě velikosti modelu v benchmarku. Srovnávací tabulka v příspěvku označuje skóre konkurentů jako převzatá z MTEB a skóre NeoMME jako vlastní hodnocení týmu. Ve starších benchmarkech ViDoRe v1 a v2, které používají nDCG@5, příspěvek uvádí, že model 260 M překonává ColModernVBERT a dvojnásobně větší model ColSmol‑500M, zatímco model 800 M překonává ColPali v1.3 s 3,6‑krát méně parametry.
Karta modelu pro NeoMME‑260M‑Retriever uvádí 263 M parametrů, skrytou velikost 1 024, váhy BF16 a 1 024‑dimenzionální husté embedování s Matryoshka‑zkracovacími body na 128, 256, 512 a 1 024 dimenzích, spolu s 128‑dimenzionálním multi‑vektorovým výstupem. Karta také uvádí výsledky textového vyhledávání na BEIR‑15, kde 260 M retriever dosahuje nDCG@10 = 0,4881 s pozdní interakcí a model 800 M dosahuje 0,5126.
Komprese, propustnost indexování a dostupnost
Protože úložiště s pozdní interakcí roste lineárně s počtem embedovacích vektorů, jsou stránky s vysokým rozlišením nákladné na indexování: stránka 2048 × 2048 generuje 4 200 vektorů pomocí NeoMME‑Retriever, což představuje přibližně 2,1 MB v float32, a příspěvek uvádí měřený průměr asi 1,5 MB na dokument napříč ViDoRe v3. Tým zkombinoval hierarchické seskupování tokenů, které shlukuje podobné vektory dokumentů a ukládá průměr každého shluku, s asymetrickou kvantizací, která ukládá embedování dokumentů v int8 nebo binární přesnosti, zatímco dotazové embedování v reálném čase zůstává ve vyšší přesnosti. V benchmarku ViDoRe v3 příspěvek uvádí, že faktor seskupování 10 s int8 dotazy a dokumenty sníží úložiště na 39 kB na stránku, což je 39‑násobné zmenšení, a přitom si zachová více než 99 % základního nDCG@10. Aggresivnější nastavení, faktor seskupování 8 s int8 dotazy a binárními dokumenty, používá 6 kB na stránku, což je 255‑krát méně, a zachovává více než 95 % kvality vyhledávání.
Tým také měřil propustnost kódování pomocí předzpracovaných obrazových tenzorů, přičemž velikosti batchů byly kalibrovány samostatně pro každý model a velikost obrazu. Při shodném vstupu 2048 × 2048 na jedné GPU NVIDIA L40S NeoMME‑Retriever‑260M kóduje přibližně 51 stránek za sekundu, což je téměř dvakrát více než 26 stránek za sekundu u ColModernVBERT, a příspěvek uvádí, že oba NeoMME‑Retriever modely jsou rychlejší než ostatní srovnávané modely při menších rozlišeních vstupu.
Všechny kontrolní body NeoMME jsou vydány pod licencí Apache 2.0 s implementací „day‑zero“ v Hugging Face Transformers a demo vizuálního vyhledávání doplněného generací je k dispozici jako Hugging Face Space. Pro doladění tým poskytuje samostatné kontrolní body pro husté a pozdní interakce kompatibilní se Sentence Transformers v6, která v současnosti podporuje jednu hlavičku vyhledávání na model; trénování obou hlaviček najednou vyžaduje třídu NeoMMEForRetrieval s vlastním Trainerem.
Přiložená technická zpráva od Auréliena Laca a Tonyho Wu byla 31. srpna 2026 odeslána na arXiv v kategorii informačního vyhledávání. V poděkováních v příspěvku autoři popisují NeoMME jako vedlejší projekt vytvořený s omezeným časem a výpočetní kapacitou a děkují společnosti H Company za podporu práce a poskytnutí výpočetních prostředků použitého při trénování.












