AI-modeller och plattformar
H Company lanserar NeoMME, en öppen källkodsmultimodal kodarfamilj

Forskare på H Company släppte NeoMME den 3 september 2026, en familj av multimodala och flerspråkiga kodare med 260 M respektive 800 M parametrar som tränats från grunden och publicerats under Apache 2.0‑licensen. Finjusterade återhämtningsvarianter ligger på modellstorlekens Pareto‑frontier i ViDoRe v3‑benchmark för visuell dokumentåtervinning, rapporterade teamet.
Enligt publiceringsinlägg är många nya återvinnare av visuella dokument anpassade från förtränade generativa vision‑språk‑modeller, där en separat förtränad vision‑kodare producerar visuella funktioner som en projektor mappar in i ett kausalt språkmodells inmatningsutrymme. Återvinning, klassificering och token‑märkning genererar inte text autoregressivt, skriver författarna, så dessa uppgifter kräver ingen kausal avkodare eller dess parameter‑ och beräkningskostnad. NeoMME kör istället text‑tokens och råa bild‑patchar genom en gemensam bidirektionell Transformer och bygger inte på någon befintlig förtränad vision‑torn, textkodare eller textavkodare.
Inlägget placerar designen i förhållande till två tidigare kodarförsök: ModernBERT, som införde effektivitetsförbättringar för bidirektionella textkodare, och ModernVBERT, som använde en ModernBERT‑liknande textkodare för visuell dokumentåtervinning samtidigt som den behöll ett separat förtränat SigLIP2‑vision‑torn. Författarna skriver att de ville eliminera kostnaden för att föra med sig komponenter från en vision‑språk‑modell in i en kodare.
Arkitektur och förtränings från grunden
Båda NeoMME‑storlekarna delar samma arkitektur. Textinmatningar använder faktoriserade token‑inbäddningar, medan bilder delas in i ett rutnät av icke‑överlappande 32 × 32‑patchar och projiceras med ett litet flerskikts‑perceptron; därefter går båda in i samma Transformer‑kodare. Bilder behåller sitt bildförhållande och storlek, så modellen kan använda fler tokens på en högupplöst, informationsrik dokumentsida än på en mindre bild. Kontextlängden är 16 384 tokens, tillräckligt för upp till två standard 3840 × 2160 4K‑UHD‑bilder. De flesta lager använder symmetrisk sliding‑window‑attention, medan var sjätte lager och det sista lagret använder global attention. Stapeln innehåller även grouped‑query‑attention, query‑key‑normalisering, gated‑attention, 2D‑roterande positions‑inbäddningar och squared‑ReLU‑MLP‑er. För text tränade teamet en BPE‑tokeniserare med ett ordförråd på 131 072 tokens från grunden på flerspråkig text, kod, matematik och maskintillverkade bild‑transkript.
NeoMME förtränas från grunden som en diskret maskerad‑diffusions‑text‑denoiser. För enbart textexempel samplas en korruptionsgrad jämnt mellan 0 och 1, och varje berättigad texttoken maskeras oberoende med den graden. Multimodala exempel använder korruptionsgrader mellan 0,3 och 1, där bild‑patcharna förblir synliga medan modellen rekonstruerar maskerad text; författarna skriver att tung maskering tvingar modellen att lära sig bild‑förankrade beskrivningar snarare än att förlita sig på enbart språk‑genvägar. Förträningen blandar flerspråkig text, kod, matematik, naturliga bilder och dokumentbilder, och varje modell bearbetar cirka 524 miljarder packade inmatningstoken, inklusive 290 miljarder från enbart textexempel. Med tanke på att denna textbudget är liten i förhållande till ModernBERT:s 2 triljon tränings‑tokens, skriver författarna att de valde NorMuon‑optimeraren för att förbättra datatillströmning.
Finjustering för återvinning och benchmarkresultat
För att utvärdera ryggraden på en nedströmsuppgift finjusterade teamet den för visuell dokumentåtervinning med hjälp av den sid‑bild‑metod som introducerades av ColPali. Istället för att återvinna extraherade textbitar rangordnar NeoMME‑Retriever skärmdumpar av dokumentsidor, vilket kringgår OCR‑förbehandling och bevarar layout, diagram, tabeller och typografi. Återvinnaren lägger till två gemensamt tränade huvuden på ryggraden: ett tätt huvud som medelvärdes‑poolar dolda tillstånd till en normaliserad vektor, och ett sen‑interaktions‑huvud som projicerar varje texttoken eller bild‑patch till en 128‑dimensionell normaliserad vektor, vilket bevarar fin‑granulära matchningar mellan frågetoken och bildregioner. Ett framåtpas ger båda representationerna. Författarna rekommenderar i allmänhet sen‑interaktions‑inbäddningar samt en pipeline med tät återvinning följt av sen‑interaktions‑omrankning för mycket stora korpusar.
På ViDoRe v3‑benchmarken rapporterar inlägget ett nDCG@10 på 0,523 för NeoMME‑Retriever‑260M, den högsta poängen bland utvärderade modeller som strikt ligger under 800 M parametrar och inom 0,002 från ColQwen2.5 samtidigt som den använder cirka 14 gånger färre parametrar. NeoMME‑Retriever‑800M når 0,556, inom 0,009 från den liknande storleken Vultron Retriever Flash, och båda modellerna ligger på benchmarkens modellstorleks‑Pareto‑frontier. Inläggets jämförelsetabell markerar konkurrenternas poäng som hämtade från MTEB och NeoMME‑poängen som teamets egna utvärderingar. På de äldre ViDoRe v1‑ och v2‑benchmarkarna, som använder nDCG@5, rapporterar inlägget att 260 M‑modellen slår ColModernVBERT och den dubbelt så stora ColSmol‑500M, medan 800 M‑modellen slår ColPali v1.3 med 3,6 gånger färre parametrar.
Det modellkort för NeoMME-260M-Retriever listar 263 M parametrar, en dold storlek på 1 024, BF16‑vikter och 1 024‑dimensionella täta inbäddningar med Matryoshka‑trunkeringspunkter vid 128, 256, 512 och 1 024 dimensioner, tillsammans med den 128‑dimensionella multi‑vektor‑utgången. Kortet rapporterar även text‑återvinningsresultat på BEIR‑15, där 260 M‑återvinnaren får 0,4881 nDCG@10 med sen interaktion och 800 M‑modellen får 0,5126.
Kompression, indexeringsgenomströmning och tillgänglighet
Eftersom lagring för sen interaktion skalar linjärt med antalet inbäddningsvektorer är högupplösta sidor dyra att indexera: en 2048 × 2048‑sida producerar 4 200 vektorer med NeoMME‑Retriever, cirka 2,1 MB i float32, och inlägget rapporterar ett uppmätt genomsnitt på cirka 1,5 MB per dokument över ViDoRe v3. Teamet kombinerade hierarkisk token‑poolning, som klustrar liknande dokumentvektorer och lagrar varje klusters medelvärde, med asymmetrisk kvantisering, som lagrar dokument‑inbäddningar i int8‑ eller binär precision medan fråge‑inbäddningar hålls i högre precision i realtid. På ViDoRe v3 rapporterar inlägget att en poolningsfaktor på 10 med int8‑frågor och dokument minskar lagringen till 39 kB per sida, en 39‑gångs reduktion, samtidigt som mer än 99 % av baslinjens nDCG@10 behålls. En mer aggressiv inställning, poolningsfaktor 8 med int8‑frågor och binära dokument, använder 6 kB per sida, 255 gånger mindre, och behåller mer än 95 % av återvinningskvaliteten.
Teamet mätte också kodningsgenomströmning med förprocessade bild‑tensorer, med batch‑storlekar kalibrerade separat för varje modell och bildstorlek. Vid en matchad 2048 × 2048‑indata på en NVIDIA L40S‑GPU kodar NeoMME‑Retriever‑260M ungefär 51 sidor per sekund, nästan dubbelt så snabbt som ColModernVBERT:s 26 sidor per sekund, och inlägget rapporterar att båda NeoMME‑Retriever‑storlekarna är snabbare än de andra jämförda modellerna vid mindre indataupplösningar.
Alla NeoMME‑kontrollpunkter släpps under Apache 2.0 med en dag‑noll‑implementation i Hugging Face Transformers, och en demo för visuellt återvinnings‑förstärkt generering finns tillgänglig som ett Hugging Face Space. För finjustering tillhandahåller teamet separata täta och sen‑interaktions‑kontrollpunkter kompatibla med Sentence Transformers v6, som för närvarande stödjer ett återvinnings‑huvud per modell; att träna båda huvuden samtidigt kräver klassen NeoMMEForRetrieval med en anpassad Trainer.
Den medföljande teknisk rapport, av Aurélien Lac och Tony Wu, lämnades in till arXiv den 31 augusti 2026 i kategorin informationsåtervinning. I inläggets tacksektion beskriver författarna NeoMME som ett sidoprojekt byggt med begränsad tid och beräkningskapacitet, och tackar H Company för att ha stödjat arbetet och tillhandahållit den beräkningskraft som användes för att träna det.












