AI-modeller og plattformer
H Company lanserer NeoMME, en åpen kildekode multimodal kodingsfamilie

Forskere ved H Company publiserte NeoMME 3. september 2026, en familie med 260 M‑ og 800 M‑parameter‑multimodale og flerspråklige kodere som er trent fra bunnen av og gjort tilgjengelige under Apache 2.0‑lisensen. Finjusterte hente‑varianter befinner seg på modellstørrelsens Pareto‑front i ViDoRe v3‑benchmarken for visuell dokumenthenting, rapporterte teamet.
Ifølge lanseringsinnlegget er mange av de nyere visuelle dokumenthenterne tilpasset fra forhåndstrente generative syn‑språk‑modeller, der en separat forhåndstrent visuell enkoder produserer visuelle trekk som en projeksjon mapper inn i et kausalt språkmodells inndata‑rom. Henting, klassifisering og token‑merking genererer ikke tekst autoregressivt, skriver forfatterne, så disse oppgavene krever ikke en kausal dekoder eller dens parameter‑ og beregningskostnad. NeoMME kjører i stedet tekst‑token og rå bilde‑patcher gjennom én delt to‑veis Transformer og er ikke basert på noen eksisterende forhåndstrent visuell tårn, tekst‑enkoder eller tekst‑dekoder.
Innlegget stiller designet opp mot to tidligere enkoderefforts: ModernBERT, som brakte effektivitetsforbedringer til to‑veis tekst‑enkodere, og ModernVBERT, som anvendte en ModernBERT‑stil tekst‑enkoder på visuell dokumenthenting mens den beholdt et separat forhåndstrent SigLIP2‑visuelt tårn. Forfatterne skriver at de ønsket å fjerne overheaden ved å bære komponenter fra en syn‑språk‑modell inn i en enkoder.
Arkitektur og opplæring fra bunnen av
Begge NeoMME‑størrelsene deler samme arkitektur. Tekst‑inndata bruker faktoriserte token‑innbygginger, mens bilder deles inn i et rutenett av ikke‑overlappende 32×32‑patcher som projiseres med et lite flerlag‑perseptron; begge går deretter inn i den samme Transformer‑enkoderen. Bilder beholder sitt sideforhold og størrelse, slik at modellen kan bruke flere token på en høyoppløst, informasjons‑tett dokumentside enn på et mindre bilde. Kontekstlengden er 16 384 token, nok til opptil to standard 3840×2160 4K‑UHD‑bilder. De fleste lag bruker symmetrisk sliding‑window‑oppmerksomhet, mens hvert sjette lag og det siste laget bruker global oppmerksomhet. Stabelen inkluderer også gruppert‑spørrings‑oppmerksomhet, spørring‑nøkkel‑normalisering, gated‑oppmerksomhet, 2D‑roterende posisjons‑innbygginger og kvadrert‑ReLU‑MLPer. For tekst trente teamet en BPE‑tokenizer med et vokabular på 131 072 token fra bunnen av på flerspråklig tekst, kode, matematikk og maskinproduserte bildetranskripsjoner.
NeoMME er forhåndstrent fra bunnen av som en diskret maskert‑diffusjon‑tekst‑denoiser. For kun‑tekst‑eksempler trekkes en korruptjonsrate jevnt fra 0 til 1, og hver kvalifisert tekst‑token maskeres uavhengig med den raten. Multimodale eksempler bruker korruptjonsrater mellom 0,3 og 1, med bild‑patchene synlige mens modellen rekonstruerer maskert tekst; forfatterne skriver at tung maskering tvinger modellen til å lære bilde‑grunnlagte beskrivelser i stedet for å stole på kun‑språklige snarveier. Forhåndstreningen blander flerspråklig tekst, kode, matematikk, naturlige bilder og dokumentbilder, og hver modell behandler omtrent 524 milliarder pakkede inndata‑token, inkludert 290 milliarder fra kun‑tekst‑eksempler. Med tanke på at dette tekst‑budsjettet er lite i forhold til ModernBERTs 2 billioner trenings‑token, skriver forfatterne at de valgte NorMuon‑optimalisatoren for å forbedre dataeffektiviteten.
Fininnstilling av henting og benchmark‑resultater
For å evaluere ryggraden på en nedstrøms‑oppgave finjusterte teamet den for visuell dokumenthenting ved hjelp av side‑bilde‑metodikken introdusert av ColPali. I stedet for å hente ut ekstraherte tekst‑biter, rangerer NeoMME‑Retriever skjermbilder av dokument‑sider, omgår OCR‑forbehandling og bevarer oppsett, diagrammer, tabeller og typografi. Retrieveren legger til to felles‑trente hoder på ryggraden: et tett hode som gjennomsnitt‑pooler skjulte tilstander til en normalisert vektor, og et sen‑interaksjons‑hode som projiserer hver tekst‑token eller bilde‑patch til en 128‑dimensjonal normalisert vektor, og bevarer fin‑gradert samsvar mellom spørrings‑token og bilde‑regioner. Ett fremover‑pass returnerer begge representasjonene. Forfatterne anbefaler generelt sen‑interaksjons‑innbygginger, og en pipeline med tett henting etterfulgt av sen‑interaksjons‑omrangering for svært store korpora.
På ViDoRe v3‑benchmarken rapporterer innlegget en nDCG@10 på 0,523 for NeoMME‑Retriever‑260M, den høyeste poengsummen blant evaluerte modeller strikt under 800 M‑parametere og innen 0,002 av ColQwen2.5 mens den bruker omtrent 14 ganger færre parametere. NeoMME‑Retriever‑800M når 0,556, innen 0,009 av den tilsvarende store Vultron Retriever Flash, og begge modellene ligger på benchmarkens modellstørrelses‑Pareto‑front. Innleggets sammenligningstabell markerer konkurrenters poengsummer som hentet fra MTEB og NeoMME‑poengsummene som teamets egne evalueringer. På de eldre ViDoRe v1‑ og v2‑benchmarkene, som bruker nDCG@5, rapporterer innlegget at 260M‑modellen overgår ColModernVBERT og den dobbelt så store ColSmol‑500M, mens 800M‑modellen overgår ColPali v1.3 med 3,6 ganger færre parametere.
Modellkortet for NeoMME‑260M‑Retriever oppgir 263 M‑parametere, en skjult størrelse på 1 024, BF16‑vekter og 1 024‑dimensjonale tette innbygginger med Matryoshka‑avkortingspunkter på 128, 256, 512 og 1 024 dimensjoner, i tillegg til den 128‑dimensjonale multi‑vektor‑utgangen. Kortet rapporterer også tekst‑hentingsresultater på BEIR‑15, hvor 260M‑retrieveren scorer 0,4881 nDCG@10 med sen interaksjon og 800M‑modellen scorer 0,5126.
Komprimering, indekserings‑gjennomstrømning og tilgjengelighet
Fordi lagring for sen interaksjon skalerer lineært med antall innbyggings‑vektorer, er høyoppløste sider dyre å indeksere: en 2048×2048‑side produserer 4 200 vektorer med NeoMME‑Retriever, omtrent 2,1 MB i float32, og innlegget rapporterer en målt gjennomsnittlig størrelse på omtrent 1,5 MB per dokument over ViDoRe v3. Teamet kombinerte hierarkisk token‑pooling, som klustrer lignende dokument‑vektorer og lagrer hver klusters gjennomsnitt, med asymmetrisk kvantisering, som lagrer dokument‑innbygginger i int8‑ eller binær presisjon mens spørrings‑innbygginger holdes i høyere presisjon på farten. På ViDoRe v3 rapporterer innlegget at en poolingsfaktor på 10 med int8‑spørringer og dokumenter reduserer lagring til 39 kB per side, en 39‑ganger reduksjon, mens mer enn 99 % av basis‑nDCG@10 beholdes. En mer aggressiv innstilling, poolingsfaktor 8 med int8‑spørringer og binære dokumenter, bruker 6 kB per side, 255 ganger mindre, og beholder mer enn 95 % av hente‑kvaliteten.
Teamet målte også koding‑gjennomstrømning ved bruk av forhåndsbehandlede bildetensorer, med batch‑størrelser kalibrert separat for hver modell og bildestørrelse. Ved en tilsvarende 2048×2048‑inngang på én NVIDIA L40S‑GPU, koder NeoMME‑Retriever‑260M omtrent 51 sider per sekund, nesten dobbelt så raskt som ColModernVBERTs 26 sider per sekund, og innlegget rapporterer at begge NeoMME‑Retriever‑størrelsene er raskere enn de andre sammenlignede modellene ved mindre inngangs‑oppløsninger.
Alle NeoMME‑kontrollpunkter er utgitt under Apache 2.0 med en dag‑null‑implementering i Hugging Face Transformers, og en visuell henting‑augmented generasjons‑demo er tilgjengelig som en Hugging Face Space. For fininnstilling tilbyr teamet separate tette og sen‑interaksjons‑kontrollpunkter kompatible med Sentence Transformers v6, som for øyeblikket støtter ett hente‑hode per modell; trening av begge hoder sammen krever NeoMMEForRetrieval‑klassen med en tilpasset Trainer.
Den medfølgende tekniske rapporten, av Aurélien Lac og Tony Wu, ble sendt inn til arXiv 31. august 2026, i kategorien informasjons‑henting. I innleggets takknemlighetsseksjon beskriver forfatterne NeoMME som et sideprosjekt bygget med begrenset tid og beregningsressurser, og takker H Company for å ha støttet arbeidet og levert beregningskraften som ble brukt til å trene det.












