AI-modellen en platforms

H Company brengt NeoMME uit, een open‑source multimodale encoderfamilie

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

H Company-onderzoekers brachten NeoMME uit op 3 september 2026, een familie van multimodale en meertalige encoders met 260 M‑ en 800 M‑parameters, getraind vanaf nul en gepubliceerd onder de Apache 2.0‑licentie. Fijn afgestemde retrieval‑varianten bevinden zich op de model‑grootte Pareto‑frontier van de ViDoRe v3 visual document retrieval‑benchmark, meldde het team.

Volgens de release post zijn veel recente visual document retrievers aangepast van voorgetrainde generatieve vision‑language‑modellen, waarbij een apart voorgetrainde vision‑encoder visuele kenmerken produceert die een projector naar de invoerruimte van een causaal taalmodel brengt. Retrieval, classificatie en token‑labeling genereren geen tekst autoregressief, schrijven de auteurs, waardoor die taken geen causale decoder of de bijbehorende parameter‑ en rekencapaciteit nodig hebben. NeoMME verwerkt in plaats daarvan tekst‑tokens en ruwe afbeeldings‑patches via één gedeelde bidirectionele Transformer en is niet gebaseerd op een bestaande voorgetrainde vision‑tower, tekst‑encoder of tekst‑decoder.

De post plaatst het ontwerp tegenover twee eerdere encoder‑inspanningen: ModernBERT, dat efficiëntieverbeteringen bracht voor bidirectionele tekst‑encoders, en ModernVBERT, dat een ModernBERT‑achtige tekst‑encoder toepaste op visual document retrieval terwijl een aparte voorgetrainde SigLIP2‑vision‑tower behouden bleef. De auteurs schrijven dat ze de overhead van het meenemen van componenten van een vision‑language‑model in een encoder wilden wegnemen.

Architectuur en vanaf‑nul pretraining

Beide NeoMME‑groottes delen dezelfde architectuur. Tekstinvoer gebruikt gefactoriseerde token‑embeddings, terwijl afbeeldingen worden opgesplitst in een raster van niet‑overlappende 32×32‑patches en geprojecteerd met een kleine multilayer perceptron; beide gaan vervolgens dezelfde Transformer‑encoder binnen. Afbeeldingen behouden hun beeldverhouding en grootte, zodat het model meer tokens kan besteden aan een hoge‑resolutie, informatie‑dichte documentpagina dan aan een kleinere afbeelding. De contextlengte is 16.384 tokens, voldoende voor maximaal twee standaard 3840×2160 4K UHD‑afbeeldingen. De meeste lagen gebruiken symmetrische sliding‑window‑attention, terwijl elke zesde laag en de laatste laag globale attention gebruiken. De stack bevat bovendien grouped‑query attention, query‑key normalisatie, gated attention, 2D rotary position embeddings en squared‑ReLU‑MLP’s. Voor tekst trainde het team een BPE‑tokenizer met een vocabulaire van 131.072 tokens vanaf nul op meertalige tekst, code, wiskunde en door machines geproduceerde afbeeldings‑transcripten.

NeoMME wordt vanaf nul voorgetraind als een discrete masked‑diffusion tekst‑denoiser. Voor uitsluitend tekstuele voorbeelden wordt een corruptieratio uniform gesampled tussen 0 en 1, en elk in aanmerking komend tekst‑token wordt onafhankelijk gemaskeerd met die ratio. Multimodale voorbeelden gebruiken corruptieratio’s tussen 0,3 en 1, waarbij de afbeeldings‑patches zichtbaar blijven terwijl het model gemaskeerde tekst reconstrueert; de auteurs schrijven dat zware masking het model dwingt om beeld‑gebaseerde beschrijvingen te leren in plaats van alleen op taal‑shortcuts te vertrouwen. Pretraining combineert meertalige tekst, code, wiskunde, natuurlijke afbeeldingen en documentafbeeldingen, en elk model verwerkt ongeveer 524 billion samengepakte invoer‑tokens, inclusief 290 billion uit uitsluitend tekstuele voorbeelden. Aangezien dit tekstbudget klein is ten opzichte van de 2 trillion trainings‑tokens van ModernBERT, schrijven de auteurs dat ze de NorMuon‑optimizer kozen om de data‑efficiëntie te verbeteren.

Retrieval fine‑tuning en benchmarkresultaten

Om de backbone te evalueren op een downstream‑taak, finetunede het team deze voor visual document retrieval met de page‑image‑methodologie geïntroduceerd door ColPali. In plaats van geëxtraheerde tekstfragmenten op te halen, rangschikt NeoMME‑Retriever screenshots van documentpagina’s, waardoor OCR‑preprocessing wordt omzeild en lay‑out, grafieken, tabellen en typografie behouden blijven. De retriever voegt twee gezamenlijk getrainde heads toe aan de backbone: een dense head die hidden states mean‑pooled naar een genormaliseerde vector, en een late‑interaction head die elk tekst‑token of afbeeldings‑patch projecteert naar een 128‑dimensionale genormaliseerde vector, waardoor fijnmazige overeenkomsten tussen query‑tokens en afbeeldings‑regio’s behouden blijven. Eén forward pass levert beide representaties op. De auteurs raden over het algemeen late‑interaction embeddings aan, en een pipeline van dense retrieval gevolgd door late‑interaction re‑ranking voor zeer grote corpora.

Op de ViDoRe v3‑benchmark meldt de post een nDCG@10 van 0,523 voor NeoMME‑Retriever‑260M, de hoogste score onder geëvalueerde modellen strikt onder 800 M‑parameters en binnen 0,002 van ColQwen2.5, terwijl ongeveer 14‑maal minder parameters worden gebruikt. NeoMME‑Retriever‑800M behaalt 0,556, binnen 0,009 van de even grootse Vultron Retriever Flash, en beide modellen liggen op de model‑grootte Pareto‑frontier van de benchmark. De vergelijkings‑tabel in de post geeft concurrent‑scores weer afkomstig van MTEB en de NeoMME‑scores als eigen evaluaties van het team. Op de oudere ViDoRe v1‑ en v2‑benchmarks, die nDCG@5 gebruiken, meldt de post dat het 260 M‑model beter presteert dan ColModernVBERT en de twee‑maal grotere ColSmol‑500M, terwijl het 800 M‑model beter presteert dan ColPali v1.3 met 3,6‑maal minder parameters.

De model card voor NeoMME‑260M‑Retriever vermeldt 263 M parameters, een hidden size van 1.024, BF16‑gewichten, en 1.024‑dimensionale dense embeddings met Matryoshka‑truncatie‑punten op 128, 256, 512 en 1.024 dimensies, naast de 128‑dimensionale multi‑vector‑output. De kaart rapporteert ook tekst‑retrieval resultaten op BEIR‑15, waar de 260 M‑retriever 0,4881 nDCG@10 scoort met late interaction en het 800 M‑model 0,5126.

Compressie, indexerings‑throughput en beschikbaarheid

Omdat late‑interaction opslag lineair schaalt met het aantal embedding‑vectoren, zijn hoge‑resolutie pagina’s duur om te indexeren: een 2048×2048‑pagina genereert 4.200 vectoren met NeoMME‑Retriever, ongeveer 2,1 MB in float32, en de post meldt een gemeten gemiddelde van circa 1,5 MB per document over ViDoRe v3. Het team combineerde hiërarchische token‑pooling, die vergelijkbare document‑vectoren clustert en het gemiddelde van elk cluster opslaat, met asymmetrische kwantisatie, die document‑embeddings opslaat als int8 of binaire precisie terwijl query‑embeddings on‑the‑fly op hogere precisie blijven. Op ViDoRe v3 meldt de post dat een pooling‑factor van 10 met int8‑queries en documenten de opslag reduceert tot 39 kB per pagina, een 39‑voudige reductie, terwijl meer dan 99 % van de baseline nDCG@10 behouden blijft. Een agressievere instelling, pooling‑factor 8 met int8‑queries en binaire documenten, gebruikt 6 kB per pagina, 255‑maal kleiner, en behoudt meer dan 95 % van de retrieval‑kwaliteit.

Het team heeft ook de encoder‑throughput gemeten met voorbewerkte afbeelding‑tensors, waarbij batch‑groottes afzonderlijk voor elk model en elke afbeeldingsgrootte werden gekalibreerd. Bij een overeenkomstige 2048×2048‑invoer op één NVIDIA L40S‑GPU codeert NeoMME‑Retriever‑260M ongeveer 51 pagina’s per seconde, bijna twee keer zoveel als de 26 pagina’s per seconde van ColModernVBERT, en de post meldt dat beide NeoMME‑Retriever‑groottes sneller zijn dan de andere vergeleken modellen bij kleinere invoerresoluties.

Alle NeoMME‑checkpoints worden uitgebracht onder Apache 2.0 met een day‑zero‑implementatie in Hugging Face Transformers, en een visual retrieval‑augmented generation‑demo is beschikbaar als een Hugging Face Space. Voor fine‑tuning levert het team aparte dense‑ en late‑interaction‑checkpoints die compatibel zijn met Sentence Transformers v6, die momenteel één retrieval‑head per model ondersteunt; beide heads gezamenlijk trainen vereist de NeoMMEForRetrieval‑klasse met een aangepaste Trainer.

Het bijbehorende technische rapport, van Aurélien Lac en Tony Wu, werd op 31 augustus 2026 ingediend bij arXiv in de categorie information retrieval. In de dankbetuigingen van de post beschrijven de auteurs NeoMME als een nevenproject gebouwd met beperkte tijd en rekenkracht, en bedanken ze H Company voor het ondersteunen van het werk en het leveren van de rekenkracht die gebruikt is om het te trainen.

Jonas Reeve is een AI-gegenereerde analist bij Unite.AI, met een focus op cognitieve AI, kunstmatige algemene intelligentie (AGI) en de theoretische grondslagen van machine-intelligentie. Zijn werk onderzoekt hoe leren, redeneren, geheugen en abstractie ontstaan in zowel biologische als kunstmatige systemen, en trekt verbindingen tussen moderne AI-architecturen en langdurige vragen in cognitieve wetenschap en filosofie van de geest.
Met een conceptuele en reflectieve benadering, onderzoekt Jonas kaders zoals redeneermodellen, agente systemen, emergente cognitie en align-theorie, met als doel om duidelijk te maken wat vooruitgang naar AGI eigenlijk betekent - en wat niet. In plaats van tijdlijnen of hype na te jagen, benadrukt hij eerst principes, conceptuele rigor en de beperkingen van huidige modellen.
Artikelen geschreven door Jonas Reeve zijn AI-gegenereerd en worden beoordeeld door het redactionele team van Unite.AI om ervoor te zorgen dat ze accurate, duidelijke en verantwoorde discussies over geavanceerde AI-concepten bevatten.