AI-mallit ja alustat
H Company julkaisee NeoMME:n, avoimen lähdekoodin multimodaalisen enkooderiperheen

H Companyn tutkijat julkaisevat NeoMME:n 3. syyskuuta 2026, 260 M‑ ja 800 M‑parametrisen multimodaalisen ja monikielisen enkooderiperheen, joka on koulutettu alusta alkaen ja julkaistu Apache 2.0 -lisenssin alla. Tiimi raportoi, että hienosäädetyt hakuvaihtoehdot sijoittuvat mallikoon Pareto-rajalle ViDoRe v3 -visuaalisen dokumenttihakukoetestissä.
Julkaisupostauksen mukaan monet viimeaikaiset visuaaliset dokumenttihakijat on sovitettu ennalta koulutetuista generatiivisista näkö‑kielimalleista, joissa erikseen esikoulutettu näköenkooderi tuottaa visuaalisia ominaisuuksia, jotka projektori kartoittaa kausaalisen kielimallin syöteavaruuteen. Hakua, luokittelua ja token‑merkintää ei synnytetä tekstiä autoregressiivisesti, kirjoittajat toteavat, joten nämä tehtävät eivät tarvitse kausaalista dekooderia tai sen parametrinen ja laskennallinen ylikuormitus. NeoMME sen sijaan käsittelee tekstitokenit ja raakat kuvasirut yhden yhteisen kaksisuuntaisen Transformerin läpi, eikä perustu mihinkään olemassa olevaan esikoulutettuun näkö‑torniin, tekstienkooderiin tai tekstidekooderiin.
Postaus asettaa suunnittelun kahden aikaisemman enkooderihankkeen, ModernBERT:n, joka toi tehokkuusparannuksia kaksisuuntaisiin tekstienkoodereihin, ja ModernVBERT:n, joka soveltaa ModernBERT‑tyylistä tekstienkooderia visuaaliseen dokumenttihakuun säilyttäen erillisen esikoulutetun SigLIP2‑näkötorni, vastakohtana. Kirjoittajat kertovat halunneensa poistaa näkö‑kielimallin komponenttien kantamisen enkooderiin aiheuttaman ylikuormituksen.
Arkkitehtuuri ja alusta alkaen tapahtuva esikoulutus
Molemmat NeoMME‑koot jakavat saman arkkitehtuurin. Tekstisyötteet käyttävät faktoroituja token‑upotuksia, kun taas kuvat jaetaan 32 × 32‑pikselin ei‑päällekkäisiin patseihin ja projisoidaan pienellä monikerroksisella perceptronilla; molemmat syötetään sitten samaan Transformer‑enkooderiin. Kuvat säilyttävät kuvasuhteensa ja koonsa, jolloin malli voi käyttää enemmän tokeneita korkean resoluution, informaatiotiheän dokumenttisivun käsittelyyn kuin pienemmän kuvan. Kontekstipituus on 16 384 tokenia, riittäen enintään kahteen tavalliseen 3840 × 2160‑4K‑UHD‑kuvaan. Useimmat kerrokset käyttävät symmetristä liukuvan ikkunan huomiointia, kun taas jokainen kuudes kerros ja viimeinen kerros käyttävät globaalia huomiointia. Pinossa on lisäksi ryhmitelty kysely‑huomiointi (grouped‑query attention), kysely‑avain‑normaalisointi, porttikohtainen huomiointi, 2‑dimensioiset pyörivät sijainti‑upotukset ja neliö‑ReLU‑MLP:t. Tekstille tiimi koulutti alusta alkaen BPE‑tokenisoijan, jossa on 131 072‑tokeninen sanasto monikieliselle tekstille, koodille, matematiikalle ja koneellisesti tuotetuille kuvatiedostoille.
NeoMME on esikoulutettu alusta alkaen diskreettinä maskattuna diffuusiotekstien denoisina. Teksti‑vain esimerkeissä korruptioprosentti otetaan tasaisesti välillä 0–1, ja jokainen kelvollinen tekstitoken maskataan itsenäisesti kyseisellä prosentilla. Monimodaalisissa esimerkeissä korruptioprosentti vaihtelee 0,3–1 välillä, jolloin kuvan patseja pidetään näkyvissä samalla kun malli rekonstruoi maskattua tekstiä; kirjoittajat toteavat, että voimakas maskaus pakottaa mallin oppimaan kuviin perustuvia kuvauksia sen sijaan, että se turvaisi pelkästään kielen lyhenteisiin. Esikoulutus sekoittaa monikielistä tekstiä, koodia, matematiikkaa, luonnollisia kuvia ja dokumenttikuvia, ja kukin malli käsittelee noin 524 miljardia pakattua syötetokenia, joista 290 miljardia on pelkästään tekstiesimerkkejä. Huomaten, että tämä tekstibudjetti on pieni verrattuna ModernBERT:n 2 triljoonan koulutustokeniin, kirjoittajat kertovat valinneensa NorMuon‑optimointialgoritmin parantaakseen datatehokkuutta.
Haku‑hienosäätö ja vertailutulokset
Arvioidakseen rungon suorituskykyä alitehtävässä tiimi hienosäätää sen visuaaliseen dokumenttihakuun käyttäen ColPali:n esittelemää sivu‑kuva‑menetelmää. Sen sijaan, että haettaisiin purettuja tekstikatkelmia, NeoMME‑Retriever järjestelee dokumenttisivujen kuvakaappauksia, ohittaen OCR‑esikäsittelyn ja säilyttäen asettelun, kaaviot, taulukot ja typografian. Retrieveriin lisätään kaksi yhteisesti koulutettua päätä rungolle: tiivis pää, joka keskiarvoistuu piilotiloista normalisoituun vektoriin, ja myöhäisvuorovaikutus‑pää, joka projisoi jokaisen tekstitokenin tai kuvan patsein 128‑dimensioonormalisoituun vektoriin, säilyttäen hienojakoiset vastaavuudet kyselytokenien ja kuvien alueiden välillä. Yksi eteenpäin suoritettu läpikäynti palauttaa molemmat representaatiot. Kirjoittajat suosittelevat yleisesti myöhäisvuorovaikutus‑upotuksia sekä tiivistä hakuputkea, jota seuraa myöhäisvuorovaikutuksen uudelleenarviointi erittäin suurille korpuksille.
ViDoRe v3 -vertailukoetestissä postaus raportoi nDCG@10‑arvoksi 0,523 NeoMME‑Retriever‑260M:lle, mikä on korkein tulos arvioiduista malleista, jotka ovat tiukasti alle 800 M‑parametrisia, ja se on 0,002:n päässä ColQwen2.5:stä käyttäen noin 14‑kertaisesti vähemmän parametreja. NeoMME‑Retriever‑800M saavuttaa 0,556, mikä on 0,009:n sisällä samankokoisen Vultron Retriever Flashin kanssa, ja molemmat mallit sijoittuvat vertailukoetestin mallikoon Pareto‑rajalle. Postauksen vertailutaulukko merkitsee kilpailijoiden pisteet peräisin MTEB:stä ja NeoMME‑pisteet tiimin omiksi arvioiksi. Vanhemmilla ViDoRe v1‑ ja v2‑vertailukoetesteillä, jotka käyttävät nDCG@5‑arvoa, postaus kertoo, että 260 M‑malli ylittää ColModernVBERT:n ja kaksinkertaisesti suuremman ColSmol‑500M:n, kun taas 800 M‑malli ylittää ColPali v1.3:n 3,6‑kertaisesti vähemmän parametreja käyttäen.
The model card for NeoMME-260M-Retriever lists 263M parameters, a hidden size of 1,024, BF16 weights, and 1,024-dimensional dense embeddings with Matryoshka truncation points at 128, 256, 512, and 1,024 dimensions, alongside the 128-dimensional multi-vector output. The card also reports text-retrieval results on BEIR-15, where the 260M retriever scores 0.4881 nDCG@10 with late interaction and the 800M model scores 0.5126.
Pakkaus, indeksointinopeus ja saatavuus
Koska myöhäisvuorovaikutus‑tallennus skaalautuu lineaarisesti upotusvektoreiden määrän kanssa, korkean resoluution sivut ovat kalliita indeksoida: 2048 × 2048‑sivu tuottaa 4 200 vektoria NeoMME‑Retrieverilla, noin 2,1 MB float32‑muodossa, ja postaus raportoi mitatun keskiarvon noin 1,5 MB per asiakirja ViDoRe v3:ssä. Tiimi yhdisti hierarkkisen token‑poolauksen, joka ryhmittelee samankaltaiset asiakirjavektorit ja tallentaa jokaisen klusterin keskiarvon, epäsymmetrisen kvantisoinnin, joka tallentaa asiakirja‑upotukset int8‑tai binaariprecisoinnilla pitäen kysely‑upotukset reaaliaikaisesti korkeammassa tarkkuudessa. ViDoRe v3:ssä postaus kertoo, että poolauskerroin 10 int8‑kyselyillä ja -asiakirjoilla vähentää tallennustilan 39 kB per sivu, 39‑kertaiseksi, säilyttäen yli 99 % perus‑nDCG@10:stä. Aggressiivisempi asetus, poolauskerroin 8 int8‑kyselyillä ja binaari‑asiakirjoilla, käyttää 6 kB per sivu, 255‑kertaisesti pienempi, ja säilyttää yli 95 % hakutuloksen laadusta.
Tiimi mittasi myös koodausnopeutta käyttäen esikäsiteltyjä kuvatenoreja, joissa eräkokoonnit kalibroitiin erikseen jokaiselle mallille ja kuvan koolle. Yhdellä NVIDIA L40S -GPU:lla, jonka syöte on 2048 × 2048, NeoMME‑Retriever‑260M koodaa noin 51 sivua sekunnissa, lähes kaksinkertaisesti ColModernVBERT:n 26 sivua sekunnissa, ja postaus raportoi, että molemmat NeoMME‑Retriever‑koot ovat nopeampia kuin muut vertailumallit pienemmillä syöteresoluutioilla.
Kaikki NeoMME‑tarkistuspisteet on julkaistu Apache 2.0 -lisenssin alla, ja ne sisältävät päivän‑nollan toteutuksen Hugging Face Transformers -kirjastossa; visuaalinen haku‑lisätty generointidemo on saatavilla Hugging Face Space -palvelussa. Hienosäätöä varten tiimi tarjoaa erilliset tiiviit ja myöhäisvuorovaikutus‑tarkistuspisteet, jotka ovat yhteensopivia Sentence Transformers v6:n kanssa, joka tällä hetkellä tukee yhtä hakupäätä per malli; molempien päiden yhteiskoulutus vaatii NeoMMEForRetrieval‑luokan mukautetulla Trainer‑luokalla.
The accompanying technical report, by Aurélien Lac and Tony Wu, was submitted to arXiv on 31. elokuuta 2026, in the information retrieval category. In the post’s acknowledgements, the authors describe NeoMME as a side project built with limited time and compute, and thank H Company for supporting the work and providing the compute used to train it.












