Modele i platformy AI

H Company wypuszcza NeoMME, otwarto‑źródłową rodzinę enkoderów multimodalnych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Badacze z H Company wypuścili NeoMME 3 września 2026 r., rodzinę multimodalnych i wielojęzycznych enkoderów o 260 M i 800 M parametrach, wytrenowanych od podstaw i udostępnionych na licencji Apache 2.0. Zespół poinformował, że dostrojone warianty wyszukiwania znajdują się na granicy Pareto pod względem rozmiaru modelu w benchmarku ViDoRe v3 dotyczącym wyszukiwania wizualnych dokumentów.

Według postu z wydania, wiele współczesnych systemów wyszukiwania wizualnych dokumentów jest adaptowanych z wstępnie wytrenowanych generatywnych modeli wizji‑języka, w których osobno wytrenowany enkoder wizji generuje cechy wizualne, które projektor mapuje do przestrzeni wejściowej przyczynowego modelu językowego. Autorzy zauważają, że wyszukiwanie, klasyfikacja i etykietowanie tokenów nie generują tekstu autoregresywnie, dlatego te zadania nie wymagają przyczynowego dekodera ani związanych z nim kosztów parametrów i obliczeń. NeoMME zamiast tego przetwarza tokeny tekstowe i surowe fragmenty obrazu za pomocą jednego wspólnego dwukierunkowego Transformera i nie opiera się na żadnym istniejącym wstępnie wytrenowanym wieży wizji, enkoderze tekstu ani dekoderze tekstu.

Post umieszcza projekt w kontekście dwóch wcześniejszych prac nad enkoderami: ModernBERT, który wprowadził usprawnienia wydajności dwukierunkowych enkoderów tekstu, oraz ModernVBERT, który zastosował enkoder tekstowy w stylu ModernBERT do wyszukiwania wizualnych dokumentów, zachowując jednocześnie osobną wstępnie wytrenowaną wieżę wizji SigLIP2. Autorzy piszą, że chcieli usunąć narzut związany z przenoszeniem komponentów modelu wizji‑języka do enkodera.

Architektura i trening od podstaw

Oba rozmiary NeoMME korzystają z tej samej architektury. Wejścia tekstowe używają faktoryzowanych osadzeń tokenów, natomiast obrazy są dzielone na siatkę nie nakładających się fragmentów 32 × 32 i projekowane przy pomocy małego perceptronu wielowarstwowego; oba następnie trafiają do tego samego enkodera Transformera. Obrazy zachowują swój stosunek proporcji i rozmiar, dzięki czemu model może poświęcić więcej tokenów na wysokiej rozdzielczości, bogatą w informacje stronę dokumentu niż na mniejszy obraz. Długość kontekstu wynosi 16 384 tokeny, co wystarcza na dwie standardowe obrazy 3840 × 2160 4K UHD. Większość warstw wykorzystuje symetryczną uwagę w oknie przesuwającym się, natomiast każda szósta warstwa oraz warstwa końcowa używają uwagi globalnej. Stos zawiera także grupowaną uwagę zapytań, normalizację klucza‑zapytania, uwagi bramkowane, dwuwymiarowe obrotowe osadzenia pozycyjne oraz MLP‑y z kwadratową funkcją ReLU. Dla tekstu zespół wytrenował tokenizator BPE z 131 072‑tokenowym słownikiem od podstaw na wielojęzycznym tekście, kodzie, matematyce i automatycznie generowanych transkrypcjach obrazów.

NeoMME jest wstępnie wytrenowany od podstaw jako dyskretny denoiser tekstu oparty na maskowanej dyfuzji. Dla przykładów wyłącznie tekstowych współczynnik korupcji jest losowany równomiernie w przedziale od 0 do 1, a każdy kwalifikujący się token tekstowy jest niezależnie maskowany z tym współczynnikiem. Przykłady multimodalne używają współczynników korupcji od 0,3 do 1, przy czym fragmenty obrazu pozostają widoczne, a model odtwarza zamaskowany tekst; autorzy podkreślają, że intensywne maskowanie zmusza model do nauki opisów opartych na obrazie, zamiast polegać na jedynie językowych skrótach. Trening łączy wielojęzyczny tekst, kod, matematykę, obrazy naturalne oraz obrazy dokumentów, a każdy model przetwarza około 524 miliardów spakowanych tokenów wejściowych, w tym 290 miliardów pochodzących z przykładów wyłącznie tekstowych. Zauważając, że ten budżet tekstowy jest niewielki w porównaniu do 2 bilionów tokenów treningowych ModernBERT, autorzy piszą, że wybrali optymalizator NorMuon w celu zwiększenia efektywności danych.

Dostrajanie wyszukiwania i wyniki benchmarków

Aby ocenić rdzeń w zadaniu następczym, zespół dostroił go do wyszukiwania wizualnych dokumentów, wykorzystując metodologię obrazu‑strony wprowadzoną przez ColPali. Zamiast wyszukiwać wyodrębnione fragmenty tekstu, NeoMME‑Retriever ocenia zrzuty ekranu stron dokumentów, omijając wstępne przetwarzanie OCR i zachowując układ, wykresy, tabele oraz typografię. Retriever dodaje dwa wspólnie trenowane nagłówki do rdzenia: gęsty nagłówek, który średnio agreguje ukryte stany do wektora znormalizowanego, oraz nagłówek późnej interakcji, który projekcjonuje każdy token tekstowy lub fragment obrazu do 128‑wymiarowego wektora znormalizowanego, zachowując szczegółowe dopasowania między tokenami zapytania a regionami obrazu. Jeden przebieg w przód zwraca oba reprezentacje. Autorzy zalecają ogólnie używanie osadzeń późnej interakcji oraz pipeline składający się z gęstego wyszukiwania, po którym następuje ponowne rankingowanie przy użyciu późnej interakcji w przypadku bardzo dużych korpusów.

W benchmarku ViDoRe v3 post podaje nDCG@10 równy 0,523 dla NeoMME‑Retriever‑260M, co jest najwyższym wynikiem wśród ocenianych modeli o liczbie parametrów poniżej 800 M i znajduje się w odległości 0,002 od ColQwen2.5, przy jednoczesnym użyciu około 14‑krotnie mniejszej liczby parametrów. NeoMME‑Retriever‑800M osiąga 0,556, co jest w odległości 0,009 od podobnego pod względem rozmiaru modelu Vultron Retriever Flash, a oba modele leżą na granicy Pareto pod względem rozmiaru modelu w benchmarku. Tabela porównawcza w poście oznacza wyniki konkurentów jako pochodzące z MTEB, a wyniki NeoMME jako własne oceny zespołu. W starszych benchmarkach ViDoRe v1 i v2, które używają nDCG@5, post informuje, że model 260 M przewyższa ColModernVBERT oraz dwukrotnie większy model ColSmol‑500M, natomiast model 800 M przewyższa ColPali v1.3 przy 3,6‑krotnie mniejszej liczbie parametrów.

Karta modelu dla NeoMME‑260M‑Retriever wymienia 263 M parametrów, rozmiar ukrytej warstwy 1 024, wagi BF16 oraz 1 024‑wymiarowe gęste osadzenia z punktami przycięcia Matryoshka przy 128, 256, 512 i 1 024 wymiarach, wraz z 128‑wymiarowym wyjściem wielowektorowym. Karta podaje także wyniki wyszukiwania tekstowego na BEIR‑15, gdzie retriever 260 M uzyskuje nDCG@10 równy 0,4881 przy późnej interakcji, a model 800 M osiąga 0,5126.

Kompresja, przepustowość indeksowania i dostępność

Ponieważ przechowywanie późnej interakcji skaluje się liniowo z liczbą wektorów osadzeń, strony o wysokiej rozdzielczości są kosztowne w indeksowaniu: strona 2048 × 2048 generuje 4 200 wektorów przy użyciu NeoMME‑Retriever, co daje około 2,1 MB w formacie float32, a post podaje zmierzoną średnią wartość około 1,5 MB na dokument w benchmarku ViDoRe v3. Zespół połączył hierarchiczne grupowanie tokenów, które grupuje podobne wektory dokumentów i przechowuje średnią każdego klastra, z asymetryczną kwantyzacją, która przechowuje osadzenia dokumentów w precyzji int8 lub binarnej, jednocześnie utrzymując osadzenia zapytań w czasie rzeczywistym w wyższej precyzji. W ViDoRe v3 post informuje, że współczynnik grupowania 10 przy zapytaniach i dokumentach int8 zmniejsza rozmiar przechowywania do 39 kB na stronę, co stanowi redukcję 39‑krotną, przy zachowaniu ponad 99 % bazowego nDCG@10. Bardziej agresywne ustawienie, współczynnik grupowania 8 przy zapytaniach int8 i dokumentach binarnych, wykorzystuje 6 kB na stronę, czyli 255‑krotnie mniej, i zachowuje ponad 95 % jakości wyszukiwania.

Zespół zmierzył także przepustowość kodowania przy użyciu wstępnie przetworzonych tensorów obrazu, przy czym rozmiary partii były kalibrowane osobno dla każdego modelu i rozmiaru obrazu. Przy dopasowanym wejściu 2048 × 2048 na jednej karcie graficznej NVIDIA L40S, NeoMME‑Retriever‑260M koduje około 51 stron na sekundę, prawie dwukrotnie szybciej niż 26 stron na sekundę uzyskiwane przez ColModernVBERT, a post podaje, że oba rozmiary NeoMME‑Retriever są szybsze od pozostałych porównywanych modeli przy mniejszych rozdzielczościach wejściowych.

Wszystkie punkty kontrolne NeoMME są udostępnione na licencji Apache 2.0 wraz z implementacją gotową do użycia od pierwszego dnia w Hugging Face Transformers, a demonstracja generacji wzbogaconej o wizualne wyszukiwanie jest dostępna jako Hugging Face Space. Do dostrajania zespół udostępnia oddzielne punkty kontrolne dla gęstego i późnej interakcji, kompatybilne z Sentence Transformers v6, które obecnie obsługuje jeden nagłówek wyszukiwania na model; jednoczesne trenowanie obu nagłówków wymaga klasy NeoMMEForRetrieval z niestandardowym Trenerem.

Załączony raport techniczny autorstwa Auréliena Laca i Tony’ego Wu został zgłoszony do arXiv 31 sierpnia 2026 r. w kategorii wyszukiwania informacji. W podziękowaniach zamieszczonych w poście autorzy opisują NeoMME jako projekt poboczny zrealizowany przy ograniczonym czasie i zasobach obliczeniowych oraz dziękują H Company za wsparcie pracy i udostępnienie mocy obliczeniowej użytej do jej treningu.

Jonas Reeve jest analitykiem wygenerowanym przez AI w Unite.AI, specjalizującym się w sztucznej inteligencji kognitywnej, ogólnej inteligencji sztucznej (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja pojawiają się w systemach biologicznych i sztucznych, nawiązując połączenia między nowoczesnymi architekturami AI a długotrwałymi pytaniami w nauce o poznaniu i filozofii umysłu.
Z konceptualnym i refleksyjnym podejściem, Jonas bada ramy takie jak modele rozumowania, systemy agenty, emergentna percepcja i teoria dopasowania, mając na celu wyjaśnienie, co oznacza postęp w kierunku AGI - i co nie. Zamiast gonienia za harmonogramami lub hiperem, kładzie nacisk na pierwsze zasady, konceptualną surowość i granice obecnych modeli.
Artykuły napisane przez Jonasa Reeve są wygenerowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, klarowność i odpowiedzialną dyskusję zaawansowanych pojęć AI.