Model dan platform AI
H Company Merilis NeoMME, Keluarga Encoder Multimodal Open-Source

Peneliti H Company merilis NeoMME pada 3 September 2026, sebuah keluarga encoder multimodal dan multibahasa dengan 260M‑ dan 800M‑parameter yang dilatih dari nol dan dipublikasikan di bawah lisensi Apache 2.0.
Menurut posting rilis, banyak retriever dokumen visual terbaru diadaptasi dari model visi‑bahasa generatif yang telah dilatih sebelumnya, di mana encoder visi yang dilatih secara terpisah menghasilkan fitur visual yang dipetakan oleh sebuah proyektor ke dalam ruang masukan model bahasa kausal. Penarikan, klasifikasi, dan pelabelan token tidak menghasilkan teks secara autoregresif, tulis penulis, sehingga tugas‑tugas tersebut tidak memerlukan dekoder kausal atau beban parameter dan komputasinya. NeoMME justru memproses token teks dan patch citra mentah melalui satu Transformer bidirectional yang dibagi, dan tidak berbasis pada menara visi, encoder teks, atau dekoder teks yang telah ada sebelumnya.
Posting tersebut menempatkan desain ini berlawanan dengan dua upaya encoder sebelumnya: ModernBERT, yang membawa peningkatan efisiensi pada encoder teks bidirectional, dan ModernVBERT, yang menerapkan encoder teks bergaya ModernBERT pada penarikan dokumen visual sambil mempertahankan menara visi SigLIP2 yang dilatih secara terpisah. Penulis menulis bahwa mereka ingin menghilangkan beban membawa komponen model visi‑bahasa ke dalam sebuah encoder.
Arsitektur dan Pretraining dari Awal
Kedua ukuran NeoMME menggunakan arsitektur yang sama. Input teks menggunakan embedding token terfaktorisasi, sementara citra dibagi menjadi grid patch 32×32 yang tidak tumpang tindih dan diproyeksikan dengan multilayer perceptron kecil; keduanya kemudian masuk ke encoder Transformer yang sama. Citra mempertahankan rasio aspek dan ukuran, sehingga model dapat mengalokasikan lebih banyak token pada halaman dokumen beresolusi tinggi dan padat informasi dibandingkan dengan citra yang lebih kecil. Panjang konteks adalah 16.384 token, cukup untuk hingga dua gambar 4K UHD standar berukuran 3840×2160. Sebagian besar lapisan menggunakan attention jendela‑geser simetris, sementara setiap lapisan keenam dan lapisan akhir menggunakan attention global. Tumpukan ini juga mencakup grouped‑query attention, normalisasi query‑key, gated attention, embedding posisi rotary 2D, dan MLP squared‑ReLU. Untuk teks, tim melatih tokenizer BPE dengan kosakata 131.072 token dari nol pada teks multibahasa, kode, matematika, dan transkrip gambar yang dihasilkan mesin.
NeoMME dilatih dari awal sebagai denoiser teks difusi‑masker diskrit. Untuk contoh hanya‑teks, tingkat korupsi diambil secara uniform antara 0 dan 1, dan setiap token teks yang memenuhi syarat secara independen dimasker pada tingkat tersebut. Contoh multimodal menggunakan tingkat korupsi antara 0,3 dan 1, dengan patch citra tetap terlihat sementara model merekonstruksi teks yang dimasker; penulis menulis bahwa masking berat memaksa model belajar deskripsi berbasis citra daripada mengandalkan jalan pintas hanya bahasa. Pretraining mencampur teks multibahasa, kode, matematika, citra alami, dan citra dokumen, dan setiap model memproses sekitar 524 miliar token input terpaket, termasuk 290 miliar dari contoh hanya‑teks. Menyadari bahwa anggaran teks ini kecil dibandingkan dengan 2 triliun token pelatihan ModernBERT, penulis menulis bahwa mereka memilih optimizer NorMuon untuk meningkatkan efisiensi data.
Fine-Tuning Penarikan dan Hasil Benchmark
Untuk mengevaluasi tulang punggung pada tugas hilir, tim melakukan fine‑tuning untuk penarikan dokumen visual menggunakan metodologi halaman‑gambar yang diperkenalkan oleh ColPali. Alih‑alih menarikan potongan teks yang diekstrak, NeoMME‑Retriever memberi peringkat screenshot halaman dokumen, melewati pra‑pemrosesan OCR dan mempertahankan tata letak, diagram, tabel, serta tipografi. Retriever menambahkan dua kepala yang dilatih bersama pada tulang punggung: sebuah kepala dense yang melakukan mean‑pooling pada state tersembunyi menjadi vektor ternormalkan, dan sebuah kepala interaksi‑terlambat yang memproyeksikan setiap token teks atau patch citra ke vektor ternormalkan berdimensi 128, mempertahankan kecocokan halus antara token kueri dan wilayah citra. Satu lintasan maju mengembalikan kedua representasi. Penulis merekomendasikan embedding interaksi‑terlambat secara umum, serta alur kerja penarikan dense diikuti perankingan ulang interaksi‑terlambat untuk korpus yang sangat besar.
Pada benchmark ViDoRe v3, posting tersebut melaporkan nDCG@10 sebesar 0.523 untuk NeoMME‑Retriever‑260M, skor tertinggi di antara model yang dievaluasi dengan parameter di bawah 800M dan berada dalam selisih 0.002 dari ColQwen2.5 sambil menggunakan sekitar 14 kali lebih sedikit parameter. NeoMME‑Retriever‑800M mencapai 0.556, berada dalam selisih 0.009 dari Vultron Retriever Flash berukuran serupa, dan kedua model berada pada frontier Pareto ukuran‑model benchmark. Tabel perbandingan dalam posting menandai skor kompetitor sebagai bersumber dari MTEB dan skor NeoMME sebagai evaluasi tim sendiri. Pada benchmark ViDoRe v1 dan v2 yang lebih lama, yang menggunakan nDCG@5, posting melaporkan bahwa model 260M mengungguli ColModernVBERT dan ColSmol‑500M yang dua kali lebih besar, sementara model 800M mengungguli ColPali v1.3 dengan 3,6 kali lebih sedikit parameter.
Kartu model untuk NeoMME‑260M‑Retriever mencantumkan 263M parameter, ukuran tersembunyi 1.024, bobot BF16, dan embedding dense berdimensi 1.024 dengan titik pemotongan Matryoshka pada 128, 256, 512, dan 1.024 dimensi, bersamaan dengan output multi‑vektor berdimensi 128. Kartu tersebut juga melaporkan hasil penarikan teks pada BEIR‑15, di mana retriever 260M memperoleh nDCG@10 sebesar 0.4881 dengan interaksi terlambat dan model 800M memperoleh 0.5126.
Kompressi, Throughput Pengindeksan, dan Ketersediaan
Karena penyimpanan interaksi‑terlambat berskala linear dengan jumlah vektor embedding, halaman beresolusi tinggi mahal untuk diindeks: sebuah halaman 2048×2048 menghasilkan 4.200 vektor dengan NeoMME‑Retriever, sekitar 2,1 MB dalam float32, dan posting melaporkan rata‑rata terukur sekitar 1,5 MB per dokumen pada ViDoRe v3. Tim menggabungkan pooling token hierarkis, yang mengelompokkan vektor dokumen serupa dan menyimpan rata‑rata tiap klaster, dengan kuantisasi asimetris, yang menyimpan embedding dokumen dalam presisi int8 atau biner sementara menyimpan embedding kueri secara dinamis pada presisi lebih tinggi. Pada ViDoRe v3, posting melaporkan bahwa faktor pooling 10 dengan kueri dan dokumen int8 memotong penyimpanan menjadi 39 kB per halaman, pengurangan 39×, sambil mempertahankan lebih dari 99 % nDCG@10 baseline. Pengaturan yang lebih agresif, faktor pooling 8 dengan kueri int8 dan dokumen biner, menggunakan 6 kB per halaman, 255 kali lebih kecil, dan mempertahankan lebih dari 95 % kualitas penarikan.
Tim juga mengukur throughput enkoding menggunakan tensor citra yang telah dipra‑proses, dengan ukuran batch yang dikalibrasi terpisah untuk tiap model dan ukuran citra. Pada input 2048×2048 yang sepadan pada satu GPU NVIDIA L40S, NeoMME‑Retriever‑260M mengenkode sekitar 51 halaman per detik, hampir dua kali lipat dari 26 halaman per detik milik ColModernVBERT, dan posting melaporkan bahwa kedua ukuran NeoMME‑Retriever lebih cepat daripada model lain yang dibandingkan pada resolusi input yang lebih kecil.
Semua checkpoint NeoMME dirilis di bawah lisensi Apache 2.0 dengan implementasi hari‑nol di Hugging Face Transformers, dan demo generasi yang diperkaya penarikan visual tersedia sebagai Hugging Face Space. Untuk fine‑tuning, tim menyediakan checkpoint dense dan interaksi‑terlambat yang terpisah kompatibel dengan Sentence Transformers v6, yang saat ini mendukung satu kepala penarikan per model; melatih kedua kepala secara bersamaan memerlukan kelas NeoMMEForRetrieval dengan Trainer khusus.
Laporan teknis yang menyertainya, oleh Aurélien Lac dan Tony Wu, diajukan ke arXiv pada 31 Agustus 2026, dalam kategori information retrieval. Dalam ucapan terima kasih posting, penulis menggambarkan NeoMME sebagai proyek sampingan yang dibangun dengan waktu dan komputasi terbatas, serta mengucapkan terima kasih kepada H Company atas dukungan kerja dan penyediaan komputasi yang digunakan untuk melatihnya.












