Yapay zeka modelleri ve platformları

H Company NeoMME’yi, Açık Kaynak Çok Modlu Kodlayıcı Ailesi Olarak Yayınladı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

H Company araştırmacıları, 3 Eylül 2026’da NeoMME’yi yayımladı; sıfırdan eğitilmiş ve Apache 2.0 lisansı altında sunulan, 260M ve 800M parametreli çok modlu ve çok dilli kodlayıcılar ailesidir. İnce ayarlı geri getirme varyantları, ekip tarafından bildirildiği üzere, ViDoRe v3 görsel belge geri getirme benchmark’inin model‑boyutu Pareto sınırında yer alıyor.

Yayın gönderisine göre, son zamanlardaki birçok görsel belge geri getirici, önceden eğitilmiş üretken görsel‑dil modellerinden uyarlanmıştır; bu modellerde ayrı bir şekilde önceden eğitilmiş görsel kodlayıcı, bir projeksiyon aracılığıyla nedensel dil modelinin girdi uzayına haritalanan görsel özellikler üretir. Yazarlar, geri getirme, sınıflandırma ve token etiketlemenin metni özerk olarak üretmediğini, bu nedenle bu görevlerin nedensel bir çözücüye ya da onun parametre ve hesaplama yüküne ihtiyaç duymadığını belirtiyor. NeoMME ise metin tokenlarını ve ham görüntü yama parçalarını tek bir ortak çift yönlü Transformer üzerinden çalıştırır ve mevcut herhangi bir önceden eğitilmiş görsel kule, metin kodlayıcı ya da metin çözücüsüne dayanmaz.

Gönderi, tasarımı iki önceki kodlayıcı çabasına karşı konumlandırıyor: çift yönlü metin kodlayıcılarına verimlilik iyileştirmeleri getiren ModernBERT ve ModernVBERT, ModernBERT tarzı bir metin kodlayıcısını görsel belge geri getirmeye uygularken ayrı bir önceden eğitilmiş SigLIP2 görsel kulesini koruyor. Yazarlar, bir görsel‑dil modelinin bileşenlerini bir kodlayıcıya taşımanın getirdiği yükü ortadan kaldırmak istediklerini belirtiyor.

Mimari ve Sıfırdan Ön‑Eğitim

NeoMME’nin iki boyutu da aynı mimariyi paylaşır. Metin girdileri faktörize token gömmeleri kullanırken, görüntüler 32×32 piksel boyutunda örtüşmeyen yama ızgaralarına bölünür ve küçük bir çok katmanlı algılayıcı (MLP) ile projeksiyon yapılır; ardından her ikisi de aynı Transformer kodlayıcısına girer. Görüntüler en boy oranlarını ve boyutlarını korur, bu sayede model yüksek çözünürlüklü, bilgi yoğun bir belge sayfasına, daha küçük bir görüntüye göre daha fazla token ayırabilir. Bağlam uzunluğu 16.384 token olup, iki standart 3840×2160 4K UHD görüntüye kadar yeterlidir. Çoğu katman simetrik kayar‑pencere dikkat mekanizması kullanırken, her altıncı katman ve son katman küresel dikkat uygular. Yığının içinde ayrıca gruplandırılmış sorgu dikkati, sorgu‑anahtar normalizasyonu, kapılı dikkat, 2D döner konum gömmeleri ve karesel‑ReLU MLP’ler bulunur. Metin için ekip, çok dilli metin, kod, matematik ve makine tarafından üretilen görüntü transkriptleri üzerinde sıfırdan 131.072 tokenlık bir sözlükle bir BPE tokenlayıcı eğitti.

NeoMME, sıfırdan ayrık maskeli‑diffüzyon metin gürültü giderici olarak ön‑eğitilmiştir. Yalnızca metin örneklerinde bozulma oranı 0 ile 1 arasında eşit dağılımlı olarak örneklenir ve her uygun metin tokenı bağımsız olarak bu oranda maskelenir. Çok modlu örneklerde bozulma oranları 0,3 ile 1 arasında değişir; görüntü yamaları görünür kalırken model maskelenmiş metni yeniden oluşturur; yazarlar, yoğun maskelenmenin modelin yalnızca dil kısayollarına dayanmak yerine görüntü‑temelli açıklamalar öğrenmesini zorladığını belirtiyor. Ön‑eğitim, çok dilli metin, kod, matematik, doğal görüntüler ve belge görüntülerini karıştırır ve her model yaklaşık 524 milyar paketlenmiş girdi tokenı işler; bunların 290 milyarı yalnızca metin örneklerinden gelir. Bu metin bütçesinin ModernBERT’in 2 trilyon eğitim tokenına göre küçük olduğunu belirten yazarlar, veri verimliliğini artırmak için NorMuon optimizatörünü seçtiklerini ifade ediyor.

Geri Getirme İnce Ayarı ve Benchmark Sonuçları

Temel modeli bir alt görevde değerlendirmek için ekip, ColPali tarafından tanıtılan sayfa‑görüntü metodolojisini kullanarak görsel belge geri getirme için ince ayar yaptı. Çıkarılan metin parçalarını geri getirmek yerine NeoMME‑Retriever, belge sayfalarının ekran görüntülerini sıralar; bu sayede OCR ön işleme atlanır ve düzen, grafikler, tablolar ve tipografi korunur. Geri getirici, temele iki ortak eğitimli baş ekler: gizli durumları ortalama havuzlayarak normalize edilmiş bir vektöre dönüştüren yoğun (dense) baş ve her metin tokenını veya görüntü yamasını 128‑boyutlu normalize edilmiş bir vektöre projeksiyon yapan geç‑etkileşim (late‑interaction) başı; bu, sorgu tokenları ile görüntü bölgeleri arasındaki ince eşleşmeleri korur. Tek bir ileri geçiş her iki temsili de döndürür. Yazarlar, genel olarak geç‑etkileşim gömmelerini öneriyor ve çok büyük veri kümeleri için yoğun geri getirme ardından geç‑etkileşim yeniden sıralama (reranking) sürecini tavsiye ediyor.

ViDoRe v3 benchmark’inde gönderi, NeoMME‑Retriever‑260M için nDCG@10 değerinin 0,523 olduğunu rapor ediyor; bu, değerlendirilen modeller arasında 800M parametrenin altında kalan ve ColQwen2.5’ten 0,002 farkla daha yüksek bir puan ve yaklaşık 14 kat daha az parametre kullanımı anlamına geliyor. NeoMME‑Retriever‑800M ise 0,556 puana ulaşarak benzer boyuttaki Vultron Retriever Flash’tan 0,009 farkla geride kalıyor ve her iki model de benchmark’in model‑boyutu Pareto sınırında yer alıyor. Gönderinin karşılaştırma tablosu, rakip puanlarını MTEB’den alındığını, NeoMME puanlarını ise ekibin kendi değerlendirmeleri olarak işaretliyor. Daha eski ViDoRe v1 ve v2 benchmark’lerinde, nDCG@5 kullanılarak, 260M modelinin ColModernVBERT ve iki kat daha büyük ColSmol‑500M’yi geride bıraktığı; 800M modelinin ise 3,6 kat daha az parametreyle ColPali v1.3’ü geride bıraktığı raporlanıyor.

NeoMME-260M-Retriever model kartı 263M parametre, 1.024 gizli boyut, BF16 ağırlıklar ve Matryoshka kırpma noktaları 128, 256, 512 ve 1.024 boyutlarında olmak üzere 1.024‑boyutlu yoğun gömmeler ile 128‑boyutlu çok‑vektör çıkışını listeler. Kart ayrıca BEIR‑15 üzerindeki metin‑geri getirme sonuçlarını rapor eder; burada 260M geri getirici, geç‑etkileşimle 0,4881 nDCG@10 puan alırken 800M model 0,5126 puan elde eder.

Sıkıştırma, İndeksleme Verimliliği ve Kullanılabilirlik

Geç‑etkileşim depolaması, gömme vektör sayısıyla lineer olarak ölçeklendiği için yüksek çözünürlüklü sayfaların indekslenmesi maliyetlidir: 2048×2048 bir sayfa, NeoMME‑Retriever ile yaklaşık 4.200 vektör üretir; bu da float32’de yaklaşık 2,1 MB demektir ve gönderi, ViDoRe v3 genelinde belge başına ortalama yaklaşık 1,5 MB ölçülen bir değer rapor ediyor. Ekip, benzer belge vektörlerini kümelendirip her kümenin ortalamasını saklayan hiyerarşik token havuzlamayı, int8 veya ikili hassasiyette belge gömmeleri depolayan asimetrik kuantizasyonla birleştirdi; sorgu gömmeleri ise daha yüksek hassasiyette tutulur. ViDoRe v3’te gönderi, int8 sorgular ve belgelerle 10 havuzlama faktörünün depolamayı sayfa başına 39 kB’ye (39 kat azalma) düşürdüğünü, temel nDCG@10’un %99’unun üzerini koruduğunu bildiriyor. Daha agresif bir ayarda, havuzlama faktörü 8, int8 sorgular ve ikili belgelerle, sayfa başına 6 kB kullanılıyor; bu, 255 kat daha küçük ve geri getirme kalitesinin %95’inin üzerini koruyor.

Ekip ayrıca ön işlenmiş görüntü tensörlerini kullanarak kodlama verimliliğini ölçtü; toplu boyutları her model ve görüntü boyutu için ayrı ayrı ayarlandı. Tek bir NVIDIA L40S GPU üzerinde 2048×2048 girdiyle NeoMME‑Retriever‑260M, saniyede yaklaşık 51 sayfa kodlarken, bu değer ColModernVBERT’in 26 sayfasının neredeyse iki katı ve gönderi, her iki NeoMME‑Retriever boyutunun daha düşük giriş çözünürlüklerinde diğer karşılaştırılan modellerden daha hızlı olduğunu rapor ediyor.

Tüm NeoMME kontrol noktaları Apache 2.0 lisansı altında, Hugging Face Transformers içinde gün‑başı (day‑zero) bir uygulama ile yayımlanmıştır ve görsel geri getirme destekli üretim demosu bir Hugging Face Space olarak mevcuttur. İnce ayar için ekip, Sentence Transformers v6 ile uyumlu ayrı yoğun ve geç‑etkileşim kontrol noktaları sunar; bu sürüm şu anda model başına bir geri getirme başı desteklemektedir; iki başı birlikte eğitmek, özel bir Trainer ile NeoMMEForRetrieval sınıfını gerektirir.

teknik rapor, Aurélien Lac ve Tony Wu tarafından hazırlanmış olup, 31 Ağustos 2026’da arXiv’e bilgi geri getirme kategorisinde gönderilmiştir. Gönderinin teşekkür bölümünde yazarlar, NeoMME’yi sınırlı zaman ve hesaplama kaynaklarıyla geliştirilen bir yan proje olarak tanımlıyor ve çalışmayı destekleyen ve eğitmek için kullanılan hesaplama kaynaklarını sağlayan H Company’ye teşekkür ediyor.

Jonas Reeve bilişsel AI, yapay genel zeka (AGI) ve makine zekasının teorik temelleri üzerine odaklanan Unite.AI'de AI tarafından oluşturulan bir analisttir. Çalışmaları, öğrenme, akıl yürütme, bellek ve soyutlama gibi kavramların hem biyolojik hem de yapay sistemlerde nasıl ortaya çıktığını keşfederek, modern AI mimarileri ile bilişsel bilim ve zihin felsefesindeki uzun süredir devam eden sorular arasında bağlantılar kurar.
Kavramsal ve düşünceli bir yaklaşım benimseyen Jonas, akıl yürütme modelleri, ajan sistemleri, ortaya çıkan biliş ve hizalama teorisi gibi çerçeveleri inceleyerek, AGI'ye doğru ilerlemenin ne anlama geldiğini - ve ne anlamadığını - açıklamayı amaçlar. Zaman çizelgesi veya hırs peşinde koşmak yerine, ilk ilkeleri, kavramsal titizliği ve mevcut modellerin sınırlarını vurgular.
Jonas Reeve tarafından yazılan makaleler AI tarafından oluşturulur ve Unite.AI'nin editör ekibi tarafından advanced AI kavramlarının doğruluğu, açıklığı ve sorumlu tartışması için gözden geçirilir.