Yapay zeka modelleri ve platformları
EAGLE: Çeşitli Kodlayıcıların Karışımı Kullanarak Multimodal Büyük Dil Modelleri için Tasarım Alanını Araştırma
Karmaşık görsel bilgileri doğru bir şekilde yorumlama yeteneği, multimodal büyük dil modelleri (MLLM’ler) için önemli bir odak noktasıdır. Recent çalışmalar, geliştirilmiş görsel algının, hallucinasyonları azaltmada ve optical character recognition (OCR) ve document analysis gibi çözünürlük duyarlı görevlerde performansı iyileştirmede önemli olduğunu göstermiştir. Birkaç recent MLLM, bu amaca ulaşmak için çeşitli vision encoders kullanmaktadır. Buna rağmen, kritik yönleri ele alan sistematik karşılaştırmalar ve ayrıntılı ablasyon çalışmaları eksikliği vardır. Bu makale, çeşitli vision encoders ve çözünürlükler kullanarak MLLM’ler için tasarım alanının kapsamlı bir araştırmasını sunmaktadır. Eagle çerçevesi, multimodal büyük dil modelleri için çeşitli kodlayıcıların karışımı kullanarak tasarım alanını araştırmayı amaçlamaktadır. Bulgular, çeşitli mevcut stratejilere ortak olan birkaç temel ilkeyi ortaya koymaktadır. Eagle, basitçe çeşitli vision encoders’ın görsel tokenlerini birleştirmenin, daha karmaşık karıştırma mimarileri veya stratejileri kadar etkili olduğunu keşfeder. Ayrıca, Eagle, vision odaklı encoders ile dil tokenleri arasındaki uçurumu köprülemek için Pre-Alignment’ı tanıtır ve model tutarlılığını tăngtırır. Sonuçlanan MLLM ailesi, Eagle, diğer önde gelen açık kaynaklı modelleri önemli MLLM benchmark’lerinde geçer.
Eagle’ın çalışması, multimodal büyük dil modellerinin (MLLM’ler) genel mimari tasarımıyla ilgilidir. Daha önce bahsedilen açık kaynaklı araştırma hattının yanı sıra, diğer önemli MLLM aileleri arasında MiniGPT-4, Lynx, Otter, QwenVL, CogVLM, VILA, GPT-4V, Gemini ve Llama 3.1 bulunur. Görsel sinyallerin dil modeline nasıl entegre edildiğine bağlı olarak, MLLM’ler “çapraz modal dikkat” modelleri ve “ön ayar” modelleri olarak geniş çapta kategorilere ayrılabilir. İlki, görsel bilgileri LLM’lerin farklı katmanlarına çapraz modal dikkat kullanarak enjekte eder, ikincisi ise görsel tokenleri dil token dizisi olarak tedavi eder ve doğrudan metin gömme ile ekler. Eagle’ın modeli, LLaVA-styled multimodal mimariyi takip ederek ön ayar ailesine aittir. MLLM’nin hızlı bir şekilde büyüyen bir alan olduğu dikkate alındığında, Eagle, daha ayrıntılı çalışmalar ve araştırmalar için daha fazla bilgi edinilmesi önerir.
Eagle’ın çalışması, MLLM’ler için vision encoder tasarımlarını iyileştirmeye odaklanan araştırmalarla yakından ilgilidir. İlk çalışmalar genellikle vision-language alignment görevleri gibi CLIP ve EVA-CLIP üzerine önceden eğitilmiş vision encoders’ı benimsemiştir. Daha güçlü vision encoders, seperti SigLIP ve InternVL, daha iyi tasarımlar, daha büyük model boyutları ve daha etkili eğitim tarifeleri ile vision-language görevlerini iyileştirmek için önerilmiştir. Modeller genellikle düşük çözünürlüklü görsellerde önceden eğitilir ve ince ayrıntıları kodlayabilme yeteneklerinden yoksun olabilir, bu nedenle daha yüksek çözünürlük adaptasyonu sık sık MLLM girişini artırmak için yapılır. Daha yüksek çözünürlük adaptasyonuna ek olarak, LLaVA-NeXT, LLaVA-UHD, Monkey, InternLM-XComposer ve InternVL gibi modeller, yüksek çözünürlüklü girişi işleyebilmek için tiling veya adaptif tiling kullanır, burada görseller daha düşük çözünürlüklü parçalara bölünür ve ayrı ayrı işlenir. Yüksek çözünürlüklü işleme yeteneği, tiling tekniklerine benzer, ancak farklı bir yaklaşım sunar ve her iki yaklaşım da uyumlu ve birleştirilebilir.
EAGLE: Çeşitli Kodlayıcıların Karışımı Kullanarak Multimodal Büyük Dil Modelleri için Tasarım Alanını Araştırma
Büyük dil modellerinin (LLM’ler) başarısı, görsel algı yeteneklerini etkinleştirmeye yönelik önemli bir ilgiyi tetikledi. Bu multimodal büyük dil modellerinin (MLLM’ler) çekirdeğinde, görsellerin görsel tokenlara dönüştürülmesi ve metin gömme ile eklenmesi yer alır. CLIP genellikle vision encoder olarak seçilir, çünkü görsel temsili, metin alanı ile önceden eğitilmiş görüntü-metin çiftleri tarafından hizalanmıştır. Mimarilere, eğitim tarifelerine ve görsel tokenlerin dil modeline nasıl enjekte edildiğine bağlı olarak, nổi bật MLLM aileleri arasında Flamingo, BLIP, PaLI, PaLM-E ve LLaVA bulunur. Bu modellerin çoğu, önceden eğitilmiş vision encoders ve LLM dizisi uzunluğundaki sınırlamalar nedeniyle göreceli olarak düşük giriş çözünürlüklerini korur. Eagle’ın çalışması, geliştirilmiş algı için birden fazla vision encoder kullanan modellerle yakından ilgilidir. Mini-Gemini ve LLaVA-HR, yüksek çözünürlüklü görsel özelliklerini düşük çözünürlüklü görsel tokenlara birleştirmeyi önerir. Çözünürlük sorunlarının ötesinde, bu önceden eğitilmiş vision encoders, metin okumak veya nesneleri yerellemek gibi belirli yeteneklerden yoksun olabilir. Bu nedenle, çeşitli modeller, vision encoders’ı farklı vision görevleri üzerinde önceden eğitmek suretiyle vision encoder’ın yeteneklerini tăngtmak için entegre eder.
Örneğin, Mousi ve Brave gibi modeller, farklı vision encoders’dan görsel tokenları kanal veya token yönünde birleştirmek suretiyle birleştirir. RADIO, farklı vision encoders’ın yeteneklerini tek bir modele birleştirmek için çoklu öğretmen damlatma yöntemini tanır. MoAI, IVE ve Prismer, ayrıca vision uzmanlarının çıktısını, OCR, algılama veya derinlik tahmini gibi ek bilgiler olarak MLLM’lerin cevaplarını üretmek için kullanır. MoVA, verilen görsel ve talimatlarına göre optimal bir vision modeli atamak için bir yönlendirme ağı tasarlar.
Recent çalışmalar, daha güçlü vision encoder tasarımlarının MLLM hallucinasyonlarını azaltmada ve çözünürlük duyarlı görevlerdeki performansı iyileştirmede önemli olduğunu göstermiştir. Birkaç çalışma, vision encoder’ın yeteneklerini, önceden eğitme verilerini ve parametreleri artırarak veya görselleri düşük çözünürlüklü parçalara bölmek suretiyle tăngtmaya odaklanır. Bu yaklaşımlar genellikle büyük eğitim kaynağı talepleri getirir. Bir verimli ancak güçlü strateji, farklı görevlerde ve giriş çözünürlüklerinde önceden eğitilmiş görsel encoders’ı birleştirmektir, ya da daha yüksek çözünürlüklü encoders’ı CLIP encoder ile birleştirmek, veya farklı encoders’dan özelliklerini sırayla eklemek, veya daha karmaşık birleştirma ve yönlendirme stratejilerini benimsemek suretiyle farklı encoders’ın faydalarını en üst düzeye çıkarmaktır. Bu “görsel uzmanların karışımı” yaklaşımı etkili olmuştur, ancak tasarım alanının ayrıntılı bir çalışması ve titiz bir ablasyon çalışması hala eksikliktedir, bu nedenle Eagle bu alana yeniden bakmayı amaçlar. Ana sorular şunlardır: hangi vision encoder kombinasyonlarını seçmek, nasıl farklı uzmanları birleştirmek ve nasıl eğitim stratejilerini birden fazla vision encoder ile ayarlamak.
Bu soruları ele almak için, Eagle sistemli bir şekilde MLLM’ler için çeşitli vision encoders’ın karışımı tasarım alanını araştırır. Bu tasarım alanının araştırılması, aşağıdaki adımları içerir: 1) çeşitli vision encoders’ın benchmarklanması ve daha yüksek çözünürlük adaptasyonu arama; 2) vision encoder birleştirma stratejileri arasında “elma ile elma” karşılaştırması yapma; 3) birden fazla vision encoder’ın optimal kombinasyonunu ilerlemeli olarak tanımlama; 4) vision uzmanlarının önceden hizalanmasını ve veri karışımını iyileştirme. Araştırma adımları aşağıdaki görselde gösterilmiştir.

Eagle’ın çalışması, farklı görevlerde ve çözünürlüklerde önceden eğitilmiş vision encoders’ın performansını kapsar, zoals vision-language alignment, self-supervised öğrenme, algılama, segmentasyon ve OCR. Yuvarlak bir yaklaşım kullanarak, Eagle temel CLIP encoder ile başlar ve her turda en iyi gelişmeyi sağlayan bir uzman ekler.
Eagle’ın çalışması, MLLM’lerde birden fazla vision encoder kullanımına ilişkin değildir, ancak sistematik bir çalışma, bu ayar altında birkaç ana bulgu ortaya koyar:
- Görsel encoders’ın MLLM eğitimi sırasında kilidinin açılması önemlidir. Bu, LLaVA ve diğer modellerde olduğu gibi birden fazla vision encoder veya öğretmenlerin bulunduğu durumlarda görsel encoders’ın kilidinin açılmasının yaygın bir uygulama olduğu gerçeğinin tersidir.
- Bazı yakın zamanda önerilen birleştirma stratejileri önemli avantajlar göstermez. Bunun yerine, kanal birleştirmesi, basit ancak rekabetçi bir birleştirma stratejisi olarak ortaya çıkar ve en iyi verimliliği ve performansı sunar.
- Ek vision uzmanlarının eklenmesi tutarlı kazançlar sağlar. Bu, MLLM algısını sistemli bir şekilde tăngtmak için umut verici bir yol olarak ortaya çıkar, tek encoders’ın ölçeklenmesinden başka. Gelişme, özellikle görsel encoders kilidi açıldığında belirgindir.
- Önceden hizalama aşaması kilit noktadır. Eagle, dondurulmuş bir LLM ile birlikte bireysel olarak fine-tune edilen非 metin hizalı görsel uzmanlarını içeren bir önceden hizalama aşaması tanır. Bu aşama, çeşitli vision encoders’ın karışımı tasarımında MLLM performansı önemli ölçüde tăngtırır.
Eagle: Yöntem ve Mimari
Önceki yöntemlerin aksine, görsel encoders arasında yeni birleştirma paradigması tasarlamak yerine, Eagle’ın amacı, farklı görsel encoders’ı birleştirmek için minimal bir tasarım tanımlamaktır, ayrıntılı ablasyonlar ve gereksiz bileşenlerin kaldırılması ile desteklenir. Aşağıdaki görselde gösterildiği gibi, Eagle, temel CLIP encoder’ı farklı mimarilere, önceden eğitme görevlerine ve çözünürlüklere sahip bir dizi görsel uzmanına genişletir. Bu uzmanlarla, Eagle farklı birleştirma mimarileri ve yöntemlerini karşılaştırır ve birden fazla encoder ile önceden eğitme stratejilerini nasıl optimize edeceğini araştırır.

Son olarak, Eagle tüm bulguları birleştirir ve yaklaşımı birden fazla uzman görsel encoders ile çeşitli çözünürlükler ve alan bilgilerine genişletir. LLaVA-1.5 ile aynı önceden eğitme verilerini kullanarak, Eagle 595k görüntü-metin çiftinden oluşur. Eagle daha sonra denetimli fine-tune aşamasına geçer ve çeşitli görevlerden veri toplar ve bunları multimodal konuşmalara dönüştürür, LLaVA-1.5, Laion-GPT4V, ShareGPT-4V, DocVQA, synDog-EN, ChartQA, DVQA ve AI2D dahil olmak üzere 934k örnek içerir.
Model ilk olarak görüntü-metin çiftleri ile bir epoch için 256’lık bir batch boyutunda önceden eğitilir, burada tüm model dondurulur ve yalnızca projector katmanı güncellenir. İkinci aşamada, model denetimli fine-tune verisi ile bir epoch için 128’lik bir batch boyutunda eğitilir. Bu araştırma için, Eagle Vicuna-7B’yi temel dil modeli olarak kullanır. Öğrenme oranları ilk aşamada 1e-3 ve ikinci aşamada 2e-5 olarak ayarlanır.
Daha Güçlü CLIP Encoder
Eagle, CLIP modeli ile araştırmasını başlatır, çünkü CLIP birçok MLLM için birincil seçim haline gelmiştir. CLIP modelleri, multimodal görevleri tăngtmede bilinen sınırlamalara sahip olmasına rağmen, multimodal görevleri tăngtmede önemlidir. Örneğin, birçok mevcut MLLM, önceden eğitilmiş CLIP çözünürlüklerini (örneğin 224 × 224 veya 336 × 336) giriş çözünürlükleri olarak kullanır. Bu durumlarda, encoders genellikle ince ayrıntıları yakalamakta zorluk çeker, bu da OCR ve belge anlama gibi çözünürlük duyarlı görevler için önemlidir.

Giriş çözünürlüğünü artırmak için yaygın bir yaklaşım, tiling’dir, burada giriş görselleri ayrı ayrı işlenen daha düşük çözünürlüklü parçalara bölünür. Daha basit bir yöntem, doğrudan giriş çözünürlüğünü ölçeklemek ve gerektiğinde vision transformer modelinin konum gömmelerini interpolasyon etmektir. Eagle, bu iki yaklaşımı dondurulmuş ve kilidsiz vision encoders ile çeşitli çözünürlüklerde karşılaştırır ve sonuçlar aşağıdaki tabloda yer alır. Bulgular aşağıdaki gibi özetlenebilir:
- CLIP encoder’ın kilidinin açılması, CLIP önceden eğitme çözünürlüğünden farklı bir daha yüksek MLLM giriş çözünürlüğüne interpolasyon edildiğinde önemli bir iyileşme sağlar, aynı çözünürlüklerde ise performans azalmaz.
- CLIP encoder’ın dondurulması ve doğrudan daha yüksek bir MLLM giriş çözünürlüğüne adaptasyonu, performansı önemli ölçüde bozar.
- Karşılaştırılmış stratejiler arasında, 448 × 448’e interpolasyon yaparak kilitsiz CLIP encoder, hem performans hem de maliyet açısından etkili ve verimlidir.
- En iyi CLIP encoder, daha küçük bir model (300M vs 6B) ve daha az önceden eğitme verisi ile InternVL’ye yakın bir performans gösterir.
CLIP-448, Eagle’a LLaVA-HR ve InternVL ile aynı ayarları sağlamak için olanak tanır, burada CLIP encoders da 448 × 448 girişini alır ve 1024 yama tokenları üretir. Daha ileri bir araştırma için, Eagle basit bir stratejiyi takip eder, giriş çözünürlüğünü ölçeklendirir ve vision encoder’ı eğitim sırasında kilidini açar.

Eagle, mevcut popüler birleştirma stratejilerinin, tasarım varyasyonlarına rağmen, aşağıdaki gibi geniş çapta kategorilere ayrılabilir:
- Dizi Ekleme: Farklı backbones’dan görsel tokenları doğrudan bir dizi olarak eklemek.
- Kanal Birleştirme: Görsel tokenları kanal boyutunda birleştirmek, dizi uzunluğunu artırmadan.
- LLaVA-HR: Yüksek çözünürlüklü özellikleri, düşük çözünürlüklü vision encoders’a bir karışım-çözünürlük adaptörü kullanarak enjekte etmek.
- Mini-Gemini: CLIP tokenlarını, başka bir yüksek çözünürlüklü vision encoder’a yerel pencerelerde çapraz dikkat ile sorgulamak için düşük çözünürlüklü sorgular olarak kullanmak.
- Deformable Dikkat: Mini-Gemini’nin üzerine kurulan yeni bir temel, burada vanilla pencere dikkati deformable dikkat ile değiştirilir.

LLaVA’nın orijinal önceden eğitme stratejisinin aksine, birden fazla vision uzmanı aynı anda hizalanmaz, bunun yerine her bir uzmanın temsilini, daha küçük bir dil modeli (pratikte Vicuna-7B) kullanarak next-token-prediction denetimi ile hizalar. Aşağıdaki görselde gösterildiği gibi, önceden hizalama ile birlikte, tüm eğitim süreci aşağıdaki adımları içerir: 1) her önceden eğitilmiş vision uzmanı, dondurulmuş bir dil modeli ile SFT verisi üzerinde kendi projector’u ile eğitilir; 2) tüm vision uzmanları birleştirilir ve yalnızca projector, görüntü-metin çiftleri verisi üzerinde eğitilir; 3) tüm model, SFT verisi üzerinde eğitilir.

Eagle: Deneyler ve Sonuçlar
Eagle, stratejilerini geliştirdikten sonra, model için aşağıdaki ilkeleri belirlemiştir: (1) daha fazla vision uzmanı ile optimize edilmiş bir eğitim tarifi entegre etmek; (2) birden fazla vision uzmanı ile doğrudan kanal birleştirmesi yapmak; (3) vision uzmanlarını ayrı olarak önceden hizalamak. Bu bölümde, Eagle modellerinin avantajlarını daha da göstermek için, ek eğitim verisi entegre edilir ve Eagle, çeşitli görevlerde mevcut en iyi MLLM’lerle karşılaştırılır. Eagle, Vicuna-v1.5-7B, Llama3-8B ve Vicuna-v1.5-13B’yi dil modelleri olarak kullanır. Vision encoders için, Bölüm 2.6’daki sonuçlara dayanarak, Eagle modelleri Eagle-X4 olarak adlandırılır, bu dört vision encoder’ı içerir: CLIP, ConvNeXt, Pix2Struct ve EVA-02, ve Eagle-X5, ek bir SAM vision encoder’ı içerir.
Görsel Soru Cevaplandırma Görevleri
Eagle, model serisini üç Görsel Soru Cevaplandırma (VQA) benchmark’lerinde karşılaştırır: GQA, VQAv2 ve VizWiz. Aşağıdaki tabloda gösterildiği gibi, Eagle-X5 GQA ve VQAv2’de en iyi performansı gösterir, birden fazla vision uzmanı entegrasyonunun avantajlarını vurgular.

OCR ve Grafik Anlama Görevleri
Eagle’ın OCR, belge ve grafik anlama yeteneklerini değerlendirmek için, model OCRBench, TextVQA ve ChartQA’da benchmarklanır. Aşağıdaki tabloda gösterildiği gibi, Eagle TextVQA’da rakiplerini önemli ölçüde geçer, yüksek çözünürlüklü mimarisi ve farklı vision encoders’ın entegrasyonu sayesinde yararlanır. Eagle, karmaşık tile分解ü gerektirmeden 1024 token’ı destekler.
Aşağıdaki görsel, OCR ve belge anlama örneklerini sunar. Yüksek çözünürlüklü adaptasyon ve birden fazla vision uzmanı entegrasyonu ile, Eagle küçük metinleri görseller içinde tanımlayabilir ve kullanıcı talimatlarına dayalı olarak bilgi çıkarabilir.

Birden fazla vision uzmanı entegrasyonunun faydalarını daha iyi anlamak için, aşağıdaki görsel, yalnızca ConvNeXt ve CLIP vision encoders’ı içeren bir modelin sonuçlarını Eagle-X5’in sonuçları ile karşılaştırır. Tam vision encoders kümesiyle, model hataları düzeltir ve yüksek çözünürlüklü görsel encoders’ın yeteneklerini, çeşitli vision görevleri üzerinde önceden eğitilmiş ek vision uzmanları ile tăngtmanın avantajını gösterir.

Multimodal Benchmark Değerlendirmesi
Eagle, MLLM’lerin çeşitli yönlerden yeteneklerini göstermek için yedi benchmark’te değerlendirilir: MME, MMBench, SEED, MathVista, MMMU, ScienceQA ve POPE. Özellikle MME, MMBench ve SEED, çeşitli gerçek dünya görevlerinde genel performansı değerlendirir. MMMU, çeşitli alanlardan kolejlere özgü bilgi gerektiren zor görevlere odaklanır. POPE, MLLM’lerin görsel hallucinasyonlarını değerlendirir. Kullanılan metriklere, bu benchmark’lerin varsayılan ayarlarına uyulur, böylece diğer modellerden bildirilen skorlarla uyumlu olur.

Son Düşünceler
Bu makalede, Eagle’ı, multimodal büyük dil modelleri için tasarım alanının kapsamlı bir araştırmasını sunan bir çalışmayı tanıttık. Önceki çalışmaların aksine, yeni birleştirma paradigması veya mimari tasarlamak yerine, Eagle sistemli tasarım seçimlerinin önemini vurgular ve çeşitli teknikler keşfeder. Eagle, bireysel vision encoders’ın eğitim tarifelerini optimize eder, genişletilebilir ve verimli bir birleştirma yöntemi tanımlar ve farklı alan bilgilerine sahip vision encoders’ı birleştirir. Sonuçlar, temel tasarım alanı dikkate alınmasının kritik önemini vurgular.












