Yapay zeka modelleri ve platformları

MoE-LLaVA: Büyük Görsel Dilleri Modelleri için Uzmanlar Karışımı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Son zamanlarda Büyük Görsel Dilleri Modelleri (LVLM) alanındaki ilerlemeler, bu çerçevelerin önemli ölçüde ölçeklendirilmesinin, çeşitli aşağı akış görevleri boyunca performansı artırabileceğini göstermiştir. MiniGPT, LLaMA ve diğerleri gibi LVLM’ler, mimarilerine görsel proje katmanları ve bir görüntü kodlayıcı entegre ederek dikkat çekici yetenekler elde etmiştir. Bu bileşenleri uygulayarak, LVLM’ler, Büyük Dilleri Modellerinin (LLM) görsel algılama yeteneklerini geliştirmektedir. Performans, modelin boyutunu ve parametre sayısını artırarak, ayrıca veri kümesi ölçeğini genişleterek daha da iyileştirilebilir.

InternVL gibi modeller, görüntü kodlayıcısını 6 milyara varan parametrelerle genişletirken, diğerleri LVLM’lerin arka ucunu 13 milyara varan parametrelerle genişletmiştir ve çeşitli görevlerde üstün performans sergilemiştir. IDEFICS, 80 milyara varan parametrelerle bir LVLM eğitmiştir. Bu ölçeklendirme yöntemleri, 34, 70 veya hatta 100 milyara varan parametrelerle ön eğitimli LLM’lerin performansını eşleştirmiş veya aşmıştır. Ancak, ölçeklendirme bir dezavantaja sahiptir: eğitim ve çıkarım maliyetlerini önemli ölçüde artırır. Bu, her hesaplamada tüm parametrelerin aktif olmasını gerektirir, bu da yüksek hesaplama ihtiyaçlarına ve dolayısıyla daha yüksek maliyetlere yol açar.

Bu makale, MoE-LLaVA’yı, LVLM’ler için etkili bir eğitim stratejisi olan MoE-Tuning kullanan bir Uzmanlar Karışımı (MoE) tabanlı seyrek LVLM mimarisini ele almaktadır. MoE-Tuning, çok modlu seyrek öğrenmede performans bozulmasını yenilikçi bir şekilde ele alır, bu da parametrenin büyük bir sayısı olan ancak tutarlı eğitim ve çıkarım maliyetleri olan bir model ile sonuçlanır. MoE-LLaVA mimarisi, yalnızca üst-k uzmanların dağıtım sırasında aktif olmasını sağlamak için tasarlanmıştır, kalan uzmanları pasif bırakır.

MoE-LLaVA çerçevesini, mekanizmasını, metodolojisini, mimarisini ve önde gelen görüntü ve video oluşturma çerçeveleri ile nasıl karşılaştırıldığını inceleyeceğiz.

MoE-LLaVA: Büyük Görsel Dilleri Modellerini Makul Bir Şekilde Ölçeklendirme

Büyük Görsel Dilleri Modelleri, görsel proje katmanları ve görüntü kodlayıcıları kullanmanın yanı sıra, model performansını artırmak için model boyutunu artırarak parametre sayısını da artırır. MiniGPT-4, InternGPT, InternVL ve diğerleri gibi bazı著名 Büyük Görsel Dilleri Modelleri, performanslarını artırmak için bu yaklaşımı takip etmiştir. Gerçek dünya uygulamalarında, yüksek kaliteli eğitim verisi ile Büyük Dilleri Modelini veya Büyük Görsel Dilleri Modelini ölçeklendirme, model performansını iyileştirmek için thường bir gereksinimdir. Ancak, model boyutunu ölçeklendirme, eğitim ve çıkarım maliyetlerini artırır ve paralel cihazlara同时 dağıtma complications ve verimliliği de artırır. Artan eğitim ve çıkarım maliyetlerinin ve hesaplama gereksinimlerinin ana nedeni, her tokenin modelin tüm parametreleri ile hesaplanması gereken yoğun bir model olmasıdır.

Öte yandan, seyrek MoE veya Uzmanlar Karışımı Modelleri, veri işlerken sabit aktif parametreleri kullanarak çerçevelemelerin etkili bir şekilde ölçeklendirilmesini göstermiştir, bu yaklaşım Doğal Dil İşleme alanında yaygın olarak benimsenmiştir. Ancak, Büyük Görsel Dilleri Modellerini doğrudan Uzmanlar Karışımı ile eğitmek zorlu bir görevdir, çünkü LLM’leri LVLM’lere dönüştürmek ve modeli aynı anda seyrek hale getirmek önemli performans bozulmasına neden olur. MoE-LLaVA çerçevesi, MoE-Tuning olarak bilinen bir eğitim stratejisini tanıtarak bu sorunu ele alır.

Aşağıdaki resimdeki gibi, MoE-Tuning işlemi ilk aşamada bir MLP veya Çok Katmanlı Perceptron kullanarak görsel tokenleri Büyük Dilleri Modeline uyarlar. Ardından, çerçeve tüm LLM parametrelerini, Büyük Görsel Dilleri Modelini genel çok modlu anlama yetenekleri ile donatmak için eğitir. Son olarak, üçüncü aşamada, çerçeve FFN veya İleri Doğru Ağını uzmanlar için başlatma ağırlıkları olarak çoğaltır ve yalnızca Uzmanlar Karışımı katmanlarını eğitir. Genel olarak, eğitim süreci seyrek modelin LVLM başlatmasından Uzmanlar Karışımı modeline dần dần geçişine yardımcı olur.

Eğitim sürecini ele aldığımıza göre, MoE-LLaVA’ya, öğrenilebilen yönlendiriciler ve MoE modelleri ile Büyük Görsel Dilleri Modelleri için bir temel olarak bakalım. MoE-LLaVA modelinin temelinde, öğrenilebilen bir yönlendirici kullanarak her tokeni farklı uzmanlara gönderen birden fazla seyrek yol bulunur. Tokenler, aktif uzmanlar tarafından topluca işlenirken, pasif yollar sessiz kalır. Çerçeve, daha büyük ve daha güçlü bir LVLM’ye doğru seyrek bir yol sağlamak için Uzmanlar Karışımı kodlayıcı katmanlarını yinelemeli olarak yığar.

MoE-LLaVA çerçevesi tarafından uygulanan yaklaşım sayesinde, benzer sayıda aktif parametreleri olan modelleri önemli bir farkla aşar ve POPE nesne hallucination benchmarkinde benzer bir performans sergiler, yalnızca 2.2 milyar parametre ile. Ayrıca, 2.2 milyar parametre ile MoE-LLaVA çerçevesi, yaklaşık 8 kat daha fazla aktif parametre ile InternVL-Chat-19B çerçevesi ile benzer bir performans sergiler.

Güçlü Büyük Dilleri Modelleri, güçlü genelleme ve talimat takibi yetenekleri ile uygulanmıştır. Büyük Görsel Dilleri Modellerine, BLIP gibi erken LLM’ler görsel sinyalleri görsel tokenlerin bir dizesine kodlayarak, birden fazla proje katmanı kullanarak başarılı bir şekilde vizyonu LLM’lere uyarlamıştır. Aynı zamanda, son çalışmalar model performansını iyileştirmek için yöntemler uygulamaya odaklanmıştır, Örneğin, talimat-takip veri kümesini genişletme, görüntü çözünürlüğünü artırma, eğitim stratejilerini optimize etme, girişi hizalama, görüntü kodlayıcısını geliştirme ve daha fazlası. Bu yaklaşımlar, görsel talimat fine-tuning veri kümesini ve model ölçeklerini genişleterek LVLM’leri güçlü görsel anlama yetenekleri ile donatmıştır. Ayrıca, bazı LVLM’ler bölgesel ve çok bölgesel görüntü anlama yeteneklerine sahiptir, ayrıca piksel bazında zemine bağlı yeteneklere sahiptir. Ancak, dense görsel veri ve modelleri ölçeklendirme ile ilgili hesaplama maliyeti genellikle çok yüksektir, bu da onu giymeyi zorlaştırır. Öte yandan, MoE-LLaVA çerçevesi, Uzmanlar Karışımı modellerinin yeteneklerini kullanarak LVLM araştırmalarını daha uygun fiyatlı hale getirmeyi amaçlar.

MoE-LLaVA: Yöntem ve Mimarisi

MoE-LLaVA çerçevesinin temelinde, bir görsel proje katmanı (Çok Katmanlı Perceptron), bir görüntü kodlayıcı, MoE blokları, birden fazla yığılmış LLM blokları ve bir kelime gömme katmanı bulunur.

Mimarisi

Aşağıdaki tablo, MoE-LLaVA çerçevesinin ayrıntılı yapılandırmasını özetler.

Verilen bir RGB görüntüsü için, görüntü kodlayıcı görüntüleri işler ve görsel tokenlerin bir dizesini alır, görsel proje katmanı ise görsel token dizisini girdi görüntülerine eşler. Metin girdileri, kelime gömme katmanı tarafından işlenir ve sonra token dizisi olarak projelendirilir. Aynı zamanda, MoE-LLaVA çerçevesi metin ve görsel tokenleri birbirine bağlar ve bunları LLM’ye besler. Ancak, çerçeve yalnızca görsel proje katmanını büyük bir dil modeli ile birlikte eğitir, bu model FFN veya İleri Doğru Ağları ve Çok Başlı Kendi Kendine Dikkat Katmanlarından oluşur. Son olarak, çerçeve her bloğa artımsal bağlantılar ve katman normalizasyonu uygular.

Devam ederek, MoE-LLaVA çerçevesi ikinci aşamadan FFN veya İleri Doğru Ağlarını çoğaltarak uzmanları başlatma adımını oluşturur. Yönlendirici, bir lineer katmandır ve her tokenin her uzmanla eşleşme olasılığını öngörür. Her token, en yüksek olasılığa sahip üst-k uzmanlar tarafından işlenir ve yönlendirici olasılıklarının softmax sonucu temelinde ağırlıklı toplam hesaplanır.

MoE-Tuning

MoE-Tuning, ilk aşamada bir MLP veya Çok Katmanlı Perceptron kullanarak görsel tokenleri Büyük Dilleri Modeline uyarlayan, ardından tüm LLM parametrelerini Büyük Görsel Dilleri Modelini genel çok modlu anlama yetenekleri ile donatmak için eğiten ve son olarak üçüncü aşamada FFN veya İleri Doğru Ağını uzmanlar için başlatma ağırlıkları olarak çoğaltan ve yalnızca Uzmanlar Karışımı katmanlarını eğiten basit ancak etkili bir üç aşamalı eğitim stratejisidir.

Aşama 1

İlk aşamada, ana hedef görsel tokenleri Büyük Dilleri Modeline uyarlamaktır, bu da LLM’nin görüntüdeki örnekleri anlamasını sağlar. MoE-LLaVA çerçevesi, görsel tokenleri Büyük Dilleri Modelinin girdi alanına projelendirmek için bir Çok Katmanlı Perceptron kullanır ve görüntü parçalarını pseudo-metin tokenleri olarak ele alır. Bu aşamada, MoE-LLaVA çerçevesi LLM’yi görüntüleri tanımlamak için eğitir ve bu aşamada LLM’ye MoE katmanlarını uygulamaz.

Aşama 2

İkinci aşamada, MoE-LLaVA çerçevesi, çerçevenin yeteneklerini ve kontrol edilebilirliğini, çok modlu talimat veri kümesi ile modeli ayarlayarak tăngtmayı amaçlar. MoE-LLaVA çerçevesi, LLM’yi bir LVLM’ye dönüştürür, bu da daha güçlü çok modlu yeteneklere sahip bir model oluşturur. Çerçeve, metin tanıma ve mantıksal görüntü akıl yürütme görevleri gibi daha karmaşık talimatlar kullanır, bu görevler modelin daha güçlü çok modlu yeteneklere sahip olmasını gerektirir. Geleneksel olarak, dense modeller için eğitim süreci bu adımda tamamlanmış kabul edilir. Ancak, MoE-LLaVA çerçevesi, LLM’yi aynı zamanda seyrek bir LVLM’ye dönüştürürken zorluklarla karşılaşmıştır. Bu zorluğu karşılamak için, çerçeve bir sonraki aşama için başlatma ağırlıkları olarak bu aşamadan alınan ağırlıkları kullanır.

Aşama 3

Üçüncü aşamada, model FFN veya İleri Doğru Ağını birkaç kez çoğaltarak uzmanları başlatma adımını oluşturur. Çerçeve, metin ve görsel tokenleri Uzmanlar Karışımı katmanlarına besler, ardından yönlendirici her token ile uzmanlar arasındaki eşleşme olasılığını hesaplar. Her token, en yüksek olasılığa sahip üst-k uzmanlar tarafından işlenir ve ağırlıklı toplam, yönlendirici olasılıklarının softmax sonucu temelinde hesaplanır. Üst-k uzmanlar aktif olduğunda, model kalan uzmanları pasif hale getirir, bu da MoE-LLaVA çerçevesine sonsuz sayıda seyrek yol sağlar ve modeli geniş bir yetenek yelpazesi ile donatır.

MoE-LLaVA: Sonuçlar ve Deneyler

MoE-LLaVA çerçevesi, CLIP-Large’u görüntü kodlayıcı olarak kullanır, Çok Katmanlı Perceptron iki katmandan oluşur ve GELU aktivasyon katmanı iki katman arasında bulunur. Varsayılan olarak, çerçeve, besleme ileri ağları ile Uzmanlar Karışımı katmanlarının alternatif değişimini kullanır, bu da Uzmanlar Karışımı katmanlarının toplam katman sayısının %50’sini oluşturduğu anlamına gelir. Aşağıdaki tablo, MoE-LLaVA çerçevesini eğitmek ve değerlendirmek için kullanılan farklı veri kümeleri ve örnek boyutlarını içerir.

Sıfır Atışlı Görsel Soru Cevaplaması

Aşağıdaki resim, MoE-LLaVA’nın bir LVLM’ye dayalı bir seyrek model olduğunu ve bir yumuşak yönlendiriciye sahip olduğunu gösterir. Çerçeve, beş farklı görüntü soru cevaplaması benchmarkinde değerlendirilir ve görüldüğü gibi, MoE-LLaVA çerçevesi dikkat çekici görüntü anlama yetenekleri sergiler ve beş farklı benchmarkte LLaVA 1.5 çerçevesi ile benzer bir performans gösterir.

Nesne Hallüsinasyon Değerlendirmesi

Nesne hallüsinasyonunu değerlendirmek için, MoE-LLaVA çerçevesi POPE değerlendirme pipeline’ını kullanır, bu bir anket tabanlı sorgu yöntemidir ve sonuçlar aşağıdaki tabloda gösterilir. Görüldüğü gibi, tüm çerçeveler arasında MoE-LLaVA, girdi görüntüsü ile tutarlı nesneler oluşturabilme yeteneği açısından en güçlü sonuçları verir. Ayrıca, MoE-LLaVA çerçevesinin evet oranını iyi bir şekilde dengelediği de dikkat çekicidir, bu da sorulara verilen cevapların doğruluğunu gösterir.

Aşağıdaki resim, uzman yüklemelerinin dağılımını gösterir, burada kesintili çizgiler, modlar veya uzmanlar arasında tokenlerin iyi bir şekilde dengelenmiş dağılımını temsil eder. İlk resim, uzmanlar içindeki yükü gösterirken, kalan resimler farklı modlara karşı uzmanların performansını gösterir.

Ayrıca, aşağıdaki resim uzmanlar arasındaki modların dağılımını gösterir.

Son Düşünceler

Bu makalede, MoE-LLaVA’yı, öğrenilebilen yönlendiriciler ve MoE modelleri ile Büyük Görsel Dilleri Modelleri için bir temel olarak ele aldık. MoE-LLaVA modelinin temelinde, birden fazla seyrek yol bulunur ve çerçeve bu yolları kullanarak her tokeni farklı uzmanlara gönderir. Tokenler, aktif uzmanlar tarafından topluca işlenirken, pasif yollar sessiz kalır. Çerçeve, daha büyük ve daha güçlü bir LVLM’ye doğru seyrek bir yol sağlamak için Uzmanlar Karışımı kodlayıcı katmanlarını yinelemeli olarak yığar. MoE-Tuning stratejisi, çok modlu seyrek öğrenmede performans bozulmasını yenilikçi bir şekilde ele alır, bu da parametrenin büyük bir sayısı olan ancak tutarlı eğitim ve çıkarım maliyetleri olan bir model ile sonuçlanır. MoE-LLaVA çerçevesinin mimarisi, yalnızca üst-k uzmanların dağıtım sırasında aktif olmasını sağlamak için tasarlanmıştır, kalan uzmanları pasif hale getirir.

Kunal Kejriwal, Python, PostgreSQL, Redis ve GCP ile AWS üzerindeki bulut altyapısında uzmanlaşmış bir backend mühendisi. Üç yıllık üretim sistemleri inşa etme ve ölçeklendirme deneyimine sahip olan Kunal, AI altyapısı, dağıtık sistemler ve makine öğrenimi iş yüklerini dağıtmanın mimarisi hakkında yazıyor.