Yapay zeka modelleri ve platformları

Uni-MoE: Birleşik Çoğul Modlu Büyük Dil Modellerini Uzmanların Karışımı ile Ölçeklendirme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Çok modlu büyük dil modellerinin (MLLM) mimari ve performansındaki recent gelişmeler, performansını artırmak için ölçeklenebilir verilerin ve modellerin önemini vurgulamıştır. Bu yaklaşım performansını artırmasına rağmen, önemli hesaplamalı maliyetler ortaya çıkarmaktadır. Mixture of Expert (MoE) modelleri, büyük dil modellerini ve görüntü-metin modellerini verimli bir şekilde ölçeklemek için başarılı bir alternatif yaklaşım olarak ortaya çıkmıştır. Ancak, MoE modelleri büyük dil modellerini ölçeklemek için ideal bir yaklaşım değildir, çünkü genellikle daha az uzman ve sınırlı modlar içerirler, bu da uygulamaları sınırlar.

Mevcut yaklaşımların karşılaştığı engelleri aşmak ve büyük dil modellerini verimli bir şekilde ölçeklemek için, bu makalede Uni-MoE adlı birleşik bir çok modlu büyük dil modeli hakkında konuşacağız. Uni-MoE, Uzmanların Karışımı (MoE) mimarisi ile donatılmış bir modeldir ve geniş bir mod ve uzman yelpazesini işleyebilir. Uni-MoE çerçevesi, büyük dil modelleri içinde Uzmanların Karışımı mimarisini uygulayarak, uzman seviyesinde model paralelliği ve veri paralelliği kullanarak eğitim ve çıkarım sürecini daha verimli hale getirmeyi amaçlar. Ayrıca, Uni-MoE çerçevesi, genellemeyi ve çoklu uzman işbirliğini artırmak için üç farklı sürecin birleşiminden oluşan ilerici bir eğitim stratejisi sunar. İlk olarak, Uni-MoE çerçevesi çeşitli bağlayıcılar kullanarak farklı modlar arası hizalama gerçekleştirir. İkinci olarak, Uni-MoE çerçevesi, uzman bileşenlerin tercihlerini, modlara özgü uzmanları modlar arası eğitim verisi ile eğitmek suretiyle etkinleştirir. Son olarak, Uni-MoE modeli, karıştırılmış çok modlu eğitim verisi üzerinde LoRA veya Düşük Rütbe Uyumlaştırma öğrenme tekniğini uygulayarak modeli ayarlar.

Bu makale, Uni-MoE çerçevesini derinlemesine ele almayı amaçlar ve mekanizmasını, metodolojisini, mimarisini ve devlet-sanatlı çerçevelerle karşılaştırmasını keşfeder. Başlayalım.

Uni-MoE: Birleşik Çoğul Modlu Büyük Dil Modellerini Ölçeklendirme

Açık kaynaklı çok modlu büyük dil modelleri, LLama ve InstantBlip gibi, son yıllarda görüntü-metin anlama görevlerindeki önemli başarıları ve gelişmeleri vurgulamıştır. Ayrıca, AI topluluğu, geleneksel görüntü-metin paradigması ötesinde, görüntü, metin, ses, video ve daha fazlasını içeren geniş bir mod yelpazesini barındıran birleşik bir çok modlu büyük dil modeli oluşturmak için aktif olarak çalışmaktadır. Açık kaynak topluluğunun çok modlu büyük dil modellerinin yeteneklerini artırmak için izlediği ortak bir yaklaşım, vizyon temel modellerinin boyutunu artırmak, bunları büyük dil modelleri ile entegre etmek ve çeşitli çok modlu veri kümelerini kullanarak talimat ayarlamasını artırmaktır. Bu gelişmeler, çok modlu büyük dil modellerinin çoklu modları işleyip anlamlandırma yeteneklerinin artmasını vurgulamıştır.

Bir modeli ölçeklemek, önemli sonuçlar veren denenmiş bir yaklaşımdır, ancak hem eğitim hem de çıkarım süreçleri için hesaplamalı maliyetli bir işlemdir.

Yüksek hesaplamalı maliyetleri aşmak için, açık kaynak topluluğu, büyük dil modellerinin eğitim ve çıkarım verimliliğini artırmak için Uzmanların Karışımı (MoE) mimarisini entegre etmeye yönelmektedir. Çoğu çok modlu büyük dil modelinin ve büyük dil modelinin her girdiyi işlerken tüm mevcut parametreleri kullandığı yoğun bir hesaplamalı yaklaşımın aksine, Uzmanların Karışımı mimarisi yalnızca her girdinin bir uzman parametre alt kümesini etkinleştirmesini gerektirir. Bu nedenle, Uzmanların Karışımı yaklaşımı, geniş modellerin verimliliğini artırmak için yoğun parametre etkinleştirmesi olmadan hesaplamalı maliyetleri azaltan bir yol olarak ortaya çıkmaktadır. Mevcut çalışmalar, Uzmanların Karışımı modellerinin metin yalnızca ve metin-görüntü büyük modellerinin oluşturulmasındaki başarılı entegrasyonunu vurgulamıştır, ancak araştırmacılar, güçlü birleşik çok modlu büyük dil modelleri oluşturmak için Uzmanların Karışımı mimarisini geliştirmenin potansiyelini tam olarak keşfetmemiştir.

Uni-MoE, Uzmanların Karışımı modellerini kullanarak çoklu modları işleyip yönetmeye çalışan bir çok modlu büyük dil modelidir. Aşağıdaki resimde gösterildiği gibi, Uni-MoE çerçevesi önce farklı modların kodlamasını modlara özgü kodlayıcılar kullanarak alır ve ardından bu kodlamaları büyük dil modellerinin dil temsil alanına çeşitli tasarlanmış bağlayıcılar kullanarak haritalar. Bu bağlayıcılar, dondurulmuş kodlayıcının çıktı temsilini damıtmak ve projeksiyonlamak için ardışık lineer projeksiyonlarla birlikte eğitilebilir bir transformer modeli içerir. Uni-MoE çerçevesi daha sonra, büyük dil modelinin iç bloğunda Uzmanların Karışımı katmanlarını tanıtır. Her Uzmanların Karışımı tabanlı blok, tüm modlar için ortak bir self-attention katmanı, token seviyesinde uzmanlık tahsis etmek için bir sparse router ve besleme ileri ağlarına dayalı çeşitli uzmanları içerir. Bu yaklaşıma bağlı olarak, Uni-MoE çerçevesi ses, ses, metin, video, görüntü ve diğer çoklu modları anlar ve yalnızca kısmi parametreleri etkinleştirerek çıkarım sırasında hesaplamalı maliyetleri azaltır.

Ayrıca, çoklu uzman işbirliğini ve genellemeyi artırmak için, Uni-MoE çerçevesi üç aşamalı bir eğitim stratejisi uygular. İlk aşamada, çerçeve, büyük dil modelinin dil alanında birleşik mod temsilini kullanarak, karşılık gelen bağlayıcıyı eğitmek için geniş görüntü/ses-metin çiftlerini kullanır. İkinci olarak, Uni-MoE modeli, her uzmanın uzmanlığını kendi alanında iyileştirmek için modlara özgü uzmanları modlar arası veri kümeleri ile ayrı ayrı eğitmektedir. Üçüncü aşamada, Uni-MoE çerçevesi, bu eğitilmiş uzmanları büyük dil modelinin Uzmanların Karışımı katmanına entegre eder ve tüm Uni-MoE çerçevesini karıştırılmış çok modlu talimat verisi ile eğitmektedir. Eğitim maliyetini daha da azaltmak için, Uni-MoE çerçevesi, self-attention katmanlarını ve önceden ayarlanmış uzmanları ayarlamak için LoRA öğrenme yaklaşımını kullanır.

Uni-MoE: Metodoloji ve Mimari

Uni-MoE çerçevesinin temel motivasyonu, çok modlu büyük dil modellerinin eğitim ve çıkarım maliyetlerinin yüksek olması ve Uzmanların Karışımı modellerinin verimliliği ile birlikte, Uzmanların Karışımı mimarisini kullanarak verimli, güçlü ve birleşik bir çok modlu büyük dil modeli oluşturmak için bir fırsat olarak ortaya çıkmaktadır. Aşağıdaki şekil, Uni-MoE çerçevesinin mimarisini, ses, konuşma ve görseller için bireysel kodlayıcılar ve ilgili mod bağlayıcıları içeren bir tasarım sunar.

Uni-MoE çerçevesi daha sonra, büyük dil modelinin eğitim ve çıkarım verimliliğini artırmak için Uzmanların Karışımı mimarisini büyük dil modeli blokları ile entegre eder. Bu, sparse bir yönlendirme mekanizması uygulayarak gerçekleştirilir. Uni-MoE çerçevesinin genel eğitim süreci, modlar arası hizalama, modlara özgü uzmanları eğitime tabi tutma ve çeşitli çok modlu talimat veri kümeleri kullanarak Uni-MoE’yi ayarlamadan oluşan üç aşamaya bölünür. Farklı mod girişlerini dilbilimsel bir forma dönüştürmek için, Uni-MoE çerçevesi, LLaVA adlı önceden eğitilmiş bir görsel dil çerçevesi üzerine kuruludur. LLaVA temel modeli, görsel kodlayıcı olarak CLIP’i ve görüntü özelliklerini soft görüntü tokenlerine dönüştürmek için lineer bir projeksiyon katmanını içerir. Ayrıca, video içeriğini işlemek için, Uni-MoE çerçevesi her videodan sekiz temsilci kare seçer ve bunları video tokenlerine dönüştürmek için ortalama havuzlama kullanarak birleştirir. Ses görevleri için, Uni-MoE çerçevesi iki kodlayıcı, BEATs ve Whisper kodlayıcısını kullanır. Model daha sonra ses özelliklerini vektörleştirir ve sabit uzunluklu konuşmayı ve sesi soft audio ve konuşma tokenlerine dönüştürmek için lineer bir projeksiyon katmanını kullanır.

Eğitim Stratejisi

Uni-MoE çerçevesi, modelin geliştirilmesini artırmak için ilerici bir eğitim stratejisi sunar. İlerici eğitim stratejisi, çeşitli uzmanların farklı yeteneklerini kullanmayı, çoklu uzman işbirliğini artırmayı ve genellemeyi artırmayı amaçlar. Eğitim süreci, Uzmanların Karışımı yapısını oluşturmak için entegre edilmiş Uzmanların Karışımı üzerine kuruludur.

Aşama 1: Modlar Arası Hizalama

İlk aşamada, Uni-MoE çerçevesi, farklı modlar arasında bağlantılılığı kurmaya çalışır. Bu, çeşitli bağlayıcılar kullanarak mod verilerini soft tokenlere dönüştürerek gerçekleştirilir. İlk eğitim aşamasının temel amacı, üretken entropy kaybını en aza indirmektir.Uni-MoE çerçevesinde, büyük dil modeli, farklı modlardaki girdiler için açıklamalar üretmek için optimize edilir ve yalnızca bağlayıcılar eğitilir, bu da Uni-MoE çerçevesinin farklı modları birleşik bir dil çerçevesi içinde birleştirmesini sağlar.

Aşama 2: Modlara Özgü Uzmanları Eğitime Tabi Tutma

İkinci aşamada, Uni-MoE çerçevesi, modlara özgü uzmanları geliştirmeye odaklanır. Bu, her uzmanın kendi alanında uzmanlığını iyileştirmek için modlar arası veri kümeleri ile eğitilmesiyle gerçekleştirilir. Ayrıca, Uni-MoE çerçevesi, besleme ileri ağlarını, modun özelliklerine daha yakından hizalamak için uyarlar ve üretken entropy kaybını temel eğitim ölçütü olarak korur.

Aşama 3: Uni-MoE’yi Ayarlamak

Üçüncü ve son aşamada, Uni-MoE çerçevesi, ikinci aşama sırasında uzmanlar tarafından ayarlanan ağırlıkları Uzmanların Karışımı katmanlarına entegre eder. Daha sonra, Uni-MoE çerçevesi, karıştırılmış çok modlu talimat verisi ile birlikte büyük dil modelini ayarlar. Aşağıdaki resim, eğitim sürecinin ilerlemesini yansıtan kaybı eğrilerini gösterir.

Uzmanların Karışımı konfigürasyonlarının karşılaştırmalı analizi, ikinci eğitim aşamasında uzmanlar tarafından iyileştirilen uzmanların, karıştırılmış modlara özgü veri kümeleri üzerinde daha iyi stabilite ve daha hızlı yakınsama sağladığını göstermiştir. Ayrıca, metin, görüntü, ses ve video gibi karmaşık çoklu modlu veri içeren görevlerde, Uni-MoE çerçevesi, iki uzman yerine dört uzman kullanırken daha tutarlı eğitim performansı ve azaltılmış kayıp değişkenliği göstermiştir.

Uni-MoE: Deneyler ve Sonuçlar

Aşağıdaki tablo, Uni-MoE çerçevesinin mimari özelliklerini özetler. LLaMA-7B mimarisine dayanan Uni-MoE çerçevesinin temel amacı, model boyutunu ölçeklemektir.

Aşağıdaki tablo, uzmanlaşmış eğitim görevleri tarafından yönlendirilen Uni-MoE çerçevesinin tasarımını ve optimizasyonunu özetler. Bu görevler, MLP katmanlarının yeteneklerini iyileştirmek ve uzmanlaşmış bilgilerini model performansı için kullanmak için önemlidir. Uni-MoE çerçevesi, farklı eğitim yöntemlerinin etkilerini açıklamak için sekiz tek modlu uzman görevi gerçekleştirir.

Model, iki video anlama, üç ses anlama ve beş konuşma görevi içeren çeşitli benchmarklar üzerinde farklı model varyantlarının performansını değerlendirir. İlk olarak, modelin konuşma-görüntü ve konuşma-metin görevlerini anlama yeteneği test edilir ve sonuçlar aşağıdaki tabloda yer alır.

Görülebileceği gibi, önceki temel modelleme sonuçları, konuşma anlama görevlerinde daha düşük sonuçlar verir ve bu da görüntü-konuşma akıl yürütme görevlerindeki performansı etkiler. Sonuçlar, MLLM’lerin karıştırılmış çok modlu veri kümeleri üzerinde genellemesini ve çoklu uzman işbirliğini önemli ölçüde artırdığını gösterir. Aşağıdaki tablo, görüntü-metin anlama görevleri üzerindeki deneysel sonuçları sunar. Görülebileceği gibi, Uni-MoE modellerinin en iyi sonuçları, temel modelleri geçer ve ortalama 4 puanlık bir farkla ayar görevini aşar.

Son Düşünceler

Bu makalede, Uzmanların Karışımı mimarisine sahip birleşik bir çok modlu büyük dil modeli olan Uni-MoE hakkında konuştuk. Uni-MoE çerçevesi, büyük dil modelleri içinde Uzmanların Karışımı mimarisini uygulayarak, uzman seviyesinde model paralelliği ve veri paralelliği kullanarak eğitim ve çıkarım sürecini daha verimli hale getirmeyi amaçlar. Ayrıca, Uni-MoE çerçevesi, genellemeyi ve çoklu uzman işbirliğini artırmak için üç farklı sürecin birleşiminden oluşan ilerici bir eğitim stratejisi sunar. İlk olarak, Uni-MoE çerçevesi, çeşitli bağlayıcılar kullanarak farklı modlar arası hizalama gerçekleştirir. İkinci olarak, Uni-MoE çerçevesi, uzman bileşenlerin tercihlerini, modlara özgü uzmanları modlar arası eğitim verisi ile eğitmek suretiyle etkinleştirir. Son olarak, Uni-MoE modeli, karıştırılmış çok modlu eğitim verisi üzerinde LoRA veya Düşük Rütbe Uyumlaştırma öğrenme tekniğini uygulayarak modeli ayarlar.

Mesleği mühendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayışla technical writer, bu alanlardaki karmaşık kavramları etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmış.