Modele i platformy AI

Uni-MoE: Skalowanie Zjednoczonych Wielomodalnych Modeli Językowych z Mixture of Experts

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Ostatnie postępy w architekturze i wydajności wielomodalowych dużych modeli językowych (MLLM) podkreśliły znaczenie skalowalnych danych i modeli w celu poprawy wydajności. Chociaż ten podejście poprawia wydajność, generuje znaczne koszty obliczeniowe, co ogranicza praktyczność i użyteczność takich podejść. Przez lata modele Mixture of Experts (MoE) wyłoniły się jako udane podejście alternatywne do efektywnej skaliowania modeli obrazu-tekstu i dużych modeli językowych, ponieważ modele MoE mają znacznie niższe koszty obliczeniowe i silną wydajność. Jednak pomimo ich zalet, modele MoE nie są idealnym podejściem do skaliowania dużych modeli językowych, ponieważ często obejmują mniej ekspertów i ograniczone modalności, co ogranicza ich zastosowanie.

Aby przeciwdziałać przeszkodom napotkanym przez obecne podejścia i w celu efektywnego skalowania dużych modeli językowych, w tym artykule omówimy Uni-MoE, zjednoczony wielomodalny duży model językowy z architekturą Mixture of Experts, który może obsługiwać szeroki zakres modalności i ekspertów. Ramy Uni-MoE implementują również architekturę Mixture of Experts w dużych modelach językowych w celu uczynienia procesu szkolenia i inferencji bardziej efektywnym poprzez zastosowanie równoległości modelu i danych na poziomie eksperta. Ponadto, w celu poprawy uogólnienia i współpracy wielu ekspertów, ramy Uni-MoE prezentują strategię szkolenia progresywnego, która jest kombinacją trzech różnych procesów. W pierwszym, ramy Uni-MoE osiągają wyrównanie cross-modalności przy użyciu różnych łączników z różnymi danymi cross-modalnymi. W drugim, ramy Uni-MoE aktywują preferencje komponentów ekspertów poprzez szkolenie ekspertów specyficznych dla modalności z danymi instrukcyjnymi cross-modalnymi. Wreszcie, model Uni-MoE implementuje technikę Low-Rank Adaptation (LoRA) na danych instrukcyjnych multimodalnych w celu dostrojenia modelu. Gdy dostrojony model Uni-MoE został oceniony na kompleksowym zestawie multimodalnych zbiorów danych, obszernych wyników eksperymentalnych podkreślił główną zaletę ram Uni-MoE w redukowaniu biasu wydajności w obsłudze mieszanych multimodalnych zbiorów danych w znacznym stopniu. Wyniki wskazały również znaczną poprawę współpracy wielu ekspertów i uogólnienia.

Ten artykuł ma na celu omówienie ram Uni-MoE w głębi, a my eksplorujemy mechanizm, metodologię, architekturę ram wraz z ich porównaniem z frameworkami stanu sztuki. Zatem zacznijmy.

Uni-MoE: Skalowanie Zjednoczonych Wielomodalnych Modeli Językowych

Wprowadzenie otwartoźródłowych wielomodalnych dużych modeli językowych, w tym LLama i InstantBlip, podkreśliło znaczący sukces i postęp w zadaniach związanych z zrozumieniem obrazu-tekstu w ciągu ostatnich kilku lat. Ponadto, społeczność AI pracuje aktywnie nad budową zjednoczonego wielomodalnego dużego modelu językowego, który mógłby pomieścić szeroki zakres modalności, w tym obraz, tekst, dźwięk, wideo i więcej, przechodząc poza tradycyjny paradygmat obraz-tekst. Podejście powszechnie stosowane przez społeczność open-source w celu zwiększenia możliwości wielomodalnych dużych modeli językowych polega na zwiększeniu rozmiaru modeli podstawowych wizji, integracji ich z dużymi modelami językowymi z miliardami parametrów oraz użyciu różnorodnych multimodalnych zbiorów danych w celu poprawy dostrojenia instrukcyjnego. Te rozwoje podkreśliły rosnącą zdolność wielomodalnych dużych modeli językowych do rozumienia i przetwarzania wielu modalności, pokazując znaczenie rozszerzania multimodalnych danych instrukcyjnych i skalowalności modelu.

Chociaż skalowanie modelu jest sprawdzonym podejściem, które daje znaczne rezultaty, skalowanie modelu jest procesem obliczeniowo kosztownym zarówno dla procesu szkolenia, jak i inferencji.

Aby przeciwdziałać problemowi wysokich kosztów obliczeniowych, społeczność open-source przechodzi w kierunku integracji architektury modelu Mixture of Experts (MoE) w dużych modelach językowych w celu poprawy wydajności szkolenia i inferencji. W przeciwieństwie do wielomodalnych dużych modeli językowych i dużych modeli językowych, które wykorzystują wszystkie dostępne parametry do przetwarzania każdego wejścia, co skutkuje gęstym podejściem obliczeniowym, architektura Mixture of Experts wymaga tylko aktywacji podzbioru parametrów ekspertów dla każdego wejścia. W rezultacie podejście Mixture of Experts wyłania się jako wiarygodna droga do poprawy wydajności dużych modeli bez rozległej aktywacji parametrów i wysokich kosztów obliczeniowych. Chociaż istniejące prace podkreśliły udaną implementację i integrację modeli Mixture of Experts w konstrukcji modeli tekstowych i tekstowo-obrazowych, badacze jeszcze nie w pełni zbadali potencjał rozwoju architektury Mixture of Experts w celu budowy potężnych zjednoczonych wielomodalnych dużych modeli językowych.

Uni-MoE jest wielomodalnym dużym modelem językowym, który wykorzystuje modele Mixture of Experts w celu interpretacji i zarządzania wieloma modalnościami, próbując zbadać skalowanie zjednoczonych wielomodalnych dużych modeli językowych z architekturą MoE. Jak pokazano na poniższym obrazie, ramy Uni-MoE najpierw uzyskują kodowanie różnych modalności przy użyciu specyficznych dla modalności kodera, a następnie mapują te kodowania na przestrzeń reprezentacji językowej dużych modeli językowych przy użyciu różnych zaprojektowanych łączników. Te łączniki zawierają szkolony model transformatora z następującymi liniowymi projekcjami w celu destylacji i projekcji wyjściowych reprezentacji zamrożonego kodera. Następnie ramy Uni-MoE wprowadzają warstwy Mixture of Experts wewnątrz bloku gęstego dużego modelu językowego. W wyniku tego każdy blok oparty na Mixture of Experts zawiera wspólną warstwę self-attention stosowaną we wszystkich modalnościach, router sparse dla alokacji ekspertyzy na poziomie tokena oraz różnych ekspertów opartych na sieci feedforward. Dzięki temu ramy Uni-MoE są w stanie zrozumieć wiele modalności, w tym mowę, dźwięk, tekst, wideo, obraz i wymagają tylko aktywacji częściowych parametrów podczas inferencji.

Ponadto, w celu poprawy współpracy wielu ekspertów i uogólnienia, ramy Uni-MoE implementują trzystopniową strategię szkolenia. W pierwszym etapie, ramy wykorzystują obszerny zestaw par obraz-dźwięk/język do szkolenia odpowiednich łączników ze względu na zjednoczoną reprezentację modalności w przestrzeni językowej dużego modelu językowego. W drugim etapie, model Uni-MoE szkoli ekspertów specyficznych dla modalności, wykorzystując zestawy danych cross-modalnych oddzielnie w celu udoskonalenia umiejętności każdego eksperta w ramach swojej dziedziny. W trzecim etapie, ramy Uni-MoE integrują wyszkolonych ekspertów w warstwę Mixture of Experts dużego modelu językowego i szkolą cały model Uni-MoE z danymi instrukcyjnymi multimodalnymi. W celu dalszego zmniejszenia kosztów szkolenia, ramy Uni-MoE wykorzystują podejście LoRA do dostrojenia tych warstw self-attention i wstępnie dostrojonych ekspertów.

Uni-MoE: Metodologia i Architektura

Podstawową motywacją za ramami Uni-MoE jest wysoki koszt szkolenia i inferencji skalowania wielomodalnych dużych modeli językowych oraz wydajność modeli Mixture of Experts, a także zbadanie możliwości stworzenia efektywnego, potężnego i zjednoczonego wielomodalnego dużego modelu językowego przy użyciu architektury MoE. Poniższy rysunek przedstawia reprezentację architektury zaimplementowanej w ramach Uni-MoE, pokazując projekt, który obejmuje indywidualne kodery dla różnych modalności, takich jak dźwięk, mowa i wizja, wraz z ich odpowiednimi łącznikami modalnymi.

Ramy Uni-MoE integrują następnie architekturę Mixture of Experts z blokami rdzenia dużych modeli językowych, co jest procesem kluczowym dla zwiększenia ogólnej wydajności zarówno procesu szkolenia, jak i inferencji. Ramy Uni-MoE osiągają to poprzez zaimplementowanie mechanizmu sparse routing. Cały proces szkolenia ram Uni-MoE można podzielić na trzy fazy: wyrównanie cross-modalności, szkolenie ekspertów specyficznych dla modalności i dostrojenie Uni-MoE przy użyciu różnorodnego zestawu multimodalnych danych instrukcyjnych. W celu efektywnej transformacji różnych modalnych wejść w format językowy, ramy Uni-MoE są zbudowane na podstawie LLaVA, wstępnie wytrenowanego frameworku językowo-wizualnego. Model podstawowy LLaVA integruje CLIP jako swój wizualny koder wraz z warstwą projekcji liniowej, która konwertuje cechy obrazu w ich odpowiednie miękkie tokeny obrazu. Ponadto, w celu przetwarzania zawartości wideo, ramy Uni-MoE wybierają osiem reprezentatywnych klatek z każdego wideo i konwertują je w tokeny wideo poprzez average pooling w celu agregacji ich reprezentacji opartej na obrazie lub klatce. Dla zadań audio, ramy Uni-MoE wdrożone dwa kodery, BEATs i koder Whisper, w celu udoskonalenia ekstrakcji cech. Następnie model destyluje wektor cech audio i utrwala długość mowy, a następnie mapuje je w tokeny mowy i miękkie audio za pomocą warstwy projekcji liniowej.

Strategia Szkolenia

Ramy Uni-MoE wprowadzają progresywną strategię szkolenia dla stopniowego rozwoju modelu. Strategia szkolenia progresywnego wprowadzona próbuje wykorzystać odrębne zdolności różnych ekspertów, poprawić wydajność współpracy wielu ekspertów i zwiększyć ogólną uogólnialność ram. Proces szkolenia jest podzielony na trzy etapy w celu zrealizowania struktury MLLM zintegrowanej z Mixture of Experts.

Etap 1: Wyrównanie Cross-Modalności

W pierwszym etapie, ramy Uni-MoE próbują ustanowić połączenie między różnymi lingwistykami i modalnościami. Ramy Uni-MoE osiągają to poprzez tłumaczenie danych modalnych w miękkie tokeny poprzez konstruowanie łączników. Głównym celem pierwszego etapu szkolenia jest minimalizacja entropii generatywnej. W ramach Uni-MoE, duży model językowy jest optymalizowany w celu generowania opisów dla wejść w różnych modalnościach, a model podlega tylko szkoleniu łączników, co pozwala ramom Uni-MoE na integrację różnych modalności w ramach zjednoczonego frameworku językowego.

Etap 2: Szkolenie Ekspertów Specyficznych dla Modalności

W drugim etapie, ramy Uni-MoE koncentrują się na rozwijaniu ekspertów jednej modalności poprzez szkolenie modelu poświęconego specyficznym danym cross-modalnym. Głównym celem jest udoskonalenie umiejętności każdego eksperta w ramach swojej dziedziny, co zwiększa ogólną wydajność systemu Mixture of Experts na szerokim zakresie multimodalnych danych. Ponadto, ramy Uni-MoE dostosowują sieci feedforward, aby lepiej odpowiadały charakterystykom modalności, utrzymując entropię generatywną jako główny wskaźnik szkolenia.

Etap 3: Dostrojenie Uni-MoE

W trzecim i ostatnim etapie, ramy Uni-MoE integrują wagi dostrojone przez ekspertów podczas etapu 2 w warstwy Mixture of Experts. Następnie ramy Uni-MoE dostrojenie modelu MLLM przy użyciu danych instrukcyjnych multimodalnych. Krzywe straty na poniższym obrazie odzwierciedlają postęp procesu szkolenia.

Porównawcza analiza konfiguracji Mixture of Experts ujawniła, że eksperci, których model udoskonalił w drugim etapie szkolenia, wykazywali zwiększoną stabilność i osiągali szybszą konwergencję na danych multimodalnych. Ponadto, w zadaniach, które obejmowały złożone multimodalne dane, w tym tekst, obrazy, dźwięk, wideo, ramy Uni-MoE wykazały bardziej spójną wydajność szkolenia i zmniejszoną zmienność straty, gdy wykorzystywały czterech ekspertów w porównaniu z dwoma.

Uni-MoE: Eksperymenty i Wyniki

Poniższa tabela podsumowuje specyfikacje architektury ram Uni-MoE. Głównym celem ram Uni-MoE, zbudowanych na architekturze LLaMA-7B, jest skalowanie rozmiaru modelu.

Poniższa tabela podsumowuje projekt i optymalizację ram Uni-MoE, kierowaną przez specjalistyczne zadania szkoleniowe. Te zadania są niezbędne do udoskonalenia możliwości warstw MLP, wykorzystując ich specjalistyczną wiedzę do poprawy wydajności modelu. Ramy Uni-MoE podejmują osiem zadań ekspertów jednej modalności, aby wyjaśnić różnice w wpływie różnych metod szkolenia.

Model ocenia wydajność różnych wariantów modelu w różnorodnym zestawie benchmarków, które obejmują dwa zadania zrozumienia wideo, trzy zadania zrozumienia audio i pięć zadań związanych z mową. Po pierwsze, model jest testowany na jego zdolność do zrozumienia zadań mowy-obraz i mowy-tekst, a wyniki są zawarte w poniższej tabeli.

Jak można zauważyć, poprzednie modele bazowe dostarczają gorsze wyniki w zadaniach zrozumienia mowy, co wpływa na wydajność w zadaniach rozumienia obrazu-mowy. Wyniki wskazują, że wprowadzenie architektury Mixture of Experts może poprawić uogólnialność MLLM w zadaniach rozumienia audio-obraz nieznanego.

Podsumowanie

W tym artykule omówiliśmy Uni-MoE, zjednoczony wielomodalny duży model językowy z architekturą Mixture of Experts, który może obsługiwać szeroki zakres modalności i ekspertów. Ramy Uni-MoE implementują również architekturę Mixture of Experts w dużych modelach językowych w celu uczynienia procesu szkolenia i inferencji bardziej efektywnym poprzez zastosowanie równoległości modelu i danych na poziomie eksperta. Ponadto, w celu poprawy uogólnienia i współpracy wielu ekspertów, ramy Uni-MoE prezentują strategię szkolenia progresywnego, która jest kombinacją trzech różnych procesów. W pierwszym, ramy Uni-MoE osiągają wyrównanie cross-modalności przy użyciu różnych łączników z różnymi danymi cross-modalnymi. W drugim, ramy Uni-MoE aktywują preferencje komponentów ekspertów poprzez szkolenie ekspertów specyficznych dla modalności z danymi instrukcyjnymi cross-modalnymi. Wreszcie, model Uni-MoE implementuje technikę Low-Rank Adaptation (LoRA) na danych instrukcyjnych multimodalnych w celu dostrojenia modelu.

"Inżynier z zawodu, pisarz z serca". Kunal jest technicznym pisarzem z głęboką miłością i zrozumieniem AI i ML, poświęconym uproszczeniu złożonych pojęć w tych dziedzinach poprzez swoje angażujące i informacyjne dokumentacje.