Modele i platformy AI

MoE-LLaVA: Mieszanka Ekspertów dla Dużych Modeli Języka i Wizji

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Ostatnie postępy w dziedzinie dużych modeli języka i wizji (LVLM) wykazały, że znaczne zwiększenie tych ramifikacji znacznie poprawia wydajność w różnych zadaniach. LVLM, w tym MiniGPT, LLaMA i inne, osiągnęły znaczące możliwości dzięki incorporacji warstw projekcji wizualnej i kodera obrazu do swojej architektury. Poprzez wdrożenie tych komponentów, LVLM zwiększają możliwości percepcji wizualnej dużych modeli języka (LLM). Wydajność można dalej poprawić, zwiększając rozmiar modelu i liczbę parametrów, a także rozszerzając skalę danych.

Modele takie jak InternVL rozszerzyły swój koder obrazu do ponad 6 miliardów parametrów, podczas gdy inne rozszerzyły tył LVLM do 13 miliardów parametrów, osiągając lepszą wydajność w szerokim zakresie zadań. IDEFICS przeszkolił LVLM z ponad 80 miliardami parametrów. Te metody skalowania doprowadziły do wyników porównywalnych lub przewyższających wydajność LLM przeszkolonych na ponad 34, 70 lub nawet 100 miliardach parametrów. Jednakże, skalowanie ma również wadę: znacznie zwiększa koszty szkolenia i inferencji. Jest to spowodowane tym, że wymaga aktywacji wszystkich parametrów dla każdego tokenu w obliczeniach, co prowadzi do wysokich potrzeb obliczeniowych i, w konsekwencji, wyższych kosztów.

W tym artykule omawiamy MoE-LLaVA, ramifikację opartą na mieszance ekspertów (MoE) dla dużych modeli języka i wizji, która wykorzystuje skuteczną strategię szkolenia, MoE-Tuning, dla LVLM. MoE-Tuning innowacyjnie rozwiązuje problem degradacji wydajności w uczeniu wielomodalnym, prowadząc do modelu z dużą liczbą parametrów, ale stałymi kosztami szkolenia i inferencji. Architektura MoE-LLaVA została zaprojektowana w taki sposób, aby aktywować tylko najlepszych ekspertów podczas wdrożenia, pozostawiając pozostałych ekspertów nieaktywnymi.

Będziemy badać ramifikację MoE-LLaVA, analizując jej mechanizm, metodykę, architekturę i porównując ją z wiodącymi ramifikacjami generacji obrazu i wideo.

MoE-LLaVA: Skalowanie Dużych Modeli Języka i Wizji w Przystępnej Cenie

Ponadto, dużych modeli języka i wizji wykorzystują warstwy projekcji wizualnej i kodery obrazu, a także zwiększają rozmiar modelu, zwiększając liczbę parametrów, aby poprawić wydajność modelu. Niektóre godne uwagi przykłady dużych modeli języka i wizji, które podążały tą ścieżką, to MiniGPT-4, InternGPT, InternVL i inne. W aplikacjach rzeczywistych, skalowanie dużego modelu języka lub dużego modelu języka i wizji z wysokiej jakości danymi szkoleniowymi często staje się koniecznością, aby poprawić wydajność modelu. Chociaż zwiększanie rozmiaru modelu poprawia wydajność, zwiększa również koszty obliczeniowe szkolenia i wdrożenia modelu, a także zwiększa komplikacje i wydajność wdrożenia modelu na urządzeniach równoległych jednocześnie. Głównym powodem zwiększonych kosztów szkolenia i inferencji, a także wymagań obliczeniowych, jest to, że każdy token w ramifikacji wymaga obliczeń z każdym parametrem w modelu, zwanym gęstym modelem.

Z drugiej strony, rzadkie modele MoE lub Mieszanka Ekspertów wykazały skuteczne skalowanie ramifikacji, przetwarzając dane z pomocą aktywowanych parametrów, podejście, które zostało szeroko przyjęte w dziedzinie przetwarzania języka naturalnego. Jednakże, wykorzystanie Mieszanki Ekspertów do szkolenia rzadkich dużych modeli języka i wizji bezpośrednio jest trudne, ponieważ konwersja LLM na LVLM i jednoczesne rozrzedzanie modelu prowadzi do znacznej degradacji wydajności. Aby wdrożyć Mieszkankę Ekspertów do skalowania LLM i LVLM, niezbędne jest najpierw zainicjowanie LVLM do rozrzedzania. Aby to osiągnąć, ramifikacja MoE-LLaVA wprowadza MoE-Tuning, prostą, ale skuteczną trzyetapową strategię szkolenia.

Jak pokazano na powyższym rysunku, proces MoE-Tuning najpierw trenuje MLP lub wielowarstwowy perceptron, który adaptuje tokeny wizualne do dużego modelu języka w pierwszym etapie. Następnie ramifikacja trenuje wszystkie parametry LLM, aby wstępnie umocnić duży model języka i wizji z ogólnymi zdolnościami zrozumienia wielomodalnego. Wreszcie, w trzecim etapie, ramifikacja powiela FFN lub sieć neuronową do przodu jako wagi inicjalizujące dla ekspertów i trenuje tylko warstwy Mieszanki Ekspertów. Ogólnie, proces szkolenia pomaga w stopniowej transformacji rzadkiego modelu od inicjacji LVLM do rzadkiej Mieszanki Ekspertów.

Po omówieniu procesu szkolenia, przyjrzyjmy się ramifikacji MoE-LLaVA, bazie dla dużych modeli języka i wizji z modelem Mieszanki Ekspertów, który wykorzystuje uczące się routery i modele MoE. W swojej istocie, model MoE-LLaVA składa się z wielu rzadkich ścieżek, a ramifikacja wykorzystuje te ścieżki do wysłania każdego tokenu do różnych ekspertów za pomocą uczącego się routera. Następnie tokeny są przetwarzane zbiorowo przez aktywowanych ekspertów, podczas gdy nieaktywne ścieżki pozostają ciche. Ramifikacja następnie stosuje warstwy kodera Mieszanki Ekspertów iteracyjnie, aby zapewnić rzadką ścieżkę do większego i bardziej potężnego LVLM.

Dzięki podejściu wdrożonemu przez ramifikację MoE-LLaVA, jest w stanie przewyższyć modele z podobną liczbą aktywnych parametrów i wyprzedzić je znaczną różnicą w teście POPE object hallucination benchmark, pomimo posiadania tylko 2,2 miliarda parametrów. Ponadto, ramifikacja MoE-LLaVA z 2,2 miliardami parametrów jest w stanie osiągnąć wyniki porównywalne do ramifikacji InternVL-Chat-19B z niemal 8-krotnie większą liczbą aktywnych parametrów.

Potężne duże modele języka z silnymi zdolnościami generalizacji i wykonywania instrukcji zostały wdrożone w dużych modelach języka i wizji. Wczesne LLM, takie jak BLIP, zakodowały sygnały wizualne w sekwencję tokenów wizualnych, umożliwiając im adaptację wizji do LLM za pomocą wielu warstw projekcji. W tym samym czasie, ostatnie prace koncentrują się na poprawie wydajności modelu poprzez wdrożenie metod, takich jak rozszerzanie zestawu danych instrukcji, zwiększanie rozdzielczości obrazu, optymalizację strategii szkolenia, wyrównywanie danych wejściowych, poprawę koderów obrazu i wiele innych. Te podejścia pomogły wyposażyć LVLM w potężne zdolności zrozumienia wizualnego, rozszerzając zestaw danych instrukcji wizualnych i skali modelu. Ponadto, niektóre LVLM posiadają również zdolności zrozumienia wizualnego, takie jak region i wieloregionowe zrozumienie, a także zdolności grundowania pikselowego. Jednakże, koszt obliczeniowy związany ze skalowaniem gęstych danych wizualnych i modeli jest często bardzo wysoki, co utrudnia ich stosowanie. Z drugiej strony, ramifikacja MoE-LLaVA ma na celu uczynienie badań nad LVLM bardziej przystępnymi, wykorzystując możliwości modeli MoE.

MoE-LLaVA : Metoda i Architektura

W swojej istocie, ramifikacja MoE-LLaVA składa się z warstwy projekcji wizualnej (wielowarstwowego perceptronu), kodera wizualnego, bloków MoE, wielu warstw LLM i warstwy osadzania słów.

Architektura

Poniższa tabela podsumowuje szczegółowe konfiguracje ramifikacji MoE-LLaVA.

Dla danego obrazu RGB, koder wizualny przetwarza obrazy, aby uzyskać sekwencję tokenów wizualnych, a warstwa projekcji wizualnej mapuje sekwencję tokenów wizualnych na obrazy wejściowe. Dane wejściowe tekstu są przetwarzane przez warstwę osadzania słów, która następnie projektuje je, aby uzyskać sekwencję tokenów. W tym samym czasie, ramifikacja MoE-LLaVA łączy tokeny tekstu i wizualne, a następnie podaje je do LLM. Jednak ramifikacja trenuje tylko warstwę projekcji wizualnej z dużym modelem języka, składającym się z FFN lub warstw wielowarstwowego perceptronu i warstw uwagi wielogłowej. Wreszcie, ramifikacja stosuje połączenia resztowe i normalizację warstw do każdego bloku.

Przechodząc dalej, ramifikacja MoE-LLaVA powiela FFN lub sieć neuronową do przodu z drugiego etapu, aby utworzyć zespół ekspertów jako krok inicjalizacji. Router, będący liniową warstwą, przewiduje prawdopodobieństwo każdego tokenu przypisania do każdego eksperta. Każdy token jest przetwarzany przez najlepszych ekspertów z maksymalnym prawdopodobieństwem i oblicza sumę ważoną na podstawie wyniku softmax prawdopodobieństwa. Gdy najlepsi eksperci są aktywowani, model wyłącza pozostałych ekspertów, podejście, które wyposaża ramifikację MoE-LLaVA w nieskończenie możliwe rzadkie ścieżki, nadając modelowi szeroki zakres możliwości.

MoE-Tuning

MoE-Tuning to prosta, ale skuteczna trzyetapowa strategia szkolenia, która najpierw trenuje MLP lub wielowarstwowy perceptron, który adaptuje tokeny wizualne do dużego modelu języka w pierwszym etapie. Następnie ramifikacja trenuje wszystkie parametry LLM, aby wstępnie umocnić duży model języka i wizji z ogólnymi zdolnościami zrozumienia wielomodalnego. Wreszcie, w trzecim etapie, ramifikacja powiela FFN lub sieć neuronową do przodu jako wagi inicjalizujące dla ekspertów i trenuje tylko warstwy Mieszanki Ekspertów.

Etap 1

W pierwszym etapie, głównym celem jest adaptacja tokenów wizualnych do dużego modelu języka, co pozwala LLM zrozumieć instancje w obrazie. Ramifikacja MoE-LLaVA wykorzystuje wielowarstwowy perceptron do projekcji tokenów wizualnych na domenę wejściową dużego modelu języka i traktuje patche obrazu jako pseudo-tokeny tekstu. W tym etapie, ramifikacja trenuje LLM, aby opisać obrazy i nie stosuje warstw MoE do LLM podczas tego etapu.

Etap 2

W drugim etapie, ramifikacja MoE-LLaVA próbuje poprawić zdolności i sterowalność ramifikacji, dostosowując model do danych instrukcji wielomodalnych. Ramifikacja osiąga to, dostosowując LLM do LVLM z zdolnościami zrozumienia wielomodalnego. Ramifikacja wykorzystuje bardziej złożone instrukcje, w tym rozpoznawanie tekstu i zadania logicznego rozumowania obrazu, które wymagają, aby model posiadał silniejsze zdolności wielomodalne. Tradycyjnie, proces szkolenia dla gęstych modeli jest uważany za kompletny na tym etapie. Jednak ramifikacja MoE-LLaVA napotkała trudności w transformacji LLM w LVLM jednocześnie z rozrzedzaniem LVLM. Aby przeciwdziałać temu wyzwaniu, ramifikacja wykorzystuje wagi z etapu jako inicjalizację dla następnego etapu, próbując złagodzić trudność uczenia się modelu rzadkiego.

Etap 3

W trzecim etapie, model powiela sieć neuronową do przodu kilka razy, aby zainicjować ekspertów jako procedurę inicjalizacji. Następnie ramifikacja podaje tokeny tekstu i wizualne do warstw Mieszanki Ekspertów, a router oblicza wagę dopasowania między ekspertami a każdym tokenem. Każdy token jest przetwarzany przez najlepszych ekspertów z agregowanym wyjściem obliczanym przez sumę ważoną na podstawie wag routerów. Gdy najlepsi eksperci są aktywowani, model wyłącza pozostałych ekspertów, podejście, które wyposaża ramifikację MoE-LLaVA w nieskończenie możliwe rzadkie ścieżki, nadając modelowi szeroki zakres możliwości.

MoE-LLaVA : Wyniki i Eksperymenty

Ramifikacja MoE-LLaVA przyjmuje CLIP-Large jako koder wizualny z wielowarstwowym perceptronem składającym się z dwóch warstw z warstwą aktywacji GELU, oddzielającą dwie warstwy. Domyślnie, ramifikacja wykorzystuje naprzemienne zastępowanie warstw do przodu z warstwami Mieszanki Ekspertów, co oznacza, że warstwy Mieszanki Ekspertów stanowią 50% całkowitej liczby warstw. Poniższa tabela zawiera różne zestawy danych wraz z ich rozmiarem próbki, wykorzystywanymi do szkolenia i oceny ramifikacji MoE-LLaVA.

Zero-Shot Image Question Answering

Poniższy rysunek pokazuje, że MoE-LLaVA jest modelem rzadkim z miękkim routerem opartym na LVLM. Ramifikacja jest oceniana na 5 benchmarkach odpowiedzi na pytania obrazowe, a jak można zobaczyć, ramifikacja MoE-LLaVA wykazuje znaczące zdolności zrozumienia wizualnego i dostarcza wyniki porównywalne do stanu sztuki ramifikacji LLaVA 1.5 na pięciu różnych benchmarkach.

Object Hallucination Evaluation

Aby ocenić halucynację obiektu, ramifikacja MoE-LLaVA przyjmuje potok oceny POPE, metodę opartą na głosowaniu, a wyniki są przedstawione w poniższej tabeli. Jak można zobaczyć, spośród wszystkich ramifikacji, MoE-LLaVA dostarcza najmocniejsze wyniki, wskazując na zdolność ramifikacji do generowania obiektów zgodnych z obrazem wejściowym. Ponadto, warto zauważyć, że ramifikacja MoE-LLaVA również dobrze balansuje stosunek tak do nie, wskazując na zdolność modelu rzadkiego do dostarczania dokładnej informacji zwrotnej dla danego pytania.

Poniższy obraz zawiera dystrybucję obciążeń ekspertów, gdzie linie przerywane reprezentują dobrze zbalansowaną dystrybucję tokenów między modalnościami lub ekspertami. Pierwszy rysunek ilustruje obciążenie wewnątrz ekspertów, podczas gdy pozostałe obrazy demonstrują wydajność ekspertów wobec różnych modalności.

Ponadto, poniższy rysunek demonstruje dystrybucję modalności w różnych ekspertach.

Końcowe Myśli

W tym artykule omówiliśmy ramifikację MoE-LLaVA, bazę dla dużych modeli języka i wizji z modelem Mieszanki Ekspertów, który wykorzystuje uczące się routery i modele MoE. W swojej istocie, model MoE-LLaVA składa się z wielu rzadkich ścieżek, a ramifikacja wykorzystuje te ścieżki do wysłania każdego tokenu do różnych ekspertów za pomocą uczącego się routera. Tokeny są następnie przetwarzane zbiorowo przez aktywowanych ekspertów, podczas gdy nieaktywne ścieżki pozostają ciche. Ramifikacja następnie stosuje warstwy kodera Mieszanki Ekspertów iteracyjnie, aby zapewnić rzadką ścieżkę do większego i bardziej potężnego LVLM. Strategia MoE-Tuning rozwiązuje powszechny problem degradacji wydajności w uczeniu wielomodalnym w innowacyjny sposób, konstruując model z znacząco dużą liczbą parametrów, ale stałymi kosztami szkolenia i inferencji. Architektura ramifikacji MoE-LLaVA została zaprojektowana w taki sposób, aby aktywować tylko najlepszych ekspertów podczas wdrożenia, pozostawiając pozostałych ekspertów nieaktywnymi.

Kunal Kejriwal jest inżynierem backendu specjalizującym się w Pythonie, PostgreSQL, Redis oraz infrastrukturze chmurowej w GCP i AWS. Z trzyletnim doświadczeniem w budowaniu i skalowaniu systemów produkcyjnych pisze o infrastrukturze AI, systemach rozproszonych i architekturze wdrażania obciążeń uczenia maszynowego.