Modele i platformy AI

Modelowanie Autoregresyjne Wizualne: Skalowalna Generacja Obrazów za Pomocą Predykcji Następnego Poziomu

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Pojawienie się modeli GPT, wraz z innymi autoregresyjnymi lub AR dużymi modelami języka, otworzyło nową erę w dziedzinie uczenia maszynowego i sztucznej inteligencji. Modele GPT i autoregresyjne często wykazują ogólną inteligencję i wszechstronność, które uważane są za znaczący krok w kierunku ogólnej sztucznej inteligencji lub AGI, pomimo występowania pewnych problemów, takich jak halucynacje. Jednakże, zagadkowy problem z tymi dużymi modelami polega na strategii samouczącego się, która pozwala modelowi przewidywać następny token w sekwencji, prosta, ale skuteczna strategia. Ostatnie prace wykazały sukces tych dużych autoregresyjnych modeli, podkreślając ich ogólną przydatność i skalowalność. Skalowalność jest typowym przykładem istniejących praw skalowania, które pozwalają badaczom przewidywać wydajność dużego modelu na podstawie wydajności mniejszych modeli, co skutkuje lepszym przydziałem zasobów. Z drugiej strony, ogólna przydatność jest często dowodzona przez strategie uczenia, takie jak zero-shot, one-shot i few-shot learning, podkreślając zdolność niezależnie wyszkolonych modeli do adaptacji do różnorodnych i niewidocznych zadań. Razem, ogólna przydatność i skalowalność ujawniają potencjał modeli autoregresyjnych do uczenia się z ogromnej ilości nieoznaczonych danych.

Budując na tym, w tym artykule, będziemy rozmawiać o Wizualnym Modelowaniu Autoregresyjnym lub ramie VAR, nowym wzorcu generacyjnym, który redefineuje autoregresyjne uczenie się na obrazach jako grubo-detaliczne „przewidywanie następnego poziomu” lub „przewidywanie następnego skalowania”. Chociaż proste, podejście jest skuteczne i pozwala autoregresyjnym transformatorom nauczyć się lepiej rozkładów wizualnych, oraz zwiększa ogólną przydatność. Ponadto, modele Wizualnego Modelowania Autoregresyjnego umożliwiają modelom autoregresyjnym w stylu GPT przewyższać transfery dyfuzyjne w generowaniu obrazów po raz pierwszy. Eksperymenty również wskazują, że ramie VAR znacznie poprawia podstawy autoregresyjne, oraz przewyższa ramie Diffusion Transformer lub DiT w wielu wymiarach, w tym wydajności danych, jakości obrazu, skalowalności i szybkości wnioskowania. Ponadto, skalowanie modeli Wizualnego Modelowania Autoregresyjnego demonstruje prawa skalowania potęgowego, podobne do tych obserwowanych w dużych modelach języka, oraz wykazuje zdolność do generalizacji zero-shot w zadaniach downstream, w tym edycji, malowaniu i wyjściowym malowaniu.

Ten artykuł ma na celu przedstawienie ramy Wizualnego Modelowania Autoregresyjnego w głębi, oraz będziemy eksplorować mechanizm, metodologię, architekturę ramy, wraz z porównaniem z ramami stanu sztuki. Będziemy również rozmawiać o tym, jak ramie Wizualnego Modelowania Autoregresyjnego demonstruje dwa ważne właściwości LLM: Prawa Skalowania i generalizację zero-shot. Więc zacznijmy.

Wizualne Modelowanie Autoregresyjne: Skalowalna Generacja Obrazów

Wspólny wzorzec wśród ostatnich dużych modeli języka jest wdrożeniem strategii samouczącej się, prostej, ale skutecznej strategii, która przewiduje następny token w sekwencji. Dzięki temu podejściu, autoregresyjne i duże modele języka wykazały znaczącą skalowalność, oraz ogólną przydatność, właściwości, które ujawniają potencjał modeli autoregresyjnych do uczenia się z ogromnej ilości nieoznaczonych danych, podsumowując istotę Ogólnej Sztucznej Inteligencji. Ponadto, badacze w dziedzinie widzenia komputerowego pracowali równolegle nad rozwojem dużych autoregresyjnych lub światowych modeli, z celem dopasowania lub przewyższenia ich imponującej skalowalności i ogólnej przydatności, z modelami takimi jak DALL-E i VQGAN, które już wykazały potencjał modeli autoregresyjnych w dziedzinie generowania obrazów. Te modele często wdrażają wizualny tokenizator, który reprezentuje lub przybliża ciągłe obrazy do siatki 2D tokenów, które następnie są spłaszczane do sekwencji 1D do autoregresyjnego uczenia się, w ten sposób odbijając sekwencyjny proces modelowania języka.

Jednakże, badacze jeszcze nie zbadali praw skalowania tych modeli, a co gorsza, wydajność tych modeli często pozostaje w tyle za modelami dyfuzyjnymi o znaczną różnicę, jak to zostało zademonstrowane na poniższym obrazie. Przerwa w wydajności wskazuje, że w porównaniu z dużymi modelami języka, możliwości modeli autoregresyjnych w widzeniu komputerowym są niedostatecznie zbadane.

Z jednej strony, tradycyjne modele autoregresyjne wymagają określonego porządku danych, natomiast z drugiej strony, Wizualne Modelowanie Autoregresyjne lub ramie VAR, ponownie rozważa, jak uporządkować obraz, i to odróżnia VAR od istniejących metod AR. Typowo, ludzie tworzą lub postrzegają obraz w hierarchiczny sposób, capture globalnej struktury, a następnie lokalnych szczegółów, wieloskalowy, grubo-detaliczny sposób, który sugeruje porządek dla obrazu w sposób naturalny. Ponadto, czerpiąc inspirację z wieloskalowych projektów, ramie VAR definiuje autoregresyjne uczenie się na obrazach jako przewidywanie następnego poziomu, w przeciwieństwie do konwencjonalnych podejść, które definiują uczenie się jako przewidywanie następnego tokenu. Podejście wdrożone przez ramie VAR rozpoczyna się od zakodowania obrazu w wieloskalowych mapach tokenów. Następnie ramie rozpoczyna autoregresyjny proces od mapy tokenów 1×1, oraz rozszerza się w rozdzielczości postępowo. Na każdym kroku, transformator przewiduje następny wyższy poziom mapy tokenów, warunkowany na wszystkich poprzednich, metodologię, którą ramie VAR nazywa modelem VAR.

Ramie VAR próbuje wykorzystać architekturę transformatora GPT-2 do wizualnego autoregresyjnego uczenia się, oraz wyniki są widoczne na benchmarku ImageNet, gdzie model VAR poprawia swoją podstawę AR znacznie, osiągając FID 1,80, oraz wynik inception 356, wraz z 20-krotną poprawą szybkości wnioskowania. Co więcej interesujące, ramie VAR zarządza przewyższać wydajność ramienia DiT lub Diffusion Transformer w zakresie FID & IS wyników, skalowalności, szybkości wnioskowania, oraz wydajności danych. Ponadto, model Wizualnego Modelowania Autoregresyjnego wykazuje silne prawa skalowania, podobne do tych zaobserwowanych w dużych modelach języka.

Podsumowując, ramie VAR próbuje dokonać następujących wkładów.

  1. Proponuje nową wizualną ramę generacyjną, która wykorzystuje wieloskalowe podejście autoregresyjne z przewidywaniem następnego poziomu, w przeciwieństwie do tradycyjnego przewidywania następnego tokenu, w wyniku czego projektuje algorytm autoregresyjny dla zadań widzenia komputerowego.
  2. Próbuje zwalidować prawa skalowania dla modeli autoregresyjnych, wraz z potencjałem generalizacji zero-shot, który naśladuje atrakcyjne właściwości LLM.
  3. Oferuje przełom w wydajności modeli wizualnych autoregresyjnych, umożliwiając modelom autoregresyjnym w stylu GPT przewyższać istniejące modele dyfuzyjne w zadaniach syntezy obrazu po raz pierwszy.

Ponadto, jest również istotne, aby omówić istniejące prawa skalowania potęgowego, które matematycznie opisują związek między rozmiarami zbiorów danych, parametrami modelu, poprawami wydajności, oraz zasobami obliczeniowymi modeli uczenia maszynowego. Po pierwsze, te prawa skalowania ułatwiają zastosowanie wydajności większego modelu przez skalowanie rozmiaru modelu, kosztów obliczeniowych, oraz danych, oszczędzając niepotrzebne koszty, oraz przydzielając budżet szkoleniowy, dostarczając zasad. Po drugie, prawa skalowania wykazały spójny i nienasycalny wzrost wydajności. Przechodząc do zasad praw skalowania w modelach języka, kilka LLM uwypukla zasadę, że zwiększanie skali modeli tendencję do poprawy wyników. Generalizacja zero-shot z drugiej strony odnosi się do zdolności modelu, szczególnie LLM, do wykonywania zadań, na które nie został wyraźnie wyszkolony. W dziedzinie widzenia komputerowego, zainteresowanie budowaniem zdolności zero-shot, oraz w-kontekście uczenia się modeli podstawowych.

Modele języka polegają na algorytmach WordPiece lub podejściu Byte Pair Encoding do tokenizacji tekstu. Modele generacyjne wizualne oparte na modelach języka również polegają ciężko na kodowaniu 2D obrazów w sekwencje tokenów 1D. Wczesne prace, takie jak VQVAE, wykazały możliwość reprezentowania obrazów jako dyskretnych tokenów z umiarkowaną jakością odtworzenia. Następca VQVAE, ramie VQGAN, wdrożyło straty percepcyjne i adversarialne, aby poprawić wierność obrazu, oraz zastosowało dekodujący tylko transformator do generowania tokenów obrazu w standardowym, autoregresyjnym skanowaniu. Modele dyfuzyjne z drugiej strony były długo uważane za liderów w zadaniach syntezy wizualnej, dzięki ich różnorodności, oraz lepszej jakości generacji. Postęp modeli dyfuzyjnych był skupiony na poprawie technik próbkowania, architektury, oraz szybkości próbkowania. Ukryte modele dyfuzyjne stosują dyfuzję w przestrzeni ukrytej, co poprawia wydajność szkolenia, oraz wnioskowania. Modele transformatora dyfuzyjnego zastępują tradycyjną architekturę U-Net z architekturą opartą na transformatorze, oraz zostały wdrożone w ostatnich modelach syntezy obrazu lub wideo, takich jak SORA, oraz Stable Diffusion.

Wizualne Autoregresyjne: Metodologia i Architektura

W swojej istocie, ramie VAR ma dwa dyskretne etapy szkolenia. W pierwszym etapie, wieloskalowy, kwantowany autoencoder lub VQVAE, koduje obraz w mapy tokenów, oraz zaimplementowano złożoną stratę odtworzenia do celów szkoleniowych. Na powyższym obrazie, osadzanie jest słowem, które definiuje konwersję dyskretnych tokenów w ciągłe wektory osadzania. W drugim etapie, transformator w modelu VAR jest szkolony przez minimalizację straty entropii krzyżowej, lub przez maksymalizację prawdopodobieństwa, przy użyciu podejścia przewidywania następnego poziomu. Wytrenowany VQVAE następnie produkuje mapę tokenów podstawy prawdy dla ramy VAR.

Modelowanie Autoregresyjne za Pomocą Przewidywania Następnego Tokenu

Dla danej sekwencji dyskretnych tokenów, gdzie każdy token jest liczbą całkowitą z słownika o rozmiarze V, model autoregresyjny przewidywania następnego tokenu, zakłada, że prawdopodobieństwo obserwowania bieżącego tokenu zależy tylko od jego prefiksu. Zakładając jednokierunkową zależność tokenów, pozwala ramie VAR rozłożyć szanse sekwencji na iloczyn warunkowych prawdopodobieństw. Szkolenie modelu autoregresyjnego obejmuje optymalizację modelu na zbiorze danych, oraz ten proces optymalizacji jest znany jako przewidywanie następnego tokenu, oraz pozwala wytrenowanemu modelowi generować nowe sekwencje. Ponadto, obrazy są 2D ciągłymi sygnałami, a zastosowanie podejścia autoregresyjnego do obrazów za pomocą procesu optymalizacji przewidywania następnego tokenu, ma kilka warunków wstępnych. Po pierwsze, obraz musi być ztokenizowany w kilka dyskretnych tokenów. Zwykle, kwantowany autoencoder jest wdrożony do konwersji mapy cech obrazu w dyskretne tokeny.

Tokeny obrazu w dyskretnych tokenach są ułożone w 2D siatce, oraz w przeciwieństwie do naturalnych zdań językowych, które mają wewnętrzny porządek z lewej do prawej, porządek tokenów obrazu musi być określony wyraźnie do jednokierunkowego uczenia się autoregresyjnego. Wcześniejsze podejścia autoregresyjne spłaszczały 2D siatkę dyskretnych tokenów w sekwencję 1D, przy użyciu metod, takich jak skanowanie w kolumnach, z-curve, lub spiralny porządek. Jak tylko dyskretne tokeny zostały spłaszczone, modele AR wyodrębniały zestaw sekwencji z zbioru danych, oraz następnie szkoliły model autoregresyjny, aby maksymalizować prawdopodobieństwo na iloczyn T warunkowych prawdopodobieństw, przy użyciu przewidywania następnego tokenu.

Wizualne Autoregresyjne Modelowanie za Pomocą Przewidywania Następnego Poziomu

Ramie VAR rekonceptualizuje modelowanie autoregresyjne na obrazach, przechodząc od przewidywania następnego tokenu do podejścia przewidywania następnego poziomu, proces, w którym zamiast być pojedynczym tokenem, jednostka autoregresyjna jest całą mapą tokenów. Model najpierw kwantuje mapę cech w wieloskalowe mapy tokenów, każdy z wyższą rozdzielczością, niż poprzedni, oraz kończy się dopasowaniem do rozdzielczości oryginalnej mapy cech. Ponadto, ramie VAR rozwija nowy, wieloskalowy kwantyzator, aby zakodować obraz w wieloskalowe, dyskretne mapy tokenów, konieczne do uczenia się VAR. Ramie VAR zastosowało tę samą architekturę, co VQGAN, ale z modyfikowaną warstwą kwantyzacji wieloskalowej, z algorytmami zademonstrowanymi na poniższym obrazie.

Wizualne Autoregresyjne: Wyniki i Eksperymenty

Ramie VAR wykorzystuje architekturę VQVAE z wieloskalowym schematem kwantyzacji, z K dodatkowymi warstwami konwolucyjnymi, oraz wykorzystuje wspólny słownik dla wszystkich skal, oraz wymiar ukryty o rozmiarze 32. Główny nacisk leży na algorytmie VAR, dzięki któremu projekt architektury modelu jest prosty, ale skuteczny. Ramie przyjmuje architekturę standardowego, dekodującego tylko transformatora, podobnego do tych wdrożonych w modelach GPT-2, z jedyną modyfikacją, polegającą na zastąpieniu tradycyjnej normalizacji warstwowej normalizacją adaptacyjną lub AdaLN. Dla syntezy warunkowej, ramie VAR wdrożyło osadzanie klas, jako token startowy, oraz warunek warstwy normalizacji adaptacyjnej.

Wyniki Generacji Obrazu Stanu Sztuki

Kiedy zestawione z istniejącymi ramiami generacyjnymi, w tym GANs lub Generative Adversarial Networks, modelami przewidywania maskowanego BERT, modelami dyfuzyjnymi, oraz modelami autoregresyjnymi w stylu GPT, ramie Wizualnego Modelowania Autoregresyjnego wykazuje obiecujące wyniki, podsumowane w poniższej tabeli.

Jak można zobaczyć, ramie Wizualnego Modelowania Autoregresyjnego nie tylko poprawia wyniki FID i IS, ale również wykazuje imponującą szybkość generacji obrazu, porównywalną do modeli stanu sztuki. Ponadto, ramie VAR również utrzymuje zadowalające wyniki precyzji i recall, co potwierdza jego spójność semantyczną. Ale prawdziwym zaskoczeniem jest imponująca wydajność ramy VAR w tradycyjnych zadaniach AR, czyniąc ją pierwszym modelem autoregresyjnym, który przewyższył model Diffusion Transformer, jak to zostało zademonstrowane w poniższej tabeli.

Wynik Generalizacji Zadania Zero-Shot

Dla zadań malowania wewnątrz i na zewnątrz, ramie VAR wymusza tokeny podstawy prawdy poza maską, oraz pozwala modelowi generować tylko tokeny wewnątrz maski, bez żadnych informacji o klasie wstrzykniętych do modelu. Wyniki są zademonstrowane na poniższym obrazie, oraz jak można zobaczyć, model VAR osiąga akceptowalne wyniki w zadaniach downstream, bez dostosowywania parametrów, lub modyfikacji architektury sieci, demonstrując ogólną przydatność ramy VAR.

Podsumowanie

W tym artykule, omówiliśmy nową ramę generacyjną, nazwaną Wizualnym Modelowaniem Autoregresyjnym, która 1) teoretycznie rozwiązuje pewne problemy wewnętrzne w standardowych modelach AR, oraz 2) pozwala modelom autoregresyjnym w stylu GPT przewyższać istniejące modele dyfuzyjne w generowaniu obrazu, pod względem jakości obrazu, różnorodności, wydajności danych, oraz szybkości wnioskowania. Z jednej strony, tradycyjne modele autoregresyjne wymagają określonego porządku danych, natomiast z drugiej strony, Wizualne Modelowanie Autoregresyjne lub ramie VAR, ponownie rozważa, jak uporządkować obraz, oraz to odróżnia VAR od istniejących metod AR. Po skalowaniu VAR do 2 miliardów parametrów, twórcy ramy VAR zaobserwowali wyraźną zależność potęgową między wynikami testowymi, a parametrami modelu, lub kosztami obliczeniowymi, z współczynnikiem korelacji Pearsona zbliżonym do −0,998, wskazującym na solidną ramę do przewidywania wydajności. Te prawa skalowania, oraz możliwość generalizacji zero-shot, jako cechy charakterystyczne LLM, zostały teraz początkowo zweryfikowane w naszych modelach transformatora VAR.

Kunal Kejriwal jest inżynierem backendu specjalizującym się w Pythonie, PostgreSQL, Redis oraz infrastrukturze chmurowej w GCP i AWS. Z trzyletnim doświadczeniem w budowaniu i skalowaniu systemów produkcyjnych pisze o infrastrukturze AI, systemach rozproszonych i architekturze wdrażania obciążeń uczenia maszynowego.