Modele i platformy AI
SHOW-O: Pojedynczy Transformer Ujednolicający Zrozumienie i Generowanie Wielomodalne
W ostatnich latach nastąpiły znaczące postępy w dużych modelach językowych (LLM), co zainspirowało rozwój wielomodowych dużych modeli językowych (MLLM). Wczesne próby MLLM, takie jak LLaVA, MiniGPT-4 i InstructBLIP, wykazały znaczące możliwości zrozumienia wielomodalnego. Aby zintegrować LLM z domenami wielomodowymi, te badania zbadały projekcję cech z pre-trenowanego, modalitycznego encodera, takiego jak CLIP, do przestrzeni wejściowej LLM, umożliwiając zrozumienie i rozumowanie wielomodalne w ramach transformatora. Chociaż istnieją różne wybory projektowe dla MLLM, takie jak encodery wizualne, adaptory dopasowania cech i zestawy danych, trening większości z tych modeli przestrzega paradygmatu autoregresyjnej generacji, który okazał się skuteczny dla generacji tekstu w LLM. Pomimo ich silnych możliwości zrozumienia wielomodalnego, te modele koncentrują się głównie na percepcji wizualnej i nie posiadają możliwości generowania wielomodalnych danych wyjściowych poza tekstem.
Modele transformatora wykazały wielki sukces w modelowaniu autoregresyjnym w przetwarzaniu języka naturalnego. Zainspirowani takim postępem, poprzednie badania bezpośrednio zastosowały to samo modelowanie autoregresyjne, aby nauczyć się zależności pikseli obrazu dla generacji obrazu i wideo. Na przykład, VideoPoet wykorzystuje architekturę transformatora tylko z dekodera do syntezy wysokiej jakości wideo z wielomodowych danych wejściowych. Bardziej niedawno, LlamaGen wykazał, że architektura dużego modelu językowego, taka jak Llama, może autoregresyjnie modelować tokeny obrazu, osiągając przyzwoitą wydajność w generacji obrazu warunkowej klasy.
W tym artykule omówimy Show-O, ujednoliconego transformatora, który łączy zrozumienie i generowanie wielomodalne. W przeciwieństwie do w pełni autoregresyjnych modeli, Show-O ujednolica modelowanie autoregresyjne i dyskretne dyfuzyjne, aby adaptacyjnie obsłużyć dane wejściowe i wyjściowe różnych i mieszanego rodzaju. Ujednolicony model elastycznie wspiera szeroki zakres zadań wizja-język, w tym odpowiedzi na pytania wizualne, generację obrazu z tekstu, malowanie i extrapolację z tekstu, oraz generację mieszanego rodzaju. Przez różne benchmarki, Show-O wykazuje porównywalną lub lepszą wydajność w porównaniu z istniejącymi indywidualnymi modelami o równoważnej lub większej liczbie parametrów, podkreślając jego potencjał jako następczy model podstawowy.
W tym ramach model jest zadany do przewidywania szumu Gaussa dodanego do ciągłych latentnych reprezentacji. W przeciwieństwie do innych modeli, takich jak D3PM, Mask-predict, ARDM i MaskGIT, które wykorzystują dyskretny proces korupcji jako alternatywę dla dyfuzyjnej Gaussa. Szczególnie, obraz jest reprezentowany jako sekwencja dyskretnych tokenów przy użyciu tokenizatora obrazu, z każdym tokenem skojarzonym z etykietą kategorialną. Rozkład tokenów jest przekształcany w rozkład jednostajny za pomocą stochastycznego procesu próbkowania. Podczas treningu, część tych tokenów jest losowo maskowana, a model jest trenowany do przewidywania oryginalnych wartości maskowanych tokenów. W tym pracy, Show-O przyjmuje modelowanie dyfuzyjne dyskretne do generacji wizualnej.
… (reszta treści)












