Modele i platformy AI

Osprey: Szkolenie instrukcji wizualnych zrozumieniem na poziomie pikseli

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Ostatnio opracowane metody szkolenia instrukcji wizualnych sprawiły, że wielomodalne duże modele językowe (MLLM) wykazały się imponującymi, ogólnymi możliwościami zrozumienia wizji i języka. Te możliwości sprawiają, że są one kluczowymi elementami budulcowymi nowoczesnych, ogólnych asystentów wizualnych. Niedawne modele, w tym MiniGPT-4, LLaVA, InstructBLIP i inne, wykazują imponujące zdolności rozumowania wizualnego i przestrzegania instrukcji. Chociaż większość z nich opiera się na parach obrazu i tekstu do wyrównania wizji i języka na poziomie obrazu, radzą sobie dobrze w tej dziedzinie. Jednak ich uzależnienie od zrozumienia na poziomie pudełka i obrazu jest główną przyczyną, dla której MLLM nie radzą sobie z powtarzaniem swoich wyników w zadaniach wyrównania wizji i języka na poziomie pikseli. Dodatkowo, ograniczona dostępność danych instrukcji opartych na maskach do szkolenia stanowi wyzwanie w dalszym doskonaleniu MLLM.

Osprey to metoda szkolenia instrukcji maski-tekstu, której głównym celem jest rozszerzenie możliwości MLLM. Wprowadza drobnoziarniste, maskowane regiony w instrukcjach językowych, aby osiągnąć zrozumienie wizji i języka na poziomie pikseli. Aby to osiągnąć, ramy Osprey tworzą zestaw danych regionu-tekstu opartych na maskach z ponad 700 tysiącami próbek. Wstrzykuje reprezentację na poziomie pikseli do dużych modeli językowych, aby zaprojektować model wizji i języka. Ramy Osprey przyjmują model wizyjny CLIP oparty na sieciach neuronowych i integrują maskę świadomego ekstraktora wizualnego w swojej architekturze. Pozwala to na precyzyjne wyodrębnienie cech wizualnych maski z danych wejściowych o wysokiej rozdzielczości.

W tym artykule omówimy ramy Osprey i zagłębimy się w ich architekturę. Omówimy również zestaw danych regionu-tekstu z ponad 700 tysiącami próbek i porównamy ich wyniki w różnych zadaniach zrozumienia regionu. Zatem, zacznijmy.

Osprey: Zrozumienie na poziomie pikseli z instrukcjami wizualnymi

Wielomodalne duże modele językowe, takie jak MiniGPT-4, Otter, Qwen-LV, InstructBLIP i inne, są liderami w rozwoju ogólnych asystentów wizualnych i słyną z wyjątkowych, wielomodalnych i generatywnych możliwości wizji. Jednak wielomodalne duże modele językowe cierpią z powodu znacznego wyzwania, gdyż dostarczają niezadowalających wyników w zadaniach zrozumienia obrazu na poziomie drobnym, takich jak podpis, klasyfikacja regionu i rozumowanie. Główną przyczyną słabych wyników w zadaniach zrozumienia obrazu na poziomie drobnym jest brak wyrównania na poziomie regionu. Niedawne MLLM, takie jak GPT4RoI, Shikra i inne, mają na celu umożliwienie zrozumienia na poziomie regionu w modelach wizji i języka, przetwarzając regiony określone przez pudełka i wykorzystując instrukcje wizualne z cechami przestrzennymi na poziomie obiektu.

Chociaż podejście do umożliwienia zrozumienia na poziomie regionu może poprawić wyniki, zastosowanie rzadkich pudełek jako bezpośredniego wejścia regionu może wprowadzić nieistotne cechy tła, prowadząc do nieprecyzyjnego wyrównania pary region-tekst dla instrukcji wizualnych w dużych modelach językowych. Podczas procesu inferencji, wejście odniesienia pudełka może nie być w stanie wykryć i reprezentować obiekt precyzyjnie, co może skutkować odchyleniem semantycznym, jak pokazano na poniższym obrazie.

W porównaniu, użycie drobnoziarnistych masek zamiast grubych pudełek jako wejścia odniesienia może reprezentować obiekty z większą precyzją. Ostatnio opracowany model SAM lub Segment Anything Model jest szkolony na miliardach wysokiej jakości masek, wykazuje imponującą jakość segmentacji w zadaniach zero-shot i obsługuje punkty lub proste pudełka jako prompty. Jednak ramy SAM nie mogą generować podstawowych etykiet semantycznych, ani dostarczać szczegółowych etykiet semantycznych i atrybutów. W rezultacie, istniejące modele nie posiadają wewnętrznej, wielomodalnej informacji drobnoziarnistej i mają ograniczone zrozumienie scen w świecie rzeczywistym.

Aby rozwiązać wyzwania stojące przed istniejącymi MLLM, Osprey, nowa metoda szkolenia instrukcji maski-tekstu, ma na celu rozszerzenie możliwości wielomodalnych dużych modeli językowych do zrozumienia na poziomie pikseli. Ramy Osprey wprowadzają maskę świadomego ekstraktora wizualnego, który precyzyjnie capture cechy wizualne maski. Następnie, ramy Osprey łączą cechy wizualne z instrukcjami językowymi, aby wygenerować sekwencję wejściową dla dużego modelu językowego i wykorzystują architekturę CLIP opartą na sieciach neuronowych, aby ułatwić użycie danych wejściowych o wysokiej rozdzielczości. Dzięki swojej konstrukcji i architekturze, ramy Osprey są w stanie osiągnąć zrozumienie semantyczne na poziomie drobnym dla regionów na poziomie obiektu i części, oraz dostarczają szczegółowe atrybuty obiektu wraz z podstawową kategorią obiektu i ulepszonymi opisami złożonych scen.

Wykorzystując możliwości instrukcji wizualnych, ramy Osprey umożliwiają nowe możliwości poza zrozumieniem na poziomie obrazu i pudełka, ponieważ ramy Osprey mogą generować zrozumienie semantyczne na poziomie drobnym przy użyciu masek klas-agnostycznych z modeli SAM. Dodatkowo, Osprey wykazuje imponujące możliwości w zadaniach klasyfikacji obiektu odniesienia, rozpoznawania słownictwa otwartego, opisie na poziomie regionu i szczegółowym opisie regionu.

Osprey: Metodologia i architektura

Poniższy rysunek pokazuje przegląd architektury ram Osprey, składającej się z dużego modelu językowego, ekstraktora wizualnego świadomego maski i kodera wizyjnego na poziomie obrazu.

Dla danego obrazu, wejścia językowego i regionów maski odniesienia, ramy wykonują konwersję i tokenizację, aby wygenerować wektorów przed wysłaniem sekwencji wektorów językowych i cech maski do dużego modelu językowego, aby uzyskać zrozumienie semantyczne na poziomie drobnym.

Koder wizyjny CLIP oparty na sieciach neuronowych

Koder wizyjny wdrożony w większości wielomodalnych dużych modeli językowych jest przykładem modelu CLIP opartego na ViT. W związku z tym, ramy Osprey przyjmują architekturę CLIP opartą na sieciach neuronowych jako koder wizyjny. Tradycyjnie, modele CLIP oparte na sieciach neuronowych wykazały imponujące możliwości generalizacji w różnych rozdzielczościach wejściowych w porównaniu z modelami CLIP opartymi na transformatore wizyjnym. Wdrożenie modelu CLIP opartego na sieciach neuronowych umożliwia szybką inferencję i efektywne szkolenie bez kompromisów w wydajności modelu. Dodatkowo, model CLIP oparty na sieciach neuronowych jest w stanie generować wieloskalowe mapy cech, które ramy Osprey wykorzystują bezpośrednio do ekstrakcji cech w każdym regionie obiektu.

Ekstraktor wizualny świadomy maski

W przeciwieństwie do istniejących modeli opartych na regionach, które wykorzystują rzadkie pudełka jako wejście odniesienia, ramy Osprey wykorzystują drobnoziarniste regiony maski do implementacji reprezentacji opartych na obiektach. Model Osprey zatrudnia komponent ekstraktora wizualnego świadomego maski, aby capture cechy wizualne na poziomie pikseli w każdym regionie obiektu. Ekstraktor wizualny świadomy maski koduje cechy wizualne na poziomie maski i dodatkowo gromadzi informacje o położeniu przestrzennym każdego regionu.

Aby to zaimplementować, Osprey najpierw wykorzystuje wielopoziomowe cechy obrazu wygenerowane przez koder wizyjny, aby przyjąć operację poolingu maski, a dla każdej cechy poziomu, ramy Osprey poolują wszystkie cechy, które leżą w regionie maski. Następnie, model koduje cechy w różnych warstwach, przekazując każdą cechę przez warstwę projekcji liniowej, która generuje wektorów na poziomie regionu, i łączy cechy wielopoziomowe, wykonując sumowanie. Model Osprey wykorzystuje warstwę MLP, aby wyprodukować token wizualny maski. Dodatkowo, Osprey zachowuje geometrię przestrzenną regionu obiektu, kodując relację położenia na poziomie pikseli, wdrażając maskę binarną dla każdego regionu obiektu. W końcu, Osprey uwzględnia token wizualny maski i odpowiednie tokeny przestrzenne dla każdego wektorów maski.

Tokenizacja LLM

Jak wcześniej wspomniano, model wyodrębnia wektorów obrazu na poziomie obrazu, wprowadzając go do wstępnie wyszkolonego kodera wizyjnego opartego na sieciach neuronowych. Dla informacji tekstowych, model najpierw wykorzystuje wstępnie wyszkolone tokenizatory LLM, aby ztokenizować sekwencje tekstowe, a następnie projekty tokenizowanych sekwencji tekstowych do wektorów tekstowych. Dla regionów opartych na maskach, model definiuje specjalny token jako placeholder, a następnie zastępuje go tokenem przestrzennym wraz z tokenem maski. Gdy model odnosi się do regionu obiektu w wejściu tekstowym, dołącza placeholder po nazwie regionu, co pozwala maskom mieszać się z tekstami, tworząc pełne zdania bez przestrzeni tokenizacji. Dodatkowo, poza instrukcjami użytkownika, model uwzględnia również prefiks promptu, specjalny token, który służy jako placeholder, który jest następnie zastąpiony przez wektorów obrazu na poziomie obrazu z kodera wizyjnego. W końcu, ramy Osprey łączą wektorów regionu i obrazu wraz z tokenami tekstowymi i wprowadzają je do dużego modelu językowego, aby zrozumieć instrukcje użytkownika i obraz z różnymi regionami w obiekcie.

Osprey: Trzystopniowy proces szkolenia

Ramy Osprey wdrożają trzystopniowy proces szkolenia, w którym każda z faz szkolenia jest nadzorowana przez minimalizację straty predykcji następnego tokenu.

Etap 1: Szkolenie wyrównania obrazu i tekstu

W pierwszym etapie, ramy Osprey wdrożają koder wizyjny CLIP oparty na sieciach neuronowych, aby wyszkolić cechy obrazu na poziomie obrazu i łącznik językowy, aby wyszkolić model do wyrównania cech obrazu i tekstu. W pierwszym etapie, ramy Osprey zatrudniają trzy komponenty: wstępnie wyszkolony duży model językowy, wstępnie wyszkolony koder wizyjny i projektor na poziomie obrazu. Ramy Osprey przyjmują również warstwę MLP, aby służyć jako łącznik wizyjno-językowy, który pomaga wzmocnić wielomodalne możliwości generatywne Osprey.

Etapy 2: Wstępne szkolenie wyrównania maski i tekstu

W drugim etapie, Osprey ładuje wagi wytrenowane w pierwszym etapie i zatrudnia komponent ekstraktora wizualnego świadomego maski, aby capture cechy regionu na poziomie pikseli. W drugim etapie, ramy Osprey szkolą tylko ekstraktor wizualny świadomy maski, aby wyrównać wektorów językowe z cechami regionu opartymi na maskach. Dodatkowo, model gromadzi pary maski pikseli i krótkie teksty z poziomu części i publicznie dostępnych zestawów danych na poziomie obiektu, i konwertuje je na dane instrukcji, aby dalej wyszkolić model.

Etapy 3: Końcowe dokształcanie

W trzecim i ostatnim etapie, model utrwala wagi kodera wizyjnego i dokształca duży model językowy, ekstraktor wizualny oparty na maskach i projektor na poziomie obrazu w swojej architekturze. Głównym celem szkolenia w trzecim etapie jest rozszerzenie możliwości modelu do śledzenia instrukcji użytkownika dokładnie i efektywnie wykonywać zadania zrozumienia regionu na poziomie pikseli.

Po wdrożeniu trzech etapów szkolenia, ramy Osprey są w stanie zrozumieć złożone scenariusze określone przez instrukcje użytkownika i oparte na regionach maski na poziomie pikseli.

Osprey: Wyniki eksperymentalne

Aby ocenić ich wydajność, twórcy Osprey przeprowadzili szereg eksperymentów, aby zademonstrować możliwości modelu w klasyfikacji, rozpoznawaniu regionu na poziomie pikseli i złożonych opisach.

Segmentacja otwartego słownictwa

Głównym celem segmentacji otwartego słownictwa jest wygenerowanie rozpoznawania regionu opartego na maskach i odpowiedniej kategorii w sposób jawny. Aby osiągnąć segmentację otwartego słownictwa, Osprey najpierw wykorzystuje wejście tekstowe, a następnie przyjmuje regiony maski odniesienia do interferencji modelu, aby ocenić wydajność modelu w zadaniach rozpoznawania otwartego słownictwa. Na podstawie odpowiedzi wygenerowanej przez wielomodalny duży model językowy, Osprey oblicza podobieństwo semantyczne między listą słownictwa a wyjściem każdego zestawu danych. Poniższy rysunek porównuje Osprey z modelem stanu sztuki.

Jak można zobaczyć, ramy Osprey przewyższają istniejące metody o znaczną granicę zarówno w zestawie danych Cityscapes, jak i ADE20K-150. Wyniki wskazują na zdolność Osprey do przewyższania istniejących podejść i osiągania solidnego zrozumienia i rozpoznawania w regionach obiektów na poziomie drobnym.

Klasyfikacja obiektu odniesienia

W zadaniu klasyfikacji obiektu odniesienia, model musi sklasyfikować obiekt w określonym regionie obrazu. Aby ocenić ich możliwości klasyfikacyjne, ramy Osprey wykorzystują dwie metryki istotności semantycznej, w tym IoU semantyczne (S-IoU) i podobieństwo semantyczne (SS). IoU semantyczne reprezentuje nachodzenie słów między etykietami podstawowymi a etykietami predykcyjnymi, podczas gdy podobieństwo semantyczne mierzy podobieństwo między etykietami predykcyjnymi i podstawowymi w przestrzeni semantycznej. Poniższy obraz pokazuje wyniki Osprey w zadaniu klasyfikacji obiektu odniesienia w porównaniu z modelem zastosowanym w podejściu na poziomie pudełka i obrazu.

Szczegółowy opis regionu

W zadaniu szczegółowego opisu regionu, model ocenia swoje możliwości opisu instrukcji na poziomie regionu wraz z innymi podejściami na poziomie regionu. Model losowo wybiera wejście inferencyjne z listy wstępnie zdefiniowanych wejść, a następnie wykorzystuje ramy LLM GPT-4, aby zmierzyć jakość odpowiedzi wygenerowanej przez model w odniesieniu do regionów odniesienia. Wykorzystując potok generowania instrukcji, model generuje pytania, a następnie szuka odpowiedzi GPT-4, po czym LLM ocenia poprawność semantyki i precyzję zrozumienia odniesienia. Poniższa tabela pokazuje wyniki Osprey w porównaniu z modelem stanu sztuki w zadaniach szczegółowego opisu regionu.

Opis na poziomie regionu

Ramy Osprey również przewyższają istniejące podejścia w zadaniach opisu na poziomie regionu, z wynikami zawartymi w poniższym obrazie.

Podsumowanie

W tym artykule omówiliśmy ramy Osprey, nową metodę szkolenia instrukcji maski-tekstu, której głównym celem jest rozszerzenie możliwości wielomodalnych dużych modeli językowych do zrozumienia na poziomie pikseli. Aby osiągnąć ten cel, ramy Osprey tworzą zestaw danych regionu-tekstu opartych na maskach z ponad 700 tysiącami próbek i wstrzykują reprezentację na poziomie pikseli do dużych modeli językowych, aby zaprojektować model wizji i języka. Ramy Osprey mają na celu znacząco poprawić możliwości MLLM do zrozumienia wizualnego na poziomie drobnym i, poprzez wdrożenie modelu CLIP opartego na sieciach neuronowych i ekstraktora wizualnego świadomego maski, Osprey osiąga możliwość zrozumienia obrazów na poziomie części i obiektu.

"Inżynier z zawodu, pisarz z serca". Kunal jest technicznym pisarzem z głęboką miłością i zrozumieniem AI i ML, poświęconym uproszczeniu złożonych pojęć w tych dziedzinach poprzez swoje angażujące i informacyjne dokumentacje.