Modele i platformy AI
Mini-Gemini: Przyspieszanie wielomodalnych modeli języka i widzenia
Postępy w dziedzinie dużych modeli językowych znacznie przyspieszyły rozwój przetwarzania języka naturalnego, czyli NLP. Wprowadzenie ramy transformatora okazało się kamieniem milowym, ułatwiającym rozwój nowej fali modeli językowych, w tym OPT i BERT, które wykazują głębokie zrozumienie języka. Ponadto, wprowadzenie modeli GPT, czyli generatywnych modeli transformatora wstępnie wyuczonych, wprowadziło nowy paradygmat z modelem autoregresyjnym i ustanowiło solidną metodę predykcji i generacji języka. Pojawienie się modeli językowych, takich jak GPT-4, ChatGPT, Mixtral, LLaMA i innych, dodatkowo przyspieszyło ewolucję, a każdy model wykazał poprawioną wydajność w zadaniach związanych z złożonym przetwarzaniem języka. Wśród istniejących metod, dostrojenie instrukcji wyłoniło się jako kluczowa technika do udoskonalenia wyjścia wstępnie wyuczonych dużych modeli językowych, a integracja tych modeli z konkretnymi narzędziami do zadań wizualnych podkreśliła ich dostosowalność i otworzyła drzwi do przyszłych zastosowań, które sięgają daleko poza tradycyjne przetwarzanie oparte na tekście.
Co więcej, zbieżność przetwarzania języka naturalnego i modeli komputerowych spowodowała powstanie modeli języka i widzenia, czyli VLM, które łączą modele językowe i wizualne, aby osiągnąć zrozumienie i zdolności rozumowania między modalnościami. Integracja i pojawienie się modeli wizualnych i językowych odegrały kluczową rolę w postępie zadań, które wymagają zarówno przetwarzania języka, jak i zrozumienia wizualnego. Pojawienie się rewolucyjnych modeli, takich jak CLIP, jeszcze bardziej zmostkowało lukę między zadaniami wizualnymi a modelami języka, demonstrując wykonalność i praktyczność aplikacji między modalnościami. Nowocześniejsze ramy, takie jak LLaMA i BLIP, wykorzystują dostosowane dane instrukcji, aby opracować efektywne strategie, które demonstrują potężne możliwości modelu. Ponadto, łączenie dużych modeli językowych z wyjściami obrazu jest celem badań wielomodalnych, a ostatnie metody mogą ominąć bezpośrednią generację, wykorzystując podejście do pobierania obrazu w celu generowania wyjść obrazu i przeplatanego tekstu.

Z tym powiedzianym, a pomimo szybkich postępów w modelach języka i widzenia, które ułatwiają podstawowe rozumowanie i dialog wizualny, nadal istnieje znacząca luka wydajnościowa między zaawansowanymi modelami, takimi jak GPT-4, a modelami języka i widzenia. Mini-Gemini to próba zwężenia luki między modelami języka i widzenia a bardziej zaawansowanymi modelami, poprzez wykorzystanie potencjału VLM z trzech stron: VLM-kierowanej generacji, wysokiej jakości danych i wysokich tokenów wizualnych. Aby poprawić tokeny wizualne, ramy Mini-Gemini proponują wykorzystanie dodatkowego encodera wizualnego do wysokiej rozdzielczości bez zwiększania liczby tokenów wizualnych. Ramy Mini-Gemini konstruują również wysokiej jakości zestaw danych w celu promowania dokładnego zrozumienia obrazów i generacji opartej na rozumowaniu. Ogólnie, ramy Mini-Gemini próbują wykorzystać potencjał modeli języka i widzenia, a także dążyć do wyposażenia istniejących ram w zdolności rozumowania obrazu, zrozumienia i generacji jednocześnie. Artykuł ten ma na celu omówienie ram Mini-Gemini w szczegółach i będziemy badać mechanizm, metodologię, architekturę ramy oraz porównanie z ramami stanu sztuki. Zatem, zacznijmy.
Mini-Gemini: Przyspieszanie wielomodalnych VLM
Na przestrzeni lat, duże modele językowe ewoluowały i teraz posiadają imponujące zdolności wielomodalne, stając się niezbędną częścią bieżących modeli języka i widzenia. Istnieje jednak luka między wielomodalnymi osiągnięciami dużych modeli językowych a modelami języka i widzenia, a ostatnie badania szukają sposobów łączenia wizji z dużymi modelami języka przy użyciu obrazów i filmów. Dla samych zadań wizualnych, rozdzielczość obrazu jest kluczowym elementem, aby wyraźnie oddać otoczenie z minimalnymi halucynacjami wizualnymi. Aby zmostkować tę lukę, badacze rozwijają modele, które poprawiają zrozumienie wizualne w bieżących modelach języka i widzenia, a dwie z najczęstszych podejść to: zwiększanie rozdzielczości i zwiększanie liczby tokenów wizualnych. Chociaż zwiększanie liczby tokenów wizualnych z wyższą rozdzielczością obrazu poprawia zrozumienie wizualne, zwykle jest towarzyszące zwiększonym wymaganiom obliczeniowym i kosztom, szczególnie przy przetwarzaniu wielu obrazów. Ponadto, możliwości istniejących modeli, jakość istniejących danych i zastosowanie pozostają niewystarczające dla przyspieszonego procesu rozwoju, pozostawiając badaczy z pytaniem, „jak przyspieszyć rozwój modeli języka i widzenia z akceptowalnymi kosztami”??
Ramy Mini-Gemini to próba odpowiedzi na to pytanie, gdyż próbują one zbadać potencjał modeli języka i widzenia z trzech stron: VLM-kierowanej generacji lub rozszerzonych aplikacji, wysokiej jakości danych i wysokich tokenów wizualnych. Po pierwsze, ramy Mini-Gemini implementują architekturę ConvNet, aby generować kandydatów o wysokiej rozdzielczości w sposób wydajny, poprawiając szczegóły wizualne przy zachowaniu liczby tokenów wizualnych dla dużych modeli językowych. Ramy Mini-Gemini łączą również publicznie dostępne wysokiej jakości zestawy danych, aby poprawić jakość danych, i integrują te udoskonalenia z modelem generatywnym i dużymi modelami języka, aby poprawić wydajność VLM i poprawić doświadczenie użytkownika. Wielowymiarowa strategia zaimplementowana przez ramy Mini-Gemini umożliwia im zbadanie ukrytych możliwości modeli języka i widzenia i osiągnięcie znaczących postępów przy ewidentnych ograniczeniach zasobów.

Ogólnie, ramy Mini-Gemini wykorzystują paradygmat „dowolny do dowolnego”, ponieważ mogą one obsługiwać zarówno tekst, jak i obrazy jako dane wejściowe i wyjściowe. W szczególności, ramy Mini-Gemini wprowadzają wydajną linię procesowania do poprawy tokenów wizualnych dla obrazów wejściowych i posiadają system podwójnych encoderów, składający się z dwóch encoderów: pierwszy encoder jest dla obrazów o wysokiej rozdzielczości, a drugi encoder jest dla niskiej jakości wizualnego osadzania. Podczas inferencji, encodery pracują w mechanizmie uwagi, gdzie niskorozdzielczościowy encoder generuje zapytania wizualne, a wysokorozdzielczościowy encoder dostarcza klucze i wartości do odniesienia. Aby poprawić jakość danych, ramy Mini-Gemini gromadzą i produkują więcej danych na podstawie publicznych zasobów, w tym zadań ukierunkowanych na instrukcje, dane związane z generacją i wysokorozdzielczościowe odpowiedzi, a zwiększona ilość i poprawiona jakość danych poprawiają ogólną wydajność i możliwości modelu. Ponadto, ramy Mini-Gemini obsługują jednoczesną generację tekstu i obrazu w wyniku integracji modelu języka i widzenia z zaawansowanymi modelami generatywnymi.
Mini-Gemini: Metodologia i Architektura
W swojej istocie, ramy Mini-Gemini są pojęciowo proste i składają się z trzech komponentów.
- Ramy wykorzystują podwójne encodery wizualne, aby dostarczyć niskiej rozdzielczości wizualnych osadzeń i kandydatów o wysokiej rozdzielczości.
- Ramy proponują wdrożenie górnego minowania, aby przeprowadzić minowanie na poziomie patcha między niskorozdzielczościowymi zapytaniami wizualnymi i wysokorozdzielczościowymi obszarami.
- Ramy Mini-Gemini wykorzystują duży model języka, aby połączyć tekst z obrazami zarówno do generacji, jak i zrozumienia jednocześnie.
Podwójne Encodery Wizualne
Ramy Mini-Gemini mogą przetwarzać zarówno dane wejściowe tekstowe, jak i obrazowe, z możliwością ich obsługi zarówno indywidualnie, jak i w połączeniu. Jak zostało to pokazane na poniższym obrazie, ramy Mini-Gemini rozpoczynają proces, wykorzystując interpolację dwuliniową do wygenerowania obrazu o niskiej rozdzielczości z odpowiedniego obrazu o wysokiej rozdzielczości.

Następnie ramy przetwarzają te obrazy i kodują je w wielowymiarowe wizualne osadzenie w dwóch równoległych przepływach obrazowych. Bardziej szczegółowo, ramy Mini-Gemini utrzymują tradycyjny przepływ dla niskorozdzielczościowych przepływów i wykorzystują wstępnie wytrenowany transformator wizualny CLIP, aby zakodować wizualne osadzenia, ułatwiając modelowi zachowanie dalekosiężnych relacji między wizualnymi patchami do późniejszych interakcji w dużych modelach języka. Dla przepływów o wysokiej rozdzielczości, ramy Mini-Gemini przyjmują encoder oparty na sieciach neuronowych (CNN) do adaptacyjnego i wydajnego przetwarzania obrazu o wysokiej rozdzielczości.
Górne Minowanie
Z podwójnymi encoderami wizualnymi generującymi osadzenia o niskiej rozdzielczości i funkcje o wysokiej rozdzielczości, ramy Mini-Gemini proponują wdrożenie górnego minowania w celu rozszerzenia potencjału modeli języka i widzenia z udoskonalonymi tokenami wizualnymi. Aby utrzymać liczbę tokenów wizualnych dla wydajności w dużych modelach języka, ramy Mini-Gemini traktują niskorozdzielczościowe wizualne osadzenia jako zapytanie i starają się pobrać istotne wskazówki wizualne z kandydatów funkcji o wysokiej rozdzielczości, a ramy traktują mapę funkcji o wysokiej rozdzielczości jako klucz i wartość.

Jak to zostało pokazane na powyższym obrazie, wzór obejmuje proces rafinowania i syntezowania wskazówek wizualnych, co prowadzi do generacji zaawansowanych tokenów wizualnych do późniejszego przetwarzania dużych modeli języka. Proces zapewnia, że ramy są w stanie ograniczyć minowanie dla każdego zapytania do jego odpowiedniej podobszaru w mapie funkcji o wysokiej rozdzielczości z liczbą funkcji pikselowych, co skutkuje zwiększoną wydajnością. Dzięki temu projektowi, ramy Mini-Gemini są w stanie wydobyć szczegóły funkcji o wysokiej rozdzielczości bez zwiększania liczby tokenów wizualnych i utrzymują równowagę między wykonalnością obliczeniową a bogactwem szczegółów.
Generacja Tekstu i Obrazu
Ramy Mini-Gemini łączą tokeny wizualne i tokeny wejściowe tekstu jako dane wejściowe do dużych modeli języka do autoregresyjnej generacji. W przeciwieństwie do tradycyjnych modeli języka i widzenia, ramy Mini-Gemini obsługują generację tylko tekstu, a także generację tekstu i obrazu jako dane wejściowe i wyjściowe, tj. inferencja „dowolny do dowolnego”. Jest to wynik imponujących zdolności zrozumienia obrazu i tekstu oraz zdolności rozumowania, a ramy Mini-Gemini są w stanie generować obrazy o wysokiej jakości. W przeciwieństwie do ostatnich prac, które koncentrują się na luce między osadzeniami tekstu w modelach generatywnych i dużych modelach języka, ramy Mini-Gemini próbują zoptymalizować lukę w dziedzinie instrukcji językowych, tłumacząc instrukcje użytkownika na wysokiej jakości instrukcje, które produkują obrazy istotne dla kontekstu w modelach dyfuzji latentnej. Ponadto, w celu lepszego zrozumienia dostrojenia instrukcji i wyrównania między modalnościami, ramy Mini-Gemini gromadzą próbki z publicznie dostępnych wysokiej jakości zestawów danych i wykorzystują framework GPT-4 Turbo, aby dalej zbudować zestaw danych o instrukcjach o rozmiarze 13K w celu wspierania generacji obrazu.

Mini-Gemini: Eksperymenty i Wyniki
Aby ocenić ich wydajność, ramy Mini-Gemini są zainicjowane z wstępnie wytrenowaną ramą ConvNext-L dla encodera wizualnego o wysokiej rozdzielczości i z wstępnie wytrenowanym transformatorem wizualnym CLIP dla encodera wizualnego o niskiej rozdzielczości. Aby zapewnić wydajność szkolenia, ramy Mini-Gemini utrzymują oba encodery wizualne w stanie niezmienionym i optymalizują projektorów górnego minowania we wszystkich etapach, a także optymalizują duży model języka podczas samej fazy dostrojenia instrukcji.

Poniższa tabela porównuje wydajność ram Mini-Gemini z modelem stanu sztuki w różnych ustawieniach, a także bierze pod uwagę prywatne modele. Jak można zauważyć, Mini-Gemini przewyższa istniejące ramy w szerokim zakresie dużych modeli języka, a także demonstruje lepszą wydajność, gdy jest skonfigurowany z Gemma-2B w kategorii efektywnych modeli. Ponadto, gdy zastosowane są większe duże modele języka, skalowalność ram Mini-Gemini jest widoczna.

Aby ocenić ich wydajność w wysokiej rozdzielczości i rozszerzonych tokenach wizualnych, eksperymenty są przeprowadzane z rozmiarem wejściowym 672 dla encodera wizualnego o niskiej rozdzielczości i 1536 dla encodera wizualnego. Jak wcześniej wspomniano, głównym celem encodera wizualnego o wysokiej rozdzielczości jest dostarczenie informacji o wysokiej rozdzielczości. Jak można zauważyć, ramy Mini-Gemini dostarczają lepszą wydajność w porównaniu z modelem stanu sztuki.

Co więcej, aby ocenić możliwości zrozumienia wizualnego ram Mini-Gemini w środowisku rzeczywistym, deweloperzy stosują model do różnych zadań związanych z rozumowaniem i zrozumieniem, jak zostało to pokazane na poniższym obrazie. Jak można zauważyć, ramy Mini-Gemini są w stanie rozwiązać szeroki zakres złożonych zadań dzięki wdrożeniu górnego minowania i wysokiej jakości danych. Ale co jest jeszcze bardziej imponujące, to fakt, że ramy Mini-Gemini demonstrują wyrafinowaną dbałość o szczegóły, która wykracza poza zwykłe zdolności rozpoznawania i opisuje złożone elementy w sposób szczegółowy.


Poniższy rysunek dostarcza kompleksowej oceny zdolności generatywnych ram Mini-Gemini.

W porównaniu z ostatnimi modelami, takimi jak ChatIllusion i AnyGPT, ramy Mini-Gemini demonstrują silniejsze zdolności zrozumienia wielomodalnego, umożliwiając generowanie tekstu na obraz podpisów, które są zgodne z instrukcjami wejściowymi, a także prowadzą do odpowiedzi obrazu na tekst o silniejszej podobieństwie pojęciowym. Co jest jeszcze bardziej imponujące, to fakt, że ramy Mini-Gemini demonstrują wybitne zdolności w generowaniu treści o wysokiej jakości przy użyciu instrukcji wielomodalnych tylko z danymi szkoleniowymi, co ilustruje solidną interpretację semantyczną i zdolności wyrównania obrazu i tekstu.

Podsumowanie
W tym artykule omówiliśmy ramy Mini-Gemini, potężne i zunifikowane ramy dla wielomodalnych modeli języka i widzenia. Głównym celem ram Mini-Gemini jest wykorzystanie ukrytych możliwości modeli języka i widzenia przy użyciu wysokiej jakości danych, strategicznego projektu ramy i rozszerzonej funkcjonalności. Mini-Gemini to próba zwężenia luki między modelami języka i widzenia a bardziej zaawansowanymi modelami, poprzez wykorzystanie potencjału VLM z trzech stron: VLM-kierowanej generacji, wysokiej jakości danych i wysokich tokenów wizualnych. Aby poprawić tokeny wizualne, ramy Mini-Gemini proponują wykorzystanie dodatkowego encodera wizualnego do wysokiej rozdzielczości bez zwiększania liczby tokenów wizualnych. Ramy Mini-Gemini konstruują również wysokiej jakości zestaw danych w celu promowania dokładnego zrozumienia obrazów i generacji opartej na rozumowaniu. Ogólnie, ramy Mini-Gemini próbują wykorzystać potencjał modeli języka i widzenia, a także dążyć do wyposażenia istniejących ram w zdolności rozumowania obrazu, zrozumienia i generacji jednocześnie.












