Modele i platformy AI
ORZEŁ: Badanie przestrzeni projektowej dla wielomodalnych dużych modeli językowych z mieszaniną encoderów
Umiejętność dokładnej interpretacji złożonych informacji wizualnych jest kluczowym punktem zainteresowania wielomodalnych dużych modeli językowych (MLLM). Ostatnie prace pokazują, że udoskonalona percepcja wizualna znacznie redukuje halucynacje i poprawia wyniki w zadaniach wrażliwych na rozdzielczość, takich jak optyczne rozpoznawanie znaków i analiza dokumentów. Kilka ostatnich MLLM osiąga to, wykorzystując mieszaninę encoderów wizualnych. Pomimo ich sukcesu, brakuje systematycznych porównań i szczegółowych badań ablacjnych, dotyczących krytycznych aspektów, takich jak wybór ekspertów i integracja wielu ekspertów wizualnych. Artykuł ten zapewnia obszerną eksplorację przestrzeni projektowej dla MLLM z wykorzystaniem mieszaniny encoderów wizualnych i rozdzielczości, ramy Eagle, która próbuje zbadać przestrzeń projektową dla wielomodalnych dużych modeli językowych z mieszaniną encoderów. Wyniki ujawniają kilka podstawowych zasad wspólnych dla różnych istniejących strategii, prowadzących do uproszczonej, ale skutecznej metody projektowej. Eagle odkrywa, że proste łączenie tokenów wizualnych z zestawu komplementarnych encoderów wizualnych jest tak skuteczne, jak bardziej złożone architektury łączenia lub strategie. Ponadto, Eagle wprowadza Pre-Alignment, aby zmostkować lukę między encoderami wizualnymi a tokenami językowymi, poprawiając spójność modelu. Wynikająca z tego rodzina MLLM, Eagle, przewyższa inne wiodące modele open-source w głównych benchmarkach MLLM.
… (reszta treści) …
Eagle: Eksperymenty i wyniki
Po starannym opracowaniu strategii, Eagle ustalił następujące zasady dla modelu: (1) integracja większej liczby ekspertów wizualnych z zoptymalizowanym przepisem szkoleniowym; (2) łączenie wielu ekspertów wizualnych za pomocą bezpośredniego łączenia kanałów; (3) wstępne szkolenie ekspertów wizualnych oddzielnie za pomocą pre-alignmentu. W tej sekcji, aby dalej zademonstrować zalety modeli Eagle, dodatkowe dane szkoleniowe są uwzględnione, a Eagle jest porównywany z bieżącymi modelami MLLM w różnych zadaniach. Eagle wykorzystuje Vicuna-v1.5-7B, Llama3-8B i Vicuna-v1.5-13B jako modele językowe. Dla encoderów wizualnych, na podstawie wyników z sekcji 2.6, modele Eagle są oznaczone jako Eagle-X4, które obejmują cztery encodery wizualne: CLIP, ConvNeXt, Pix2Struct i EVA-02, oraz Eagle-X5, które obejmują dodatkowy encoder wizualny SAM.
Zadania odpowiedzi na pytania wizualne
Eagle porównuje serie modeli w trzech benchmarkach odpowiedzi na pytania wizualne, w tym GQA, VQAv2 i VizWiz. Jak pokazuje poniższa tabela, Eagle-X5 osiąga wyniki na poziomie stanu sztuki w GQA i VQAv2, podkreślając zalety integracji dodatkowych ekspertów wizualnych.
… (reszta treści) …
Końcowe myśli
W tym artykule omówiliśmy Eagle, dogłębną analizę przestrzeni projektowej dla integracji encoderów wizualnych w wielomodalnych dużych modelach językowych. W przeciwieństwie do poprzednich prac, które koncentrują się na projektowaniu nowych paradygmatów łączenia, Eagle odkrywa, że systematyczne wybory projektowe mają znaczenie i odkrywa szereg przydatnych technik. Krok po kroku, Eagle optymalizuje przepis szkoleniowy poszczególnych encoderów wizualnych, identyfikuje rozszerzalną i wydajną metodę łączenia, oraz stopniowo łączy encodery wizualne z różną wiedzą domenową. Wyniki podkreślają krytyczne znaczenie podstawowych rozważań przestrzeni projektowej.












