Modely a platformy AI

EAGLE: Prozkoumání designového prostoru pro multimodální velké jazykové modely pomocí směsi encoderů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Schopnost přesně interpretovat komplexní vizuální informace je zásadním zaměřením multimodálních velkých jazykových modelů (MLLMs). Nedávné práce ukazují, že vylepšená vizuální percepci významně snižuje halucinace a zlepšuje výkon na úkolech citlivých na rozlišení, jako je optické rozpoznávání znaků a analýza dokumentů. Několik nedávných MLLM dosahuje tohoto cíle pomocí směsi vizuálních encoderů. Navzdory jejich úspěchu chybí systematické srovnání a podrobné studie ablace, které se zabývají kritickými aspekty, jako je výběr odborníků a integrace více vizuálních odborníků. Tento článek poskytuje rozsáhlé prozkoumání designového prostoru pro MLLM pomocí směsi vizuálních encoderů a rozlišení, rámec Eagle, který se snaží prozkoumat designový prostor pro multimodální velké jazykové modely pomocí směsi encoderů. Zjištění odhalila několik základních principů společných pro různé existující strategie, což vedlo k zjednodušenému, ale účinnému designovému přístupu. Eagle zjistil, že jednoduché spojování vizuálních tokenů z množiny komplementárních vizuálních encoderů je stejně účinné jako složitější architektury nebo strategie míchání. Kromě toho Eagle představuje Pre-Alignment, aby překlenul mezery mezi vizuálně orientovanými encodery a jazykovými tokeny, což zlepšuje koherenci modelu. Výsledná rodina MLLM, Eagle, překonává ostatní přední open-source modely na hlavních MLLM benchmarcích.

Práce Eagle je související s obecným architektonickým designem multimodálních velkých jazykových modelů (MLLMs). Kromě linie reprezentativního open-source výzkumu, který byl zmíněn dříve, patří mezi další významné rodiny MLLM MiniGPT-4, Lynx, Otter, QwenVL, CogVLM, VILA, GPT-4V, Gemini a Llama 3.1. V závislosti na tom, jak jsou vizuální signály integrovány do jazykového modelu, lze MLLM rozdělit do dvou kategorií: “cross-modal attention” modely a “prefix-tuning” modely. První typ vkládá vizuální informace do různých vrstev LLM pomocí cross-modální pozornosti, zatímco druhý typ zachází s vizuálními tokeny jako s částí jazykové tokenové sekvence a přímo je připojuje s textovými vložkami. Model Eagle patří do rodiny prefix-tuning následujícím LLaVA-styled multimodální architekturu.

… (full translation)

Eagle: Experimenty a výsledky

Po pečlivém vývoji svých strategií Eagle stanovil následující zásady pro model: (1) integrace více vizuálních odborníků s optimalizovaným tréninkovým receptem; (2) kombinace více vizuálních odborníků pomocí přímého kanálového spojování; (3) předtrénink vizuálních odborníků samostatně pomocí pre-alignmentu. V této části se Eagle dále porovnává se stávajícími špičkovými MLLM na různých úkolech. Eagle používá Vicuna-v1.5-7B, Llama3-8B a Vicuna-v1.5-13B jako jazykové modely. Pro vizuální encodery jsou modely Eagle označeny jako Eagle-X4, které zahrnují čtyři vizuální encodery: CLIP, ConvNeXt, Pix2Struct a EVA-02, a Eagle-X5, které zahrnují další SAM vizuální encoder.

Úkoly vizuálního dotazování

Eagle porovnává modely napříč třemi úkoly vizuálního dotazování, včetně GQA, VQAv2 a VizWiz. Jak je znázorněno v následující tabulce, Eagle-X5 dosahuje špičkového výkonu na GQA a VQAv2, což zdůrazňuje výhody integrace dalších vizuálních odborníků.

… (full translation)

Závěrečné myšlenky

V tomto článku jsme hovořili o Eagle, hluboké analýze designového prostoru pro integraci vizuálních encoderů do multimodálních velkých jazykových modelů. Na rozdíl od předchozích prací, které se zaměřují na návrh nových fúzních paradigmat, Eagle zjistil, že systematické designové volby jsou důležité a objevily se řada užitečných technik. Krok za krokem Eagle optimalizuje tréninkový recept jednotlivých vizuálních encoderů, identifikuje rozšiřitelnou a efektivní fúzní metodu a postupně kombinuje vizuální encodery s rozdílnými znalostmi domény. Výsledky zdůrazňují kritickou důležitost základních designových prostorových úvah.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.