Modely a platformy AI

LLaVA-UHD: Efektivně vnímá obrázky v jakémkoli poměru stran a vysoké rozlišení

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Poslední pokrok a vývoj velkých jazykových modelů zaznamenal významný nárůst schopností rozumění, vnímání a interakce s vizuálními informacemi. Moderní rámce dosahují tohoto cíle projekcí vizuálních signálů do velkých jazykových modelů, aby je ermögňovaly vizuálně interpretovat svět, širokou škálu scénářů, které závisí na strategiích vizuálního kódování. Nicméně, reálné obrázky neobsahují pouze širokou škálu scénářů, ale také se výrazně liší v rozlišení a poměru stran, což představuje významné výzvy pro velké jazykové modely napříč různými doménami a úkoly. Aby se vyrovnaly s významnou variací, kterou představují reálné obrázky, moderní velké jazykové modely vnímají obrázky v nízkém rozlišení, tj. 224×224, a pevném poměru stran, tj. 1:1. Ačkoli tato kompromis zvyšuje obecnou použitelnost velkých jazykových modelů v reálných aplikacích, často vede k velmi rozmazaným obrázkům a způsobuje závažné deformace tvarů. Tento kompromis významně ovlivňuje schopnosti velkých multimodálních modelů, zejména těch, které jsou optimalizovány pro jemné úkoly, jako je optické rozpoznávání znaků a porozumění malým objektům. Vzhledem k tomu, že rozlišení a poměr stran jsou předem určeny, modely mohou pouze odhadnout rozmazané obrázky, což vede k halucinacím modelu, kdy model produkuje textové odpovědi, které nejsou fakticky zakotveny v obrázcích.

V tomto článku budeme hovořit o LLaVA-UHD, novém přístupu, který nejprve bere rámce LLaVA-1,5 a GPT-4V jako reprezentativní příklady a snaží se odhalit systematické chyby, které jsou hluboko zakořeněny ve strategii vizuálního kódování. Rámec LLaVA-UHD, multimodální model, se snaží řešit tyto výzvy. Rámec LLaVA-UHD může vnímat obrázky v vysokém rozlišení i v jakémkoli poměru stran. Rámec LLaVA-UHD se skládá ze tří klíčových komponent. První, strategie modulárního vizuálního kódování, která rozděluje obrázky v nativním rozlišení na menší, variabilní velikosti, aby zvýšila efektivitu a prodloužila kódování. Druhá, kompresní modul, který dále kondenzuje vizuální tokeny produkované vizuálními kodéry. Třetí, prostorový schéma, které organizuje tokeny pro velké jazykové modely. Komplexní experimenty ukazují, že rámec LLaVA-UHD je schopen překonat současné velké jazykové modely na 9 benchmarcích. Kromě toho, pomocí pouze 94% inferenčních výpočtů, rámec LLaVA-UHD je schopen podporovat obrázky s 6krát větším rozlišením, tj. 672×1088.

LLaVA-UHD: Efektivně vnímá obrázky v jakémkoli poměru stran a vysoké rozlišení

Vizuální rozumění, vnímání a interakce zaznamenaly významný pokrok, zejména díky nedávnému tlaku na velké jazykové modely. V moderních rámcích se toto dosahuje tím, že se vizuální signály zavádějí do velkých jazykových modelů, aby je ermögňovaly vizuálně interpretovat svět, širokou škálu scénářů, které závisí na strategiích vizuálního kódování. Rozdíl v scénáři odráží úzkou pokrytí velkých jazykových modelů napříč různými doménami a úkoly, zatímco rozdíl v rozlišení a poměru stran odhaluje velké intratřídní variace v reálných obrázcích, které jsou obtížně zpracovatelné. Na rozdíl od malého měřítka, které snižuje variaci, modely po BERT řeší významnost z nízkého rozlišení (například pro LLaVA-UHD je to 224×224) obrázků s pevným poměrem stran, 1:1, aby poskytly reálné obrázky. Ačkoli tato kompromis je užitečný pro zajištění obecné použitelnosti velkých jazykových modelů v reálných aplikacích, často vede k velmi rozmazaným obrázkům a způsobuje závažné deformace tvarů. To snižuje schopnosti velkých multimodálních modelů, zejména těch, které jsou optimalizovány pro jemné úkoly, jako je optické rozpoznávání znaků a porozumění malým objektům. Vzhledem k tomu, že rozlišení a poměr stran jsou předem určeny, modely mohou pouze odhadnout rozmazané obrázky, což vede k halucinacím modelu, kdy model produkuje textové odpovědi, které nejsou fakticky zakotveny v obrázcích. Proč tedy benchmarkové multimodální modely nevnímají obrázky v vysokém rozlišení a variabilním poměru stran?

Existují dva hlavní důvody, proč benchmarkové multimodální modely nejsou schopny vnímat obrázky s vysokým rozlišením a variabilním poměrem stran. První, protože vizuální kodéry jsou předem trénovány v pevném rozlišení, což činí obtížným pro model a kodér zpracovat obrázky s variabilním poměrem stran a rozlišením, což významně ovlivňuje adaptabilitu modelu. Druhá, protože kódování vysokých rozlišení obrázků přímo pomocí vizuálních transformátorů je spojeno se značnými výpočetními náklady ve vztahu k velikosti obrázků. Kromě toho, výpočetní náklady mohou být významně vyšší pro velké jazykové modely, aby zpracovaly velké množství vizuálních tokenů pro vysoké rozlišení obrázků, což významně ovlivňuje celkovou efektivitu modelu. Aby se tyto výzvy překonaly, rámec LLaVA-UHD, velký multimodální model, který vnímá vysoké rozlišení obrázků a jakýkoli poměr stran, bere rámce LLaVA-1,5 a GPT-4V jako reprezentativní příklady a snaží se odhalit systematické chyby, které jsou hluboko zakořeněny ve strategii vizuálního kódování.

Nahoře uvedený obrázek ukazuje experimentální výsledky GPT-4V při identifikaci počtu objektů v obrázku. V jádru rámce LLaVA-UHD jsou tři komponenty. První, strategie modulárního vizuálního kódování, která rozděluje obrázky v nativním rozlišení na menší, variabilní velikosti, aby zvýšila efektivitu a prodloužila kódování. Na rozdíl od nedávných velkých jazykových modelů, které přizpůsobují obrázky několika pevným rozlišením a poměrům stran, variabilní velikosti vytvořené rámcem LLaVA-UHD umožňují plnou adaptabilitu na nativní rozlišení obrázků bez deformace tvarů, přepočtu nebo vyplněného prostoru. Druhá, model kondenzuje vizuální tokeny kompresním modulem na skromnou délku, což vede ke snížení výpočetních nákladů pro velké jazykové modely. Třetí, model organizuje kondenzované tokeny pomocí prostorového schématu, aby informoval velké jazykové modely o poloze tokenů v obrázcích.

LLaVA-UHD: Metodika a architektura

Na základě poznatků z pilotních experimentů, které studovaly existující rámce, včetně GPT-4V a LLaVA-1,5, rámec LLaVA-UHD implementuje tříkomponentní architekturu, jak je ukázáno na následujícím obrázku.

První, strategie modulárního vizuálního kódování, která rozděluje obrázky v nativním rozlišení na menší, variabilní velikosti, aby zvýšila efektivitu a prodloužila kódování. Druhá, kompresní modul, který kondenzuje vizuální tokeny produkované vizuálními kodéry. Třetí, prostorový schéma, které organizuje tokeny pro velké jazykové modely. Podívejme se blíže na tyto komponenty.

Modulární vizuální kódování

Obecný přístup k řešení vysokých rozlišení obrázků s variabilním poměrem stran je interpolovat pozice vkládání vizuálního transformátoru nebo ViT do cílové formy pro přímé kódování jako celku. Nicméně, implementace tohoto přístupu je často spojena s vysokými výpočetními náklady a problémy mimo distribuci, které vedou k dalšímu zhoršení výkonu. Aby se tato výzva překonala, rámec LLaVA-UHD představuje modulární vizuální kódovací strategii, která rozděluje obrázky v nativním rozlišení na menší, variabilní velikosti, aby zvýšila efektivitu a prodloužila kódování. Díky použití variabilních velikostí, rámec LLaVA-UHD je schopen dosáhnout plné adaptability na nativní rozlišení obrázků bez deformace tvarů nebo vyplněného prostoru. Kromě toho, primárním cílem strategie rozdělení obrázků je určit rozdělení vysokých rozlišení obrázků s minimálními změnami rozlišení každého kusu. Pro daný obrázek s určitým rozlišením (w, h) a vizuálním transformátorem, který je předem trénován v jiném rozlišení, rámec LLaVA-UHD nejdříve určuje ideální počet kousků potřebných pro zpracování obrázku. Rámec pak rozdělí počet kousků na m sloupců a n řádků. Rámec pak definuje funkci skóre, aby měřil odchylku od standardního předem trénovaného nastavení vizuálního transformátoru. Teoreticky, rámec LLaVA-UHD je schopen prokázat, že strategie rozdělení implementovaná v jeho architektuře zajišťuje minimální očekávané změny a skromné nejhorší změny ve vztahu k standardnímu předem trénovanému rozlišení pro každý kousek.

Kromě toho, většina existujících velkých jazykových modelů implementuje statické rozlišení pro kódování obrázků, přístup, který brání plné adaptabilitě modelu na nativní rozlišení, protože mají přístup pouze k několika předem definovaným pevným tvarům kousků. Kromě toho, statické rozlišení kousků poškozuje výkon, efektivitu a správnost modelu, protože nevyhnutelně způsobuje deformaci tvarů, přepočet nebo vyplněný prostor. Aby se tato výzva překonala, rámec LLaVA-UHD navrhuje kódovat obrázky v poměru stran, jak je definováno strategií rozdělení. Konkrétněji, rámec LLaVA-UHD nejdříve přepočte původní obrázek proporcionálně v souladu s poměrem stran, aby se zajistilo, že počet patchů se vejde do předem trénovaného rozlišení, maximálně. Rámec LLaVA-UHD pak přetvoří předem trénovanou 1D pozici vkládání vizuálního transformátoru do 2D formátu v souladu se svým předem trénovaným nastavením.

Kompresní vrstva

Obecný problém, se kterým se velké jazykové modely setkávají při zpracování vysokých rozlišení obrázků, je, že množství vizuálních tokenů, které musí zpracovat, je významně vyšší (například rámec LLaVA-1,5 produkuje kolem 3500 vizuálních tokenů při zpracování jednoho obrázku s rozlišením 672×1008), což představuje významnou část výpočetních zdrojů a nákladů. Aby se tato výzva překonala, model LLaVA-UHD implementuje sdílenou perceiver resampler vrstvu, aby kondensoval vizuální tokeny každého kousku obrázku. Model pak implementuje sadu dotazovacích vektorů pomocí cross-attention, aby resamploval výstup vizuálních tokenů vizuálních kodérů na nižší počet. Ve srovnání s převládajícími Multilayer Perceptron-based vizuálními projekčními strategiemi, perceiver sample přístup implementovaný rámcem LLaVA-UHD je schopen udržet dostupný, ale pevný počet vizuálních tokenů, nezávisle na rozlišení obrázku, což činí rámec LLaVA-UHD více kompatibilním s úkoly zpracování a porozumění vysokých rozlišení obrázků. Aby se to ilustrovalo, rámec LLaVA-UDH generuje stejný počet tokenů při kódování obrázku s rozlišením 672×1008 jako rámec LLaVA-1,5 generuje při kódování obrázku s rozlišením 336×336, téměř 6krát účinněji než jeho konkurent.

Prostorový schéma pro kousky obrázků

Je nezbytné informovat velký jazykový model o prostorové organizaci kousků obrázků, protože rozdělení obrázků je dynamické napříč různými obrázky. Rámec LLaVA-UHD navrhuje a implementuje prostorový schéma, které používá dvě speciální tokeny, aby informovalo velký jazykový model o relativní poloze kousků obrázků. Podle tohoto prostorového schématu, rámec LLaVA-UHD používá „,“ pro oddělení reprezentací kousků v řádku, a různé řádky jsou odděleny pomocí „n“.

LLaVA-UDH: Experimenty a výsledky

Rámec LLaVA-UHD je vyhodnocen proti 9 populárním benchmarkům, včetně obecných vizuálních otázek, optických znakových vizuálních otázek, halucinačních benchmarkek a komplexních benchmarkek. Kromě toho, rámec LLaVA-UHD je srovnán se silnými základními modely, včetně LLaVA-1,5, MiniGPT-v2, InstructBLIP, BLIP-2 a dalších.

Výkon rámce LLaVA-UHD na 9 populárních benchmarcích je shrnut a srovnán s populárními benchmarkek v tabulce níže.

Na základě výše uvedeného výkonu, lze dospět k závěru, že rámec LLaVA-UHD je schopen překonat silné základní modely na populárních benchmarkek, včetně silných obecných základních modelů, které byly trénovány na významně větším množství dat, a také překonat velké jazykové modely, které vyžadují významně více výpočtů, jako je Fuyu-8B, Monkey a další. Druhá, výsledky také ukazují, že rámec LLaVA-UHD dosahuje významně lepších výsledků než architektura LLaVA-1,5, a na jedné straně, kde LLaVA-1,5 podporuje pevné rozlišení 336×336, rámec LLaVA-UHD podporuje obrázky s rozlišením 672×1088 a jakýmkoli poměrem stran, a stejný počet vizuálních tokenů.

Závěrečné myšlenky

V tomto článku jsme hovořili o LLaVA-UHD, novém přístupu, který nejprve bere rámce LLaVA-1,5 a GPT-4V jako reprezentativní příklady a snaží se odhalit systematické chyby, které jsou hluboko zakořeněny ve strategii vizuálního kódování. Rámec LLaVA-UHD, multimodální model, se snaží řešit tyto výzvy. Rámec LLaVA-UHD může vnímat obrázky v vysokém rozlišení i v jakémkoli poměru stran. Rámec LLaVA-UHD se skládá ze tří klíčových komponent. První, strategie modulárního vizuálního kódování, která rozděluje obrázky v nativním rozlišení na menší, variabilní velikosti, aby zvýšila efektivitu a prodloužila kódování. Druhá, kompresní modul, který kondenzuje vizuální tokeny produkované vizuálními kodéry. Třetí, prostorový schéma, které organizuje tokeny pro velké jazykové modely. Komplexní experimenty ukazují, že rámec LLaVA-UHD je schopen překonat současné velké jazykové modely na 9 benchmarcích. Kromě toho, pomocí pouze 94% inferenčních výpočtů, rámec LLaVA-UHD je schopen podporovat obrázky s 6krát větším rozlišením, tj. 672×1088.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.