AI-modeller og platforme

LLaVA-UHD: Effektivt opfatter billeder i enhver billedforhold og høj opløsning

mm
Føj Unite.AI til dine foretrukne kilder på Google

Den seneste fremgang og udvikling af store sprogmodeller har oplevet en betydelig øgning i vision-sprog-forståelse, -forståelse og interaktionsmuligheder. Moderne rammer opnår dette ved at projicere visuelle signaler ind i store sprogmodeller for at gøre dem i stand til at fortolke verden visuelt, en række scenarier, der afhænger af visuel kodningstrategier. Imidlertid indeholder billeder fra den virkelige verden ikke kun en bred vifte af scenarier, men de varierer også betydeligt i forhold til opløsninger og billedforhold, hvilket udgør betydelige udfordringer for store sprogmodeller på tværs af forskellige domæner og opgaver. For at tackle den betydelige variation, der er påført af billeder fra den virkelige verden, opfatter moderne store sprogmodeller billeder i lav opløsning, f.eks. 224×224, og et fast billedforhold, f.eks. 1:1. Selvom kompromiset med at fastholde lav opløsning og fast billedforhold øger det generelle anvendelsesområde af store sprogmodeller i virkelige anvendelser, kan det ofte føre til meget uklare billeder samt alvorlig formforvrængning. Kompromiset påvirker betydeligt evnerne hos store multimodale modeller eller LMM’er, især de, der er optimeret til finmærkede opgaver, herunder optisk tegnkendelse og forståelse af små objekter. Desuden, da opløsningen og billedforholdet er forudbestemt, kan modellerne kun gætte på de uklare billeder, hvilket resulterer i modelhallucinationer, en situation, hvor modellen producerer tekstuelle svar, der ikke er faktisk grundet i billederne.

I denne artikel vil vi tale om LLaVA-UHD, en ny tilgang, der først tager LLaVA-1,5 og GPT-4V-rammerne som repræsentative eksempler og forsøger at afsløre de systematiske fejl, der er rodnet i deres visuelle kodningstrategi. LLaVA-UHD-rammen, en multimodal model, er et forsøg på at tackle udfordringerne. LLaVA-UHD-rammen kan opfatte billeder i høj opløsning samt i enhver billedforhold. LLaVA-UHD-rammen er bygget op omkring tre nøglekomponenter. Først en billedmoduleringsstrategi, der deler native opløsningsbilleder op i mindre, variable størrelsesbilleder for at forbedre effektiviteten og udvide kodningen. Dernæst en kompressionsmodul, der kondenserer billedtoken, der produceres af visuelle kodningsenheder, yderligere. Endelig en spatial skema, der organiserer billedtoken for store sprogmodeller. Omfattende eksperimenter viser, at LLaVA-UHD-rammen kan overgå store sprogmodeller i 9 benchmarks. Desuden kan LLaVA-UHD-rammen, ved at bruge kun 94% af slutningsberegningen, understøtte billeder med 6 gange større opløsning, f.eks. 672×1088.

LLaVA-UHD: Effektivt opfatter billeder i enhver billedforhold og høj opløsning

Vision-sprog-forståelse, -forståelse og interaktionsmuligheder har gjort betydelig fremgang på grund af den seneste skub for store sprogmodeller. I moderne rammer opnås dette ved at feede visuelle signaler ind i store sprogmodeller for at gøre dem i stand til at fortolke verden visuelt, en række scenarier, der afhænger af visuel kodningstrategier. Forskellen i scenarie afspejler en snæver dækning af store sprogmodeller på tværs af forskellige domæner og opgaver, mens forskellen i opløsninger og billedforhold afslører de store intraklassevariationer i billeder fra den virkelige verden, som er svære at tackle. Til forskel fra den lille skala, der reducerer variationen, tager modeller efter BERT fat i betydningen af lav opløsning (f.eks. for LLaVA-UHD er det 224×224) af billeder med et fast billedforhold, 1:1, for at give billeder fra den virkelige verden. Selvom kompromiset med at fastholde lav opløsning og fast billedforhold er nyttigt for at sikre det generelle anvendelsesområde af store sprogmodeller i virkelige anvendelser, kan det ofte føre til meget uklare billeder samt alvorlig formforvrængning. Dette reducerer evnerne hos store multimodale modeller eller LMM’er, især de, der er optimeret til finmærkede opgaver, herunder optisk tegnkendelse og forståelse af små objekter. Da opløsningen og billedforholdet er forudbestemt, kan modellerne kun gætte på de uklare billeder, hvilket resulterer i modelhallucinationer, en situation, hvor modellen producerer tekstuelle svar, der ikke er faktisk grundet i billederne.

Der er to primære årsager til, at benchmark LMM’er ikke kan opfatte billeder med høj opløsning og varierende billedforhold. Først og fremmest, da visuelle kodningsenheder er forudtrænet i faste opløsninger, gør det det svært for modellen og kodningsenheden at tackle billeder med varierende billedforhold og opløsninger, hvilket påvirker betydeligt modellens tilpasningsmuligheder. Dernæst er kodningen af højopløsningsbilleder direkte ved hjælp af visionstransformatorer forbundet med betydelige beregningsomkostninger i forhold til billedernes størrelse. Desuden kan beregningsomkostningerne være betydeligt højere for store sprogmodeller til at behandle et stort antal visuelle token for højopløsningsbilleder, hvilket påvirker betydeligt modellens samlede effektivitet. For at tackle disse udfordringer tager LLaVA-UHD, en stor multimodal model, der kan opfatte billeder i høj opløsning og enhver billedforhold, LLaVA-1,5 og GPT-4V-rammerne som repræsentative eksempler og forsøger at afsløre de systematiske fejl, der er rodnet i deres visuelle kodningstrategi.

Billedet ovenfor afspejler de eksperimentelle resultater for GPT-4V i at identificere antallet af objekter i et billede. LLaVA-UHD-rammen har tre komponenter. Først en billedmoduleringsstrategi, der deler native opløsningsbilleder op i mindre, variable størrelsesbilleder for at forbedre effektiviteten og udvide kodningen. Til forskel fra de seneste store sprogmodeller, der passer billeder ind i flere faste opløsninger og billedforhold, giver de variable størrelsesbilleder, der produceres af LLaVA-UHD-rammen, fuld tilpasning til native opløsningsbilleder uden at forvrænge former, ændre størrelse eller udfylde. Dernæst kondenserer modellen de visuelle token ved en kompressionslag til en moderat længde, hvilket reducerer beregningen for store sprogmodeller betydeligt. Endelig organiserer modellen de komprimerede billedtoken i en spatial skema for at underrette store sprogmodeller om billedernes placering i billederne.

LLaVA-UHD: Metodik og Arkitektur

På baggrund af erfaringerne fra nogle piloteksperimenter for at studere eksisterende rammer, herunder GPT-4V og LLaVA-1,5, implementerer LLaVA-UHD-rammen en trekomponentarkitektur, som vist i billedet nedenfor.

Først en billedmoduleringsstrategi, der deler native opløsningsbilleder op i mindre, variable størrelsesbilleder for at forbedre effektiviteten og udvide kodningen. Dernæst en kompressionsmodul, der kondenserer billedtoken, der produceres af visuelle kodningsenheder, yderligere. Endelig en spatial skema, der organiserer billedtoken for store sprogmodeller. Lad os se nærmere på disse komponenter.

Moduleret Visuel Kodning

En almindelig tilgang til at tackle højopløsningsbilleder med forskellige billedforhold er at interpolere positionsembeddingerne af Visionstransformator eller ViT til målformen for direkte kodning som en helhed. Imidlertid er implementeringen af denne tilgang ofte forbundet med høje beregningsomkostninger, og udfordringer uden for distributionen resulterer i yderligere præstationsnedgang. For at tackle denne udfordring præsenterer LLaVA-UHD-rammen en moduleret visuel kodningstrategi, der grundlæggende søger at dele native opløsningsbilleder op i mindre, variable størrelsesbilleder, hvor hver billedstørrelse er tæt på standardforudtræningsindstillingerne for visionstransformator. Takket være brugen af variable størrelsesbilleder kan LLaVA-UHD-rammen opnå fuld tilpasning til native opløsningsbilleder uden at implementere nogen formforvrængende omformning eller udfyldning. Desuden er det primære mål for billedmoduleringsstrategien at bestemme en opdeling af højopløsningsbilleder med minimal ændring af opløsningerne for hver billedstørrelse.

Desuden søger LLaVA-UHD-rammen at kodningsbilleder i billedforhold, som defineres af opdelingsstrategien. For at være mere specifik resizer LLaVA-UHD-rammen det originale billede proportionalt i overensstemmelse med billedforholdet, så antallet af patches passer inden for forudtræningsbudgettet, dvs. antallet af positionsembeddingsekvenser i visionstransformator, maksimalt. LLaVA-UHD-modellen omformer derefter den forudtrænede 1D-positionsembeddingsekvens af visionstransformator til en 2D-format i overensstemmelse med dets forudtræningsindstillinger.

Kompressionslag

En almindelig udfordring, som store sprogmodeller står over for, når de behandler højopløsningsbilleder, er, at antallet af visuelle token, de skal behandle, er betydeligt højere (for reference producerer LLaVA-1,5-rammen ca. 3500 visuelle token, når den behandler et enkelt billede med opløsning 672×1008), hvilket står for en stor del af beregningsressourcerne og omkostningerne. For at tackle denne udfordring implementerer LLaVA-UHD-modellen en delt perceiver-resampler-lag til at kondensere de visuelle token for hver billedstørrelse. Modellen implementerer derefter en række forespørgselsvektorer via cross-attention til at resample outputtet af billedtoken fra visuelle kodningsenheder til et lavere antal. I sammenligning med almindelige Multilayer Perceptron-baserede visuelle projekteringsstrategier er perceiver-samplesammenhængen, der implementeres af LLaVA-UHD, i stand til at opretholde et rimeligt, men fast antal visuelle token, uanset billedopløsningen, hvilket gør LLaVA-UHD-rammen mere kompatibel med højopløsningsbilledbehandling og -forståelse.

Rumlig Skema for Billedslices

Det er en nødvendig praksis at underrette store sprogmodeller om den rumlige organisation af billedslices, da opdelingen af billeder er dynamisk på tværs af forskellige billeder. LLaVA-UHD-rammen designer og implementerer en rumlig skema, der bruger to specielle token til at underrette store sprogmodeller om den relative position af billedslices. Under denne rumlige skema bruger LLaVA-UHD-rammen “,” til at adskille billedrepræsentationerne i en række, og rækkerne adskilles ved hjælp af en “n”.

LLaVA-UDH: Eksperimenter og Resultater

LLaVA-UHD-rammen evalueres mod 9 populære benchmarks, herunder generelle visuelle spørgsmålssvarende benchmarks, optisk tegnbaserede visuelle spørgsmålssvarende benchmarks, hallucinationsbenchmarks og omfattende benchmarks. Desuden sammenlignes LLaVA-UHD-rammen med stærke baselines, herunder LLaVA-1,5, MiniGPT-v2, InstructBLIP, BLIP-2 og flere.

Præstationen af LLaVA-UHD-rammen på 9 populære benchmarks sammenlignes og sammenfattes i tabellen nedenfor.

På baggrund af ovenstående resultater kan det konkluderes, at LLaVA-UHD-rammen kan overgå stærke baseline-modeller på populære benchmarks, herunder stærke generelle baselines, der er trænet på en betydeligt større mængde data, samt overgå LLaVA-1,5-arkitekturen. Desuden viser resultaterne, at LLaVA-UHD-rammen opnår betydeligt bedre resultater end LLaVA-1,5-arkitekturen, og på den ene side, hvor LLaVA-1,5 understøtter en fast 336×336 opløsning, understøtter LLaVA-UHD-rammen 672×1088 opløsningsbilleder med enhver billedforhold og samme antal visuelle token.

Afsluttende tanker

I denne artikel har vi talt om LLaVA-UHD, en ny tilgang, der først tager LLaVA-1,5 og GPT-4V-rammerne som repræsentative eksempler og forsøger at afsløre de systematiske fejl, der er rodnet i deres visuelle kodningstrategi. LLaVA-UHD-rammen, en multimodal model, er et forsøg på at tackle udfordringerne. LLaVA-UHD-rammen kan opfatte billeder i høj opløsning samt i enhver billedforhold. LLaVA-UHD-rammen er bygget op omkring tre nøglekomponenter. Først en billedmoduleringsstrategi, der deler native opløsningsbilleder op i mindre, variable størrelsesbilleder for at forbedre effektiviteten og udvide kodningen. Dernæst en kompressionsmodul, der kondenserer billedtoken, der produceres af visuelle kodningsenheder, yderligere. Endelig en spatial skema, der organiserer billedtoken for store sprogmodeller. Omfattende eksperimenter viser, at LLaVA-UHD-rammen kan overgå store sprogmodeller i 9 benchmarks. Desuden kan LLaVA-UHD-rammen, ved at bruge kun 94% af slutningsberegningen, understøtte billeder med 6 gange større opløsning, f.eks. 672×1088.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.