AI-modeller og plattformer

EAGLE: Utforsking av designrommet for multimodale store språkmodeller med en blanding av encodere

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Evnen til å tolke komplekse visuelle informasjon nøyaktig er et viktig fokusområde for multimodale store språkmodeller (MLLMs). Nyere arbeid viser at forbedret visuell persepsjon betydelig reduserer hallucinasjoner og forbedrer ytelsen på oppløsningssensitive oppgaver, som optisk tegngjenkjenning og dokumentanalyse. Flere nyere MLLMs oppnår dette ved å bruke en blanding av visjonencodere. Til tross for deres suksess, finnes det en mangel på systematiske sammenligninger og detaljerte ablasjonsstudier som omhandler kritiske aspekter, som ekspertutvalg og integrering av flere visjonsekspertise. Denne artikkelen gir en omfattende utforsking av designrommet for MLLMs ved å bruke en blanding av visjonencodere og oppløsninger, Eagle-rammeverket som prøver å utforske designrommet for multimodale store språkmodeller med en blanding av encodere. Funndene avdekker flere underliggende prinsipper som er felles for ulike eksisterende strategier, og fører til en strømlinjeformet, men effektiv designtilnærming. Eagle oppdager at å konkatenerer visuelle token fra en samling av komplementære visjonencodere er like effektivt som mer komplekse blandingarkitekturer eller strategier. I tillegg introduserer Eagle Pre-Alignment for å brygge gapet mellom visjon-fokuserte encodere og språktoken, og forbedrer modellens kohens. Den resulterende familien av MLLMs, Eagle, overgår andre ledende åpne modeller på store MLLM-benchmark.

Eagles arbeid er relatert til den generelle arkitekturdesignen for multimodale store språkmodeller (MLLMs). Foruten linjen av representative åpne forskningsarbeid nevnt tidligere, inkluderer andre noterlige familier av MLLMs, men er ikke begrenset til, MiniGPT-4, Lynx, Otter, QwenVL, CogVLM, VILA, GPT-4V, Gemini og Llama 3.1. Avhengig av hvordan visjonssignaler integreres i språkmodellen, kan MLLMs bredt kategoriseres i “cross-modal attention”-modeller og “prefix-tuning”-modeller. Den førstnevnte injiserer visuell informasjon i ulike lag av LLMs ved å bruke cross-modal attention, mens den sistnevnte behandler visuelle token som en del av språktokensekvensen og appende dem direkte med tekst-embeddings. Eagles modell tilhører prefix-tuning-familien ved å følge en LLaVA-stil multimodal arkitektur. Da MLLM er et raskt voksende felt, anbefaler Eagle å henvise til mer detaljerte studier og undersøkelser for ytterligere innsikt.

Eagles arbeid er nært relatert til forskning som fokuserer på å forbedre visjonencodedesign for MLLMs. Tidlige arbeider adopterte vanligvis visjonencodere pre-trent på visjon-språk-alignment-oppdrag som CLIP og EVA-CLIP. Sterkere visjonencodere, som SigLIP og InternVL, er blitt foreslått for å forbedre visjon-språk-oppdrag med bedre design, større modellstørrelse og mer effektive treningsrecepter. Da modellene ofte er pre-trent på lavoppløselige bilder og kan mangle evnen til å kode fin-grained detaljer, utføres ofte høyoppløselig tilpasning for å øke MLLM-inndataoppløsningen. I tillegg til høyoppløselig tilpasning, bruker modeller som LLaVA-NeXT, LLaVA-UHD, Monkey, InternLM-XComposer og InternVL tiling eller adaptiv tiling for å håndtere høyoppløselig inndata, hvor bilder deles inn i lavoppløselige patcher og prosesseres separat. Mens evnen til å håndtere høyoppløselig inndata gjøres mulig ved å introdusere flere visjonsekspertise, skiller denne tilnærmingen seg noe fra tiling-teknikker, selv om begge er kompatible og kan kombineres.

EAGLE: Bruk av blanding av encodere for å utforske designrommet for multimodale LLMs

Suksessen til store språkmodeller (LLMs) har vakt betydelig interesse for å aktivere deres visuelle persepsjonsevner, og tillate dem å se, forstå og resonere i den virkelige verden. I kjernen av disse multimodale store språkmodellene (MLLMs) ligger en typisk design hvor bilder konverteres til en serie av visuelle token av visjonencodere og appendes med tekst-embeddings. CLIP er ofte valgt som visjonencodere fordi dens visuelle representasjon er alignert med tekstrommet ved å være pre-trent på bilde-tekst-par.

Eagles arbeid er nært relatert til modeller som bruker flere visjonencodere for å forbedre persepsjonen. Mini-Gemini og LLaVA-HR foreslår å fusjonere høyoppløselige visuelle egenskaper inn i lavoppløselige visuelle token. Forbi oppløsingsproblemer, kan disse pre-trente visjonencodere mangle bestemte evner, som å lese tekst eller lokalisere objekter. For å løse dette, integrerer ulike modeller visjonencodere pre-trent på ulike visjon-oppdrag for å forbedre visjonencodernes evner.

For eksempel, modeller som Mousi og Brave fusjonerer visuelle token fra ulike visjonencodere ved å konkatenerer langs kanal- eller tokendimensjonen. RADIO introduserer en multi-lærer-destillasjonsmetode for å samordne evnene til ulike visjonencodere i en enkelt modell. MoAI, IVE og Prismer bruker utgangen av visjonsekspertise, som OCR, deteksjon eller dybdeestimering, for å supplere ytterligere informasjon for MLLMs til å generere svar. MoVA utvikler en routing-nettverk for å tildele en optimal visjonmodell basert på det gitt bildet og instruksjonene.

Nyere studier har vist at sterkere visjonencodedesign er viktig for å redusere MLLM-hallusinasjoner og forbedre ytelsen på oppløsningssensitive oppgaver som optisk tegngjenkjenning (OCR). Flere arbeider fokuserer på å forbedre evnen til visjonencodere, enten ved å skalerer opp pre-treningdata og parametre eller ved å dele bilder inn i lavoppløselige patcher. Disse tilnærmingene introduserer ofte store treningsresurskrav. En effektiv, men kraftig strategi er å blande visuelle encodere pre-trent med ulike oppdrag og inndataoppløsninger, enten ved å fusjonere høyoppløselige encodere med CLIP-encodere, sekvensielt appende egenskaper fra ulike encodere eller ved å adoptere mer komplekse fusjons- og routingstrategier for å maksimere fordelen av ulike encodere. Denne “blanding-av-visjonsekspert”-tilnærmingen har vist seg å være effektiv, selv om en detaljert studie av dens designrom med rigorøs ablasjon ennå mangler, og motiverer Eagle til å se på dette området på nytt. Nøkkelspørsmål forblir: hvilke visjonencoderekombinasjoner å velge, hvordan å fusjonere ulike eksperter og hvordan å justere treningsstrategier med flere visjonencodere.

For å løse disse spørsmålene, utforsker Eagle systematisk designrommet for blanding-av-visjonencodere for å forbedre MLLM-persepsjon. Utforskingen av dette designrommet inkluderer følgende steg: 1) benchmarking av ulike visjonencodere og søking etter høyoppløselig tilpasning; 2) gjennomføring av en “apples-to-apples”-sammenligning mellom visjonencodere-fusjonsstrategier; 3) progressiv identifikasjon av den optimale kombinasjonen av flere visjonencodere; 4) forbedring av visjonsekspert-pre-alignment og data-blanding. Utforskingstegene er illustrert i figuren nedenfor.

Eagles studie dekker ytelsen til visjonencodere pre-trent på ulike oppdrag og oppløsninger, som visjon-språk-alignment, selv-supervisert læring, deteksjon, segmentering og OCR. Ved å bruke en round-robin-tilnærming, begynner Eagle med den grunnleggende CLIP-encodere og legger til en ekstra ekspert om gangen, og velger eksperten som gir den beste forbedringen i hver runde.

mens Eagles arbeid ikke er det første til å utnytte flere visjonencodere i MLLMs, fører den systematiske studien til flere nøkkelFUNN under denne innstillingen:

  • Å låse opp visjonencodere under MLLM-trening betyr noe. Dette er i kontrast til modeller som LLaVA og andre som tar i bruk flere visjonencodere eller lærere, hvor å fryse visjonencodere har vært vanlig praksis.
  • Noen nylig foreslåtte fusjonsstrategier viser ikke betydelige fordeler. I stedet fremstår direkte kanal-konkatenering som en enkel, men konkurrerende fusjonsstrategi, og tilbyr den beste effisiensen og ytelsen.
  • Å inkorporere flere visjonsekspertise fører til konsistente gevinster. Dette gjør det til en løftende vei for å systematisk forbedre MLLM-persepsjon, foruten å skalerer opp enkelt encodere. Forbedringen er særlig uttalt når visjonencodere er låst opp.
  • Pre-alignment-stadiet er nøkkel. Eagle introduserer et pre-alignment-stadie hvor ikke-tekst-orienterte visjonsekspertise individuelt finjusteres med en frozen LLM før de trenes sammen. Dette stadiet forbedrer betydelig MLLM-ytelsen under blanding-av-visjonencodere-designet.

Eagle: Metodologi og Arkitektur

I motsetning til tidligere metoder som fokuserer på å designe nye fusjonsparadigmer eller arkitekturer mellom visjonencodere, er Eagles mål å identifisere en minimalistisk design for å fusjonere ulike visjonencodere, støttet av detaljerte ablasjoner og fjerning av unødvendige komponenter. Som vist i figuren nedenfor, begynner Eagle med å utvide den grunnleggende CLIP-encodere til en samling av visjonsekspertise med ulike arkitekturer, pre-treningoppdrag og oppløsninger. Med disse ekspertene sammenligner Eagle ulike fusjonsarkitekturer og metoder og utforsker hvordan å optimere pre-treningstrategier med flere encodere.

Til slutt kombinerer Eagle alle funnene og utvider tilnærmingen til flere ekspertvisjonencodere med ulike oppløsninger og domenekunnskap. Ved å bruke samme pre-treningdata som LLaVA-1.5, som består av 595k bilde-tekst-par, går Eagle over til den overvåkede finjusteringstiden ved å samle data fra en rekke oppgaver og konvertere dem til multimodale samtaler, inkludert LLaVA-1.5, Laion-GPT4V, ShareGPT-4V, DocVQA, synDog-EN, ChartQA, DVQA og AI2D, og resulterer i 934k eksempler.

Modellen er først pre-trent med bilde-tekst-par i en epoch med en batch-størrelse på 256, hvor hele modellen er frozen, og bare projector-laget oppdateres. I den andre fasen er modellen finjustert på overvåket finjusteringdata i en epoch med en batch-størrelse på 128. For denne utforskingen bruker Eagle Vicuna-7B som den underliggende språkmodellen. Læringsratene er satt til 1e-3 for den første fasen og 2e-5 for den andre fasen.

Større CLIP-Encodere

Eagle begynner utforskingen med CLIP-modellen, da den har blitt det primære valget for mange MLLMs. Mens CLIP-modeller er kjent for å forbedre multimodale oppgaver, er deres begrensninger også blitt godt dokumentert. For eksempel tenderer mange eksisterende MLLMs til å bruke pre-trente CLIP-oppløsninger (som 224 × 224 eller 336 × 336) som deres inndataoppløsninger. I disse tilfellene sliter encodere ofte med å fange fin-grained detaljer viktige for oppløsningssensitive oppgaver som OCR og dokumentforståelse.

For å håndtere økt inndataoppløsning, er en vanlig tilnærming tiling, hvor inndata-bilder deles inn i fliser og kodet separat. En enklere metode er å direkte skalerer opp inndataoppløsningen og interpolere posisjons-embeddings av visjonstransformator-modellen hvis nødvendig. Eagle sammenligner disse to tilnærmingene med frozen og unfrozen visjonencodere over ulike oppløsninger, med resultater i tabellen ovenfor. Funndene kan sammenfattes som følger:

  • Å låse opp CLIP-encodere fører til betydelig forbedring når interpolering til en høyere MLLM-inndataoppløsning som forskjeller fra CLIP-pre-treningoppløsningen, uten ytelsesnedgang når oppløsningene forblir de samme.
  • Å fryse CLIP-encodere og direkte tilpasse den til en høyere MLLM-inndataoppløsning skader betydelig ytelsen.
  • Blant de sammenlignede strategiene, viser direkte interpolering til 448 × 448 med en unfrozen CLIP-encodere seg å være både effektiv og effisient i termer av ytelse og kostnad.
  • Den beste CLIP-encodere oppnår en ytelse nær InternVL, til tross for å være en mye mindre modell (300M vs. 6B) med mindre pre-treningdata.

Det er verdt å merke seg at CLIP-448 tillater Eagle å matche innstillingen med LLaVA-HR og InternVL, hvor CLIP-encodere er tilsvarende tilpasset å ta 448 × 448 inndata og utgang 1024 patch-token. For videre utforsking, følger Eagle denne enkle strategien for å skalerer opp inndataoppløsningen og låse opp visjonencodere under trening.

Eagle observerer at eksisterende populære fusjonsstrategier, til tross for deres designvariasjoner, kan bredt kategoriseres som følger:

  1. Sequens-Append: Direkte appende av visuelle token fra ulike bakgrunner som en lengre sekvens.
  2. Kanal-Konkatenering: Konkatenering av visuelle token langs kanal-dimensjonen uten å øke sekvenslengden.
  3. LLaVA-HR: Injiserer høyoppløselige egenskaper inn i lavoppløselige visjonencodere ved å bruke en blanding-av-oppløsninger-adapter.
  4. Mini-Gemini: Bruker CLIP-token som lavoppløselige forespørsler for å krysse-attendere en annen høyoppløselig visjonencodere i samlokaliserte lokale vinduer.
  5. Deformabel Attention: En ny baseline introdusert på toppen av Mini-Gemini, hvor vanlig vindu-attention erstattes med deformabel attention.

I stedet for å trene en projector for å samtidig alignere flere visjonsekspertise som i LLaVAs opprinnelige pre-treningstrategi, alignerer vi først representasjonen av hver enkelt ekspert med en mindre språkmodell (Vicuna-7B i praksis) ved å bruke next-token-prediction-overvåking. Som vist i figuren nedenfor, med pre-alignment, består hele treningprosessen av tre steg: 1) trening av hver pre-trent visjonsekspert med sin egen projector på SFT-data, mens språkmodellen holdes frozen; 2) kombinerer alle visjonsekspertise fra første steg og trener bare projector med bilde-tekst-par-data; 3) trener hele modellen på SFT-data.

Eagle: Eksperimenter og Resultater

Etter å ha metodisk utviklet sine strategier, har Eagle etablert følgende prinsipper for modellen: (1) integrere flere visjonsekspertise med en optimalisert treningsresept; (2) kombinere flere visjonsekspertise gjennom direkte kanal-konkatenering; (3) pre-trening av visjonsekspertise separat via pre-alignment. I denne delen, for å ytterligere demonstrere fordelen av Eagle-modellene, inkorporeres ytterligere treningsdata, og Eagle sammenlignes mot nåværende state-of-the-art MLLMs over ulike oppgaver. Eagle bruker Vicuna-v1.5-7B, Llama3-8B og Vicuna-v1.5-13B som språkmodellene. For visjonencodere, basert på resultater i seksjon 2.6, er Eagle-modellene betegnet som Eagle-X4, som inkluderer fire visjonencodere: CLIP, ConvNeXt, Pix2Struct og EVA-02, og Eagle-X5, som inkluderer en ekstra SAM-visjonencodere.

Visuell Spørsmål-Besvarelse-Oppgaver

Eagle sammenligner modellserien over tre visuell spørsmål-besvarelse-benchmark, inkludert GQA, VQAv2 og VizWiz. Som vist i tabellen nedenfor, oppnår Eagle-X5 state-of-the-art-ytelse på GQA og VQAv2, og høyligter fordelen av å inkorporere flere visjonsekspertise.

OCR og Kartforståelse-Oppgaver

For å evaluere OCR-, dokument- og kartforståelsesevnen til Eagle, benchmarkes modellen på OCRBench, TextVQA og ChartQA. Som vist i tabellen ovenfor, overgår Eagle betydelig konkurrentene på TextVQA, og nyter godt av sin høyoppløselige arkitektur og integrering av ulike visjonencodere. Merkverdig, opprettholder Eagle en enkel design, og støtter opp til 1024 token uten å kreve kompleks tile-dekomposisjon av bilder.

Figuren nedenfor presenterer eksempler på OCR- og dokumentforståelses-tilfeller. Med høyoppløselig tilpasning og inklusjon av flere visjonsekspertise, kan Eagle identifisere små tekst innenfor bilder og nøyaktig trekke ut informasjon basert på brukerinstruksjoner.

For å bedre forstå fordelen av å introdusere eksperter pre-trent på andre visjon-oppdrag, visualiserer figuren nedenfor resultater fra en modell med bare ConvNeXt- og CLIP-visjonencodere, sammenlignet med resultater fra Eagle-X5. Med hele settet av visjonencodere, korrigerte modellen suksessfullt feil, og demonstrerte at selv når utstyrt med høyoppløselige visjonencodere pre-trent på visjon-språk-alignment, er Eagles evner ytterligere forbedret ved å inkorporere flere visjonsekspertise pre-trent på ulike visjon-oppdrag.

Multimodal Benchmark-Evaluering

Eagle evalueres på syv benchmark for MLLMs for å demonstrere sine evner fra ulike perspektiver, inkludert MME, MMBench, SEED, MathVista, MMMU, ScienceQA og POPE. Spesifikt, MME, MMBench og SEED vurderer den overordnede ytelsen på ulike virkelige oppgaver som involverer resonnering, gjenkjenning, kunnskap og OCR. MMMU fokuserer på utfordrende problemer fra ulike domener som krever college-nivå kunnskap. POPE vurderer de visuelle hallucinasjonene til MLLMs. Metrikker brukt i denne evalueringen holder seg til standardinnstillingene for disse benchmarkene. Eagle rapporterer persepsjonsscoren for MME, en_dev-split for MMBench, bilde-split for SEED, test-mini-split for MathVista, val-split for MMMU, F1-score for POPE og bilde-scoren for ScienceQA, og sikrer at dette er i linje med rapporterte score fra andre modeller.

Slutt tanker

I denne artikkelen har vi talt om Eagle, en dyptgående analyse av designrommet for å integrere visjonencodere i multimodale store språkmodeller. I motsetning til tidligere arbeider som fokuserer på å designe nye fusjonsparadigmer, finner Eagle at systematiske designvalg betyr noe, og oppdager en rekke nyttige tekniker. Steg for steg, optimaliserer Eagle treningsreseppten for enkeltvisjonencodere, identifiserer en utvidbar og effisient fusjonsmetode, og kombinerer gradvis visjonencodere med ulik domenekunnskap. Resultatene høyligter den kritiske betydningen av grunnleggende designrom-betraktninger.

En ingeniør av yrke, en forfatter av hjerte. Kunal er en teknisk forfatter med en dyp kjærlighet og forståelse av AI og ML, dedikert til å forenkle komplekse konsepter i disse feltene gjennom sin engasjerende og informerende dokumentasjon.