AI-modeller og plattformer

Mini-Gemini: Accelererende Multi-Modalitet VLMs

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Fremgangen i store språkmodeller har betydelig akselerert utviklingen av naturleg språkbehandling, eller NLP. Innføringen av transformer-rammeverket viste seg å være en milepæl, og muliggjorde utviklingen av en ny bølge av språkmodeller, inkludert OPT og BERT, som viser dypt språklig forståelse. Videre har innføringen av GPT, eller generative forhånds-treningstransformer-modeller, introdusert en ny paradigme med autoregressiv modellering og etablert en robust metode for språkprediksjon og -generering. Innføringen av språkmodeller som GPT-4, ChatGPT, Mixtral, LLaMA og andre har ytterligere drivet rask utvikling, med hver modell som viser forbedret ytelse i oppgaver som involverer kompleks språkbehandling. Blant eksisterende metoder har instruksjonstuning fremkommet som en nøkkelteknikk for å finjustere utgangen av forhånds-trente store språkmodeller, og integreringen av disse modellene med spesifikke verktøy for visuelle oppgaver har høylysnet deres tilpasningsevne og åpnet dører for fremtidige anvendelser. Disse går langt utenfor den tradisjonelle tekstbaserte behandlingen av LLM til å inkludere multimodale interaksjoner.

Fortsatt har konvergeringen av naturleg språkbehandling og datamaskin-synsmodeller gitt opphav til VLM, eller Visjon-Språk-Modeller, som kombinerer språklig og synsmodeller for å oppnå kryss-modalt forståelse og resonemeringsevner. Integreringen og oppfinnelsen av visuelle og språklige modeller har spilt en avgjørende rolle i å fremme oppgaver som krever både språkbehandling og visuell forståelse. Fremkomsten av revolusjonære modeller som CLIP har ytterligere brot gapet mellom synsoppgaver og språkmodeller, og demonstrert muligheten og praktisiteten av kryss-modale anvendelser. Mer nylige rammer som LLaMA og BLIP utnytter tilpasset instruksjonsdata for å utvikle effektive strategier som demonstrerer modellens potente evner. Videre er kombinasjonen av store språkmodeller med bilde-utgang det fokusert på nyere multimodale forskning, med nyere metoder som kan omgå direkte generering ved å bruke bilde-oppføring-tilnærmingen til å produsere bilde-utgang og sammenføyde tekster.

Med dette sagt, og til tross for de raske fremgangene i visjon-språk-modeller som muliggjør grunnleggende resonemering og visuell dialog, finnes det fortsatt et betydelig ytelsesgap mellom avanserte modeller som GPT-4 og visjon-språk-modeller. Mini-Gemini er et forsøk på å lukke gapet som finnes mellom visjon-språk-modeller og mer avanserte modeller ved å utnytte potensialet i VLM for bedre ytelse fra tre aspekter: VLM-guidet generering, høykvalitetsdata og høyoppløselige visuelle token. For å forbedre visuelle token, foreslår Mini-Gemini-rammeverket å bruke en ekstra visuell encoder for høyoppløselig finjustering uten å øke antallet visuelle token. Mini-Gemini-rammeverket konstruerer videre en høykvalitetsdataset i et forsøk på å fremme presis forståelse av bilder og resonemering-basert generering. Overordnet sett forsøker Mini-Gemini-rammeverket å utnytte potensialet i visjon-språk-modeller og å gi eksisterende rammer med bilde-resonemering, -forståelse og -genereringskapasiteter samtidig. Denne artikkelen har som mål å dekke Mini-Gemini-rammeverket i dybden, og vi utforsker mekanismen, metodologien, arkitekturen til rammeverket sammen med sammenligningen med state-of-the-art-rammeverk. La oss begynne.

Mini-Gemini: Accelererende Multi-Modalitet VLMs

Over årene har store språkmodeller utviklet seg, og de har nå bemerkelsesverdige multi-modale evner, og er blitt en essensiell del av nåværende visjon-språk-modeller. Likevel finnes det et gap mellom de multi-modale prestasjonene til store språkmodeller og visjon-språk-modeller, med nyere forskning som søker å kombinere syn med store språkmodeller ved hjelp av bilder og videoer. For synsoppgaver selv er bilde-oppløsning en avgjørende faktor for å uttrykke omgivelsene med minimal visuell hallusinasjon. For å lukke gapet, utvikler forskere modeller for å forbedre den visuelle forståelsen i nåværende visjon-språk-modeller, og to av de vanligste tilnærmingene er: å øke oppløsningen og å øke antallet visuelle token. Selv om å øke antallet visuelle token med høyoppløselige bilder forbedrer den visuelle forståelsen, er forbedringen ofte ledsaget av økte beregningskrav og tilhørende kostnader, spesielt når det behandles flere bilder. Videre er evnene til eksisterende modeller, kvaliteten på eksisterende data og anvendeligheten utilstrekkelig for en akselerert utviklingsprosess, og etterlater forskere med spørsmålet: “Hvordan akselerere utviklingen av visjon-språk-modeller med akseptable kostnader”?

Mini-Gemini-rammeverket er et forsøk på å svare på spørsmålet, og forsøker å utforske potensialet i visjon-språk-modeller fra tre aspekter: VLM-guidet generering eller utvidede anvendelser, høykvalitetsdata og høyoppløselige visuelle token. Først implementerer Mini-Gemini-rammeverket en ConvNet-arkitektur for å generere høyoppløselige kandidater effektivt, og forbedrer visuelle detaljer samtidig som den opprettholder visuelle tokencounts for den store språkmodellen. Mini-Gemini-rammeverket kombinerer offentlig tilgjengelige høykvalitetsdataset i et forsøk på å forbedre kvaliteten på data, og integrerer disse forbedringene med state-of-the-art-genererings- og store språkmodeller i et forsøk på å forbedre ytelsen til VLM, og å forbedre brukeropplevelsen. Den multifacetterte strategien implementert av Mini-Gemini-rammeverket muliggjør det å utforske skjulte evner i visjon-språk-modeller, og oppnår betydelige fremgang med åpenbare ressursbegrensninger.

Generelt setter Mini-Gemini-rammeverket i gang en “noe-til-noe”-paradigme, da det kan håndtere både tekst og bilder som inndata og utdata. Spesifikt introduserer Mini-Gemini-rammeverket en effektiv pipeline for å forbedre visuelle token for inndata-bilder, og inneholder en dobbel-encoder-system bestående av to encodere: den første encoder er for høyoppløselige bilder, mens den andre encoder er for lavkvalitets visuell innlejring. Under inferens arbeider encodere i en oppmerksomhetsmekanisme, hvor lavoppløselig encoder genererer visuelle forespørsler, mens høyoppløselig encoder gir nøkkel og verdier for referanse. For å forbedre datakvaliteten, samler Mini-Gemini-rammeverket og produserer mer data basert på offentlige ressurser, inkludert oppgave-orienterte instruksjoner, genererings-relatert data og høyoppløselige svar, med den økte mengden og forbedrede kvaliteten som forbedrer den totale ytelsen og evnene til modellen. Videre støtter Mini-Gemini-rammeverket samtidig tekst- og bilde-generering som et resultat av integreringen av visjon-språk-modellen med avanserte genereringsmodeller.

Mini-Gemini : Metodologi og Arkitektur

I sin kerne er Mini-Gemini-rammeverket konseptuelt enkelt, og består av tre komponenter.

  1. Rammeverket setter i gang dobbel-visjon-encodere for å gi lavoppløselige visuelle innleiringer og høyoppløselige kandidater.
  2. Rammeverket foreslår å implementere patch-info-utvinning for å utføre utvinning på patch-nivå mellom lavoppløselige visuelle forespørsler og høyoppløselige regioner.
  3. Mini-Gemini-rammeverket utnytter en stor språkmodell for å kombinere tekst med bilder for både generering og forståelse samtidig.

Dobbelt-Visjon-Encodere

Mini-Gemini-rammeverket kan prosessere både tekst- og bilde-inndata, med mulighet til å håndtere dem enten individuelt eller i en kombinasjon. Som demonstrert i følgende bilde, starter Mini-Gemini-rammeverket prosessen ved å bruke bilineær interpolasjon for å generere en lavoppløselig bilde fra dets tilhørende høyoppløselige bilde.

Rammeverket prosesserer deretter disse bildene og koder dem inn i en multi-grid visuell innlejring i to parallele bildeflows. Mer spesifikt opprettholder Mini-Gemini-rammeverket den tradisjonelle pipeline for lavoppløselige flows og setter i gang en CLIP-forhånds-trent Visuell Transformer for å kode visuelle innleiringer, og muliggjør modellen å opprettholde lang-rekke-relasjonen mellom visuelle patcher for påfølgende interaksjoner i store språkmodeller. For høyoppløselige flows setter Mini-Gemini-rammeverket i gang en CNN- eller Convolution Neural Networks-basert encoder for adaptiv og effektiv høyoppløselig bildebehandling.

Patch-Info-Utvinning

Med dobbelt-visjon-encodere som genererer LR-innleiringer og HR-egenskaper, foreslår Mini-Gemini-rammeverket å implementere patch-info-utvinning med målet å utvide potensialet i visjon-språk-modeller med forbedrede visuelle token. For å opprettholde antallet visuelle token for effektivitet i store språkmodeller, tar Mini-Gemini-rammeverket lavoppløselige visuelle innleiringer som forespørsel, og forsøker å hente relevante visuelle hint fra HR-egenskapskandidater, med rammeverket som tar HR-egenskapskartet som nøkkel og verdi.

Som demonstrert i ovenstående bilde, omfatter formelen prosessen med å finjustere og syntetisere visuelle hint, som fører til generering av avanserte visuelle token for påfølgende store språkmodell-behandling. Prosessen sikrer at rammeverket kan begrense utvinningen for hver forespørsel til dets tilhørende underregion i HR-egenskapskartet med piksel-vis-egenskapsantall, og resulterer i forbedret effektivitet. På grunn av denne designen er Mini-Gemini-rammeverket i stand til å utvinne HR-egenskapsdetaljer uten å forbedre antallet visuelle token, og opprettholder en balanse mellom beregningsmulighet og rikdom av detaljer.

Tekst- og Bildegenerering

Mini-Gemini-rammeverket konkatenerer visuelle token og inndata-tekst-token som inndata til store språkmodeller for auto-regressiv generering. I motsetning til tradisjonelle visjon-språk-modeller, støtter Mini-Gemini-rammeverket tekst-bare så vel som tekst-bilde-generering som inndata og utdata, dvs. enhver-til-noe-inferens, og det er resultatet av denne utmerkede bilde-tekst-forståelse og resonemeringsevnen, Mini-Gemini er i stand til å generere høykvalitetsbilder. I motsetning til nyere arbeid som fokuserer på domene-gapet mellom tekst-innleiringer av genereringsmodeller og store språkmodeller, forsøker Mini-Gemini-rammeverket å optimere gapet i domenet av språk-prompter ved å oversette bruker-instruksjoner til høykvalitets-prompter som produserer kontekst-relevante bilder i latent-diffusjonsmodeller. Videre, for en bedre forståelse av instruksjonsfinjustering og kryss-modal-alignment, samler Mini-Gemini-rammeverket prøver fra offentlig tilgjengelige høykvalitetsdataset, og bruker GPT-4-turbo-rammeverket til å konstruere et 13K instruksjonsfølging-dataset for å støtte bilde-generering.

Mini-Gemini : Eksperimenter og Resultater

For å evaluere dens ytelse, er Mini-Gemini-rammeverket instantiert med det forhånds-trente ConvNext-L-rammeverket for HR-visuell encoder, og med en CLIP-forhånds-trent Visuell Transformer for LR-visuell encoder. For å sikre treningseffektivitet, holder Mini-Gemini-rammeverket de to visuelle encodere fikset, og optimaliserer prosjektorer av patch-info-utvinning i alle stadier, og optimaliserer den store språkmodellen under instruksjonsfinjusterings-stadiet selv.

Følgende tabell sammenligner ytelsen til Mini-Gemini-rammeverket mot state-of-the-art-modeller over forskjellige innstillinger, og tar også i betraktning private modeller. Som det kan observeres, overgår Mini-Gemini eksisterende rammer over en rekke LLMs konsekvent på normal oppløsning, og demonstrerer overlegen ytelse når konfigurert med Gemma-2B i kategorien effektive modeller. Videre, når større store språkmodeller er anvendt, er skalerbarheten til Mini-Gemini-rammeverket tydelig.

For å evaluere dens ytelse på høyoppløselig og utvidede visuelle token, er eksperimentene utført med en inndata-størrelse på 672 for LR-visuell encoder, og 1536 for visuell encoder. Som nevnt tidligere, er hovedformålet med HR-visuell encoder å tilby høyoppløselig kandidat-informasjon. Som det kan observeres, leverer Mini-Gemini-rammeverket overlegen ytelse når sammenlignet mot state-of-the-art-rammeverk.

Videre, for å vurdere den visuelle forståelses-evnen til Mini-Gemini-rammeverket i reale settinger, anvender utviklere modellen til en rekke resonemering- og forståelsesoppgaver, som demonstrert i følgende bilde. Som det kan observeres, er Mini-Gemini-rammeverket i stand til å løse en rekke komplekse oppgaver takket være implementeringen av patch-info-utvinning og høykvalitetsdata. Men hva som er enda mer imponerende er det faktum at Mini-Gemini-rammeverket demonstrerer en skarp tillegg til detaljer som går langt utenfor ren gjenkjenningsevne, og beskriver intrikate elementer intrikat.

Følgende figur gir en omfattende evaluering av de genererings-evnene til Mini-Gemini-rammeverket.

Når sammenlignet mot nyere modeller som ChatIllusion og AnyGPT, demonstrerer Mini-Gemini-rammeverket sterkere multi-modale forståelsesevner, og muliggjør å generere tekst-til-bilde-underskrifter som sammenfaller med inndata-instruksjoner bedre, og resulterer i bilde-til-tekst-svar med sterkere konseptuell likhet. Hva som er enda mer imponerende er det faktum at Mini-Gemini-rammeverket demonstrerer bemerkelsesverdige evner i å generere høykvalitetsinnhold ved hjelp av multi-modale menneskelige instruksjoner bare med tekst-trening-data, en evne som illustrerer Mini-Gemini-rammeverkets robuste semantisk tolkning og bilde-tekst-alignment-evner.

Slutt-tanker

I denne artikkelen har vi talt om Mini-Gemini, et potensiale og strømlinjeformet rammeverk for multi-modale visjon-språk-modeller. Det primære målet med Mini-Gemini-rammeverket er å utnytte de latente evnene i visjon-språk-modeller ved hjelp av høykvalitetsdata, strategisk design av rammeverket og en utvidet funksjonell omfang. Mini-Gemini er et forsøk på å lukke gapet som finnes mellom visjon-språk-modeller og mer avanserte modeller ved å utnytte potensialet i VLM for bedre ytelse fra tre aspekter: VLM-guidet generering, høykvalitetsdata og høyoppløselige visuelle token. For å forbedre visuelle token, foreslår Mini-Gemini-rammeverket å bruke en ekstra visuell encoder for høyoppløselig finjustering uten å øke antallet visuelle token. Mini-Gemini-rammeverket konstruerer videre en høykvalitetsdataset i et forsøk på å fremme presis forståelse av bilder og resonemering-basert generering. Overordnet sett forsøker Mini-Gemini-rammeverket å utnytte potensialet i visjon-språk-modeller og å gi eksisterende rammer med bilde-resonemering, -forståelse og -genereringskapasiteter samtidig.

Kunal Kejriwal er en backend‑ingeniør som spesialiserer seg på Python, PostgreSQL, Redis og skyinfrastruktur på GCP og AWS. Med tre års erfaring med å bygge og skalere produksjonssystemer skriver han om AI‑infrastruktur, distribuerte systemer og arkitekturen bak utrulling av maskinlæringsarbeidsbelastninger.