AI-modeller og platforme

Mini-Gemini: Accelererende Multi-Modalitet VLM’er

mm
Føj Unite.AI til dine foretrukne kilder på Google

Fremskridtene inden for store sprogmodeller har betydeligt accelereret udviklingen af naturlig sprogbehandling, eller NLP. Introduktionen af transformer-rammen viste sig at være en milepæl, der lettede udviklingen af en ny bølge af sprogmodeller, herunder OPT og BERT, som viser dyb forståelse for sprog. Desuden introducerede GPT, eller Generative Pre-trained Transformer-modeller, en ny paradigm med autoregressiv modellering og etablerede en robust metode til sprogforudsigelse og -generering. Ankomsten af sprogmodeller som GPT-4, ChatGPT, Mixtral, LLaMA og andre har yderligere fremmet hurtig evolution, hvor hver model viser forbedret præstation i opgaver, der involverer kompleks sprogbehandling. Blandt eksisterende metoder er instruktionsafstemning dukket op som en nøgleteknik til at raffinere outputtet af store forudtrænede sprogmodeller, og integrationen af disse modeller med specifikke værktøjer til visuelle opgaver har fremhævet deres tilpasningsevne og åbnet døre for fremtidige anvendelser. Disse strækker sig langt ud over den traditionelle tekstbaserede behandling af LLM’er til at omfatte multimodale interaktioner.

Desuden har konvergen af naturlig sprogbehandling og computer vision-modeller givet anledning til VLM’er, eller Vision Language Models, som kombinerer sprog- og visionmodeller for at opnå cross-modalt forståelse og resonanskapaciteter. Integrationen og opkomsten af visuelle og sprogmodeller har spillet en afgørende rolle i at fremme opgaver, der kræver både sprogbehandling og visuel forståelse. Opkomsten af revolutionerende modeller som CLIP har yderligere brobygget mellem vision-opgaver og sprogmodeller, og demonstreret muligheden og praktikabiliteten af cross-modale anvendelser. Mere nylige rammer som LLaMA og BLIP udnytter tilpasset instruktionsdata til at udvikle effektive strategier, der demonstrerer modellens potente kapaciteter. Desuden er kombinationen af store sprogmodeller med billedoutput fokus for nylig multimodal forskning, hvor nylige metoder kan omgå direkte generering ved at anvende billedhentningsmetoden til at producere billedoutput og sammenflettede tekster.

Med det sagt, og på trods af de hurtige fremskridt i vision-sprogmodeller, der faciliterer grundlæggende resonans og visuel dialog, findes der stadig en betydelig præstationsgap mellem avancerede modeller som GPT-4 og vision-sprogmodeller. Mini-Gemini er et forsøg på at mindske gapet mellem vision-sprogmodeller og mere avancerede modeller ved at udnytte potentialet for VLM’er til bedre præstation fra tre aspekter: VLM-guideret generering, højkvalitetsdata og højopløsningsvisuelle token. For at forbedre visuelle token foreslår Mini-Gemini-rammen at anvende en ekstra visuel encoder til højopløsningsraffinering uden at øge antallet af visuelle token. Mini-Gemini-rammen konstruerer desuden en højkvalitetsdataset i et forsøg på at fremme præcis forståelse af billeder og resonansbaseret generering. Samlet set forsøger Mini-Gemini-rammen at udnytte potentialet for vision-sprogmodeller og sigte mod at udruste eksisterende rammer med billedresonans, -forståelse og -genereringskapaciteter samtidig. Denne artikel sigter mod at dække Mini-Gemini-rammen i dybden og udforske mekanismen, metoden, arkitekturen i rammen samt sammenligningen med state-of-the-art-rammer. Så lad os komme i gang.

Mini-Gemini: Accelererende Multi-Modalitet VLM’er

Gennem årene er store sprogmodeller udviklet, og de har nu bemærkelsesværdige multi-modale kapaciteter og er blevet en essentiel del af nuværende vision-sprogmodeller. Der findes dog et gap mellem de multi-modale præstationer af store sprogmodeller og vision-sprogmodeller, og nylig forskning søger at kombinere vision med store sprogmodeller ved hjælp af billeder og videoer. For vision-opgaver i sig selv er billedopløsning en afgørende faktor for at udtrykke omgivelserne med minimal visuel hallucination. For at brobygge gapet udvikler forskere modeller til at forbedre den visuelle forståelse i nuværende vision-sprogmodeller, og to af de mest almindelige tilgange er: at øge opløsningen og øge antallet af visuelle token. Selv om øgningen af antallet af visuelle token med højopløsningsbilleder forbedrer den visuelle forståelse, følges forbedringen ofte med øgede beregningskrav og tilhørende omkostninger, især ved behandling af multiple billeder. Desuden er kapaciteterne af eksisterende modeller, kvaliteten af eksisterende data og anvendeligheden utilstrækkelige til en accelereret udviklingsproces, hvilket efterlader forskere med spørgsmålet: “Hvordan kan man accelerere udviklingen af vision-sprogmodeller med acceptabel omkostning?”

Mini-Gemini-rammen er et forsøg på at besvare spørgsmålet, da den søger at udforske potentialet for vision-sprogmodeller fra tre aspekter: VLM-guideret generering eller udvidede anvendelser, højkvalitetsdata og højopløsningsvisuelle token. Først implementerer Mini-Gemini-rammen en ConvNet-arkitektur til at generere højopløsningskandidater effektivt, hvilket forbedrer visuelle detaljer samtidig med at opretholde antallet af visuelle token for den store sprogmodel. Mini-Gemini-rammen kombinerer offentligt tilgængelige højkvalitetsdatasets i et forsøg på at forbedre kvaliteten af data og integrerer disse forbedringer med state-of-the-art-genererings- og store sprogmodeller i et forsøg på at forbedre præstationen af VLM’er og forbedre brugeroplevelsen. Den multifacetterede strategi, der er implementeret i Mini-Gemini-rammen, giver den mulighed for at udforske skjulte kapaciteter af vision-sprogmodeller og opnår betydelige fremskridt med åbenlyse ressourcebegrænsninger.

I almindelighed anvender Mini-Gemini-rammen en “any-to-any”-paradigme, da den kan håndtere både tekst og billeder som input og output. Særligt introducerer Mini-Gemini-rammen en effektiv pipeline til at forbedre visuelle token for inputbilleder og omfatter en dobbelt-encoder-system bestående af to encodere: den første encoder er til højopløsningsbilleder, mens den anden encoder er til lavkvalitetsvisuel indlejring. Under inferens arbejder encodere i en opmærksomhedsmechanisme, hvor lavkvalitetsencoderen genererer visuelle forespørgsler, mens højopløsningsencoderen giver nøgle og værdier til reference. For at forbedre datakvaliteten indsamler og producerer Mini-Gemini-rammen mere data baseret på offentlige ressourcer, herunder opgaveorienterede instruktioner, generationsrelaterede data og højopløsningsrespons, og den øgede mængde og forbedrede kvalitet forbedrer den samlede præstation og kapaciteter af modellen. Desuden understøtter Mini-Gemini-rammen samtidig tekst- og billedgenerering som resultat af integrationen af vision-sprogmodellen med avancerede genereringsmodeller.

Mini-Gemini: Metode og Arkitektur

I sin kerne er Mini-Gemini-rammen konceptuelt enkel og består af tre komponenter.

  1. Rammen anvender dobbeltvision-encodere til at give lavkvalitetsvisuelle indlejring og højopløsningskandidater.
  2. Rammen foreslår at implementere patch-info-udvinding til at udføre udvinding på patchniveau mellem lavkvalitetsvisuelle forespørgsler og højopløsningsområder.
  3. Mini-Gemini-rammen anvender en stor sprogmodel til at kombinere tekst med billeder til både generering og forståelse samtidig.

Dobbelt-Vision-Encodere

Mini-Gemini-rammen kan behandle både tekst- og billedinput, med mulighed for at håndtere dem enten individuelt eller i kombination. Som demonstreret i følgende billed, starter Mini-Gemini-rammen processen ved at anvende bilineær interpolation til at generere et lavkvalitetsbillede fra dets tilsvarende højopløsningsbillede.

Rammen behandler derefter billederne og indkoderer dem i en multi-grid-visuel indlejring i to parallelle billedstrømme. Mere specifikt opretholder Mini-Gemini-rammen den traditionelle pipeline for lavkvalitetsstrømme og anvender en CLIP-forudtrænet Visuel Transformer til at indkode visuelle indlejring, hvilket giver modellen mulighed for at bevare den lange-række-relation mellem visuelle patcher til efterfølgende interaktioner i store sprogmodeller. For højopløsningsstrømme anvender Mini-Gemini-rammen en CNN- eller Convolution Neural Networks-baseret encoder til adaptiv og effektiv højopløsningsbilledebehandling.

Patch-Info-Udvinding

Med dobbelt-vision-encodere, der genererer lavkvalitetsindlejring og højopløsningsfunktioner, foreslår Mini-Gemini-rammen at implementere patch-info-udvinding med det formål at udvide potentialet for vision-sprogmodeller med forbedrede visuelle token. For at opretholde antallet af visuelle token til effektivitet i store sprogmodeller, tager Mini-Gemini-rammen lavkvalitetsvisuelle indlejring som forespørgsel og søger at hente relevante visuelle hints fra højopløsningskandidatfunktioner, hvor rammen tager højopløsningsfunktionkortet som nøgle og værdi.

Som demonstreret i billedet ovenfor, indkapsler formelen processen med at raffinere og syntetisere visuelle hints, hvilket fører til generering af avancerede visuelle token til efterfølgende store sprogmodelbehandling. Processen sikrer, at rammen kan begrænse udvindingen for hver forespørgsel til dets tilsvarende underområde i højopløsningsfunktionkortet med pixel-vis-funktionstælling, hvilket resulterer i forbedret effektivitet. Takket være denne design, er Mini-Gemini-rammen i stand til at udtrække højopløsningsfunktiondetaljer uden at forbedre antallet af visuelle token og opretholder en balance mellem beregningsmulighed og rigdom af detaljer.

Tekst- og Billedgenerering

Mini-Gemini-rammen konkatenerer visuelle token og input-teksttoken som input til store sprogmodeller til auto-regressiv generering. I modsætning til traditionelle vision-sprogmodeller understøtter Mini-Gemini-rammen både tekst-alene og tekst-billedgenerering som input og output, dvs. enhver til enhver inferens, og det er resultatet af denne fremragende billed-tekstforståelse og resonanskapaciteter, at Mini-Gemini er i stand til at generere højkvalitetsbilleder. I modsætning til nylige arbejder, der fokuserer på domænegapet mellem tekstindlejring af generationsmodeller og store sprogmodeller, forsøger Mini-Gemini-rammen at optimere gapet i domænet for sprogprompts ved at oversætte brugerinstruktioner til højkvalitetsprompts, der producerer kontekst-relevante billeder i latent diffusionsmodeller. Desuden til en bedre forståelse af instruktionsfinetuning og cross-modalt alignment indsamler Mini-Gemini-rammen prøver fra offentligt tilgængelige højkvalitetsdatasets og anvender GPT-4-turbo-rammen til yderligere at konstruere en 13K-instruktionsfølgende dataset til at understøtte billedgenerering.

Mini-Gemini: Eksperimenter og Resultater

For at evaluere dens præstation er Mini-Gemini-rammen instantieret med den forudtrænede ConvNext-L-ramme til højopløsningsvision-encoderen og med en CLIP-forudtrænet Visuel Transformer til lavkvalitetsvision-encoderen. For at sikre trænings-effektivitet holder Mini-Gemini-rammen de to vision-encodere faste og optimerer projektørerne af patch-info-udvinding i alle faser og optimerer den store sprogmodel under instruktionsafstemningsfasen selv.

Den følgende tabel sammenligner præstationen af Mini-Gemini-rammen mod state-of-the-art-modeller over forskellige indstillinger og tager også i betragtning private modeller. Som det kan ses, overgår Mini-Gemini eksisterende rammer konsekvent over en bred vifte af LLM’er ved normal opløsning og demonstrerer overlegen præstation, når den er konfigureret med Gemma-2B i kategorien af effektive modeller. Desuden demonstrerer Mini-Gemini-rammen sin skalerbarhed, når større store sprogmodeller anvendes.

For at evaluere dens præstation på høj opløsning og udvidede visuelle token udføres eksperimenterne med en input-størrelse på 672 for lavkvalitetsvision-encoderen og 1536 for visuel encoderen. Som nævnt tidligere er hovedformålet med højopløsningsvision-encoderen at tilbyde højopløsningskandidatinformation. Som det kan ses, leverer Mini-Gemini-rammen overlegen præstation i sammenligning med state-of-the-art-rammer.

Desuden til at vurdere den visuelle forståelsespræstation af Mini-Gemini-rammen i virkelige sammenhænge anvender udviklerne modellen til en række af resonans- og forståelsesopgaver, som demonstreres i følgende billed. Som det kan ses, er Mini-Gemini-rammen i stand til at løse en bred vifte af komplekse opgaver takket være implementeringen af patch-info-udvinding og højkvalitetsdata. Men hvad der er endnu mere imponerende, er det faktum, at Mini-Gemini-rammen demonstrerer en skarp tilføjelse til detaljer, der strækker sig langt ud over blot genkendelsespræstation og beskriver intrikate elementer intrikat.

Den følgende figur giver en komplet vurdering af de genereringskapaciteter af Mini-Gemini-rammen.

I sammenligning med nylige modeller som ChatIllusion og AnyGPT demonstrerer Mini-Gemini-rammen stærkere multi-modale forståelseskapaciteter, hvilket giver den mulighed for at generere tekst-til-billed-underskrifter, der er i overensstemmelse med input-instruktionerne bedre, og resulterer i billed-til-tekst-svar med stærkere konceptuel lighed. Hvad der er endnu mere imponerende, er det faktum, at Mini-Gemini-rammen demonstrerer bemærkelsesværdig dygtighed i at generere højkvalitetsindhold ved hjælp af multi-model-menneskeinstruktioner alene med teksttræningsdata, en kapacitet, der illustrerer Mini-Gemini’s robuste semantiske fortolkning og billed-tekst-alignment-kapaciteter.

Endelige Tanker

I denne artikel har vi talt om Mini-Gemini, en potent og strømlinet ramme til multi-modale vision-sprogmodeller. Det primære formål med Mini-Gemini-rammen er at udnytte de latente kapaciteter af vision-sprogmodeller ved hjælp af højkvalitetsdata, strategisk design af rammen og en udvidet funktionsområde. Mini-Gemini er et forsøg på at mindske gapet mellem vision-sprogmodeller og mere avancerede modeller ved at udnytte potentialet for VLM’er til bedre præstation fra tre aspekter: VLM-guideret generering, højkvalitetsdata og højopløsningsvisuelle token. For at forbedre visuelle token foreslår Mini-Gemini-rammen at anvende en ekstra visuel encoder til højopløsningsraffinering uden at øge antallet af visuelle token. Mini-Gemini-rammen konstruerer desuden en højkvalitetsdataset i et forsøg på at fremme præcis forståelse af billeder og resonansbaseret generering. Samlet set forsøger Mini-Gemini-rammen at udnytte potentialet for vision-sprogmodeller og sigte mod at udruste eksisterende rammer med billedresonans, -forståelse og -genereringskapaciteter samtidig.

Kunal Kejriwal er en backend-ingeniør med speciale i Python, PostgreSQL, Redis og cloud-infrastruktur på GCP og AWS. Med tre års erfaring i at bygge og skalere produktionssystemer skriver han om AI-infrastruktur, distribuerede systemer og arkitekturen bag implementering af maskinlæringsarbejdsbelastninger.