AI-modeller och plattformar

Mini-Gemini: Accelererande Multi-Modalitet VLMs

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Utvecklingen av stora språkmodeller har accelererat utvecklingen av naturlig språkbehandling, eller NLP, i betydande utsträckning. Introduktionen av transformer-ramverket visade sig vara en milstolpe, vilket möjliggjorde utvecklingen av en ny våg av språkmodeller, inklusive OPT och BERT, som visar djup förståelse för språk. Dessutom introducerade GPT, eller generativa förtränade transformermodeller, en ny paradigm med autoregressiv modellering och etablerade en robust metod för språkprediktion och generering. Utvecklingen av språkmodeller som GPT-4, ChatGPT, Mixtral, LLaMA och andra har ytterligare bränslat snabb utveckling, med varje modell som visar förbättrad prestanda i uppgifter som involverar komplex språkbehandling. Bland befintliga metoder har instruktionsjustering framkommit som en nyckelteknik för att finslipa utmatningen av förtränade stora språkmodeller, och integreringen av dessa modeller med specifika verktyg för visuella uppgifter har lyft fram deras anpassningsförmåga och öppnat dörrar för framtida tillämpningar. Dessa sträcker sig långt bortom den traditionella textbaserade bearbetningen av LLM till att omfatta multimodala interaktioner.

Dessutom har konvergensen av naturlig språkbehandling och datorseende-modeller gett upphov till VLM, eller Vision Language Models, som kombinerar språkliga och visuella modeller för att uppnå tvärmodal förståelse och resonemangsförmåga. Integreringen och framväxten av visuella och språkliga modeller har spelat en avgörande roll i att främja uppgifter som kräver både språkbehandling och visuell förståelse. Framväxten av revolutionerande modeller som CLIP har ytterligare brottats om gapet mellan vision och språkmodeller, och visat på möjligheten och praktikaliteten i tvärmodala tillämpningar. Mer nyligen har ramverk som LLaMA och BLIP utnyttjat anpassad instruktionsdata för att utveckla effektiva strategier som visar på modellens kraftfulla förmågor. Dessutom fokuserar den senaste multimodala forskningen på att kombinera stora språkmodeller med bildutmatning, med metoder som kan kringgå direkt generering genom att använda bildsökning för att producera bildutmatning och sammanflätade texter.

Med det sagda, och trots den snabba utvecklingen av visionsspråkmodeller som möjliggör grundläggande resonemang och visuell dialog, finns fortfarande en betydande prestandagap mellan avancerade modeller som GPT-4 och visionsspråkmodeller. Mini-Gemini är ett försök att minska gapet som finns mellan visionsspråkmodeller och mer avancerade modeller genom att utnyttja potentialen hos VLM från tre aspekter: VLM-styrd generering, högkvalitetsdata och högupplösta visuella token. För att förbättra visuella token föreslår Mini-Gemini-ramverket att använda en extra visuell encoder för högupplösningsförfining utan att öka antalet visuella token. Mini-Gemini-ramverket konstruerar dessutom en högkvalitetsdataset i ett försök att främja exakt förståelse av bilder och resonemangsbaserad generering. Sammantaget försöker Mini-Gemini-ramverket att utnyttja potentialen hos visionsspråkmodeller och syftar till att ge befintliga ramverk med bildresonemang, förståelse och generativa förmågor samtidigt. Den här artikeln syftar till att täcka Mini-Gemini-ramverket i detalj, och vi utforskar mekanismen, metodiken, arkitekturen i ramverket samt dess jämförelse med state-of-the-art-ramverk. Så låt oss komma igång.

Mini-Gemini: Accelererande Multi-Modalitet VLMs

Under åren har stora språkmodeller utvecklats, och de har nu en imponerande multimodal förmåga, och blir en viktig del av nuvarande visionsspråkmodeller. Det finns dock ett gap mellan den multimodala prestandan hos stora språkmodeller och visionsspråkmodeller, med den senaste forskningen som söker sätt att kombinera vision med stora språkmodeller med hjälp av bilder och videor. För visionuppgifter i sig är bildupplösning en avgörande faktor för att explicit beskriva omgivningen med minimala visuella hallucinationer. För att brottas om gapet utvecklar forskare modeller för att förbättra den visuella förståelsen i nuvarande visionsspråkmodeller, och två av de vanligaste metoderna är: att öka upplösningen och att öka antalet visuella token. Även om ökningen av antalet visuella token med högupplösta bilder förbättrar den visuella förståelsen, åtföljs förbättringen ofta av ökade beräkningskrav och associerade kostnader, särskilt när flera bilder bearbetas. Dessutom är förmågan hos befintliga modeller, kvaliteten på befintliga data och tillämpbarheten otillräcklig för en accelererad utvecklingsprocess, vilket lämnar forskare med frågan: “Hur kan man accelerera utvecklingen av visionsspråkmodeller med acceptabla kostnader?”

Mini-Gemini-ramverket är ett försök att besvara frågan, eftersom det försöker att utforska potentialen hos visionsspråkmodeller från tre aspekter: VLM-styrd generering eller utvidgade tillämpningar, högkvalitetsdata och högupplösta visuella token. Först implementerar Mini-Gemini-ramverket en ConvNet-arkitektur för att generera högupplösta kandidater effektivt, vilket förbättrar visuella detaljer samtidigt som det behåller antalet visuella token för den stora språkmodellen. Mini-Gemini-ramverket kombinerar offentligt tillgängliga högkvalitetsdataset i ett försök att förbättra datans kvalitet, och integrerar dessa förbättringar med state-of-the-art-generativa och stora språkmodeller i ett försök att förbättra prestandan hos VLM, och förbättra användarupplevelsen. Den mångfacetterade strategin som implementeras av Mini-Gemini-ramverket möjliggör det att utforska dolda förmågor hos visionsspråkmodeller, och uppnår betydande framsteg med uppenbara resursbegränsningar.

I allmänhet använder Mini-Gemini-ramverket en “any-to-any”-paradigm, eftersom det kan hantera både text och bilder som in- och utdata. Särskilt introducerar Mini-Gemini-ramverket en effektiv pipeline för att förbättra visuella token för ingångsbilder, och består av ett dubbel-encodersystem som består av två encoders: den första encodern är för högupplösta bilder, medan den andra encodern är för lågkvalitativa visuella inbäddningar. Under inferens arbetar encoderna i en uppmärksamhetsmekanism, där den lågupplösta encodern genererar visuella frågor, medan den högupplösta encodern tillhandahåller nyckel och värden för referens. För att förbättra datans kvalitet samlar Mini-Gemini-ramverket in och producerar mer data baserat på offentliga resurser, inklusive uppgiftsorienterade instruktioner, generationsrelaterad data och högupplösta svar, med den ökade mängden och förbättrade kvaliteten som förbättrar den övergripande prestandan och förmågan hos modellen. Dessutom stöder Mini-Gemini-ramverket samtidig text- och bildgenerering som ett resultat av integreringen av visionsspråkmodellen med avancerade generativa modeller.

Mini-Gemini: Metodik och Arkitektur

I sin kärna är Mini-Gemini-ramverket konceptuellt enkelt, och består av tre komponenter.

  1. Ramverket använder dubbla visionencoders för att tillhandahålla lågupplösta visuella inbäddningar och högupplösta kandidater.
  2. Ramverket föreslår att implementera patch-info-utvinning för att utföra utvinning på patchnivå mellan lågupplösta visuella frågor och högupplösta områden.
  3. Mini-Gemini-ramverket använder en stor språkmodell för att kombinera text med bilder för både generering och förståelse samtidigt.

Dubbla Vision Encoders

Mini-Gemini-ramverket kan bearbeta både text- och bildinmatningar, med möjlighet att hantera dem antingen individuellt eller i kombination. Som visas i följande bild börjar Mini-Gemini-ramverket processen genom att använda bilineär interpolation för att generera en lågupplöstad bild från dess motsvarande högupplösta bild.

Ramverket bearbetar sedan dessa bilder och kodar dem till en multi-grid visuell inbäddning i två parallella bildflöden. Mer specifikt behåller Mini-Gemini-ramverket den traditionella pipeline för lågupplösta flöden och använder en CLIP-förtränad visuell transformer för att koda de visuella inbäddningarna, vilket möjliggör för modellen att behålla den långsiktiga relationen mellan visuella patchar för efterföljande interaktioner i stora språkmodeller. För högupplösta flöden använder Mini-Gemini-ramverket en CNN-baserad eller convolutionell neurala nätverksbaserad encoder för adaptiv och effektiv högupplösningsbildbehandling.

Patch Info Mining

Med de dubbla visionencoderna som genererar LR-inbäddningarna och HR-egenskaperna, föreslår Mini-Gemini-ramverket att implementera patch-info-utvinning i syfte att utöka potentialen hos visionsspråkmodeller med förbättrade visuella token. För att behålla antalet visuella token för effektivitet i stora språkmodeller, tar Mini-Gemini-ramverket de lågupplösta visuella inbäddningarna som frågan, och syftar till att hämta relevanta visuella ledtrådar från HR-egenskapskandidaterna, med ramverket som tar HR-egenskapskartan som nyckel och värde.

Som visas i ovanstående bild omfattar formeln processen för att förädla och syntetisera visuella ledtrådar, vilket leder till genereringen av avancerade visuella token för efterföljande stora språkmodellbehandling. Processen säkerställer att ramverket kan begränsa utvinningen för varje fråga till dess motsvarande subregion i HR-egenskapskartan med pixelvis egenskapsräkning, vilket resulterar i förbättrad effektivitet. På grund av denna design kan Mini-Gemini-ramverket extrahera HR-egenskapsdetaljer utan att förbättra antalet visuella token, och upprätthåller en balans mellan beräkningsmässig genomförbarhet och rikedom på detaljer.

Text och Bildgenerering

Mini-Gemini-ramverket sammanfogar de visuella token och inmatningstexttoken som inmatning till stora språkmodeller för auto-regressiv generering. Till skillnad från traditionella visionsspråkmodeller stöder Mini-Gemini-ramverket text-endast samt text-bildgenerering som in- och utdata, dvs. “any-to-any”-inferens, och det är resultatet av denna utmärkta bild-textförståelse och resonemangsförmåga som Mini-Gemini kan generera högkvalitativa bilder. Till skillnad från nyliga arbeten som fokuserar på domän-gapet mellan textinbäddningar av generationsmodeller och stora språkmodeller, försöker Mini-Gemini-ramverket att optimera gapet i domänen för språkprompt genom att översätta användarinstruktioner till högkvalitativa prompt som producerar kontextrelevanta bilder i latent diffusionsmodeller. Dessutom, för en bättre förståelse av instruktionsfinjustering och tvärmodal anpassning, samlar Mini-Gemini-ramverket prover från offentligt tillgängliga högkvalitetsdataset, och använder GPT-4-turbo-ramverket för att ytterligare konstruera ett 13K-instruktionsföljande dataset för att stödja bildgenerering.

Mini-Gemini: Experiment och Resultat

För att utvärdera dess prestanda, är Mini-Gemini-ramverket instansierat med det förtränade ConvNext-L-ramverket för HR-visionencodern, och med en CLIP-förtränad visuell transformer för LR-visionencodern. För att säkerställa träningsEffektivitet, behåller Mini-Gemini-ramverket de två visionencoderna fixerade, och optimerar projektorerna för patch-info-utvinning i alla stadier, och optimerar den stora språkmodellen under instruktionsjusteringsstadiet.

Följande tabell jämför prestandan hos Mini-Gemini-ramverket mot state-of-the-art-modeller över olika inställningar, och tar även hänsyn till privata modeller. Som kan observeras, överträffar Mini-Gemini befintliga ramverk konsekvent över en bred range av LLM vid normal upplösning, och visar överlägsen prestanda när det konfigureras med Gemma-2B i kategorin effektiva modeller. Dessutom, när större stora språkmodeller används, är skalbarheten hos Mini-Gemini-ramverket uppenbar.

För att utvärdera dess prestanda på högupplösning och utökade visuella token, utförs experimenten med en ingångsstorlek på 672 för LR-visionencodern, och 1536 för den visuella encodern. Som nämnts tidigare, är det primära syftet med HR-visionencodern att erbjuda högupplösningskandidatinformation. Som kan observeras, levererar Mini-Gemini-ramverket överlägsen prestanda när det jämförs med state-of-the-art-ramverk.

Dessutom, för att bedöma den visuella förståelsens duglighet hos Mini-Gemini-ramverket i realistiska miljöer, tillämpar utvecklare modellen på en mängd olika resonemangs- och förståelseuppgifter, som visas i följande bild. Som kan observeras, kan Mini-Gemini-ramverket lösa en mängd komplexa uppgifter tack vare implementeringen av patch-info-utvinning och högkvalitetsdata. Men vad som är ännu mer imponerande är det faktum att Mini-Gemini-ramverket visar en skarp uppmärksamhet på detaljer som sträcker sig bortom ren erkännandeförmåga, och beskriver intrikata element på ett detaljerat sätt.

Följande figur ger en omfattande utvärdering av de generativa förmågorna hos Mini-Gemini-ramverket.

När det jämförs med nyliga modeller som ChatIllusion och AnyGPT, visar Mini-Gemini-ramverket en starkare tvärmodal förståelse, vilket möjliggör att generera text-till-bild-kapitel som överensstämmer med ingångsinstruktionerna bättre, och resulterar i bild-till-text-svar med starkare konceptuell likhet. Vad som är ännu mer imponerande är det faktum att Mini-Gemini-ramverket visar en anmärkningsvärd förmåga att generera högkvalitativt innehåll med hjälp av multimodala mänskliga instruktioner endast med textträningsdata, en förmåga som illustrerar Mini-Geminis robusta semantiska tolkning och bild-text-anpassning.

Slutliga Tankar

I denna artikel har vi talat om Mini-Gemini, ett kraftfullt och strömlinjeformat ramverk för multimodala visionsspråkmodeller. Det primära syftet med Mini-Gemini-ramverket är att utnyttja de dolda förmågorna hos visionsspråkmodeller med hjälp av högkvalitetsdata, strategisk design av ramverket och en utvidgad funktionsomfång. Mini-Gemini är ett försök att minska gapet som finns mellan visionsspråkmodeller och mer avancerade modeller genom att utnyttja potentialen hos VLM från tre aspekter: VLM-styrd generering, högkvalitetsdata och högupplösta visuella token. För att förbättra visuella token föreslår Mini-Gemini-ramverket att använda en extra visuell encoder för högupplösningsförfining utan att öka antalet visuella token. Mini-Gemini-ramverket konstruerar dessutom en högkvalitetsdataset i ett försök att främja exakt förståelse av bilder och resonemangsbaserad generering. Sammantaget försöker Mini-Gemini-ramverket att utnyttja potentialen hos visionsspråkmodeller, och syftar till att ge befintliga ramverk med bildresonemang, förståelse och generativa förmågor samtidigt.

Kunal Kejriwal är en backend‑ingenjör som specialiserar sig på Python, PostgreSQL, Redis och molninfrastruktur på GCP och AWS. Med tre års erfarenhet av att bygga och skala produktionssystem skriver han om AI‑infrastruktur, distribuerade system och arkitekturen bakom distribution av maskininlärningsarbetsbelastningar.