AI-modeller och plattformar

MiniGPT-5: Interleaved Vision-And-Language Generation via Generative Vokens

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Under de senaste åren har stora språkmodeller (LLM) fått uppmärksamhet från AI-utvecklare över hela världen på grund av genombrott inom naturlig språkbehandling (NLP). Dessa modeller har satt nya benchmark för textgenerering och förståelse. Men trots framstegen inom textgenerering är det fortfarande en utmaning att producera bilder som sammanhänger med textberättelser. För att tackla detta har utvecklare introducerat en innovativ vision och språkgenereringsmetod baserad på “generativa vokens”, som brottar gapet för harmoniserade text- och bildutdata.

Grundvalen för MiniGPT-5 är en tvåstegs utbildningsstrategi som fokuserar kraftigt på beskrivningsfri multimodal datagenerering där utbildningsdata inte kräver någon omfattande bildbeskrivning. Dessutom för att förbättra modellens integritet, inkorporerar modellen en klassificeringsfri vägledningssystem som förbättrar effektiviteten hos en voken för bildgenerering. I den initiala fasen har MiniGPT-5-ramverket visat kraftfull prestanda och en betydande förbättring jämfört med baseline-Modellen Divter som tränats på MMDialog-datasättet, och har konsekvent visat sin förmåga att leverera jämförbara och till och med överlägsna multimodala utdata i mänskliga utvärderingar som utförts på VIST-datasättet, vilket ytterligare belyser dess prestanda och effektivitet över olika benchmark.

MiniGPT5 : En introduktion

Med de senaste utvecklingarna av LLM-ramverken och tillämpningar baserade på dessa LLM-ramverk, är multimediainTEGRERINGSfunktionen ett område som har sett en ökning i popularitet, eftersom det också visar sig vara en viktig framsteg som driver en mängd olika tillämpningar, från state-of-the-art-innehållsskapande verktyg till avancerade multimodala dialogagenter. Med kontinuerlig forskning och utveckling är språk- och visionsmodeller på den punkt där arbetet pågår för att möjliggöra för dem att generera både text och visuell data sömlöst. Förmågan hos LLM att generera multimodal data sömlöst kommer att hjälpa till att förbättra interaktioner över olika domäner, inklusive e-handel, media och virtuell verklighet.

Till slut är målet att tillåta modeller att syntetisera, känna igen och svara på ett konsekvent och logiskt sätt med hjälp av både text och visuella modaliteter, och därmed spela en avgörande roll i att harmonisera informationsflödet och skapa logiska och konsekventa berättelser. Behovet av att uppnå en blandning av text och visuella modaliteter drivs främst av behovet av mer flytande, integrerade och interaktiva multimodala interaktioner i LLM, och slutligen uppnå alternativ språk- och visiongenerering. Men att uppnå integrerade och interaktiva multimodala interaktioner i LLM är en komplicerad uppgift full av många utmaningar, inklusive

  1. Även om nuvarande LLM är extremt effektiva och kapabla när det gäller textgenerering och bearbetning av text- och bildpar, levererar de inte tillfredsställande prestanda när det gäller att generera bilder.
  2. Utvecklingen av dessa vision- och språkmodeller bygger tungt på ämnesfokuserad data, vilket gör det svårt för modellerna att anpassa den genererade texten med dess motsvarande bilder.
  3. Slutligen finns det ett behov av att komma med mer effektiva strategier, eftersom minneskraven för LLM ökar, särskilt när de utför nedströmsuppgifter.

MiniGPT-5-ramverket, en växelvis språk- och visiongenereringsalgoritmteknik som introducerar begreppet “generativa vokens” i ett försök att tackla de ovan nämnda utmaningarna. MiniGPT-5-ramverket föreslår en ny metod för multimodal datagenerering genom att kombinera stora språkmodeller med Stable Diffusion-tekniker med hjälp av specialvisuala token. Den föreslagna tvåstegsträningsmetoden som används av MiniGPT-5-ramverket betonar vikten av en grundläggande fas fri från beskrivningar och förbereder modellen för att leverera effektiv prestanda även i scenarier med begränsad data.

Men vad som skiljer MiniGPT-5-modellen från nuvarande existerande ramverk är att de generiska stadierna i MiniGPT-5-ramverket inte består av domänspecifika annoteringar. Dessutom för att säkerställa att den genererade texten och dess motsvarande bilder är i harmoni med varandra, distribuerar MiniGPT-5-ramverket en dual-loss-strategi som ytterligare förbättrar MiniGPT-5:s tillvägagångssätt för att använda klassificeringsfri vägledning och generativa vokens. MiniGPT-5-ramverket optimerar utbildningseffektivitet och tacklar minnesbegränsningarna tack vare deras parameter-effektiva strategi för finjustering av modellen.

För att ge er en snabb sammanfattning, MiniGPT-5-ramverket

  1. Föreslår en metod som använder multimodala encoders som representerar en ny och generisk metod som historiskt sett har visat sig vara mer effektiv än traditionella LLM, och använder generativa token i kombination med Stable Diffusion-tekniker för att generera växelvis språk- och visuell output.
  2. Föreslår en tvåstegsträningsstrategi för generation av beskrivningsfri multimodal output, och inkorporerar klassificeringsfri vägledning under utbildningen för att ytterligare förbättra kvaliteten på den genererade data.

MiniGPT-5-modellen är starkt inspirerad av tidigare forskning och arbete inom områdena

  • Text till bildgenerering : För att underlätta transformationen av textbeskrivningar till deras respektive visuella representationer, och text till bildmodeller.
  • MLLM eller Multimodala stora språkmodeller : Använda förtränade LLM-modeller för att undersöka deras tillämpningar och effektivitet i generering av multimodal data.
  • Multimodal generation med stora språkmodeller : För att förbättra förmågan hos en LLM att sömlöst integrera språk- och visuell datagenerering.

MiniGPT-5 : Metod, Arkitektur och Ramverk

För att möjliggöra stora språkmodeller med multimodal datagenereringsförmåga, introducerar MiniGPT-5-modellen ett ramverk som syftar till att integrera text till bildgenereringsmodeller och förtränade multimodala stora språkmodeller. MiniGPT-5-ramverket introducerar dessutom “generativa vokens”, specialvisuala token som tillåter utvecklare att tackla diskrepanser som uppstår mellan olika domäner genom att kunna träna direkt på råbilder. För att ytterligare förbättra kvaliteten på den multimodala data som genereras av LLM, introducerar MiniGPT-5-ramverket en klassificeringsfri strategi i kombination med en avancerad tvåstegsträningsmetod. Låt oss ta en detaljerad titt på MiniGPT-5-ramverket.

Multimodal Inmatningssteg

Utvecklingen av LLM i den senaste tiden har fört LLM:s multimodala förståelseförmåga till ljuset, vilket möjliggör bearbetning av bilder som en sekventiell inmatning. MiniGPT-5-ramverket använder särskilt utformade generativa vokens för att producera visuella funktioner i ett försök att utöka LLM:s multimodala förståelseförmåga till multimodal datagenerering. Dessutom använder MiniGPT-5-ramverket parameter-effektiva och avancerade finjusteringsmetoder för multimodal utlärning med LLM-ramverket.

Multimodal Kodning

Den förtränade visuella encodern i MiniGPT-5-ramverket transformerar varje inmatningsbild till en funktion, och varje texttoken är inbäddad som en vektor, och inmatningspromptfunktionerna genereras när dessa inbäddningar konkateneras med varandra.

Lägga till Vokens i Stora Språkmodeller

Traditionellt består stora språkmodellers ordförråd endast av texttoken, vilket är varför utvecklarna som arbetar med MiniGPT-5-ramverket var tvungna att brottas gapet mellan de generativa och traditionella LLM. MiniGPT-5-ramverket introducerar en uppsättning specialtoken som generativa token i ordförrådet hos LLM. Ramverket använder sedan det dolda utmatningstillståndet hos LLM för dessa specialvoken för efterföljande bildgenerering, och införandet av växelvisa bilder representeras av positionen för voken.

PEFT eller Parameter-Effektiv Finjustering

PEFT eller Parameter-Effektiv Finjustering är ett viktigt koncept som används för att träna LLM, och ändå är tillämpningarna av PEFT i multimodala miljöer fortfarande outforskade till en ganska stor utsträckning. MiniGPT-5-ramverket använder Parameter-Effektiv Finjustering över encodern i MiniGPT-4-ramverket för att träna modellen att förstå instruktioner eller promptrar bättre, och även förbättra den övergripande prestandan hos modellen i en nollskott- eller ny miljö.

Multimodal Utmatningsgenerering

För att anpassa den generativa modellen med de generativa token exakt, formulerar MiniGPT-5-ramverket en kompakt mappningsmodul för att matcha dimensionerna, och inkorporerar övervakningsförluster, inklusive latent diffusionsmodellförlust och textutrymme-förlust. Den latenta diffusionsövervakningsförlusten anpassar de lämpliga visuella funktionerna med token direkt, medan textutrymmesförlusten hjälper modellen att lära sig de korrekta positionerna för token. Eftersom de generativa voken i MiniGPT-5-ramverket vägleds direkt av bilderna, behöver MiniGPT-5-ramverket inte att bilderna har en omfattande beskrivning, vilket resulterar i en beskrivningsfri inlärning.

Textutrymmesgenerering

MiniGPT-5-ramverket följer den kasuella språkmodelleringen för att generera både voken och text i textutrymmet gemensamt, och under utbildningsfasen lägger utvecklarna till voken i positionen för de faktiska bilderna, och tränar modellen att förutsäga voken inom textgenerering.

Mappning av Vokenfunktioner för Bildgenerering

Efter att ha genererat textutrymmet, anpassar ramverket det dolda utmatningstillståndet med textvillkorsfunktionen för text till bildgenereringsmodellen. Ramverket stöder också en funktionmappningsmodul som inkluderar en dual-lagers MLP-modell, en lärbart dekodarfunktionsserie och en fyrlagers encoder-decoder-transformator-modell.

Bildgenerering med LDM eller Latent Diffusionsmodell

För att generera de erforderliga bilderna i avbrusningsprocessen, använder ramverket mappningsfunktionerna som en villkorsinmatning. Ramverket använder också en LDM eller Latent Diffusionsmodell för vägledning, eftersom under utbildningsfasen omvandlas den faktiska bilden först till en latent funktion med hjälp av en förtränad VAE, varefter utvecklarna får den latenta brusfunktionen genom att lägga till något brus.

Det omfattande tillvägagångssättet som används av MiniGPT-5-ramverket möjliggör för utvecklare att ha en sammanhängande förståelse och generering av både visuella och textelement, med hjälp av specialtoken, utnyttjande av förtränade modellers förmågor och användning av innovativa utbildningstekniker.

MiniGPT-5 : Utbildning och Resultat

När utvecklare arbetade med MiniGPT-5-ramverket, observerade de att utbildning på en begränsad växelvis text- och bild datasätt direkt kan resultera i bilder med minskad kvalitet och felanpassning, givet den betydande domänförändringen mellan bild- och textdomäner. För att mildra detta problem, antog utvecklare två distinkta utbildningsstrategier,

  1. Inklusive inkorporering av klassificeringsfria vägledningstekniker som förbättrar effektiviteten hos generativa token under diffusionsprocessen.
  2. Den andra strategin är ytterligare indelad i två steg
    1. En initial förträningsfas som fokuserar främst på att anpassa grova funktioner.
    2. En finjusteringsfas som möjliggör funktioninlärning.

CFG eller Klassificeringsfri Vägledning

Idén att först utnyttja CFG för multimodal generation kom som ett resultat av ett försök att förbättra konsekvens och logik mellan de genererade bilderna och texterna, och CFG introduceras under text till bild diffusionsprocessen. Denna metod observerar att genom att träna på både ovillkorlig och villkorsgenerering med villkorsavbrott, kan den generativa modellen uppnå förbättrade villkorsresultat.

Tvåstegs Utbildningsstrategi

Givet den betydande domänförändringen som observerats mellan text- och bildgenerering, och ren textgenerering, använder MiniGPT-5-ramverket en tvåstegsstrategi för utbildning

  1. Unimodal Anpassningssteg eller UAS,
  2. Multimodal Inlärningssteg eller MLS.

Initialt anpassar ramverket bildgenereringsfunktionerna med vokenfunktionen i enstaka text- och bildpar datasätt, där varje datasample innehåller endast en text och endast en bild, och texten är vanligtvis bildbeskrivningen. I detta stadium tillåter ramverket LLM att generera voken genom att använda bildbeskrivningar som LLM-inmatningar.

När UAS har utförts framgångsrikt, kan modellen generera bilder för enstaka textbeskrivningar, men kämpar med växelvis språk- och visiongenerering, inklusive text- och bildpar, och komplicerad resonemang krävs för bild- och textgenerering. För att tackla denna utmaning, har utvecklarna ytterligare finjusterat MiniGPT-5-ramverket med hjälp av PEFT-parametrar genom att använda växelvisa vision- och språkdatasätt som VIST. Under detta stadium konstruerar ramverket tre olika uppgifter från datasättet

  1. Text Endast Generering : Genererar den relaterade texten givet den efterföljande bilden.
  2. Bild Endast Generering : Genererar den relaterade bilden givet den efterföljande texten.
  3. Multimodal Generering : Genererar text- och bildpar med hjälp av den givna kontexten.

MiniGPT-5 : Benchmark och Resultat

För att utvärdera dess prestanda i multimodal generation omfattande, jämför MiniGPT-5-utvecklingsteamets prestanda med andra framstående baseline-modeller, inklusive Divter, GILL och den finjusterade unimodala genereringsmodellen, och jämförelsen visas i tabellen nedan.

MiniGPT-5-ramverket förstår att den multimodala utmatningen kan vara meningsfull enligt kontexten, men den kan skilja sig från den faktiska verkligheten, vilket är den primära anledningen till att MiniGPT-5-ramverket också inkorporerar mänskliga inmatningar för att utvärdera och bedöma modellens prestanda. Sammantaget mäts effektiviteten hos MiniGPT-5-ramverket för multimodala uppgifter med hjälp av tre perspektiv.

  1. Språk Kontinuitet : bedömer om den genererade innehållet anpassar sig till den tillhandahållna kontexten sömlöst.
  2. Bild Kvalitet : bedömer eller utvärderar relevansen och tydligheten hos den genererade bilden.
  3. Multimodal Samstämmighet : för att bestämma om den kombinerade text- och bildutmatningen är i samklang med den ursprungliga kontexten.

VIST Slutgiltig Steg Utvärdering

I den första fasen av experimenten, syftar MiniGPT-5-ramverket till att generera de motsvarande bilderna, och tabellen nedan sammanfattar resultaten som erhållits från denna inställning.

Som det kan ses, kan MiniGPT-5-ramverket i alla tre inställningarna överträffa den finjusterade SD2-ramverket, vilket belyser effektiviteten hos MiniGPT-5-pipelinen.

Figuren ovan jämför prestandan hos MiniGPT-5-ramverket med den finjusterade MiniGPT-4-ramverket på S-BERT, Rouge-L och Meteor prestandamått. Resultaten indikerar att användningen av generativa voken inte påverkar prestandan hos ramverket negativt när det gäller att utföra multimodala förståelseuppgifter. Resultaten visar också att MiniGPT-5-ramverket kan utnyttja långa horisontella multimodala inmatningsprompter över ett brett utbud av data för att generera högkvalitativa och sammanhängande bilder utan att kompromissa med den ursprungliga modellens förmåga för multimodal förståelse.

Tabellen ovan jämför prestandan hos tre ramverk på 5 000 prover för multimodal generation från aspekterna Multimodal Samstämmighet, Bild Kvalitet och Språk Kontinuitet. Som det kan observeras, överträffar MiniGPT-5-ramverket de andra två baseline-modellerna i mer än 70% av fallen. Å andra sidan visar tabellen nedan prestandan hos MiniGPT-5-ramverket på CC3M-valideringsdatasättet för generation av enstaka bilder. Tack vare datalimitationer, fann utvecklare en lucka för vokenanpassning när de användes med Stable Diffusion. Trots denna begränsning överträffar MiniGPT-5-ramverket den nuvarande state-of-the-art-baseline-modellen GILL över alla mått.

Slutsats

I denna artikel har vi talat om MiniGPT-5, en växelvis språk- och visiongenereringsalgoritmteknik som introducerar begreppet “generativa vokens” i ett försök att utnyttja förmågan hos LLM att generera multimodal data genom att anpassa den stora språkmodellen med en text till bildgenereringsmodell som är förtränad. Vi har talat om de viktigaste komponenterna och den övergripande arkitekturen hos MiniGPT-5-ramverket, tillsammans med resultaten som indikerar betydande förbättringar i prestanda och effektivitet jämfört med nuvarande baseline- och state-of-the-art-modeller. MiniGPT-5 syftar till att sätta en ny benchmark i multimodal innehålls- och datagenereringsdomänen, och syftar till att lösa de utmaningar som tidigare modeller mött när de försökte lösa samma problem.

En ingenjör till yrket, en författare av hjärtat. Kunal är en teknisk skribent med ett djupt kärlek och förståelse för AI och ML, dedikerad till att förenkla komplexa begrepp inom dessa områden genom sin engagerande och informativa dokumentation.