AI-modeller och plattformar
Styrning av bildredigering via multimodala stora språkmodeller
Visuella designverktyg och visionsmodeller har omfattande tillämpningar inom multimedia-industrin. Trots betydande framsteg under de senaste åren krävs fortfarande en solid förståelse av dessa verktyg för deras drift. För att förbättra tillgänglighet och kontroll antar multimedia-industrin alltmer textstyrda eller instruktionsbaserade bildredigeringsmetoder. Dessa metoder använder naturliga språkkommandon i stället för traditionella regionala masker eller utförliga beskrivningar, vilket möjliggör mer flexibel och kontrollerad bildmanipulation. Men instruktionsbaserade metoder ger ofta korta instruktioner som kan vara svåra för befintliga modeller att fullständigt fånga och utföra. Dessutom är diffusionsmodeller, kända för sin förmåga att skapa realistiska bilder, mycket efterfrågade inom bildredigeringssektorn.
Dessutom har Multimodala stora språkmodeller (MLLM) visat imponerande prestanda i uppgifter som involverar visuellt medveten svarsgenerering och cross-modalt förstående. MLLM-styrd bildredigering (MGIE) är en studie inspirerad av MLLM som utvärderar deras förmågor och analyserar hur de stöder redigering genom text eller guidade instruktioner. Denna metod innebär att lära sig att ge uttryckliga instruktioner och härleda uttrycksfulla instruktioner. MGIE-redigeringsmodellen förstår visuell information och utför redigering genom slut-till-slut-träning. I den här artikeln kommer vi att dyka djupt in i MGIE, utvärdera dess påverkan på global bildoptimering, Photoshop-liknande ändringar och lokal redigering. Vi kommer också att diskutera betydelsen av MGIE i instruktionsbaserade bildredigeringsuppgifter som förlitar sig på uttrycksfulla instruktioner. Låt oss börja vår utforskning.
MLLM-styrd bildredigering eller MGIE: En introduktion
Multimodala stora språkmodeller och diffusionsmodeller är två av de mest använda AI- och ML-ramverken för närvarande, tack vare deras anmärkningsvärda generativa förmågor. Å ena sidan har vi diffusionsmodeller, som är kända för att producera högkvalitativa och visuellt tilltalande bilder, medan å andra sidan har vi multimodala stora språkmodeller, som är berömda för sin exceptionella förmåga att generera en mängd olika innehåll, inklusive text, språk, tal och bilder/videor.
Diffusionsmodeller byter ut de latenta cross-modala kartorna för att utföra visuell manipulation som återspeglar ändringen av den ingående målbildtexten, och de kan också använda en guidad mask för att redigera en specifik region av bilden. Men den primära anledningen till att diffusionsmodeller används för multimedia-applikationer är att de, i stället för att förlita sig på utförliga beskrivningar eller regionala masker, använder instruktionsbaserade redigeringsmetoder som tillåter användare att uttrycka hur de vill redigera bilden direkt med hjälp av textinstruktioner eller kommandon. Vidare behöver stora språkmodeller ingen introduktion, eftersom de har visat betydande framsteg inom en mängd olika språkuppgifter, inklusive textsummering, maskinöversättning, textgenerering och svar på frågor. Stora språkmodeller tränas vanligtvis på en stor och varierad mängd träningsdata, vilket ger dem visuell kreativitet och kunskap, och möjliggör att de kan utföra flera visions-språk-uppgifter. Utbyggnaden av stora språkmodeller, MLLM eller multimodala stora språkmodeller, kan använda bilder som naturliga indata och ge lämpliga visuellt medvetna svar.
Med det sagt, även om diffusionsmodeller och MLLM-ramverk används för bildredigeringsuppgifter, finns det vissa styrningsproblem med textbaserade instruktioner som hämmar den övergripande prestandan, vilket har lett till utvecklingen av MGIE eller MLLM-styrd bildredigering, ett AI-drivet ramverk som består av en diffusionsmodell och en MLLM-modell, som visas i följande bild.
Inom MGIE-arkitekturen är diffusionsmodellen slut-till-slut-tränad för att utföra bildredigering med latent fantasi om det avsedda målet, medan MLLM-ramverket lär sig att förutsäga precisa uttrycksfulla instruktioner. Tillsammans tar diffusionsmodellen och MLLM-ramverket tillvara på den inneboende visuella härledningen, vilket möjliggör att de kan hantera tvetydiga mänskliga kommandon och resultera i realistisk redigering av bilder, som visas i följande bild.
MGIE-ramverket hämtar inspiration från två befintliga metoder: Instruktionsbaserad bildredigering och Vision Large Language Models.
Instruktionsbaserad bildredigering kan förbättra tillgängligheten och kontrollerbarheten av visuell manipulation avsevärt genom att följa mänskliga kommandon. Det finns två huvudsakliga ramverk som används för instruktionsbaserad bildredigering: GAN-ramverk och diffusionsmodeller. GAN eller Generative Adversarial Networks kan ändra bilder, men är antingen begränsade till specifika domäner eller producerar orealistiska resultat. Å andra sidan kan diffusionsmodeller med stor skala kontrollera cross-modala uppmärksamhetskartor för globala kartor för att uppnå bildredigering och transformation. Instruktionsbaserad redigering fungerar genom att ta emot raka kommandon som indata, ofta inte begränsade till regionala masker och utförliga beskrivningar. Men det finns en sannolikhet att de tillhandahållna instruktionerna är antingen tvetydiga eller inte tillräckligt precisa för att följa instruktioner för redigeringsuppgifter.
Visionsstora språkmodeller är berömda för sin textgenererande och generaliseringsförmåga över olika uppgifter, och de har ofta en robust textuell förståelse, och de kan ytterligare producera exekverbara program eller pseudokod. Denna förmåga hos stora språkmodeller möjliggör att MLLM kan uppfatta bilder och ge lämpliga svar med visuell funktionshärledning med instruktionsjustering, med senaste modeller som antar MLLM för att generera bilder relaterade till samtalet eller indata-texten. Men vad som skiljer MGIE från MLLM eller VLLM är det faktum att medan den senare kan producera bilder som skiljer sig från indata från scratch, MGIE utnyttjar MLLM:s förmåga att förbättra bildredigeringsförmågan med härledda instruktioner.
MGIE: Arkitektur och metodik
Traditionellt har stora språkmodeller använts för naturliga språkbehandlingsgenereringsuppgifter. Men sedan MLLM blev mainstream, fick LLM möjlighet att ge rimliga svar genom att uppfatta bilder. Konventionellt initieras en multimodal stor språkmodell från en förtränad LLM, och den innehåller en visuell encoder och en adapter för att extrahera visuella funktioner och projicera visuella funktioner till språkmodellitet. På grund av detta kan MLLM-ramverket uppfatta visuella indata, även om utdata fortfarande är begränsad till text.
Det föreslagna MGIE-ramverket syftar till att lösa detta problem och möjliggöra att en MLLM kan redigera en ingångsbild till en utgångsbild baserat på den givna textinstruktionen. För att uppnå detta innehåller MGIE-ramverket en MLLM och tränar för att härleda koncisa och uttrycksfulla textinstruktioner. Dessutom lägger MGIE-ramverket till specialbilder i sin arkitektur för att överbrygga gapet mellan vision och språkmodell, och antar redigeringshuvudet för transformationen av modaliteterna. Dessa modaliteter fungerar som den latenta visuella fantasin från den multimodala stora språkmodellen och guider diffusionsmodellen för att uppnå redigeringsuppgifterna. MGIE-ramverket kan sedan utföra visuell perceptionsuppgifter för rimlig bildredigering.
Koncis uttrycksfull instruktion
Traditionellt kan multimodala stora språkmodeller erbjuda visuellt relaterade svar med sin cross-modala perception tack vare instruktionsjustering och funktionshärledning. För att redigera bilder använder MGIE-ramverket en textprompt som primär språklig indata med bilden och härleder en detaljerad förklaring för redigeringskommandot. Men dessa förklaringar kan ofta vara för långa eller innehålla upprepade beskrivningar, vilket resulterar i missförstådda avsikter, vilket tvingar MGIE att använda en förtränad sammanfattare för att få koncisa berättelser, vilket möjliggör att MLLM genererar sammanfattade utdata. Ramverket behandlar den koncisa men uttrycksfulla guiden som en uttrycksfull instruktion och använder cross-entropiförlust för att träna den multimodala stora språkmodellen med lärarstyrning.
Användning av en uttrycksfull instruktion ger en mer konkret idé jämfört med textinstruktionen, eftersom den överbryggar gapet för rimlig bildredigering, vilket förbättrar ramverkets effektivitet ytterligare. Dessutom härleder MGIE-ramverket under inferensperioden koncisa uttrycksfulla instruktioner i stället för att producera långa berättelser och förlita sig på extern sammanfattning. På grund av detta kan MGIE-ramverket fånga den visuella fantasin om redigeringsavsikterna, men är fortfarande begränsat till språkmodellitet. För att övervinna detta hinder lägger MGIE-modellen till ett visst antal visuella token efter den uttrycksfulla instruktionen med tränbara ordinbäddningar, vilket möjliggör att MLLM genererar dem med hjälp av sin LM eller språkmodellshuvud.
Bildredigering med latent fantasi
I nästa steg antar MGIE-ramverket redigeringshuvudet för att transformera bildinstruktionen till faktisk visuell vägledning. Redigeringshuvudet är en sekvens-till-sekvens-modell som hjälper till att mappa de sekventiella visuella token från MLLM till meningsfulla latenta semantiskt som dess redigeringsvägledning. För att vara mer specifik kan transformationen av ordinbäddningar tolkas som en allmän representation i visuell modell, och använder en instansmedveten visuell fantasikomponent för redigeringsavsikterna. Dessutom, för att guida bildredigering med visuell fantasi, inbäddar MGIE-ramverket en latent diffusionsmodell i sin arkitektur som innehåller en variational autoencoder och hanterar brusreducering i det latenta utrymmet. Det primära målet med den latenta diffusionsmodellen är att generera det latenta målet från att bevara det latenta indata och följa redigeringsvägledningen. Diffusionsprocessen lägger till brus till det latenta målet över regelbundna tidsintervall, och brusnivån ökar med varje tidssteg.
Inlärning av MGIE
Följande figur sammanfattar algoritmen för inlärningsprocessen av det föreslagna MGIE-ramverket.
Som det kan observeras lär sig MLLM att härleda koncisa uttrycksfulla instruktioner med hjälp av instruktionsförlusten. Med den latenta fantasin från bildinstruktionerna transformerar ramverket modaliteten för redigeringshuvudet och guider den latenta diffusionsmodellen för att syntetisera den resulterande bilden och tillämpar redigeringsförlusten för diffusionsutbildning. Slutligen fryser ramverket en majoritet av viktorna, vilket resulterar i parameter-effektiv slut-till-slut-träning.
MGIE: Resultat och utvärdering
MGIE-ramverket använder IPr2Pr-databasen som sin primära förträningsdata, och den innehåller över 1 miljon CLIP-filtrerade data med instruktioner extraherade från GPT-3-modellen och en Prompt-to-Prompt-modell för att syntetisera bilderna. Dessutom behandlar MGIE-ramverket InsPix2Pix-ramverket, som bygger på CLIP-textencoder med en diffusionsmodell, som sin baslinje för instruktionsbaserad bildredigering. Dessutom tar MGIE-modellen också hänsyn till en LLM-styrd bildredigeringsmodell som antagits för uttrycksfulla instruktioner från instruktionsbara indata, men utan visuell perception.
Kvantitativ analys
Följande figur sammanfattar redigeringsresultaten i en nollskottssättning, där modellerna tränats endast på IPr2Pr-databasen. För GIER- och EVR-data som involverar Photoshop-liknande ändringar kan de uttrycksfulla instruktionerna avslöja konkreta mål i stället för tvetydiga kommandon, vilket möjliggör att redigeringsresultaten liknar redigeringsavsikterna bättre.
Även om både LGIE och MGIE tränas på samma data som InsPix2Pix-modellen, kan de erbjuda detaljerade förklaringar via inlärning med den stora språkmodellen, men LGIE är fortfarande begränsad till en enda modell. Dessutom kan MGIE-ramverket ge en betydande prestandaförbättring, eftersom det har tillgång till bilder och kan använda dessa för att härleda explicita instruktioner.
För att utvärdera prestandan på instruktionsbaserad bildredigering för specifika ändamål, finjusterar utvecklare flera modeller på varje databas, som sammanfattas i följande tabell.
Som det kan observeras, efter anpassning av Photoshop-liknande redigeringsuppgifter för EVR och GIER, visar modellerna en förbättring av prestanda. Men det är värt att notera att eftersom finjustering gör uttrycksfulla instruktioner mer domänspecifika, upplever MGIE-ramverket en betydande förbättring av prestanda, eftersom det också lär sig domänspecifik vägledning, vilket möjliggör att diffusionsmodellen visar konkrekt redigerade scener från den finjusterade stora språkmodellen, vilket gynnar både lokal modifiering och lokal optimering. Dessutom, eftersom den visuellt medvetna vägledningen är mer i linje med de avsedda redigeringsmålen, levererar MGIE-ramverket konsekvent bättre resultat jämfört med LGIE.
Följande figur visar CLIP-S-poängen över ingångs- eller grundbilderna och de uttrycksfulla instruktionerna. En högre CLIP-poäng indikerar relevansen av instruktionerna med redigeringskällan, och som det kan observeras, har MGIE en högre CLIP-poäng jämfört med LGIE-modellen över både ingångs- och utgångsbilderna.
Kvalitativa resultat
Följande bild sammanfattar den kvalitativa analysen av MGIE-ramverket.
Som vi vet är LGIE-ramverket begränsat till en enda modell på grund av att det har en enda språklig insikt och är benäget att härleda felaktiga eller irrelevanta förklaringar för att redigera bilden. Men MGIE-ramverket är multimodalt, och med tillgång till bilder, slutför det redigeringsuppgifterna och tillhandahåller explicit visuell fantasi som stämmer väl överens med målet.
Slutliga tankar
I den här artikeln har vi talat om MGIE eller MLLM-styrd bildredigering, en MLLM-inspirerad studie som syftar till att utvärdera multimodala stora språkmodeller och analysera hur de stöder redigering med hjälp av text eller guidade instruktioner, samtidigt som de lär sig att tillhandahålla explicit vägledning genom att härleda uttrycksfulla instruktioner samtidigt. MGIE-redigeringsmodellen fångar visuell information och utför redigering eller manipulation med hjälp av slut-till-slut-träning. I stället för tvetydig och kort vägledning producerar MGIE-ramverket explicit visuellt medveten vägledning som resulterar i rimlig bildredigering.












