AI-modeller og plattformer
Veiledning basert på multimodale store språkmodeller for bilde redigering eller MGIE: En introduksjon
Visuell designverktøy og språkmodeller for syn har vidstrakt anvendelse i multimediaindustrinen. Til tross for betydelige fremgang i de siste årene, er en solid forståelse av disse verktøyene fortsatt nødvendig for deres drift. For å forbedre tilgjengelighet og kontroll, har multimediaindustrinen i økende grad tatt i bruk tekstbasert eller instruksjonsbasert bilde redigeringsteknikker. Disse teknikkene bruker naturlige språk kommandoer i stedet for tradisjonelle regionale masker eller omfattende beskrivelser, og tillater mer fleksible og kontrollerte bilde manipulasjoner. Imidlertid kan instruksjonsbaserte metoder ofte gi korte instruksjoner som kan være utfordrende for eksisterende modeller å fullt ut fange og utføre. I tillegg er diffusjonsmodeller, kjent for deres evne til å skape realistiske bilder, i høy etterspørsel innen bilde redigering sektoren.
I tillegg har Multimodale store språkmodeller (MLLMs) vist imponerende ytelse i oppgaver som involverer visuell-avhengig respons generering og cross-modalt forståelse. MLLM-veiledet bilde redigering (MGIE) er en studie inspirert av MLLMs som vurderer deres evner og analyserer hvordan de støtter redigering gjennom tekst eller veiledede instruksjoner. Denne tilnærmingen innebærer å lære å gi eksplisitte instruksjoner og ålede uttrykksfulle instruksjoner. MGIE-redigeringsmodellen forstår visuell informasjon og utfører redigering eller manipulasjon gjennom end-to-end-trening. I denne artikkelen vil vi dykke dypt inn i MGIE, og vurdere dens innvirkning på global bilde optimalisering, Photoshop-liknende modifikasjoner og lokal redigering. Vi vil også diskutere betydningen av MGIE i instruksjonsbasert bilde redigering oppgaver som avhenger av uttrykksfulle instruksjoner. La oss begynne vår utforskning.
MLLM-veiledet bilde redigering eller MGIE: En introduksjon
Multimodale store språkmodeller og diffusjonsmodeller er to av de mest brukte AI- og ML-rammeverkene for tiden, på grunn av deres bemerkelsesverdige generative evner. På den ene siden har du diffusjonsmodeller, best kjent for å produsere høyt realistiske og visuelt tiltalende bilder, mens på den andre siden har du multimodale store språkmodeller, kjent for deres usedvanlige evner i å generere en rekke innhold, inkludert tekst, språk, tale og bilder/videoer.
Diffusjonsmodeller bytter ut latente cross-modale kart for å utføre visuell manipulasjon som reflekterer endringen av innputt-målet, og de kan også bruke en veiledet maske for å redigere en bestemt region av bildet. Men hovedgrunnen til at diffusjonsmodeller er så mye brukt i multimediaplikasjoner er at de, i stedet for å avhenge av omfattende beskrivelser eller regionale masker, bruker instruksjonsbasert redigeringstilnærming som tillater brukerne å uttrykke hvordan de ønsker å redigere bildet direkte ved å bruke tekstinstruksjoner eller kommandoer. Videre, store språkmodeller trenger ingen introduksjon, siden de har vist betydelige fremgang over en rekke ulike språkoppgaver, inkludert tekstsummering, maskinoversettelse, tekstgenerering og spørsmålssvar. LLMs er vanligvis trent på en stor og divers mengde treningdata som utstyrer dem med visuell kreativitet og kunnskap, og tillater dem å utføre flere visuell-språklig oppgaver. Bygget på LLMs, MLLMs eller multimodale store språkmodeller kan bruke bilder som naturlige innputt og gi passende visuelt avhengige responser.
Med det sagt, selv om diffusjonsmodeller og MLLM-rammeverk er mye brukt i bilde redigering oppgaver, finnes det noen veiledningsproblemer med tekstbaserte instruksjoner som hemmer den totale ytelsen, og resulterer i utviklingen av MGIE eller MLLM-veiledet bilde redigering, et AI-drevet rammeverk bestående av en diffusjonsmodell og en MLLM-modell, som vist i følgende bilde.
Innenfor MGIE-arkitekturen er diffusjonsmodellen trent fra ende til ende for å utføre bilde redigering med latent forestilling av det ønskede målet, mens MLLM-rammeverket lærer å forutsi nøyaktige uttrykksfulle instruksjoner. Sammen tar diffusjonsmodellen og MLLM-rammeverket i bruk den innebygde visuelle avledningen, og tillater det å håndtere tvetydige menneskelige kommandoer, og resulterer i realistisk redigering av bildene, som vist i følgende bilde.
MGIE-rammeverket trekker tung inspirasjon fra to eksisterende tilnærminger: Instruksjonsbasert bilde redigering og Visuell stor språkmodell.
Instruksjonsbasert bilde redigering kan forbedre tilgjengeligheten og kontrollen av visuell manipulasjon betydelig ved å følge menneskelige kommandoer. Det finnes to hovedrammeverk som brukes for instruksjonsbasert bilde redigering: GAN-rammeverk og diffusjonsmodeller. GAN eller Generative Adversarial Networks er i stand til å endre bilder, men er enten begrenset til bestemte domener eller produserer urealistiske resultater. På den andre siden kan diffusjonsmodeller med stor skala kontrollere cross-modale oppmerksomhetskart for å nå bilde redigering og transformasjon. Instruksjonsbasert redigering fungerer ved å motta rette kommandoer som innputt, ofte ikke begrenset til regionale masker og omfattende beskrivelser. Imidlertid finnes det en sjanse for at de gitt instruksjonene er enten tvetydige eller ikke presise nok til å følge instruksjoner for redigering oppgaver.
Visuell stor språkmodell er kjent for sin tekstgenererende og generaliserings evne over en rekke oppgaver, og den har ofte en robust tekstlig forståelse, og kan videre produsere eksekverbare programmer eller pseudokode. Denne evnen til stor språkmodell tillater MLLMs å oppfatte bilder og gi passende responser ved å bruke visuell funksjonsalignering med instruksjonsjustering, og nyere modeller som antar MLLMs for å generere bilder relatert til samtalen eller innputt-teksten. Imidlertid, hva som skiller MGIE fra MLLMs eller VLLMs er det faktum at, mens den sistnevnte kan produsere bilder forskjellige fra innputt fra scratch, MGIE utnytter evnene til MLLMs for å forbedre bilde redigering evnene med avledede instruksjoner.
MGIE: Arkitektur og metode
Tradisjonelt har store språkmodeller blitt brukt for naturlig språkbehandling genererende oppgaver. Men siden MLLMs ble mainstream, ble LLMs utstyrt med evnen til å gi rimelige responser ved å oppfatte bilder. Konvensjonelt blir en multimodal stor språkmodell initialisert fra en forhåndstrening LLM, og den inneholder en visuell encoder og en adapter for å trekke ut visuelle funksjoner, og prosjektere visuelle funksjoner inn i språklig modus. På grunn av dette er MLLM-rammeverket i stand til å oppfatte visuelle innputt, selv om utgangen fortsatt er begrenset til tekst.
Det foreslåtte MGIE-rammeverket har til hensikt å løse dette problemet, og å muliggjøre en MLLM for å redigere et innputt-bilde til et utgangsbilde basert på de gitt tekstlige instruksjoner. For å oppnå dette, inneholder MGIE-rammeverket en MLLM og trener for å avlede konsise og eksplisitte uttrykksfulle tekstinstruksjoner. Videre legger MGIE-rammeverket til spesielle bilde-token i sin arkitektur for å brokke gapet mellom visuell og språklig modus, og antar editthodet for transformasjon av modalitetene. Disse modalitetene tjener som den latente visuelle forestillingen fra den multimodale store språkmodellen, og veileder diffusjonsmodellen for å oppnå redigering oppgavene. MGIE-rammeverket er deretter i stand til å utføre visuell persepsjon oppgaver for rimelig bilde redigering.
Konsis uttrykksfull instruksjon
Tradisjonelt kan multimodale store språkmodeller gi visuell-relaterte responser med sin cross-modale persepsjon på grunn av instruksjonsjustering og funksjonsalignering. For å redigere bilder, bruker MGIE-rammeverket en tekstlig prompt som primær språklig innputt sammen med bildet, og avler en detaljert forklaring for redigeringskommandoen. Imidlertid kan disse forklaringene ofte være for lange eller inneholde repetitive beskrivelser, og resultere i misforståtte intensjoner, og tvinger MGIE til å bruke en forhåndstrening summeringsverktøy for å få konsise fortellinger, og tillater MLLM å generere summeringsutgang. Rammeverket behandler den konsise, men eksplisitte veiledningen som en uttrykksfull instruksjon, og bruker cross-entropi tap for å trene den multimodale store språkmodellen ved å bruke lærer-enforcing.
Bruken av en uttrykksfull instruksjon gir en mer konkrete idé sammenlignet med tekstinstruksjonen, og brokker gapet for rimelig bilde redigering, og forbedrer effektiviteten til rammeverket ytterligere. Videre, under inferensperioden, avler MGIE-rammeverket konsise uttrykksfulle instruksjoner i stedet for å produsere lange fortellinger og å avhenge av ekstern summering. På grunn av dette er MGIE-rammeverket i stand til å få tak i den visuelle forestillingen av redigeringsintensjonene, men er fortsatt begrenset til språklig modus. For å overvinne denne hindringen, legger MGIE-modellen til et bestemt antall visuelle token etter den uttrykksfulle instruksjonen med treningable ord-embeddings, og tillater MLLM å generere dem ved å bruke sin LM eller språkmodellhode.
Bilde redigering med latent forestilling
I neste trinn, antar MGIE-rammeverket editthodet for å transformere bildeinstruksjonen til faktisk visuell veiledning. Editthodet er en sekvens-til-sekvens modell som hjelper med å kartlegge sekvensielle visuelle token fra MLLM til meningsfulle latente semantisk som redigeringsveiledning. For å være mer spesifik, kan transformasjonen over ord-embeddings tolkes som en generell representasjon i visuell modus, og bruker en instans-bevisst visuell forestilling komponent for redigeringsintensjonene. Videre, for å veilede bilde redigering med visuell forestilling, innlemmer MGIE-rammeverket en latent diffusjonsmodell i sin arkitektur som inkluderer en variasjonsautoencoder og addreser den støyende diffusjonen i latent rommet. Hovedmålet med den latente diffusjonsmodellen er å generere den latente målet fra å bevare den latente innputt og følge redigeringsveiledningen. Diffusjonsprosessen legger til støy til den latente målet over regulære tidsintervaller, og støynivået øker med hver tidssteg.
Læring av MGIE
Følgende figur summerer algoritmen for læring prosessen av det foreslåtte MGIE-rammeverket.
Som det kan observeres, lærer MLLM å avlede konsise uttrykksfulle instruksjoner ved å bruke instruksjons tap. Ved å bruke den latente forestillingen fra innputt-bildeinstruksjonene, transformerer rammeverket modaliteten til editthodet, og veileder den latente diffusjonsmodellen for å syntetisere det resulterende bildet, og bruker redigerings tap for diffusjonstrening. Til slutt, fryser rammeverket en majoritet av vektene, og resulterer i parameter-effektiv end-to-end-trening.
MGIE: Resultater og evaluering
MGIE-rammeverket bruker IPr2Pr-datasettet som sin primære forhåndstrening data, og det inneholder over 1 million CLIP-filtrerte data med instruksjoner ekstrahert fra GPT-3-modellen, og en Prompt-til-Prompt-modell for å syntetisere bildene. Videre, behandler MGIE-rammeverket InsPix2Pix-rammeverket bygget på CLIP-tekst-encoder med en diffusjonsmodell som sin baseline for instruksjonsbasert bilde redigering oppgaver. Videre, tar MGIE-modellen også i betraktning en LLM-veiledet bilde redigering modell antatt for uttrykksfulle instruksjoner fra instruksjonskun innputt, men uten visuell persepsjon.
Kvantitativ analyse
Følgende figur summerer redigeringsresultatene i en null-skudd-innstillingssetting med modellene som er trent bare på IPr2Pr-datasettet. For GIER og EVR-data som involverer Photoshop-liknende modifikasjoner, kan uttrykksfulle instruksjoner avsløre konkrete mål i stedet for tvetydige kommandoer, og tillater redigeringsresultatene å ligne redigeringsintensjonene bedre.
Selv om både LGIE og MGIE er trent på samme data som InsPix2Pix-modellen, kan de tilby detaljerte forklaringer ved å lære med den store språkmodellen, men likevel er LGIE begrenset til en enkelt modus. Videre, kan MGIE-rammeverket gi en betydelig ytelsesforbedring, ettersom det har tilgang til bilder, og kan bruke disse bildene for å avlede eksplisitte instruksjoner.
For å evaluere ytelsen på instruksjonsbasert bilde redigering oppgaver for bestemte formål, finjusterer utviklere flere modeller på hver datasett, som summeres i følgende tabell.
Som det kan observeres, etter å ha tilpasset Photoshop-liknende redigering oppgaver for EVR og GIER, demonstrerer modellene en forbedring i ytelse. Imidlertid er det verdt å merke seg at, siden finjustering gjør uttrykksfulle instruksjoner mer domenespesifikke også, er MGIE-rammeverket vitne til en massiv forbedring i ytelse, ettersom det også lærer domene-relatert veiledning, og tillater diffusjonsmodellen å demonstrere konkrete redigerte scener fra den finjusterte store språkmodellen, og nyter både lokal modifikasjon og lokal optimalisering. Videre, siden visuelt avhengig veiledning er mer i samsvar med de ønskede redigeringsmålene, leverer MGIE-rammeverket konsekvent bedre resultater sammenlignet med LGIE.
Følgende figur demonstrerer CLIP-S-poenget over innputt- eller grunntruth-bilder og uttrykksfulle instruksjoner. Et høyere CLIP-poeng indikerer relevansen av instruksjonene med redigeringskilden, og som det kan observeres, har MGIE et høyere CLIP-poeng sammenlignet med LGIE-modellen over både innputt- og utgangsbilder.
Kvalitative resultater
Følgende bilde summerer den kvalitative analysen av MGIE-rammeverket.
Som vi vet, er LGIE-rammeverket begrenset til en enkelt modus på grunn av at det har en enkelt språkbasert innsikt, og er utsatt for å avlede feil eller irrelevante forklaringer for å redigere bildet. Imidlertid er MGIE-rammeverket multimodalt, og med tilgang til bilder, fullfører det redigering oppgavene, og gir eksplisitte visuelle forestillinger som ligner målet veldig godt.
Slutt tanker
I denne artikkelen har vi talt om MGIE eller MLLM-veiledet bilde redigering, en MLLM-inspirert studie som har til hensikt å evaluere multimodale store språkmodeller og analysere hvordan de støtter redigering ved å bruke tekst eller veiledede instruksjoner, samtidig som det lærer å gi eksplisitte instruksjoner og å avlede uttrykksfulle instruksjoner samtidig. MGIE-redigeringsmodellen fanger visuell informasjon og utfører redigering eller manipulasjon ved å bruke end-to-end-trening. I stedet for tvetydig og kort veiledning, produserer MGIE-rammeverket eksplisitte visuelt avhengige instruksjoner som resulterer i rimelig bilde redigering.












