AI-modeller og platforme

Vejledning af billedredigering via multimodale store sprogmodeller

mm
Føj Unite.AI til dine foretrukne kilder på Google

Visuelle designværktøjer og vision sprogmodeller har bred anvendelse i multimedieindustrien. Trods betydelige fremskridt i de seneste år, er en solid forståelse af disse værktøjer stadig nødvendig for deres drift. For at forbedre tilgængelighed og kontrol, adopterer multimedieindustrien i stigende grad tekstvejledede eller instruktionsbaserede billedredigeringsteknikker. Disse teknikker anvender naturlige sprogkommandoer i stedet for traditionelle regionale masker eller udførlige beskrivelser, hvilket muliggør mere fleksible og kontrollerede billedmanipulationer. Imidlertid kan instruktionsbaserede metoder ofte give korte retningslinjer, der kan være svære for eksisterende modeller at fuldt ud fange og udføre. Derudover er diffusionsmodeller, kendt for deres evne til at skabe realistiske billeder, i høj efterspørgsel inden for billedredigeringssktoren.

Desuden Multimodale store sprogmodeller (MLLMs) har vist imponerende præstationer i opgaver, der involverer visuelt bevidst responsgeneration og cross-modalt forståelse. MLLM-vejledning af billedredigering (MGIE) er en studie inspireret af MLLMs, der vurderer deres evner og analyserer, hvordan de understøtter redigering gennem tekst eller vejledning. Denne tilgang indebærer at lære at give eksplicit vejledning og at aflede udtryksfulde instruktioner. MGIE-redigeringsmodellen forstår visuel information og udfører redigering gennem end-to-end-træning. I denne artikel vil vi dykke dybt ind i MGIE, vurderer dets impact på global billedoptimering, Photoshop-lignende ændringer og lokal redigering. Vi vil også diskutere betydningen af MGIE i instruktionsbaserede billedredigeringssopgaver, der afhænger af udtryksfulde instruktioner. Lad os begynde vores udforskning.

MLLM-vejledning af billedredigering eller MGIE: En introduktion

Multimodale store sprogmodeller og diffusionsmodeller er to af de mest anvendte AI- og ML-rammer i øjeblikket på grund af deres bemærkelsesværdige generative egenskaber. På den ene side har du diffusionsmodeller, der er bedst kendt for at producere højrealistiske og visuelt tiltalende billeder, mens på den anden side har du multimodale store sprogmodeller, der er berømte for deres exceptionelle evne til at generere en bred vifte af indhold, herunder tekst, sprog, tale og billeder/videoer.

Diffusionsmodeller udveksler de latente cross-modale kort for at udføre visuel manipulation, der afspejler ændringen af den indledende målbeskrivelse, og de kan også anvende en vejledende maske til at redigere et bestemt område af billedet. Men den primære grund til, at diffusionsmodeller er bredt anvendt i multimedieapplikationer, er, at de i stedet for at afhænge af udførlige beskrivelser eller regionale masker anvender instruktionsbaserede redigeringstilgange, der tillader brugere at udtrykke, hvordan de vil redigere billedet direkte ved hjælp af tekstinstruktioner eller kommandoer. Fremover har store sprogmodeller ikke brug for introduktion, da de har demonstreret betydelige fremskridt på tværs af en række forskellige sprogopgaver, herunder tekstsummering, maskinoversættelse, tekstgenerering og besvarelse af spørgsmål. LLM’er er typisk trænet på en stor og divers måde af træningsdata, der udstyrer dem med visuel kreativitet og viden, hvilket tillader dem at udføre flere vision-sprogopgaver.

Med det sagt, selvom diffusionsmodeller og MLLM-rammer er bredt anvendt til billedredigeringssopgaver, findes der nogle vejledningsproblemer med tekstbaserede instruktioner, der hæmmer den samlede præstation, hvilket resulterer i udviklingen af MGIE eller MLLM-vejledning af billedredigering, et AI-drevet ramme, der består af en diffusionsmodel og en MLLM-model, som vist i følgende billed.

Inden for MGIE-arkitekturen er diffusionsmodellen end-to-end trænet til at udføre billedredigering med latent imagination af det ønskede mål, mens MLLM-rammen lærer at forudsige præcise udtryksfulde instruktioner. Sammen tager diffusionsmodellen og MLLM-rammen udnyttelse af den indre visuelle afledning, der tillader den at adresse tvetydige menneskelige kommandoer, hvilket resulterer i realistisk redigering af billeder, som vist i følgende billed.

MGIE-rammen henter inspiration fra to eksisterende tilgange: Instruktionsbaseret billedredigering og Vision Large Language Models.

Instruktionsbaseret billedredigering kan forbedre tilgængeligheden og kontrollen over visuel manipulation betydeligt ved at følge menneskelige kommandoer. Der findes to primære rammer, der anvendes til instruktionsbaseret billedredigering: GAN-rammer og diffusionsmodeller. GAN eller Generative Adversarial Networks er i stand til at ændre billeder, men er enten begrænset til bestemte domæner eller producerer urealistiske resultater. På den anden side kan diffusionsmodeller med stor skala træning kontrollere de cross-modale opmærksomheds-kort for globale kort til at opnå billedredigering og transformation. Instruktionsbaseret redigering fungerer ved at modtage direkte kommandoer som input, ofte ikke begrænset til regionale masker og udførlige beskrivelser. Imidlertid findes der en sandsynlighed for, at de givne instruktioner er enten tvetydige eller ikke præcise nok til at følge instruktioner for redigeringssopgaver.

Vision Large Language Models er berømte for deres tekstgenererings- og generaliseringskapaciteter på tværs af forskellige opgaver og har ofte en robust tekstforståelse og kan yderligere producere eksekverbare programmer eller pseudokode. Denne kapacitet hos store sprogmodeller tillader MLLM’er at opfatte billeder og give passende visuelt bevidste svar ved hjælp af visuel funktionssammenligning med instruktionsjustering, og nyere modeller adopterer MLLM’er til at generere billeder relateret til chat eller inputtekst. Imidlertid er det, der adskiller MGIE fra MLLM’er eller VLLM’er, det faktum, at hvor sidstnævnte kan producere billeder, der er forskellige fra input fra scratch, MGIE udnytter MLLM’er til at forbedre billedredigeringsevner med afledte instruktioner.

MGIE: Arkitektur og metode

Traditionelt har store sprogmodeller været anvendt til naturlig sprogbehandling og genereringsopgaver. Men efter at MLLM’er blev mainstream, blev LLM’er udstyret med evnen til at give rimelige svar ved at opfatte billeder som input. Konventionelt initialiseres en multimodal stor sprogmodel fra en fortrænet LLM og indeholder en visuel encoder og en adapter til at trække visuelle funktioner og projicere visuelle funktioner ind i sprogmodus henholdsvis. Takket være dette er MLLM-rammen i stand til at opfatte visuelle input, selvom outputtet stadig er begrænset til tekst.

Den foreslåede MGIE-ramme sigter mod at løse dette problem og faciliterer en MLLM til at redigere et inputbillede til et outputbillede på basis af den givne tekstuelle instruktion. For at opnå dette indeholder MGIE-rammen en MLLM og trænes til at aflede koncise og udtryksfulde tekstinstruktioner. Yderligere tilføjer MGIE-rammen særlige billedtoken i sin arkitektur for at brokke gabets mellem vision og sprogmodus og adopterer edit-hovedet til transformation af modaliteterne. Disse modaliteter fungerer som den latente visuelle imagination fra den multimodale store sprogmodel og guider diffusionsmodellen til at opnå redigeringssopgaverne. MGIE-rammen er herefter i stand til at udføre visuelle perceptionssopgaver til rimelig billedredigering.

Koncise udtryksfuld instruktion

Traditionelt kan multimodale store sprogmodeller tilbyde visuelt relaterede svar med deres cross-modale perception takket være instruktionsjustering og funktionssammenligning. Til billedredigering anvender MGIE-rammen en tekstprompt som primær sproginput med billedet og afleder en detaljeret forklaring for redigeringskommandoen. Imidlertid kan disse forklaringer ofte være for lange eller indeholde gentagne beskrivelser, hvilket resulterer i misforståede intentioner, hvilket tvinger MGIE til at anvende en fortrænet sammenfatter til at opnå koncise fortællinger, hvilket tillader MLLM’en at generere sammenfattede output. Rammen behandler den koncise, men udtryksfulde vejledning som en udtryksfuld instruktion og anvender cross-entropi-tab til at træne den multimodale store sprogmodel ved hjælp af lærer-gennemføring.

At anvende en udtryksfuld instruktion giver en mere koncret idé sammenlignet med tekstinstruktionen, da den brokker gabets mellem rimelig billedredigering, hvilket forbedrer rammeffektiviteten yderligere. Yderligere afleder MGIE-rammen under inferensperioden koncise udtryksfulde instruktioner i stedet for at producere lange fortællinger og afhænge af ekstern sammenfattelse. Takket være dette er MGIE-rammen i stand til at opnå den visuelle imagination af redigeringsintentionerne, men er stadig begrænset til sprogmodus. For at overvinde denne hindring tilføjer MGIE-modellen en bestemt antal visuelle token efter den udtryksfulde instruktion med trænbar ord-embedding, hvilket tillader MLLM’en at generere dem ved hjælp af dens LM eller sprogmodel-hoved.

Billedredigering med latent imagination

I det næste trin anvender MGIE-rammen edit-hovedet til at transformere billedinstruktionen til faktisk visuel vejledning. Edit-hovedet er en sekvens-til-sekvens-model, der hjælper med at kortlægge de sekventielle visuelle token fra MLLM’en til meningsfulde latente semantiske som dens redigeringsvejledning. For at være mere specifik kan transformationen over ord-embeddings fortolkes som en generel repræsentation i visuel modus og anvender en instansbevidst visuel imagination-komponent til redigeringsintentionerne. Yderligere til at guide billedredigering med visuel imagination indeholder MGIE-rammen en latent diffusionsmodel i sin arkitektur, der inkluderer en variational autoencoder og adresse den støjende diffusion i den latente rum. Det primære mål for den latente diffusionsmodel er at generere den latente mål fra at bevare den latente input og følge redigeringsvejledningen. Diffusionsprocessen tilføjer støj til den latente mål over regelmæssige tidsintervaller, og støjeniveauet øges med hver tidssteg.

Læring af MGIE

Følgende figur summerer algoritmen for læringssprocessen af den foreslåede MGIE-ramme.

Som det kan observeres, lærer MLLM’en at aflede koncise udtryksfulde instruktioner ved hjælp af instruktions-tab. Ved hjælp af den latente imagination fra billedinstruktionerne transformerer rammen modaliteten af edit-hovedet og guider den latente diffusionsmodel til at syntetisere det resulterende billede og anvender redigerings-tab til diffusions-træning. Til sidst fryser rammen en majoritet af vægtene, hvilket resulterer i parameter-effektiv end-to-end-træning.

MGIE: Resultater og evaluering

MGIE-rammen anvender IPr2Pr-datasættet som sin primære fortræningsdata og indeholder over 1 million CLIP-filtrerede data med instruktioner, der er afledt fra GPT-3-modellen, og en Prompt-to-Prompt-model til at syntetisere billederne. Yderligere behandler MGIE-rammen InsPix2Pix-rammen, der er bygget på CLIP-tekst-encoderen med en diffusionsmodel, som sin baseline for instruktionsbaseret billedredigering. Yderligere tager MGIE-modellen også i betragtning en LLM-vejledt billedredigering-model, der er adopteret til udtryksfulde instruktioner fra instruktionskun-input, men uden visuel perception.

Kvantitativ analyse

Følgende figur summerer redigeringsresultaterne i en zero-shot-indstilling, hvor modellerne er trænet kun på IPr2Pr-datasættet. For GIER- og EVR-data, der involverer Photoshop-lignende ændringer, kan de udtryksfulde instruktioner afsløre konkrete mål i stedet for tvetydige kommandoer, hvilket tillader redigeringsresultaterne at ligne redigeringsintentionerne bedre.

Selvom både LGIE og MGIE er trænet på samme data som InsPix2Pix-modellen, kan de tilbyde detaljerede forklaringer via læring med den store sprogmodel, men LGIE er stadig begrænset til en enkelt modus. Yderligere kan MGIE-rammen give en betydelig præstationsforbedring, da den har adgang til billeder og kan anvende disse billeder til at aflede eksplicitte instruktioner.

For at evaluere præstationen på instruktionsbaseret billedredigering for bestemte formål, finjusterer udviklere flere modeller på hver datasæt, som summeret i følgende tabel.

Som det kan observeres, efter at have tilpasset Photoshop-lignende redigeringssopgaver til EVR og GIER, demonstrerer modellerne en forbedring af præstationen. Imidlertid er det værd at bemærke, at da finjustering gør udtryksfulde instruktioner mere domænespecifikke, oplever MGIE-rammen en massiv forbedring af præstationen, da den også lærer domæne-relateret vejledning, hvilket tillader diffusionsmodellen at demonstrere konkrete redigerede scener fra den finjusterede store sprogmodel, hvilket gavner både lokal modificering og lokal optimering. Yderligere, da den visuelt bevidste vejledning er mere aligneret med de ønskede redigeringsmål, leverer MGIE-rammen konsekvent bedre resultater sammenlignet med LGIE.

Følgende figur demonstrerer CLIP-S-scoren på tværs af input eller grundsandsgoal-billeder og udtryksfulde instruktioner. En højere CLIP-score indikerer relevansen af instruktionerne med redigeringskilden, og som det kan observeres, har MGIE en højere CLIP-score sammenlignet med LGIE-modellen på tværs af både input- og output-billeder.

Kvalitativ resultater

Følgende billed summerer den kvalitative analyse af MGIE-rammen.

Som vi ved, er LGIE-rammen begrænset til en enkelt modus på grund af, at den har en enkelt sprog-baseret indsigt, og er tilbøjelig til at aflede forkerte eller irrelevante forklaringer for billedredigering. Imidlertid er MGIE-rammen multimodal, og med adgang til billeder, gennemfører den redigeringssopgaverne og giver eksplicit visuel imagination, der aligner med målet rigtigt godt.

Endelige tanker

I denne artikel har vi talt om MGIE eller MLLM-vejledning af billedredigering, en MLLM-inspireret studie, der sigter mod at evaluere multimodale store sprogmodeller og analysere, hvordan de faciliterer redigering ved hjælp af tekst eller vejledning, mens de lærer at give eksplicit vejledning ved at aflede udtryksfulde instruktioner samtidigt. MGIE-redigeringsmodellen fanger visuel information og udfører redigering eller manipulation ved hjælp af end-to-end-træning. I stedet for tvetydig og kort vejledning producerer MGIE-rammen eksplicit visuelt bevidste instruktioner, der resulterer i rimelig billedredigering.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.