AI-modeller og plattformer

Selv-oppmerksomhetsveiledning: Forbedring av prøve kvalitet i diffusjonsmodeller

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Støyningsdiffusjonsmodeller er generative AI-rammer som syntetiserer bilder fra støy gjennom en iterativ støyningsprosess. De feires for sine eksepsjonelle bildegenereringsmuligheter og mangfold, som i stor grad tilskrives tekst- eller klassifikasjonsbasert veiledning, inkludert klassifikatorveiledning og klassifikatorfri veiledning. Disse modellene har vært bemerkelsesverdig suksessfulle i å lage mangfoldige, høykvalitetsbilder. Nyere studier har vist at veiledningsteknikker som klassifikasjonsbeskrivelser og -etiketter spiller en avgjørende rolle i å forbedre kvaliteten på bildene disse modellene genererer.

Likevel møter diffusjonsmodeller og veiledningsmetoder begrensninger under visse eksterne betingelser. Klassifikatorfri veiledningsmetoden (CFG), som bruker etikettutslipp, legger til kompleksitet til treningprosessen, mens klassifikatorveiledningsmetoden (CG) krever ekstra klassifikator-trening. Begge metoder er noe begrenset av deres avhengighet av hardt-erhvervede eksterne betingelser, som begrenser deres potensiale og begrenser dem til betingede innstillinger.

For å møte disse begrensningene har utviklere formulert en mer generell tilnærming til diffusjonsveiledning, kjent som Selv-oppmerksomhetsveiledning (SAG). Denne metoden utnytter informasjon fra mellomliggende prøver av diffusjonsmodeller for å generere bilder. Vi vil utforske SAG i denne artikkelen, diskutere dens funksjoner, metode og resultater sammenlignet med nåværende state-of-the-art-rammer og -pipeliner.

Selv-oppmerksomhetsveiledning: Forbedring av prøve kvalitet i diffusjonsmodeller

Støyningsdiffusjonsmodeller (DDM) har fått popularitet for sin evne til å lage bilder fra støy via en iterativ støyningsprosess. Bildesyntesekapasiteten til disse modellene skyldes i stor grad de anvendte diffusjonsveiledningsmetodene. Til tross for deres styrker, møter diffusjonsmodeller og veiledningsbaserte metoder utfordringer som tilleggskompleksitet og økte beregningskostnader.

For å overvinne de nåværende begrensningene, har utviklere introdusert Selv-oppmerksomhetsveiledningsmetoden, en mer generell formulering av diffusjonsveiledning som ikke avhenger av eksterne informasjon fra diffusjonsveiledning, og dermed muliggjør en betingselsesfri og fleksibel tilnærming til å veilede diffusjonsrammer. Tilnærmingen valgt av Selv-oppmerksomhetsveiledning hjelper til å forbedre anvendeligheten av tradisjonelle diffusjonsveiledningsmetoder til tilfeller med eller uten eksterne krav. 

Selv-oppmerksomhetsveiledning er basert på den enkle prinsippet om generell formulering, og antagelsen at intern informasjon innholdt i mellomliggende prøver kan tjene som veiledning også. På bakgrunn av dette prinsippet, introduserer SAG-metoden først Uskarpguidance, en enkel og rett frem løsning for å forbedre prøvekvalitet. Uskarpguidance har som mål å utnytte de gode egenskapene til Gaussisk uskarpe for å fjerne fin-skala detaljer naturlig ved å veilede mellomliggende prøver ved hjelp av informasjonen som er fjernet som et resultat av Gaussisk uskarpe. Selv om Uskarpguidance-metoden forbedrer prøvekvaliteten med en moderat veiledningsskala, klarer den ikke å gjenta resultatene på en stor veiledningsskala, da den ofte introduserer strukturell tvetydighet i hele regioner. Som et resultat, har Uskarpguidance-metoden vanskelig for å alignere den opprinnelige inndata med forutsagnet av den degraderte inndata. For å forbedre stabiliteten og effektiviteten til Uskarpguidance-metoden på en større veiledningsskala, forsøker Selv-oppmerksomhetsveiledning å utnytte selv-oppmerksomhetsmekanismen til diffusjonsmodellene, da moderne diffusjonsmodeller allerede inneholder en selv-oppmerksomhetsmekanisme i sin arkitektur. 

Med antagelsen at selv-oppmerksomhet er essensiell for å fange saliente informasjon i sin kjerne, bruker Selv-oppmerksomhetsveiledningsmetoden selv-oppmerksomhetskart av diffusjonsmodellene for å adversativt uskarpe regioner som inneholder salient informasjon, og i prosessen, veilede diffusjonsmodellene med nødvendig restinformasjon. Metoden utnytter deretter oppmerksomhetskartene under diffusjonsmodellenes reversprosess for å forbedre kvaliteten på bildene og bruker selv-betingelse for å redusere artefakter uten å kreve ekstra trening eller eksterne informasjon. 

For å sammenfatte, Selv-oppmerksomhetsveiledningsmetoden

  1. Er en ny tilnærming som bruker interne selv-oppmerksomhetskart av diffusjonsrammer for å forbedre generert prøvebildekvalitet uten å kreve noen ekstra trening eller avhengighet av eksterne betingelser. 
  2. SAG-metoden forsøker å generalisere betingede veiledningsmetoder til en betingselsesfri metode som kan integreres med enhver diffusjonsmodell uten å kreve ekstra ressurser eller eksterne betingelser, og dermed forbedre anvendeligheten av veiledningsbaserte rammer. 
  3. SAG-metoden forsøker også å demonstrere sine ortogonale evner til eksisterende betingede metoder og rammer, og dermed muliggjør en forbedring av ytelse ved å muliggjøre en fleksibel integrasjon med andre metoder og modeller. 

Videre, Selv-oppmerksomhetsveiledningsmetoden lærer fra funnene i relaterte rammer, inkludert Støyningsdiffusjonsmodeller, Sampling Guidance, Generative AI Selv-oppmerksomhetsmetoder og Diffusjonsmodellenes interne representasjoner. Likevel, på sitt kjerne, implementerer Selv-oppmerksomhetsveiledningsmetoden lærdommene fra DDPM eller Støyningsdiffusjonsprobabilistiske modeller, Klassifikatorveiledning, Klassifikatorfri veiledning og Selv-oppmerksomhet i Diffusjonsrammer. Vi vil diskutere disse i dybden i den kommende seksjonen. 

Selv-oppmerksomhetsveiledning: Preliminærer, Metodologi og Arkitektur

Støyningsdiffusjonsprobabilistisk Modell eller DDPM

DDPM eller Støyningsdiffusjonsprobabilistisk Modell er en modell som bruker en iterativ støyningsprosess for å gjenopprette et bilde fra hvit støy. Tradisjonelt, mottar en DDPM-modell en inndata og en varianseplan på et tidspunkt for å få bildet ved hjelp av en fremoverprosess kjent som Markov-prosessen. 

Klassifikator og Klassifikatorfri Veiledning med GAN-Implementering

GAN eller Generative Adversarial Networks besitter en unik handel med mangfold for trofasthet, og for å bringe denne evnen til diffusjonsmodeller, foreslår Selv-oppmerksomhetsveiledningsrammen å bruke en klassifikatorveiledningsmetode som bruker en ekstra klassifikator. Omvendt, kan en klassifikatorfri veiledningsmetode også implementeres uten å bruke en ekstra klassifikator for å oppnå samme resultater. Selv om metoden leverer de ønskede resultater, er den likevel ikke komputasjonelt viable, da den krever ekstra etiketter og begrenser rammen til betingede diffusjonsmodeller som krever ekstra betingelser som tekst eller klasse, samt ekstra treningdetaljer som legger til kompleksiteten til modellen. 

Generalisering av Diffusjonsveiledning

Selv om Klassifikator og Klassifikatorfri Veiledningsmetoder leverer de ønskede resultater og hjelper med betinget generering i diffusjonsmodeller, er de avhengige av ekstra inndata. For enhver gitt tidspunkt, består inndata for en diffusjonsmodell av en generalisert betingelse og en forstyrret prøve uten den generaliserte betingelsen. Videre, omfatter den generaliserte betingelsen intern informasjon innenfor den forstyrrede prøven eller en ekstern betingelse, eller begge. Den resulterende veiledningen formuleres med hjelp av en imaginær regressor med antagelsen at den kan forutsi den generaliserte betingelsen. 

Forbedring av Bildekvalitet ved hjelp av Selv-oppmerksomhetskart

Den generaliserte diffusjonsveiledningen antyder at det er mulig å gi veiledning til den reversprosessen i diffusjonsmodeller ved å trekke ut salient informasjon i den generaliserte betingelsen innholdt i den forstyrrede prøven. Bygget på dette, fanger Selv-oppmerksomhetsveiledningsmetoden salient informasjon for reversprosesser effektivt, samtidig som den begrenser risikoene som oppstår som et resultat av ut-av-distribusjonsproblemer i forhånds-trent diffusjonsmodeller. 

Uskarpguidance

Uskarpguidance i Selv-oppmerksomhetsveiledning er basert på Gaussisk uskarpe, en lineær filtermetode hvor inndata-signalet konvolveres med en Gaussisk filter for å generere en utdata. Med en økning i standardavvik, reduserer Gaussisk uskarpe de fin-skala detaljene innenfor inndata-signalet, og resulterer i lokalt u skillet inndata-signaler ved å glatte dem mot en konstant. Videre, har eksperimenter indikert en informasjonsubalanse mellom inndata-signalet og Gaussisk uskarpe-utdatasignalet, hvor utdatasignalet inneholder mer fin-skala informasjon. 

På bakgrunn av dette lærdommet, introduserer Selv-oppmerksomhetsveiledningsrammen Uskarpguidance, en teknikk som bevisst utelater informasjon fra mellomliggende rekonstruksjoner under diffusjonsprosessen, og i stedet, bruker denne informasjonen for å veilede sine forutsagn mot å øke relevansen av bilder til inndata-informasjonen. Uskarpguidance forårsaker essensielt at den opprinnelige forutsagnet avviker mer fra den uskarpede inndata-forutsagnet. Videre, forhindrer den gode egenskapen i Gaussisk uskarpe at utdatasignalet avviker betydelig fra det opprinnelige signalet med en moderat avvik. Enkelt sagt, skjer uskarpning i bildene naturlig, noe som gjør Gaussisk uskarpe til en mer egnet metode å anvende på forhånds-trent diffusjonsmodeller. 

I Selv-oppmerksomhetsveiledningspipelinen, blurres inndata-signalet først ved hjelp av en Gaussisk filter, og deretter diffuseres det med ekstra støy for å produsere utdatasignalet. Ved å gjøre dette, mildner SAG-pipelinen den resulterende uskarpens sideeffekt som reduserer Gaussisk støy, og gjør veiledningen avhengig av innhold i stedet for å være avhengig av tilfeldig støy. Selv om Uskarpguidance leverer tilfredsstillende resultater på rammer med moderat veiledningsskala, klarer den ikke å gjenta resultatene på eksisterende modeller med en stor veiledningsskala, da den ofte blir utsatt for å produsere støyende resultater, som vist i følgende bilde. 

Disse resultatene kan være et resultat av den strukturelle tvetydigheten introdusert i rammen av global uskarpe, som gjør det vanskelig for SAG-pipelinen å alignere forutsagnet av den opprinnelige inndata med den degraderte inndata, resulterende i støyende utganger. 

Selv-oppmerksomhetsmekanisme

Som nevnt tidligere, har diffusjonsmodeller vanligvis en innebygd selv-oppmerksomhetskomponent, og det er en av de viktigste komponentene i en diffusjonsmodellramme. Selv-oppmerksomhetsmekanismen implementeres i kjernen av diffusjonsmodellene, og det tillater modellen å fokusere på de saliente delene av inndata under den generative prosessen, som vist i følgende bilde med høyfrekvensmasker i toppraden og selv-oppmerksomhetsmasker i bunnen av de endelig genererte bildene. 

Den foreslåtte Selv-oppmerksomhetsveiledningsmetoden bygger på samme prinsipp, og utnytter evnene til selv-oppmerksomhetskart i diffusjonsmodeller. Overordnet, blurres selv-oppmerksomhetsprøver i inndata-signalet eller, enkelt sagt, skjules informasjonen om prøver som blir oppmerksomt av diffusjonsmodellene. Videre, inneholder utdatasignalet i Selv-oppmerksomhetsveiledning intakte regioner av inndata-signalet, noe som betyr at det ikke resulterer i strukturell tvetydighet av inndata, og løser problemet med global uskarpe. Pipelinen får deretter de aggregerte selv-oppmerksomhetskartene ved å utføre GAP eller Global Average Pooling for å aggregere selv-oppmerksomhetskart til dimensjonen, og oppsamples til nærmeste nabo for å matche oppløsningen av inndata-signalet. 

Selv-oppmerksomhetsveiledning: Eksperimenter og Resultater

For å evaluere dens ytelse, blir Selv-oppmerksomhetsveiledningspipelinen samplet ved hjelp av 8 Nvidia GeForce RTX 3090 GPUs, og bygges på forhånds-trent IDDPM, ADM og Stable Diffusion-rammer

Ubetinget Generering med Selv-oppmerksomhetsveiledning

For å måle effektiviteten til SAG-pipelinen på ubetingede modeller og demonstrere den betingselsesfrie egenskapen som ikke besittes av Klassifikatorveiledning og Klassifikatorfri Veiledningsmetode, kjøres SAG-pipelinen på ubetinget forhånds-trente rammer på 50 000 prøver. 

Som det kan observeres, forbedrer implementeringen av SAG-pipelinen FID, sFID og IS-målene til ubetinget inndata, samtidig som den reduserer recall-verdien. Videre, er de kvalitative forbedringene som et resultat av implementeringen av SAG-pipelinen tydelig i følgende bilder, hvor bildene øverst er resultater fra ADM og Stable Diffusion-rammer, mens bildene nederst er resultater fra ADM og Stable Diffusion-rammer med SAG-pipelinen. 

Betinget Generering med SAG

Integreringen av SAG-pipelinen i eksisterende rammer leverer eksepsjonelle resultater i ubetinget generering, og SAG-pipelinen er i stand til å være betingselsesuavhengig, noe som tillater SAG-pipelinen å bli implementert for betinget generering også. 

Stabil Diffusjon med Selv-oppmerksomhetsveiledning

Selv om den opprinnelige Stabil Diffusjons-rammen genererer høykvalitetsbilder, kan integreringen av Stabil Diffusjons-rammen med Selv-oppmerksomhetsveiledningspipelinen forbedre resultatene dramatisk. For å evaluere dens effekt, bruker utviklere tomme promter for Stabil Diffusjon med tilfeldig seed for hver bildepar, og bruker menneskelig evaluering på 500 par bilder med og uten Selv-oppmerksomhetsveiledning. Resultatene er demonstrert i følgende bilde.  

Videre, kan implementeringen av SAG forbedre evnene til Stabil Diffusjons-rammen, da fusjonen av Klassifikatorfri Veiledning med Selv-oppmerksomhetsveiledning kan utvide området til Stabil Diffusjons-modeller til tekst-til-bilde-syntese. Videre, er de genererte bildene fra Stabil Diffusjons-modellen med Selv-oppmerksomhetsveiledning av høyere kvalitet med færre artefakter, takket være selv-betingelses-effekten av SAG-pipelinen, som demonstrert i følgende bilde. 

Nåværende Begrensninger

Selv om implementeringen av Selv-oppmerksomhetsveiledningspipelinen kan forbedre kvaliteten på de genererte bildene betydelig, har den likevel noen begrensninger. 

En av de største begrensningene er ortogonaliteten med Klassifikatorveiledning og Klassifikatorfri Veiledning. Som det kan observeres i følgende bilde, forbedrer implementeringen av SAG FID-scoren og forutsagnsscoren, noe som betyr at SAG-pipelinen inneholder en ortogonal komponent som kan brukes med tradisjonelle veiledningsmetoder samtidig. 

Likevel, krever den at diffusjonsmodellene blir trent på en bestemt måte, noe som legger til kompleksitet samt beregningskostnader. 

Videre, implementeringen av Selv-oppmerksomhetsveiledning øker ikke minne- eller tidforbruk, et tegn på at overheadet resulterende fra operasjoner som masking og uskarpe i SAG er ubetydelig. Likevel, legger den til beregningskostnadene, da den inkluderer en ekstra steg i forhold til ingen veiledningsmetoder. 

Slutt tanker

I denne artikkelen, har vi talt om Selv-oppmerksomhetsveiledning, en ny og generell formulering av veiledningsmetode som bruker intern informasjon tilgjengelig i diffusjonsmodeller for å generere høykvalitetsbilder. Selv-oppmerksomhetsveiledning er basert på det enkle prinsippet om generell formulering, og antagelsen at intern informasjon innholdt i mellomliggende prøver kan tjene som veiledning også. Selv-oppmerksomhetsveiledningspipelinen er en betingselsesfri og treningfri tilnærming som kan implementeres over forskjellige diffusjonsmodeller, og bruker selv-betingelse for å redusere artefakter i de genererte bildene og forbedre den totale kvaliteten. 

En ingeniør av yrke, en forfatter av hjerte. Kunal er en teknisk forfatter med en dyp kjærlighet og forståelse av AI og ML, dedikert til å forenkle komplekse konsepter i disse feltene gjennom sin engasjerende og informerende dokumentasjon.