AI-modeller och plattformar

SjÃĪlvuppmÃĪrksamhetsvÃĪgledning: FÃķrbÃĪttring av provkvalitet fÃķr diffusionsmodeller

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google

Diffusionsmodeller fÃķr avbullring ÃĪr generativa AI-ramverk som syntetiserar bilder frÃĨn brus genom en iterativ avbullringsprocess. De hyllas fÃķr sin exceptionella bildgenereringsfÃķrmÃĨga och mÃĨngfald, till stor del tack vare text- eller klassvillkorsbaserade vÃĪgledningsmetoder, inklusive klassificeringsvÃĪgledning och klassfri vÃĪgledning. Dessa modeller har varit noterbart framgÃĨngsrika i att skapa mÃĨngfaldiga, hÃķgkvalitativa bilder. Nya studier har visat att vÃĪgledningstekniker som klassrubriker och etiketter spelar en avgÃķrande roll fÃķr att fÃķrbÃĪttra kvaliteten pÃĨ de bilder som dessa modeller genererar.

Men diffusionsmodeller och vÃĪgledningsmetoder stÃĨr infÃķr begrÃĪnsningar under vissa yttre fÃķrhÃĨllanden. Klassfri vÃĪgledningsmetod (CFG), som anvÃĪnder etikettborttagning, lÃĪgger till komplexitet i utbildningsprocessen, medan klassificeringsvÃĪgledningsmetoden (CG) krÃĪver ytterligare klassificeringsutbildning. BÃĨda metoderna ÃĪr nÃĨgot begrÃĪnsade av sin beroende av hÃĨrda yttre fÃķrhÃĨllanden, vilket begrÃĪnsar deras potential och begrÃĪnsar dem till villkorsbaserade instÃĪllningar.

FÃķr att ÃĨtgÃĪrda dessa begrÃĪnsningar har utvecklare formulerat en mer allmÃĪn approach till diffusionsvÃĪgledning, kÃĪnd som SjÃĪlvuppmÃĪrksamhetsvÃĪgledning (SAG). Denna metod utnyttjar information frÃĨn intermediÃĪra prover av diffusionsmodeller fÃķr att generera bilder. Vi kommer att undersÃķka SAG i denna artikel, diskutera dess funktionssÃĪtt, metodik och resultat i jÃĪmfÃķrelse med nuvarande toppmodeller och pipeline.

SjÃĪlvuppmÃĪrksamhetsvÃĪgledning: FÃķrbÃĪttring av provkvalitet fÃķr diffusionsmodeller

Diffusionsmodeller fÃķr avbullring (DDM) har blivit populÃĪra fÃķr sin fÃķrmÃĨga att skapa bilder frÃĨn brus via en iterativ avbullringsprocess. BildsyntesfÃķrmÃĨgan hos dessa modeller ÃĪr till stor del tack vare de anvÃĪnda diffusionsvÃĪgledningsmetoderna. Trots deras styrkor stÃĨr diffusionsmodeller och vÃĪgledningsbaserade metoder infÃķr utmaningar som tillagd komplexitet och Ãķkade berÃĪkningskostnader.

FÃķr att Ãķvervinna nuvarande begrÃĪnsningar har utvecklare introducerat SjÃĪlvuppmÃĪrksamhetsvÃĪgledningsmetoden, en mer allmÃĪn formulering av diffusionsvÃĪgledning som inte fÃķrlitar sig pÃĨ yttre information frÃĨn diffusionsvÃĪgledning, och dÃĪrmed mÃķjliggÃķr en villkorsfri och flexibel approach fÃķr att vÃĪgleda diffusionsramverk. TillvÃĪgagÃĨngssÃĪttet valt av SjÃĪlvuppmÃĪrksamhetsvÃĪgledning hjÃĪlper slutligen till att fÃķrbÃĪttra tillÃĪmpbarheten av traditionella diffusionsvÃĪgledningsmetoder i fall med eller utan yttre krav.

SjÃĪlvuppmÃĪrksamhetsvÃĪgledning bygger pÃĨ den enkla principen om allmÃĪn formulering, och antagandet att intern information inuti intermediÃĪra prover kan tjÃĪna som vÃĪgledning ocksÃĨ. UtifrÃĨn denna princip introducerar SAG-metoden fÃķrst Blur-vÃĪgledning, en enkel och rak lÃķsning fÃķr att fÃķrbÃĪttra provkvalitet. Blur-vÃĪgledning syftar till att utnyttja de gynnsamma egenskaperna hos Gaussisk oskÃĪrpa fÃķr att ta bort fina detaljer pÃĨ ett naturligt sÃĪtt genom att vÃĪgleda intermediÃĪra prover med hjÃĪlp av den eliminerade informationen som ett resultat av Gaussisk oskÃĪrpa.

Med antagandet att sjÃĪlvuppmÃĪrksamhet ÃĪr avgÃķrande fÃķr att fÃĨnga viktiga detaljer i kÃĪrnan, anvÃĪnder SjÃĪlvuppmÃĪrksamhetsvÃĪgledningsmetoden sjÃĪlvuppmÃĪrksamhetskartor frÃĨn diffusionsmodellerna fÃķr att antagonistiskt oskarpa omrÃĨden som innehÃĨller viktiga detaljer, och dÃĪrigenom vÃĪgleder diffusionsmodellerna med erforderlig restinformation. Metoden anvÃĪnder sedan uppmÃĪrksamhetskartorna under diffusionsmodellernas omvÃĪnda process fÃķr att fÃķrbÃĪttra bildkvaliteten och anvÃĪnder sjÃĪlvbetingning fÃķr att minska artefakterna utan att krÃĪva ytterligare utbildning eller yttre information.

FÃķr att sammanfatta, SjÃĪlvuppmÃĪrksamhetsvÃĪgledningsmetoden

  1. Är en ny approach som anvÃĪnder interna sjÃĪlvuppmÃĪrksamhetskartor frÃĨn diffusionsramverk fÃķr att fÃķrbÃĪttra den genererade provbildkvaliteten utan att krÃĪva nÃĨgon ytterligare utbildning eller fÃķrlita sig pÃĨ yttre fÃķrhÃĨllanden.
  2. SAG-metoden fÃķrsÃķker generalisera villkorsbaserade metoder till en villkorsfri metod som kan integreras med vilken diffusionsmodell som helst utan att krÃĪva ytterligare resurser eller yttre fÃķrhÃĨllanden, och dÃĪrigenom fÃķrbÃĪttrar tillÃĪmpbarheten av vÃĪgledningsbaserade ramverk.
  3. SAG-metoden fÃķrsÃķker ocksÃĨ demonstrera sin ortogonala fÃķrmÃĨga gentemot existerande villkorsbaserade metoder och ramverk, och dÃĪrigenom mÃķjliggÃķr en prestandafÃķrbÃĪttring genom att mÃķjliggÃķra flexibel integration med andra metoder och modeller.

Vidare, SjÃĪlvuppmÃĪrksamhetsvÃĪgledningsmetoden lÃĪr av resultaten frÃĨn relaterade ramverk, inklusive Diffusionsmodeller fÃķr avbullring, Provguidning, Generativ AI SjÃĪlvuppmÃĪrksamhetsmetoder och Diffusionsmodellers interna representationer. Men i sin kÃĪrna implementerar SjÃĪlvuppmÃĪrksamhetsvÃĪgledningsmetoden lÃĪrdomarna frÃĨn DDPM eller Diffusionsmodeller fÃķr avbullring med sannolikhetsmodell, KlassificeringsvÃĪgledning, Klassfri vÃĪgledning och SjÃĪlvuppmÃĪrksamhet i diffusionsramverk.

SjÃĪlvuppmÃĪrksamhetsvÃĪgledning: PreliminÃĪra, Metodik och Arkitektur

Diffusionsmodell fÃķr avbullring med sannolikhetsmodell eller DDPM

DDPM eller Diffusionsmodell fÃķr avbullring med sannolikhetsmodell ÃĪr en modell som anvÃĪnder en iterativ avbullringsprocess fÃķr att ÃĨterstÃĪlla en bild frÃĨn vitt brus. Traditionellt tar en DDPM-modell emot en inmatningsbild och en variansschema vid en tidpunkt fÃķr att erhÃĨlla bilden med hjÃĪlp av en framÃĨtriktad process som kallas Markovisk process.

KlassificeringsvÃĪgledning och Klassfri vÃĪgledning med GAN-implementering

GAN eller Generativa Adversariala NÃĪtverk besitter unik handelsmÃĨngfald fÃķr trohet, och fÃķr att bringa denna fÃķrmÃĨga hos GAN-ramverk till diffusionsmodeller, fÃķreslÃĨr SjÃĪlvuppmÃĪrksamhetsvÃĪgledningsramverket att anvÃĪnda en klassificeringsvÃĪgledningsmetod som anvÃĪnder en ytterligare klassificerare. OmvÃĪnt kan en klassfri vÃĪgledningsmetod ocksÃĨ implementeras utan anvÃĪndning av en ytterligare klassificerare fÃķr att uppnÃĨ samma resultat. Även om metoden levererar de Ãķnskade resultaten, ÃĪr den fortfarande inte berÃĪkningsmÃĪssigt livskraftig eftersom den krÃĪver ytterligare etiketter och fÃķrutsÃĪtter diffusionsmodeller som krÃĪver ytterligare fÃķrhÃĨllanden som text eller klass, samt ytterligare utbildningsdetaljer som lÃĪgger till komplexitet i modellen.

Generalisering av diffusionsvÃĪgledning

Även om Klassificerings- och Klassfri vÃĪgledningsmetoder levererar de Ãķnskade resultaten och hjÃĪlper till med villkorsbaserad generering i diffusionsmodeller, ÃĪr de beroende av ytterligare inmatningar. FÃķr en given tidpunkt bestÃĨr inmatningen fÃķr en diffusionsmodell av en generaliserad villkor och ett stÃķrt prov utan den generaliserade villkoret. Dessutom omfattar den generaliserade villkoret intern information inom det stÃķrda provet eller ett yttre villkor, eller bÃĨda. Den resulterande vÃĪgledningen formuleras med hjÃĪlp av en imaginÃĪr regressor med antagandet att den kan fÃķrutsÃĪga den generaliserade villkoret.

FÃķrbÃĪttring av bildkvalitet med hjÃĪlp av SjÃĪlvuppmÃĪrksamhetskartor

Den generaliserade diffusionsvÃĪgledningen antyder att det ÃĪr mÃķjligt att ge vÃĪgledning till den omvÃĪnda processen av diffusionsmodeller genom att extrahera viktiga detaljer i den generaliserade villkoret som finns i det stÃķrda provet. UtifrÃĨn detta bygger SjÃĪlvuppmÃĪrksamhetsvÃĪgledningsmetoden pÃĨ samma princip och utnyttjar fÃķrmÃĨgan hos sjÃĪlvuppmÃĪrksamhetskartor i diffusionsmodeller fÃķr att effektivt fÃĨnga viktiga detaljer fÃķr omvÃĪnda processer samtidigt som den begrÃĪnsar riskerna som uppstÃĨr till fÃķljd av distributionproblem i fÃķrutbildade diffusionsmodeller.

Blur-vÃĪgledning

Blur-vÃĪgledning i SjÃĪlvuppmÃĪrksamhetsvÃĪgledning bygger pÃĨ Gaussisk oskÃĪrpa, en linjÃĪr filtermetod dÃĪr inmatningssignalen konvolveras med en Gaussisk filter fÃķr att generera en utmatningssignal. Med en Ãķkning av standardavvikelsen minskar Gaussisk oskÃĪrpa de fina detaljerna inom inmatningssignalerna och resulterar i lokalt otydliga inmatningssignalerna genom att jÃĪmna ut dem mot en konstant. Dessutom har experiment visat en informationsobalans mellan inmatningssignalen och Gaussisk oskÃĪrpa-utmatningssignalen, dÃĪr utmatningssignalen innehÃĨller mer fina detaljer.

UtifrÃĨn denna lÃĪrdom introducerar SjÃĪlvuppmÃĪrksamhetsvÃĪgledningsramverket Blur-vÃĪgledning, en teknik som medvetet utesluter informationen frÃĨn intermediÃĪra rekonstruktioner under diffusionsprocessen och istÃĪllet anvÃĪnder denna information fÃķr att vÃĪgleda sina fÃķrutsÃĪgelser mot att Ãķka relevansen fÃķr bilderna i fÃķrhÃĨllande till inmatningsinformationen. Blur-vÃĪgledning orsakar i princip att den ursprungliga fÃķrutsÃĪgelsen avviker mer frÃĨn den oskarpa inmatningsfÃķrutsÃĪgelsen. Dessutom fÃķrhindrar den gynnsamma egenskapen i Gaussisk oskÃĪrpa att utmatningssignalerna avviker signifikant frÃĨn den ursprungliga signalen med en mÃĨttlig avvikelse.

I SjÃĪlvuppmÃĪrksamhetsvÃĪgledningspipelinen oskarpas inmatningssignalen fÃķrst med en Gaussisk filter och diffunderas sedan med ytterligare brus fÃķr att producera utmatningssignalen. Genom att gÃķra detta mildrar SAG-pipelinen den negativa effekten av den resulterande oskÃĪrpan som minskar Gaussiskt brus och gÃķr vÃĪgledningen beroende av innehÃĨll snarare ÃĪn slumpmÃĪssigt brus. Även om Blur-vÃĪgledning levererar tillfredsstÃĪllande resultat pÃĨ ramverk med mÃĨttlig vÃĪgledningsskala, misslyckas den med att replikera resultaten pÃĨ existerande modeller med en stor vÃĪgledningsskala eftersom den tenderar att producera bullriga resultat, som visas i fÃķljande bild.

Dessa resultat kan vara ett resultat av den strukturmÃĪssiga tvetydighet som introduceras i ramverket av global oskÃĪrpa, vilket gÃķr det svÃĨrt fÃķr SAG-pipelinen att justera fÃķrutsÃĪgelserna av den ursprungliga inmatningen med den degraderade inmatningen, vilket resulterar i bullriga utmatningar.

SjÃĪlvuppmÃĪrksamhetsmekanism

Som nÃĪmnts tidigare har diffusionsmodeller vanligtvis en inbyggd sjÃĪlvuppmÃĪrksamhetskomponent, och det ÃĪr en av de viktigaste komponenterna i en diffusionsmodell. SjÃĪlvuppmÃĪrksamhetsmekanismen implementeras i kÃĪrnan av diffusionsmodellerna och tillÃĨter modellen att uppmÃĪrksamma de viktiga delarna av inmatningen under den generativa processen, som visas i fÃķljande bild med hÃķgfrekventa masker i den Ãķvre raden och sjÃĪlvuppmÃĪrksamhetsmasker i den nedre raden av de slutligt genererade bilderna.

Den fÃķreslagna SjÃĪlvuppmÃĪrksamhetsvÃĪgledningsmetoden bygger pÃĨ samma princip och utnyttjar fÃķrmÃĨgan hos sjÃĪlvuppmÃĪrksamhetskartor i diffusionsmodeller. Sammanfattningsvis oskarpar SjÃĪlvuppmÃĪrksamhetsvÃĪgledningsmetoden de sjÃĪlvuppmÃĪrksammade patcharna i inmatningssignalen eller, i enkla ord, dÃķljer informationen om patcharna som uppmÃĪrksammas av diffusionsmodellerna. Dessutom innehÃĨller utmatningssignalerna i SjÃĪlvuppmÃĪrksamhetsvÃĪgledning intakta omrÃĨden av inmatningssignalerna, vilket innebÃĪr att de inte resulterar i strukturmÃĪssig tvetydighet i inmatningarna och lÃķser problemet med global oskÃĪrpa. Pipelinen erhÃĨller sedan de aggregerade sjÃĪlvuppmÃĪrksamhetskartorna genom att utfÃķra GAP eller Global Average Pooling fÃķr att aggregera sjÃĪlvuppmÃĪrksamhetskartor till dimensionen och upp sampelnÃĪrmaste granne fÃķr att matcha inmatningssignalens upplÃķsning.

SjÃĪlvuppmÃĪrksamhetsvÃĪgledning: Experiment och Resultat

FÃķr att utvÃĪrdera dess prestanda sampas SjÃĪlvuppmÃĪrksamhetsvÃĪgledningspipelinen med 8 Nvidia GeForce RTX 3090 GPU:er och byggs pÃĨ fÃķrutbildade IDDPM, ADM och Stable Diffusionsramverk.

ObestÃĪmd generering med SjÃĪlvuppmÃĪrksamhetsvÃĪgledning

FÃķr att mÃĪta effektiviteten av SAG-pipelinen pÃĨ obestÃĪmda modeller och demonstrera den villkorsfria egenskapen som inte besitts av KlassificeringsvÃĪgledning och Klassfri vÃĪgledning, kÃķrs SAG-pipelinen pÃĨ obestÃĪmt fÃķrutbildade ramverk pÃĨ 50 000 prover.

Som det kan observeras, fÃķrbÃĪttrar implementeringen av SAG-pipelinen FID, sFID och IS-mÃĨtten fÃķr obestÃĪmd inmatning samtidigt som den minskar ÃĨterkallsvÃĪrdet. Dessutom ÃĪr de kvalitativa fÃķrbÃĪttringarna som ett resultat av implementeringen av SAG-pipelinen uppenbara i fÃķljande bilder, dÃĪr bilderna i toppen ÃĪr resultat frÃĨn ADM och Stable Diffusionsramverk, medan bilderna i botten ÃĪr resultat frÃĨn ADM och Stable Diffusionsramverk med SAG-pipelinen.

Villkorsbaserad generering med SAG

Integreringen av SAG-pipelinen i existerande ramverk levererar exceptionella resultat i obestÃĪmd generering, och SAG-pipelinen ÃĪr kapabel till villkorsagnostik som tillÃĨter SAG-pipelinen att implementeras fÃķr villkorsbaserad generering ocksÃĨ.

Stabil diffusjon med SjÃĪlvuppmÃĪrksamhetsvÃĪgledning

Även om det ursprungliga Stable Diffusionsramverket genererar hÃķgkvalitativa bilder, kan integreringen av Stable Diffusionsramverket med SjÃĪlvuppmÃĪrksamhetsvÃĪgledningspipelinen fÃķrbÃĪttra resultaten drastiskt. FÃķr att utvÃĪrdera dess effekt anvÃĪnder utvecklare tomma prompter fÃķr Stable Diffusion med slumpmÃĪssig seed fÃķr varje bildpar och anvÃĪnder mÃĪnsklig utvÃĪrdering pÃĨ 500 par bilder med och utan SjÃĪlvuppmÃĪrksamhetsvÃĪgledning. Resultaten visas i fÃķljande bild.

Dessutom kan implementeringen av SAG fÃķrbÃĪttra fÃķrmÃĨgan hos Stable Diffusionsramverket, eftersom sammanslagning av Klassfri vÃĪgledning med SjÃĪlvuppmÃĪrksamhetsvÃĪgledning kan utÃķka omfÃĨnget fÃķr Stable Diffusionsmodeller till text-till-bildsyntes. Dessutom ÃĪr de genererade bilderna frÃĨn Stable Diffusionsmodellen med SjÃĪlvuppmÃĪrksamhetsvÃĪgledning av hÃķgre kvalitet med fÃĪrre artefakter tack vare den sjÃĪlvbetingande effekten av SAG-pipelinen, som visas i fÃķljande bild.

Aktuella begrÃĪnsningar

Även om implementeringen av SjÃĪlvuppmÃĪrksamhetsvÃĪgledningspipelinen kan fÃķrbÃĪttra kvaliteten pÃĨ de genererade bilderna avsevÃĪrt, har den vissa begrÃĪnsningar.

En av de stÃķrsta begrÃĪnsningarna ÃĪr ortogonaliteten med KlassificeringsvÃĪgledning och Klassfri vÃĪgledning. Som det kan observeras i fÃķljande bild, fÃķrbÃĪttrar implementeringen av SAG FID-poÃĪngen och fÃķrutsÃĪgelsescoret, vilket innebÃĪr att SAG-pipelinen innehÃĨller en ortogonal komponent som kan anvÃĪndas med traditionella vÃĪgledningsmetoder samtidigt.

Men det krÃĪver fortfarande att diffusionsmodellerna trÃĪnas pÃĨ ett visst sÃĪtt, vilket lÃĪgger till komplexitet samt berÃĪkningskostnader.

Dessutom krÃĪver implementeringen av SjÃĪlvuppmÃĪrksamhetsvÃĪgledning inte Ãķkad minnes- eller tidsÃĨtgÃĨng, vilket tyder pÃĨ att den ÃķverhÃĪngande kostnaden som hÃĪrrÃķr frÃĨn operationer som maskering och oskÃĪrpa i SAG ÃĪr fÃķrsumbar. Men den lÃĪgger fortfarande till berÃĪkningskostnader eftersom den innehÃĨller ett ytterligare steg jÃĪmfÃķrt med inga vÃĪgledningsmetoder.

Slutliga tankar

I denna artikel har vi talat om SjÃĪlvuppmÃĪrksamhetsvÃĪgledning, en ny och allmÃĪn formulering av vÃĪgledningsmetod som utnyttjar intern information tillgÃĪnglig inom diffusionsmodellerna fÃķr att generera hÃķgkvalitativa bilder. SjÃĪlvuppmÃĪrksamhetsvÃĪgledning bygger pÃĨ den enkla principen om allmÃĪn formulering och antagandet att intern information inuti intermediÃĪra prover kan tjÃĪna som vÃĪgledning ocksÃĨ. SjÃĪlvuppmÃĪrksamhetsvÃĪgledningspipelinen ÃĪr en villkorsfri och utbildningsfri approach som kan implementeras Ãķver olika diffusionsmodeller och anvÃĪnder sjÃĪlvbetingning fÃķr att minska artefakterna i de genererade bilderna och fÃķrbÃĪttrar den Ãķvergripande kvaliteten.

En ingenjÃķr till yrket, en fÃķrfattare av hjÃĪrtat. Kunal ÃĪr en teknisk skribent med ett djupt kÃĪrlek och fÃķrstÃĨelse fÃķr AI och ML, dedikerad till att fÃķrenkla komplexa begrepp inom dessa omrÃĨden genom sin engagerande och informativa dokumentation.