AI-modeller och plattformar

Självuppmärksamhetsvägledning: Förbättring av provkvalitet för diffusionsmodeller

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Diffusionsmodeller för avbullring är generativa AI-ramverk som syntetiserar bilder från brus genom en iterativ avbullringsprocess. De hyllas för sin exceptionella bildgenereringsförmåga och mångfald, till stor del tack vare text- eller klassvillkorsbaserade vägledningsmetoder, inklusive klassificeringsvägledning och klassfri vägledning. Dessa modeller har varit noterbart framgångsrika i att skapa mångfaldiga, högkvalitativa bilder. Nya studier har visat att vägledningstekniker som klassrubriker och etiketter spelar en avgörande roll för att förbättra kvaliteten på de bilder som dessa modeller genererar.

Men diffusionsmodeller och vägledningsmetoder står inför begränsningar under vissa yttre förhållanden. Klassfri vägledningsmetod (CFG), som använder etikettborttagning, lägger till komplexitet i utbildningsprocessen, medan klassificeringsvägledningsmetoden (CG) kräver ytterligare klassificeringsutbildning. Båda metoderna är något begränsade av sin beroende av hårda yttre förhållanden, vilket begränsar deras potential och begränsar dem till villkorsbaserade inställningar.

För att åtgärda dessa begränsningar har utvecklare formulerat en mer allmän approach till diffusionsvägledning, känd som Självuppmärksamhetsvägledning (SAG). Denna metod utnyttjar information från intermediära prover av diffusionsmodeller för att generera bilder. Vi kommer att undersöka SAG i denna artikel, diskutera dess funktionssätt, metodik och resultat i jämförelse med nuvarande toppmodeller och pipeline.

Självuppmärksamhetsvägledning: Förbättring av provkvalitet för diffusionsmodeller

Diffusionsmodeller för avbullring (DDM) har blivit populära för sin förmåga att skapa bilder från brus via en iterativ avbullringsprocess. Bildsyntesförmågan hos dessa modeller är till stor del tack vare de använda diffusionsvägledningsmetoderna. Trots deras styrkor står diffusionsmodeller och vägledningsbaserade metoder inför utmaningar som tillagd komplexitet och ökade beräkningskostnader.

För att övervinna nuvarande begränsningar har utvecklare introducerat Självuppmärksamhetsvägledningsmetoden, en mer allmän formulering av diffusionsvägledning som inte förlitar sig på yttre information från diffusionsvägledning, och därmed möjliggör en villkorsfri och flexibel approach för att vägleda diffusionsramverk. Tillvägagångssättet valt av Självuppmärksamhetsvägledning hjälper slutligen till att förbättra tillämpbarheten av traditionella diffusionsvägledningsmetoder i fall med eller utan yttre krav.

Självuppmärksamhetsvägledning bygger på den enkla principen om allmän formulering, och antagandet att intern information inuti intermediära prover kan tjäna som vägledning också. Utifrån denna princip introducerar SAG-metoden först Blur-vägledning, en enkel och rak lösning för att förbättra provkvalitet. Blur-vägledning syftar till att utnyttja de gynnsamma egenskaperna hos Gaussisk oskärpa för att ta bort fina detaljer på ett naturligt sätt genom att vägleda intermediära prover med hjälp av den eliminerade informationen som ett resultat av Gaussisk oskärpa.

Med antagandet att självuppmärksamhet är avgörande för att fånga viktiga detaljer i kärnan, använder Självuppmärksamhetsvägledningsmetoden självuppmärksamhetskartor från diffusionsmodellerna för att antagonistiskt oskarpa områden som innehåller viktiga detaljer, och därigenom vägleder diffusionsmodellerna med erforderlig restinformation. Metoden använder sedan uppmärksamhetskartorna under diffusionsmodellernas omvända process för att förbättra bildkvaliteten och använder självbetingning för att minska artefakterna utan att kräva ytterligare utbildning eller yttre information.

För att sammanfatta, Självuppmärksamhetsvägledningsmetoden

  1. Är en ny approach som använder interna självuppmärksamhetskartor från diffusionsramverk för att förbättra den genererade provbildkvaliteten utan att kräva någon ytterligare utbildning eller förlita sig på yttre förhållanden.
  2. SAG-metoden försöker generalisera villkorsbaserade metoder till en villkorsfri metod som kan integreras med vilken diffusionsmodell som helst utan att kräva ytterligare resurser eller yttre förhållanden, och därigenom förbättrar tillämpbarheten av vägledningsbaserade ramverk.
  3. SAG-metoden försöker också demonstrera sin ortogonala förmåga gentemot existerande villkorsbaserade metoder och ramverk, och därigenom möjliggör en prestandaförbättring genom att möjliggöra flexibel integration med andra metoder och modeller.

Vidare, Självuppmärksamhetsvägledningsmetoden lär av resultaten från relaterade ramverk, inklusive Diffusionsmodeller för avbullring, Provguidning, Generativ AI Självuppmärksamhetsmetoder och Diffusionsmodellers interna representationer. Men i sin kärna implementerar Självuppmärksamhetsvägledningsmetoden lärdomarna från DDPM eller Diffusionsmodeller för avbullring med sannolikhetsmodell, Klassificeringsvägledning, Klassfri vägledning och Självuppmärksamhet i diffusionsramverk.

Självuppmärksamhetsvägledning: Preliminära, Metodik och Arkitektur

Diffusionsmodell för avbullring med sannolikhetsmodell eller DDPM

DDPM eller Diffusionsmodell för avbullring med sannolikhetsmodell är en modell som använder en iterativ avbullringsprocess för att återställa en bild från vitt brus. Traditionellt tar en DDPM-modell emot en inmatningsbild och en variansschema vid en tidpunkt för att erhålla bilden med hjälp av en framåtriktad process som kallas Markovisk process.

Klassificeringsvägledning och Klassfri vägledning med GAN-implementering

GAN eller Generativa Adversariala Nätverk besitter unik handelsmångfald för trohet, och för att bringa denna förmåga hos GAN-ramverk till diffusionsmodeller, föreslår Självuppmärksamhetsvägledningsramverket att använda en klassificeringsvägledningsmetod som använder en ytterligare klassificerare. Omvänt kan en klassfri vägledningsmetod också implementeras utan användning av en ytterligare klassificerare för att uppnå samma resultat. Även om metoden levererar de önskade resultaten, är den fortfarande inte beräkningsmässigt livskraftig eftersom den kräver ytterligare etiketter och förutsätter diffusionsmodeller som kräver ytterligare förhållanden som text eller klass, samt ytterligare utbildningsdetaljer som lägger till komplexitet i modellen.

Generalisering av diffusionsvägledning

Även om Klassificerings- och Klassfri vägledningsmetoder levererar de önskade resultaten och hjälper till med villkorsbaserad generering i diffusionsmodeller, är de beroende av ytterligare inmatningar. För en given tidpunkt består inmatningen för en diffusionsmodell av en generaliserad villkor och ett stört prov utan den generaliserade villkoret. Dessutom omfattar den generaliserade villkoret intern information inom det störda provet eller ett yttre villkor, eller båda. Den resulterande vägledningen formuleras med hjälp av en imaginär regressor med antagandet att den kan förutsäga den generaliserade villkoret.

Förbättring av bildkvalitet med hjälp av Självuppmärksamhetskartor

Den generaliserade diffusionsvägledningen antyder att det är möjligt att ge vägledning till den omvända processen av diffusionsmodeller genom att extrahera viktiga detaljer i den generaliserade villkoret som finns i det störda provet. Utifrån detta bygger Självuppmärksamhetsvägledningsmetoden på samma princip och utnyttjar förmågan hos självuppmärksamhetskartor i diffusionsmodeller för att effektivt fånga viktiga detaljer för omvända processer samtidigt som den begränsar riskerna som uppstår till följd av distributionproblem i förutbildade diffusionsmodeller.

Blur-vägledning

Blur-vägledning i Självuppmärksamhetsvägledning bygger på Gaussisk oskärpa, en linjär filtermetod där inmatningssignalen konvolveras med en Gaussisk filter för att generera en utmatningssignal. Med en ökning av standardavvikelsen minskar Gaussisk oskärpa de fina detaljerna inom inmatningssignalerna och resulterar i lokalt otydliga inmatningssignalerna genom att jämna ut dem mot en konstant. Dessutom har experiment visat en informationsobalans mellan inmatningssignalen och Gaussisk oskärpa-utmatningssignalen, där utmatningssignalen innehåller mer fina detaljer.

Utifrån denna lärdom introducerar Självuppmärksamhetsvägledningsramverket Blur-vägledning, en teknik som medvetet utesluter informationen från intermediära rekonstruktioner under diffusionsprocessen och istället använder denna information för att vägleda sina förutsägelser mot att öka relevansen för bilderna i förhållande till inmatningsinformationen. Blur-vägledning orsakar i princip att den ursprungliga förutsägelsen avviker mer från den oskarpa inmatningsförutsägelsen. Dessutom förhindrar den gynnsamma egenskapen i Gaussisk oskärpa att utmatningssignalerna avviker signifikant från den ursprungliga signalen med en måttlig avvikelse.

I Självuppmärksamhetsvägledningspipelinen oskarpas inmatningssignalen först med en Gaussisk filter och diffunderas sedan med ytterligare brus för att producera utmatningssignalen. Genom att göra detta mildrar SAG-pipelinen den negativa effekten av den resulterande oskärpan som minskar Gaussiskt brus och gör vägledningen beroende av innehåll snarare än slumpmässigt brus. Även om Blur-vägledning levererar tillfredsställande resultat på ramverk med måttlig vägledningsskala, misslyckas den med att replikera resultaten på existerande modeller med en stor vägledningsskala eftersom den tenderar att producera bullriga resultat, som visas i följande bild.

Dessa resultat kan vara ett resultat av den strukturmässiga tvetydighet som introduceras i ramverket av global oskärpa, vilket gör det svårt för SAG-pipelinen att justera förutsägelserna av den ursprungliga inmatningen med den degraderade inmatningen, vilket resulterar i bullriga utmatningar.

Självuppmärksamhetsmekanism

Som nämnts tidigare har diffusionsmodeller vanligtvis en inbyggd självuppmärksamhetskomponent, och det är en av de viktigaste komponenterna i en diffusionsmodell. Självuppmärksamhetsmekanismen implementeras i kärnan av diffusionsmodellerna och tillåter modellen att uppmärksamma de viktiga delarna av inmatningen under den generativa processen, som visas i följande bild med högfrekventa masker i den övre raden och självuppmärksamhetsmasker i den nedre raden av de slutligt genererade bilderna.

Den föreslagna Självuppmärksamhetsvägledningsmetoden bygger på samma princip och utnyttjar förmågan hos självuppmärksamhetskartor i diffusionsmodeller. Sammanfattningsvis oskarpar Självuppmärksamhetsvägledningsmetoden de självuppmärksammade patcharna i inmatningssignalen eller, i enkla ord, döljer informationen om patcharna som uppmärksammas av diffusionsmodellerna. Dessutom innehåller utmatningssignalerna i Självuppmärksamhetsvägledning intakta områden av inmatningssignalerna, vilket innebär att de inte resulterar i strukturmässig tvetydighet i inmatningarna och löser problemet med global oskärpa. Pipelinen erhåller sedan de aggregerade självuppmärksamhetskartorna genom att utföra GAP eller Global Average Pooling för att aggregera självuppmärksamhetskartor till dimensionen och upp sampelnärmaste granne för att matcha inmatningssignalens upplösning.

Självuppmärksamhetsvägledning: Experiment och Resultat

För att utvärdera dess prestanda sampas Självuppmärksamhetsvägledningspipelinen med 8 Nvidia GeForce RTX 3090 GPU:er och byggs på förutbildade IDDPM, ADM och Stable Diffusionsramverk.

Obestämd generering med Självuppmärksamhetsvägledning

För att mäta effektiviteten av SAG-pipelinen på obestämda modeller och demonstrera den villkorsfria egenskapen som inte besitts av Klassificeringsvägledning och Klassfri vägledning, körs SAG-pipelinen på obestämt förutbildade ramverk på 50 000 prover.

Som det kan observeras, förbättrar implementeringen av SAG-pipelinen FID, sFID och IS-måtten för obestämd inmatning samtidigt som den minskar återkallsvärdet. Dessutom är de kvalitativa förbättringarna som ett resultat av implementeringen av SAG-pipelinen uppenbara i följande bilder, där bilderna i toppen är resultat från ADM och Stable Diffusionsramverk, medan bilderna i botten är resultat från ADM och Stable Diffusionsramverk med SAG-pipelinen.

Villkorsbaserad generering med SAG

Integreringen av SAG-pipelinen i existerande ramverk levererar exceptionella resultat i obestämd generering, och SAG-pipelinen är kapabel till villkorsagnostik som tillåter SAG-pipelinen att implementeras för villkorsbaserad generering också.

Stabil diffusjon med Självuppmärksamhetsvägledning

Även om det ursprungliga Stable Diffusionsramverket genererar högkvalitativa bilder, kan integreringen av Stable Diffusionsramverket med Självuppmärksamhetsvägledningspipelinen förbättra resultaten drastiskt. För att utvärdera dess effekt använder utvecklare tomma prompter för Stable Diffusion med slumpmässig seed för varje bildpar och använder mänsklig utvärdering på 500 par bilder med och utan Självuppmärksamhetsvägledning. Resultaten visas i följande bild.

Dessutom kan implementeringen av SAG förbättra förmågan hos Stable Diffusionsramverket, eftersom sammanslagning av Klassfri vägledning med Självuppmärksamhetsvägledning kan utöka omfånget för Stable Diffusionsmodeller till text-till-bildsyntes. Dessutom är de genererade bilderna från Stable Diffusionsmodellen med Självuppmärksamhetsvägledning av högre kvalitet med färre artefakter tack vare den självbetingande effekten av SAG-pipelinen, som visas i följande bild.

Aktuella begränsningar

Även om implementeringen av Självuppmärksamhetsvägledningspipelinen kan förbättra kvaliteten på de genererade bilderna avsevärt, har den vissa begränsningar.

En av de största begränsningarna är ortogonaliteten med Klassificeringsvägledning och Klassfri vägledning. Som det kan observeras i följande bild, förbättrar implementeringen av SAG FID-poängen och förutsägelsescoret, vilket innebär att SAG-pipelinen innehåller en ortogonal komponent som kan användas med traditionella vägledningsmetoder samtidigt.

Men det kräver fortfarande att diffusionsmodellerna tränas på ett visst sätt, vilket lägger till komplexitet samt beräkningskostnader.

Dessutom kräver implementeringen av Självuppmärksamhetsvägledning inte ökad minnes- eller tidsåtgång, vilket tyder på att den överhängande kostnaden som härrör från operationer som maskering och oskärpa i SAG är försumbar. Men den lägger fortfarande till beräkningskostnader eftersom den innehåller ett ytterligare steg jämfört med inga vägledningsmetoder.

Slutliga tankar

I denna artikel har vi talat om Självuppmärksamhetsvägledning, en ny och allmän formulering av vägledningsmetod som utnyttjar intern information tillgänglig inom diffusionsmodellerna för att generera högkvalitativa bilder. Självuppmärksamhetsvägledning bygger på den enkla principen om allmän formulering och antagandet att intern information inuti intermediära prover kan tjäna som vägledning också. Självuppmärksamhetsvägledningspipelinen är en villkorsfri och utbildningsfri approach som kan implementeras över olika diffusionsmodeller och använder självbetingning för att minska artefakterna i de genererade bilderna och förbättrar den övergripande kvaliteten.

En ingenjör till yrket, en författare av hjärtat. Kunal är en teknisk skribent med ett djupt kärlek och förståelse för AI och ML, dedikerad till att förenkla komplexa begrepp inom dessa områden genom sin engagerande och informativa dokumentation.