AI-modellen en platforms
Zelf-Aandachtbegeleiding: Verbetering van de Kwaliteit van Steekproeven van Diffusiemodellen
Diffusiemodellen zijn generatieve AI-kaders die afbeeldingen uit ruis synthetiseren via een iteratief denoiseringsproces. Ze worden gevierd om hun uitzonderlijke beeldgeneratiecapaciteiten en diversiteit, die grotendeels worden toegeschreven aan tekst- of klasse-voorwaardelijke begeleidingsmethoden, waaronder classificatiebegeleiding en classificatie-vrije begeleiding. Deze modellen zijn opvallend succesvol geweest in het creëren van diverse, hoge-kwaliteit afbeeldingen. Recent onderzoek heeft aangetoond dat begeleidingsmethoden zoals klassebijschriften en labels een cruciale rol spelen bij het verbeteren van de kwaliteit van de afbeeldingen die deze modellen genereren.
Echter, diffusiemodellen en begeleidingsmethoden hebben beperkingen onder bepaalde externe omstandigheden. De Classificatie-Vrije Begeleiding (CFG) methode, die label dropping gebruikt, voegt complexiteit toe aan het trainingsproces, terwijl de Classificatiebegeleiding (CG) methode additionele classificatietraining vereist. Beide methoden zijn enigszins beperkt door hun afhankelijkheid van moeilijk verkregen externe omstandigheden, waardoor hun potentieel wordt beperkt en ze worden beperkt tot voorwaardelijke instellingen.
Om deze beperkingen aan te pakken, hebben ontwikkelaars een meer algemene benadering van diffusiebegeleiding geformuleerd, bekend als Zelf-Aandachtbegeleiding (SAG). Deze methode maakt gebruik van informatie uit tussensteekproeven van diffusiemodellen om afbeeldingen te genereren. We zullen SAG in dit artikel bespreken, waarin we het functioneren, de methodologie en de resultaten vergelijken met de huidige state-of-the-art-kaders en -pijplijnen.
Zelf-Aandachtbegeleiding: Verbetering van de Kwaliteit van Steekproeven van Diffusiemodellen
Diffusiemodellen (DDM’s) hebben populariteit gewonnen vanwege hun vermogen om afbeeldingen uit ruis te creëren via een iteratief denoiseringsproces. De beeldsynthesecapaciteiten van deze modellen zijn grotendeels te wijten aan de gebruikte diffusiebegeleidingsmethoden. Ondanks hun sterke punten, hebben diffusiemodellen en begeleidingsmethoden uitdagingen zoals toegevoegde complexiteit en verhoogde computationele kosten.
Om de huidige beperkingen te overwinnen, hebben ontwikkelaars de Zelf-Aandachtbegeleidingmethode geïntroduceerd, een meer algemene formulering van diffusiebegeleiding die niet afhankelijk is van externe informatie van diffusiebegeleiding, waardoor een voorwaardelijke en flexibele benadering van begeleiding mogelijk wordt. De benadering die door Zelf-Aandachtbegeleiding wordt gekozen, helpt uiteindelijk bij het verbeteren van de toepasbaarheid van traditionele diffusiebegeleidingsmethoden in gevallen met of zonder externe vereisten.
Zelf-Aandachtbegeleiding is gebaseerd op het eenvoudige principe van een algemene formulering en de veronderstelling dat interne informatie die is opgenomen in tussensteekproeven ook als begeleiding kan dienen. Op basis van dit principe introduceert de SAG-methode eerst Blur-begeleiding, een eenvoudige en rechttoe rechtaan oplossing om de steekproefkwaliteit te verbeteren. Blur-begeleiding heeft als doel de gunstige eigenschappen van Gaussian blur te benutten om fijnschalige details natuurlijk te verwijderen door tussensteekproeven te begeleiden met behulp van de verwijderde informatie als gevolg van Gaussian blur.
Met de veronderstelling dat zelf-aandacht essentieel is om belangrijke informatie te capteren, gebruikt de Zelf-Aandachtbegeleidingsmethode zelf-aandachtskaarten van de diffusiemodellen om de regio’s met belangrijke informatie te verbluren en begeleidt de diffusiemodellen met de vereiste restinformatie. De methode maakt vervolgens gebruik van de aandachtskaarten tijdens het omgekeerde proces van de diffusiemodellen om de kwaliteit van de afbeeldingen te verbeteren en gebruikt zelf-conditie om de artefacten te verminderen zonder additionele training of externe informatie te vereisen.

Om samen te vatten, de Zelf-Aandachtbegeleidingsmethode
- Is een nieuwe benadering die interne zelf-aandachtskaarten van diffusiekaders gebruikt om de gegenereerde steekproefafbeeldingskwaliteit te verbeteren zonder additionele training of afhankelijkheid van externe omstandigheden.
- De SAG-methode probeert de voorwaardelijke begeleidingsmethoden te generaliseren tot een voorwaardelijke methode die kan worden geïntegreerd met elk diffusiemodel zonder additionele middelen of externe omstandigheden, waardoor de toepasbaarheid van begeleidingskaders wordt verbeterd.
- De SAG-methode probeert ook aan te tonen dat het orthogonale capaciteiten heeft ten opzichte van bestaande voorwaardelijke methoden en kaders, waardoor een prestatieverbetering mogelijk wordt door flexibele integratie met andere methoden en modellen.
Verdergaand, de Zelf-Aandachtbegeleidingsmethode leert van de bevindingen van verwante kaders, waaronder Denoising Diffusiemodellen, Sampling Guidance, Generatieve AI Zelf-Aandachtsmethoden en Diffusiemodellen Interne Representaties. Echter, in zijn kern implementeert de Zelf-Aandachtbegeleidingsmethode de bevindingen van DDPM of Denoising Diffusie Probabilistische Modellen, Classificatiebegeleiding, Classificatie-vrije Begeleiding en Zelf-Aandacht in Diffusiekaders. We zullen hier dieper op ingaan in de volgende sectie.
Zelf-Aandachtbegeleiding: Voorlopers, Methodologie en Architectuur
Denoising Diffusie Probabilistisch Model of DDPM
DDPM of Denoising Diffusie Probabilistisch Model is een model dat een iteratief denoiseringsproces gebruikt om een afbeelding uit witte ruis te herstellen. Traditioneel ontvangt een DDPM-model een invoerbeeld en een variantieschema op een tijdstap om het beeld te verkrijgen met behulp van een voorwaartse proces dat bekend staat als het Markoviaanse proces.
Classificatie en Classificatie-vrije Begeleiding met GAN Implementatie
GAN of Generatieve Adversariale Netwerken bezitten unieke diversiteit voor geloofwaardigheid, en om deze capaciteit van GAN-kaders naar diffusiemodellen te brengen, stelt de Zelf-Aandachtbegeleidingskader voor om een classificatiebegeleidingsmethode te gebruiken die een additionele classificator gebruikt. Omgekeerd kan een classificatie-vrije begeleidingsmethode ook worden geïmplementeerd zonder het gebruik van een additionele classificator om dezelfde resultaten te bereiken. Hoewel de methode de gewenste resultaten oplevert, is het nog steeds niet computationeel haalbaar omdat het additionele labels vereist en het kader ook beperkt tot voorwaardelijke diffusiemodellen die additionele omstandigheden zoals tekst of een klasse vereisen, evenals additionele trainingsdetails die de complexiteit van het model verhogen.
Generaliseren van Diffusiebegeleiding
Hoewel Classificatie en Classificatie-vrije Begeleidingsmethoden de gewenste resultaten opleveren en helpen bij voorwaardelijke generatie in diffusiemodellen, zijn ze afhankelijk van additionele invoer. Voor elke gegeven tijdstap bestaat de invoer voor een diffusiemodel uit een gegeneraliseerde voorwaarde en een verstoord monster zonder de gegeneraliseerde voorwaarde. Bovendien omvat de gegeneraliseerde voorwaarde interne informatie binnen het verstoord monster of een externe voorwaarde, of beide. De resulterende begeleiding wordt geformuleerd met behulp van een imaginaire regressor met de veronderstelling dat het de gegeneraliseerde voorwaarde kan voorspellen.
Verbeteren van Beeldkwaliteit met Zelf-Aandachtskaarten
De Gegeneraliseerde Diffusiebegeleiding impliceert dat het mogelijk is om begeleiding te bieden aan het omgekeerde proces van diffusiemodellen door het extraheren van belangrijke informatie in de gegeneraliseerde voorwaarde die is opgenomen in het verstoord monster. Gebouwd op hetzelfde, de Zelf-Aandachtbegeleidingsmethode capteert de belangrijke informatie voor omgekeerde processen effectief, terwijl het de risico’s die ontstaan als gevolg van uit-distributieproblemen in voorgetrainde diffusiemodellen beperkt.
Blur-begeleiding
Blur-begeleiding in Zelf-Aandachtbegeleiding is gebaseerd op Gaussian Blur, een lineaire filtermethode waarbij het invoersignaal wordt geconvolueerd met een Gaussian filter om een uitvoersignaal te genereren. Met een toename in de standaarddeviatie, vermindert Gaussian Blur de fijnschalige details binnen de invoersignalen en resulteert in lokaal ononderscheidbare invoersignalen door ze te gladstrijken naar de constante. Bovendien hebben experimenten een informatie-ongelijkheid aangetoond tussen het invoersignaal en het Gaussian blur-uitvoersignaal, waarbij het uitvoersignaal meer fijnschalige informatie bevat.
Op basis van deze kennis, introduceert de Zelf-Aandachtbegeleidingskader Blur-begeleiding, een techniek die intentioneel de informatie uit tussenreconstructies tijdens het diffusieproces uitsluit en in plaats daarvan deze informatie gebruikt om de voorspellingen te begeleiden naar het verhogen van de relevantie van afbeeldingen voor de invoerinformatie. Blur-begeleiding zorgt er essentieel voor dat de oorspronkelijke voorspelling meer afwijkt van de verbluurde invoervoorspelling. Bovendien voorkomt de gunstige eigenschap in Gaussian blur dat de uitvoersignalen significant afwijken van het oorspronkelijke signaal met een matige afwijking. In eenvoudige woorden, treedt verbluring op in de afbeeldingen natuurlijk, waardoor Gaussian blur een meer geschikte methode is om toe te passen op voorgetrainde diffusiemodellen.
In de Zelf-Aandachtbegeleidingspijplijn wordt het invoersignaal eerst verblurd met een Gaussian filter en vervolgens gediffundeerd met additionele ruis om het uitvoersignaal te produceren. Door dit te doen, mitigeert de SAG-pijplijn het neveneffect van de resulterende verbluring die de Gaussian ruis vermindert en maakt de begeleiding afhankelijk van inhoud in plaats van afhankelijk te zijn van willekeurige ruis. Hoewel Blur-begeleiding bevredigende resultaten oplevert op kaders met een matige begeleidingschaal, faalt het om de resultaten te repliceren op bestaande modellen met een grote begeleidingschaal, omdat het gevoelig is voor het produceren van lawaaierige resultaten, zoals wordt aangetoond in de volgende afbeelding.

Deze resultaten kunnen het gevolg zijn van de structurele ambiguïteit die in het kader wordt geïntroduceerd door globale verbluring, waardoor het voor de SAG-pijplijn moeilijk wordt om de voorspellingen van de oorspronkelijke invoer te aligneren met de gedegradeerde invoer, waardoor lawaaierige uitvoer ontstaat.
Zelf-Aandachtsmechanisme
Zoals eerder vermeld, hebben diffusiemodellen meestal een ingebouwd zelf-aandachtscomponent, en het is een van de meer essentiële componenten in een diffusiemodelkader. Het Zelf-Aandachtsmechanisme wordt geïmplementeerd in de kern van de diffusiemodellen en het staat de modellen toe om aandacht te schenken aan de belangrijke delen van de invoer tijdens het generatieve proces, zoals wordt aangetoond in de volgende afbeelding met hoogfrequente maskers in de bovenste rij en zelf-aandachtsmaskers in de onderste rij van de gegenereerde afbeeldingen.

De voorgestelde Zelf-Aandachtbegeleidingsmethode bouwt voort op hetzelfde principe en benut de capaciteiten van zelf-aandachtskaarten in diffusiemodellen. Over het algemeen, de Zelf-Aandachtbegeleidingsmethode verblurt de zelf-geattendeerde patches in het invoersignaal of, in eenvoudige woorden, verhult de informatie van patches die worden geattendeerd door de diffusiemodellen. Bovendien bevatten de uitvoersignalen in Zelf-Aandachtbegeleiding intacte regio’s van de invoersignalen, wat betekent dat het niet resulteert in structurele ambiguïteit van de invoer en lost het probleem van globale verbluring op. De pijplijn verkrijgt vervolgens de geaggregeerde zelf-aandachtskaarten door globale gemiddelde pooling uit te voeren om zelf-aandachtskaarten te aggregeren naar de dimensie en door nearest-neighbor omhoog te bemonsteren om de resolutie van het invoersignaal te matchen.
Zelf-Aandachtbegeleiding: Experimenten en Resultaten
Om de prestaties te evalueren, wordt de Zelf-Aandachtbegeleidingspijplijn bemonsterd met behulp van 8 Nvidia GeForce RTX 3090 GPU’s en is gebouwd op voorgetrainde IDDPM, ADM en Stable Diffusie-kaders.
Onvoorwaardelijke Generatie met Zelf-Aandachtbegeleiding
Om de effectiviteit van de SAG-pijplijn op onvoorwaardelijke modellen te meten en om de voorwaardelijke eigenschap die niet wordt bezeten door Classificatiebegeleiding en Classificatie-vrije Begeleiding te demonstreren, wordt de SAG-pijplijn uitgevoerd op onvoorwaardelijk getrainde kaders op 50.000 steekproeven.

Zoals te zien is, verbetert de implementatie van de SAG-pijplijn de FID, sFID en IS-metingen van onvoorwaardelijke invoer, terwijl het de recall-waarde verlaagt. Bovendien zijn de kwalitatieve verbeteringen als gevolg van de implementatie van de SAG-pijplijn zichtbaar in de volgende afbeeldingen, waarbij de afbeeldingen bovenaan de resultaten zijn van ADM en Stable Diffusie-kaders, terwijl de afbeeldingen onderaan de resultaten zijn van de ADM en Stable Diffusie-kaders met de SAG-pijplijn.


Voorwaardelijke Generatie met SAG
De integratie van de SAG-pijplijn in bestaande kaders levert uitzonderlijke resultaten op in onvoorwaardelijke generatie, en de SAG-pijplijn is in staat om voorwaardelijke generatie te produceren.
Stable Diffusie met Zelf-Aandachtbegeleiding
Hoewel het oorspronkelijke Stable Diffusie-kader hoge-kwaliteit afbeeldingen genereert, kan de integratie van het Stable Diffusie-kader met de Zelf-Aandachtbegeleidingspijplijn de resultaten aanzienlijk verbeteren. Om de invloed te evalueren, gebruiken ontwikkelaars lege prompts voor Stable Diffusie met een willekeurige zaad voor elke afbeeldingspaar en gebruiken ze humane evaluatie op 500 paren van afbeeldingen met en zonder Zelf-Aandachtbegeleiding.

Bovendien kan de implementatie van SAG de capaciteiten van het Stable Diffusie-kader verbeteren, aangezien het combineren van Classificatie-vrije Begeleiding met Zelf-Aandachtbegeleiding de reikwijdte van Stable Diffusie-modellen kan uitbreiden naar tekst-naar-afbeelding-synthese. Bovendien zijn de gegenereerde afbeeldingen van het Stable Diffusie-model met Zelf-Aandachtbegeleiding van hogere kwaliteit met minder artefacten, dankzij het zelf-conditie-effect van de SAG-pijplijn, zoals wordt aangetoond in de volgende afbeelding.

Huidige Beperkingen
Hoewel de implementatie van de Zelf-Aandachtbegeleidingspijplijn de kwaliteit van de gegenereerde afbeeldingen aanzienlijk kan verbeteren, heeft het enkele beperkingen.
Een van de belangrijkste beperkingen is de orthogonaliteit met Classificatiebegeleiding en Classificatie-vrije Begeleiding. Zoals te zien is in de volgende afbeelding, verbetert de implementatie van SAG de FID-score en de voorspellingscore, wat aangeeft dat de SAG-pijplijn een orthogonaal component bevat dat gelijktijdig kan worden gebruikt met traditionele begeleidingsmethoden.

Echter, het vereist nog steeds dat diffusiemodellen op een specifieke manier worden getraind, waardoor de complexiteit en computationele kosten toenemen.
Bovendien verhoogt de implementatie van Zelf-Aandachtbegeleiding de geheugen- of tijdsconsumptie niet, wat aangeeft dat de overhead die resulteert uit bewerkingen zoals maskeren en verbluren in SAG verwaarloosbaar is. Echter, het voegt nog steeds toe aan de computationele kosten, aangezien het een additionele stap omvat in vergelijking met benaderingen zonder begeleiding.

Slotgedachten
In dit artikel hebben we het over Zelf-Aandachtbegeleiding gehad, een nieuwe en algemene formulering van begeleidingsmethode die gebruik maakt van interne informatie die beschikbaar is binnen de diffusiemodellen voor het genereren van hoge-kwaliteit afbeeldingen. Zelf-Aandachtbegeleiding is gebaseerd op het eenvoudige principe van een algemene formulering en de veronderstelling dat interne informatie die is opgenomen in tussensteekproeven ook als begeleiding kan dienen. De Zelf-Aandachtbegeleidingspijplijn is een voorwaardelijke en trainingsvrije benadering die kan worden geïmplementeerd in verschillende diffusiemodellen en gebruikt zelf-conditie om de artefacten in de gegenereerde afbeeldingen te verminderen en de algehele kwaliteit te verbeteren.












