AI-modellen en platforms
Hoge precisie semantische beeldbewerking met EditGAN
Generatieve tegenstrijdige netwerken of GAN’s hebben de afgelopen maanden nieuwe toepassingen in de beeldbewerkingsindustrie gekregen. EditGAN wint aan populariteit in de AI/ML-industrie omdat het een novum is voor hoge precisie en hoge kwaliteit semantische beeldbewerking.
We zullen het EditGAN-model in detail bespreken en u laten weten waarom het een mijlpaal kan zijn in de semantische beeldbewerkingsindustrie.
Laten we beginnen. Maar voordat we weten wat EditGAN is, is het belangrijk om te begrijpen wat de belangrijkheid van EditGAN is en waarom het een significante stap vooruit is.
Waarom EditGAN?
Hoewel traditionele GAN-architecturen de AI-gebaseerde beeldbewerkingsindustrie aanzienlijk hebben doen vooruitgaan, zijn er enkele grote uitdagingen bij het opbouwen van een GAN-architectuur van scratch.
- Tijdens de trainingsfase heeft een GAN-architectuur een grote hoeveelheid gelabelde gegevens met semantische segmentatie-annotaties nodig.
- Ze zijn alleen in staat om hoogwaardige controle te bieden.
- En vaak interpoleren ze alleen heen en weer tussen afbeeldingen.
Het kan worden opgemerkt dat traditionele GAN-architecturen, hoewel ze het werk doen, niet effectief zijn voor grootschalige inzet. De ondermaatse efficiëntie van traditionele GAN-architectuur is de reden waarom EditGAN in 2022 door NVIDIA (NVDA ) is geïntroduceerd.
EditGAN is voorgesteld als een effectieve methode voor hoge precisie en hoge kwaliteit semantische beeldbewerking met de mogelijkheid om gebruikers toe te staan afbeeldingen te bewerken door hun zeer gedetailleerde segmentatiemaskers van een afbeelding te wijzigen. Een van de redenen waarom EditGAN een schaalbare methode is voor beeldbewerkkingstaken, is vanwege zijn architectuur.
Het EditGAN-model is gebouwd op een GAN-kader dat afbeeldingen en hun semantische segmentaties gezamenlijk modelleert en alleen een handvol gelabelde of geannoteerde trainingsgegevens nodig heeft. De ontwikkelaars van EditGAN hebben geprobeerd om een afbeelding in de latent ruimte van de GAN te embedden om de afbeelding effectief te wijzigen door conditionele latent code-optimalisatie uit te voeren in overeenstemming met de segmentatie-bewerking. Bovendien probeert het model om “bewerkingsvectoren” in de latent ruimte te vinden die de bewerkingen realiseren.
De architectuur van het EditGAN-kader laat het model toe om een willekeurig aantal bewerkingsvectoren te leren die vervolgens rechtstreeks op andere afbeeldingen met hoge snelheid en efficiëntie kunnen worden toegepast. Bovendien geven experimentele resultaten aan dat EditGAN afbeeldingen kan bewerken met een niveau van detail dat nog nooit eerder is gezien, terwijl de afbeeldingskwaliteit tot een maximum wordt behouden.
Om samen te vatten waarom we EditGAN nodig hebben, is het de eerste GAN-gebaseerde beeldbewerkingsframework die
- Zeerge precisie bewerking biedt.
- Kan werken met een handvol gelabelde gegevens.
- Effectief kan worden ingezet in real-time scenario’s.
- Compositionaliteit toelaat voor meerdere bewerkingen tegelijk.
- Werkt op GAN-gegenereerde, reële geëmbedde en zelfs uit-domein afbeeldingen.
Hoge precisie semantische beeldbewerking met EditGAN
StyleGAN2, een state-of-the-art GAN-kader voor beeldsynthese, is het primaire beeldgeneratiecomponent van EditGAN. Het StyleGAN2-kader kaart latent codes die zijn getrokken uit een pool van multivariate normale verdeling en kaart deze naar realistische afbeeldingen.
StyleGAN2 is een diep generatief model dat is getraind om afbeeldingen te synthetiseren van de hoogste kwaliteit mogelijk, samen met het verkrijgen van een semantische begrip van de gemodelleerde afbeeldingen.
Segmentatie training en inferentie
Het EditGAN-model embedt een afbeelding in de GAN’s latent ruimte met behulp van optimalisatie en een encoder om segmentatie uit te voeren op een nieuwe afbeelding en de segmentatie-tak te trainen. Het EditGAN-kader bouwt voort op eerdere werken en traint een encoder om de afbeeldingen in de latent ruimte te embedden. Het primaire doel hier is om de encoder te trainen, bestaande uit standaard pixel-wijs L2 en LPIPS constructie-verliezen, met behulp van monsters van GAN en reële trainingsgegevens. Bovendien regulariseert het model de encoder expliciet met behulp van de latent codes wanneer het werkt met GAN-monsters.
Als resultaat embedt het model de geannoteerde afbeeldingen uit de dataset, gelabeld met semantische segmentatie, in de latent ruimte en gebruikt cross-entropie-verlies om de segmentatie-tak van de generator te trainen.
Gebruik van segmentatie-bewerking om semantiek in latent ruimte te vinden
Het primaire doel van EditGAN is om de gezamenlijke verdeling van semantische segmentaties en afbeeldingen te benutten voor hoge precisie beeldbewerking. Laten we zeggen dat we een afbeelding x hebben die bewerkt moet worden, dus het model embedt de afbeelding in EditGAN’s latent ruimte of gebruikt de monster-afbeeldingen van het model zelf. De segmentatie-tak genereert y of de overeenkomstige segmentatie, voornamelijk omdat zowel RGB-afbeeldingen als segmentaties dezelfde latent codes w delen. Ontwikkelaars kunnen vervolgens elke label- of digitale schildertool gebruiken om de segmentatie te wijzigen en deze handmatig te bewerken volgens hun vereisten.

Verschillende manieren van bewerken tijdens inferentie
De latent ruimte bewerkingsvectoren die zijn verkregen met behulp van optimalisatie, kunnen worden beschreven als semantisch betekenisvol en zijn vaak ontkoppeld met verschillende attributen. Daarom kan het model, om een nieuwe afbeelding te bewerken, de afbeelding rechtstreeks in de latent ruimte embedden en dezelfde bewerkingsoperaties uitvoeren die het model eerder heeft geleerd, zonder de optimalisatie opnieuw van scratch uit te voeren. Het zou veilig zijn om te zeggen dat de bewerkingsvectoren die het model leert de optimalisatie amortiseren die essentieel was om de afbeelding initieel te bewerken.
Het is de moeite waard om op te merken dat ontwikkelaars de ontkoppeling nog niet hebben geperfectioneerd en bewerkingsvectoren vaak niet de beste resultaten opleveren wanneer ze op andere afbeeldingen worden gebruikt. Echter, het probleem kan worden overwonnen door bewerkingsartefacten uit andere delen van de afbeelding te verwijderen door enkele extra optimalisatie-stappen tijdens de testtijd uit te voeren.
Op basis van onze huidige kennis, kan het EditGAN-kader op drie verschillende manieren worden gebruikt om afbeeldingen te bewerken.
- Real-time bewerken met bewerkingsvectoren
Voor afbeeldingen die gelokaliseerd en ontkoppeld zijn, bewerkt het model de afbeeldingen door bewerkingsvectoren toe te passen die eerder zijn geleerd met verschillende schalen en manipuleert de afbeeldingen op interactieve tarieven.
- Gebruik van zelf-supervised verfijning voor vector-gebaseerde bewerking
Voor het bewerken van gelokaliseerde afbeeldingen die niet perfect ontkoppeld zijn met andere delen van de afbeelding, initialiseert het model het bewerken van de afbeelding met behulp van eerder geleerde bewerkingsvectoren en verwijdert bewerkingsartefacten door enkele extra optimalisatie-stappen tijdens de testtijd uit te voeren.
- Optimalisatie-gebaseerde bewerking
Om grote schaal- en afbeeldingsspecifieke bewerkingen uit te voeren, voert het model optimalisatie vanaf het begin uit, omdat bewerkingsvectoren niet kunnen worden gebruikt om dergelijke overdrachten naar andere afbeeldingen uit te voeren.
Implementatie
Het EditGAN-kader wordt geëvalueerd op afbeeldingen die zijn verdeeld over vier verschillende categorieën: Auto’s, Vogels, Katten en Gezichten. De segmentatie-tak van het model wordt getraind met behulp van afbeelding-masker-paren van 16, 30, 30, 16 als gelabelde trainingsgegevens voor Auto’s, Vogels, Katten en Gezichten respectievelijk. Wanneer de afbeelding puur met optimalisatie wordt bewerkt of wanneer het model probeert de bewerkingsvectoren te leren, voert het model 100 optimalisatie-stappen uit met de Adam-optimalisator.
Voor de dataset van Katten, Auto’s en Gezichten, gebruikt het model reële afbeeldingen uit de testset van DatasetGAN die niet zijn gebruikt om de GAN te trainen voor het uitvoeren van bewerkingsfunctionaliteit. Deze afbeeldingen worden rechtstreeks in de latent ruimte van EditGAN geëmbed met behulp van optimalisatie en codering. Voor de categorie Vogels wordt de bewerking getoond op GAN-gegenereerde afbeeldingen.
Resultaten
Kwalitatieve resultaten
In-domein resultaten

De bovenstaande afbeelding toont de prestaties van het EditGAN-kader wanneer het eerder geleerde bewerkingsvectoren toepast op nieuwe afbeeldingen en de afbeeldingen verfijnt met 30 optimalisatie-stappen. Deze bewerkingsoperaties die door het EditGAN-kader worden uitgevoerd, zijn ontkoppeld voor alle klassen en behouden de algehele kwaliteit van de afbeeldingen. In vergelijking met de resultaten van EditGAN en andere kaders, kan worden opgemerkt dat het EditGAN-kader andere methoden overtreft bij het uitvoeren van hoge precisie- en complexe bewerkingen, terwijl het onderwerp-identiteit en afbeeldingskwaliteit op hetzelfde moment behoudt.
Wat verbazingwekkend is, is dat het EditGAN-kader extreem hoge precisie bewerkingen kan uitvoeren, zoals het verwijden van de pupillen of het bewerken van de velgspaken in de banden van een auto. Bovendien kan EditGAN ook worden gebruikt om semantische delen van objecten te bewerken die slechts enkele pixels hebben, of om grote schaalwijzigingen in een afbeelding aan te brengen. Het is de moeite waard om op te merken dat de verschillende bewerkingsoperaties van het EditGAN-kader in staat zijn om gemanipuleerde afbeeldingen te genereren die niet in de GAN-trainingsgegevens voorkomen.
Uit-domein resultaten
Om de prestaties van EditGAN buiten het domein te evalueren, is het kader getest op de MetFaces-dataset. Het EditGAN-model gebruikt in-domein reële gezichten om bewerkingsvectoren te creëren. Het model embedt vervolgens MetFaces-portretten die buiten het domein liggen met behulp van een 100-staps optimalisatieproces en past de bewerkingsvectoren toe via een 30-staps zelf-supervised verfijningsproces. De resultaten kunnen worden gezien in de volgende afbeelding.

Kwantitatieve resultaten
Om de beeldbewerkingsmogelijkheden van EditGAN kwantitatief te meten, gebruikt het model een glimlach-bewerkingsbenchmark die voor het eerst is geïntroduceerd door MaskGAN. Gezichten met een neutrale expressie worden vervangen door glimlachende gezichten en de prestaties worden gemeten over drie parameters.
- Semantische correctheid
Het model gebruikt een vooraf getrainde glimlach-attribuut-classificator om te meten of de gezichten in de afbeeldingen glimlachende expressies vertonen na bewerking.
- Verdelingsniveau beeldkwaliteit
Kernel Inception Distance of KID en Frechet Inception Distance of FID wordt berekend tussen de CelebA-testdataset en 400 bewerkte testafbeeldingen.
- Identiteitsbehoud
De mogelijkheid van het model om de identiteit van onderwerpen te behouden wanneer de afbeelding wordt bewerkt, wordt gemeten met behulp van een vooraf getraind ArcFace-kenmerk-extractienetwerk.

De bovenstaande tabel vergelijkt de prestaties van het EditGAN-kader met andere baseline-modellen op de glimlach-bewerkingsbenchmark. De methode die door het EditGAN-kader wordt gevolgd om dergelijke hoge resultaten te leveren, wordt vergeleken met drie verschillende baseline-modellen:
- MaskGAN
MaskGAN neemt niet-glimlachende afbeeldingen samen met hun segmentatiemaskers en een doel-glimlach-segmentatiemasker als invoer. Het is de moeite waard om op te merken dat, in vergelijking met EditGAN, het MaskGAN-kader een grote hoeveelheid geannoteerde gegevens nodig heeft.
- Lokale bewerking
EditGAN vergelijkt ook zijn prestaties met lokale bewerking, een methode die wordt gebruikt om GAN-kenmerken te clusteren om lokale bewerking te implementeren en die afhankelijk is van referentie-afbeeldingen.
- InterFaceGAN
Net als EditGAN, probeert InterFaceGAN ook om bewerkingsvectoren in de latent ruimte van het model te vinden. Echter, in tegenstelling tot EditGAN, gebruikt het InterFaceGAN-kader een grote hoeveelheid geannoteerde gegevens, hulp-attribuut-classificatoren en heeft het geen fijne bewerkingsprecisie.
- StyleGAN2Distillatie
Deze methode creëert een alternatieve benadering die geen reële afbeeldingsembeddings nodig heeft, maar in plaats daarvan een bewerkingsvector-model gebruikt om een trainingsdataset te creëren.

Beperkingen
Omdat EditGAN is gebaseerd op het GAN-kader, heeft het dezelfde beperking als elk ander GAN-model: het kan alleen werken met afbeeldingen die kunnen worden gemodelleerd door de GAN. De beperking van EditGAN om alleen te werken met GAN-gemodelleerde afbeeldingen is de belangrijkste reden waarom het moeilijk is om EditGAN in verschillende scenario’s te implementeren. Echter, het is de moeite waard om op te merken dat de hoge precisie bewerkingen van EditGAN gemakkelijk kunnen worden overgedragen naar andere afbeeldingen door gebruik te maken van bewerkingsvectoren.
Conclusie
Een van de belangrijkste redenen waarom GAN geen industrienorm is in het veld van beeldbewerking, is vanwege de beperkte praktische toepasbaarheid. GAN-kaders vereisen meestal een grote hoeveelheid geannoteerde trainingsgegevens en leveren niet vaak een hoge efficiëntie en nauwkeurigheid.
EditGAN probeert de problemen die worden gepresenteerd door conventionele GAN-kaders aan te pakken en probeert een effectieve methode te zijn voor hoge kwaliteit en hoge precisie semantische beeldbewerking. De resultaten tot nu toe hebben aangetoond dat EditGAN inderdaad biedt wat het claimt en dat het al beter presteert dan sommige van de huidige industrienormen en -modellen.












