Andersons vinkel

Plastisk Kirurgi for GAN-Genererede Ansigter

mm
Føj Unite.AI til dine foretrukne kilder på Google
Improvements in synthetically generated (GAN) images

Nyt forskning fra Sydkorea lover at forbedre kvaliteten af syntetisk ansigtsdata skabt af Generative Adversarial Networks (GANs).

Systemet kan identificere billedartefakter produceret af GAN-processer og afhjælpe dem, selv til punktet med at erstatte hår, der var skjult af en kasket, erstatte dele af ansigtet, der helt mangler i originalen, og fjerne forhindringer som hænder og solbriller, og fungerer også godt på scenerisk og arkitektonisk output.

GAN-korrektion

Venstre for hver kolonne, det originale GAN-output med fejl, efterfulgt af to andre tilgange til artefakterne, og til sidst af metoden brugt af de sydkoreanske forskere. Kilde: https://arxiv.org/pdf/2104.06118.pdf

De fleste nyere tilgange til at forbedre kvaliteten af GAN-genererede billeder har taget stilling til, at artefakter er en beskæftigelsesrelateret skade af processen, og behandle metoden som en ‘naturs kraft’, og de mere psykedeliske eller aberrationale resultater, som den kan producere, som en uundgåelig biprodukt.

I stedet foreslår den sydkoreanske forskning faktisk at ‘fikse’ berørte billeder på en måde, der ikke forstyrer den fortsatte generative kæde, ved at identificere aspekter, der forårsager artefakter, og reducere eller eliminere deres indflydelse i GAN-netværket på et semi-overvåget niveau, der overgår og udvider de native selvkorrektionsmekanismer i GAN-arkitekturen.

Til projektet var det nødvendigt at oprette en bredt anvendelig håndmærket dataset af billeder, der var stærkt berørt af GAN-artefakter. Initialt brugte forskerne Frechet Inception Distance (FID), en metrik, der vurderer kvaliteten af GAN-output ved at sammenligne funktioner i billederne, som en kvalificeringsenhed. De 10.000 billeder med de højeste FID-scores blandt en række af 200.000 billeder blev brugt som diskrete ‘artefakt-enheder’. Herefter mærkede forskerne 2.000 genererede billeder, klassificerede hver som ‘normal’ eller berørt af FID-artefakter. Så blev der oprettet en model til at klassificere datasettet i artefakt, normal og tilfældige virkelige eksempler.

Efter dette blev Gradient-weighted Class Activation Mapping (Grad-CAM) brugt til at generere masker for artefakt-påvirkede områder, effektivt automatiserende mærkning af fejl.

Grad-CAM-masker

I billedet ovenfor er Grad-CAM-maskerne blevet anvendt på output fra LSUN-Church outdoor-datasettet og CelebA-HQ-datasettet.

Ved at analysere de 20 mest ramte resultater fra en række af 20.000 billeder genereres segmenteringsmasker, hvori repræsentative resultater på tværs af generationerne (som sandsynligvis er mere nøjagtige eller overbevisende end artefakterne) kan erstattes ved at sænke aktiveringen af de artefakt-producerende enheder i efterfølgende generationer.

Menneskelig vurdering af korrektionerne resulterede i, at 53% af de ‘reparerede’ billeder blev mærket som ‘normale’, mens 97% af de originale billeder stadig viser betydelige forbedringer på originalerne.

Forskerne hævder, at denne metode, med nogle mindre ombygninger, også kan tilpasses til NVIDIA’s StyleGAN2.

GAN-brillefjernelse

Fordele Ved Syntetisk Data

Primært i forhold til ansigtsdata er den generelle mangel på virkelige verdens datasets for computer vision en hindring for divers forskning i vigtige forskningssektorer, såsom ansigtsgenkendelse, emotion-genkendelse, medicinsk forskning og studier i mere detaljeret segmentering af ansigtets topologi, blandt andre felter.

Den nuværende modreaktion mod fri brug af web-orienteret data og den ad hoc-samling af virkelige ansigtsbilleder til inklusion i ansigtsdatabaser er en yderligere hindring for forskning, med en stigende antal stater og nationer indfører restriktionerweb-scraping, og tilførslen af sociale medie-billeder til disse formål.

Over de sidste ti år har et begrænset antal højtydende ansigtsdatasets tilbudt en tilflugt fra denne usikkerhed, med forskellige årlige offentlige forskningsudfordringer centreret omkring dem. Men dette har sandsynligvis ført til, at forskningsprojekter har tilpasset deres metoder specifikt til disse datasets, med konsistente og sammenlignelige resultater fra år til år, opnået til en høj pris for manglen på diversitet i kilde materialet – en situation, der bliver værre hvert år, nye forskningsprojekter begrænser sig til disse rammer.

Desuden har nogle af disse ‘traditionelle’ datasets været under kritik for mangel på racemæssig diversitet, hvilket antyder, at disse benchmark-støtter måske ikke længere anses for egnede ressourcer i den nærmeste fremtid.

Dette betyder, at der er behov for højkvalitets ansigtsdata, der er realistisk, men hvor de bidragende ‘virkelige verdens’-billeder er blevet transformeret langt ud over genkendelighed. Selv om denne brug af virkelige ansigtsdata ‘på afstand’ måske selv kan udløse problemer over herkomst af GAN-genererede ansigter, er det en forhindring, der sandsynligvis ikke vil opstå, før der er etableret juridiske og tekniske mekanismer for dataindsamling af denne art; og i forhold til mulige ændringer af lovgivningsrammerne omkring sagen, er det stadig en mindre fare end at bruge billeder af virkelige mennesker.

Fremtidig Læsning:

Forbedring af Synthetic Images
Automatisk Korrektion af Interne Enheder i Generative Neurale Netværk

Forfatter til maskinlæringsartikler, domæneekspert i menneskeskabt billedsynthese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]