Andersons hoek

Adobe Research breidt Disentangled GAN Face Editing uit

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Het is niet moeilijk om te begrijpen waarom entanglement een probleem is in beeldsynthese, omdat het vaak een probleem is in andere gebieden van het leven; bijvoorbeeld, het is veel moeilijker om kurkuma uit een curry te verwijderen dan om een augurk uit een hamburger te verwijderen, en het is praktisch onmogelijk om een kop koffie ontzoet te maken. Sommige dingen komen gewoon in een bundel.

Evenzo is entanglement een obstakel voor beeldsynthesearchitecturen die idealiter verschillende functies en concepten willen scheiden wanneer ze machine learning gebruiken om gezichten (of honden, boten of elk ander domein) te maken of te bewerken.

Als je functies zoals leeftijd, geslacht, haarkleur, huidskleur, emotie enzovoort kunt scheiden, heb je het begin van echte instrumentatie en flexibiliteit in een kader dat gezichtsbeelden op een echt granulair niveau kan maken en bewerken, zonder ongewenste ‘passagiers’ in deze conversies mee te nemen.

Bij maximale entanglement (boven links) kun je alleen het beeld van een geleerd GAN-netwerk veranderen in het beeld van een andere persoon.

Dit is effectief het gebruik van de laatste AI-computervisietechnologie om iets te bereiken dat al meer dan dertig jaar geleden op andere manieren was opgelost .

Met een zekere mate van scheiding (‘Medium Separation’ in eerder bovenstaand beeld) is het mogelijk om stijlgebaseerde veranderingen aan te brengen, zoals haarkleur, expressie, cosmetische toepassing en beperkte hoofdrotatie, onder andere.

Bron: FEAT: Face Editing with Attention, februari 2022, https://arxiv.org/pdf/2202.02713.pdf

Bron: FEAT: Face Editing with Attention, februari 2022, https://arxiv.org/pdf/2202.02713.pdf

Er zijn de afgelopen twee jaar verschillende pogingen gedaan om interactieve gezichtsbewerkingsomgevingen te maken die een gebruiker in staat stellen om gezichtskenmerken te veranderen met schuifregelaars en andere traditionele UI-interacties, terwijl de kernfuncties van het doelgezicht intact blijven wanneer toevoegingen of veranderingen worden aangebracht. Dit is echter een uitdaging gebleken vanwege de onderliggende functie/stijlentanglement in de latent ruimte van de GAN.

Om bijvoorbeeld het bril-kenmerk is vaak verweven met het geleefd-kenmerk, wat betekent dat het toevoegen van een bril ook het ‘verouderen’ van het gezicht kan betekenen, terwijl het verouderen van het gezicht ook een bril kan toevoegen, afhankelijk van de mate van toegepaste scheiding van hoogwaardige functies (zie ‘Testen’ hieronder voor voorbeelden).

Het is bijna onmogelijk om de haarkleur en andere haaspecten te veranderen zonder dat de haarstrengen en -dispositie opnieuw worden berekend, wat een ‘sissend’, overgangs-effect geeft.

Bron: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Bron: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Latent-to-Latent GAN Traversal

Een nieuw door Adobe geleid onderzoek ingeschreven voor WACV 2022 biedt een novelle aanpak voor deze onderliggende problemen in een artikel getiteld Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images.

Aanvullend materiaal uit het artikel Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images. Hier zien we dat basiskenmerken in het geleerde gezicht niet worden meegesleept in niet-gerelateerde veranderingen. Zie de volledige video-embed aan het einde van het artikel voor betere details en resolutie. Bron: https://www.youtube.com/watch?v=rf_61llRH0Q

Aanvullend materiaal uit het artikel Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images. Hier zien we dat basiskenmerken in het geleerde gezicht niet worden meegesleept in niet-gerelateerde veranderingen. Zie de volledige video-embed aan het einde van het artikel voor betere details en resolutie. Bron: https://www.youtube.com/watch?v=rf_61llRH0Q

Het artikel is interessant omdat Adobe al enige tijd in deze ruimte actief is, en het is verleidelijk om je voor te stellen dat deze functionaliteit in de komende jaren in een Creative Suite-project terechtkomt; maar vooral omdat de architectuur die voor het project is gemaakt, een andere aanpak heeft voor het behoud van visuele integriteit in een GAN-gezichtsbewerker tijdens het toepassen van veranderingen.

De auteurs verklaren:

‘[We] trainen een neurale netwerk om een latent-to-latent-transformatie uit te voeren die de latent encoding vindt die overeenkomt met het beeld met het gewijzigde kenmerk. Aangezien de techniek eenmalig is, vertrouwt het niet op een lineaire of niet-lineaire traject van de geleidelijke verandering van de kenmerken.’

‘Door het netwerk eind-tot-eind over de volledige generatiepijplijn te trainen, kan het systeem zich aanpassen aan de latent ruimtes van standaard generatorarchitecturen. Conserverings-eigenschappen, zoals het behoud van de identiteit van de persoon, kunnen worden gecodeerd in de vorm van trainingsverliezen. ‘

‘Zodra het latent-to-latent-netwerk was getraind, kan het opnieuw worden gebruikt voor willekeurige beelden zonder opnieuw te trainen.’

Dit laatste betekent dat de voorgestelde architectuur bij de eindgebruiker in een voltooide staat arriveert. Het moet nog steeds een neurale netwerk op lokale middelen uitvoeren, maar nieuwe beelden kunnen ‘ingevallen’ worden en zijn klaar voor bewerking, aangezien het kader voldoende losgekoppeld is om geen verdere beeldspecifieke training nodig te hebben.

Geslacht en gezichtsbeharing veranderd terwijl schuifregelaars willekeurige en arbitrare paden door de latent ruimte ploten, niet alleen 'tussen eindpunten schrobben'.

Geslacht en gezichtsbeharing veranderd terwijl schuifregelaars willekeurige en arbitrare paden door de latent ruimte ploten, niet alleen ‘tussen eindpunten schrobben’. Zie de video aan het einde van het artikel voor meer transformaties in betere resolutie.

Onder de belangrijkste prestaties in het werk is de mogelijkheid van het netwerk om ‘identiteiten in de latent ruimte te bevriezen’ door alleen het kenmerk in een doelvector te veranderen en ‘correctie-termen’ te bieden die identiteiten die worden getransformeerd, behouden.

Feitelijk is het voorgestelde netwerk ingebed in een bredere architectuur die alle verwerkte elementen orkestreert, die door vooraf getrainde componenten met bevroren gewichten gaan die geen ongewenste laterale effecten op transformaties zullen produceren.

Aangezien het trainingsproces afhankelijk is van triplets die kunnen worden gegenereerd door een zaadbeeld (onder GAN-inversie) of een bestaande initiële latent encoding, is het hele trainingsproces onbegeleid, met de stilzwijgende acties van het gebruikelijke bereik van label- en curatorssystemen in dergelijke systemen effectief in de architectuur gebakken. Feitelijk gebruikt het nieuwe systeem standaard attribuutregressors:

‘[Het] aantal kenmerken dat ons netwerk onafhankelijk kan controleren, is alleen beperkt door de mogelijkheden van de herkenner(s) – als je een herkenner voor een kenmerk hebt, kun je het toevoegen aan willekeurige gezichten. In onze experimenten hebben we het latent-to-latent-netwerk getraind om de aanpassing van 35 verschillende gezichtskenmerken toe te staan, meer dan elke eerdere benadering.’

Het systeem omvat een extra veiligheidsmaatregel tegen ongewenste ‘neveneffect’-transformaties: in de afwezigheid van een verzoek om een kenmerkverandering, zal het latent-to-latent-netwerk een latent vector toewijzen aan zichzelf, waardoor de stabiele persistentie van de doelidentiteit verder toeneemt.

Gezichtsherkenning

Een terugkerend probleem met GAN- en encoder/decoder-gebaseerde gezichtsbewerkers van de afgelopen jaren is dat toegepaste transformaties de gelijkenis tendens tot verslechtering hebben. Om dit te bestrijden, gebruikt het Adobe-project een ingebed gezichtsherkenningssysteem genaamd FaceNet als discriminator.

Projectarchitectuur, zie onder midden-links voor de opname van FaceNet. Bron: Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images, OpenAccess.

Projectarchitectuur, zie onder midden-links voor de opname van FaceNet. Bron: Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images, OpenAccess.

(Als persoonlijke noot lijkt dit een bemoedigende stap naar de integratie van standaard gezichtsidentificatie- en expressieherkenningssystemen in generatieve netwerken, waarschijnlijk de beste manier om de blinde pixel-naar-pixel-mapping te overwinnen die de huidige deepfake-architecturen domineert ten koste van expressiefideliteit en andere belangrijke domeinen in de gezichtsgeneratiesector.)

Toegang tot alle gebieden in de latent ruimte

Een andere indrukwekkende functie van het kader is de mogelijkheid om willekeurig tussen potentiële transformaties in de latent ruimte te reizen, op gebruikerswhim. Verschillende eerdere systemen die exploratoire interfaces boden, lieten de gebruiker vaak ‘schrobben’ tussen vaste functietransformatietijden – indrukwekkend, maar vaak een lineaire of voorgeschreven ervaring.

Van Improving GAN Equilibrium by Raising Spatial Awareness: hier scrubbet de gebruiker door een reeks van potentiële overgangspunten tussen twee latent ruimte-locaties, maar binnen de grenzen van vooraf getrainde locaties in de latent ruimte. Om andere soorten transformaties op basis van hetzelfde materiaal toe te passen, is herconfiguratie en/of opnieuw trainen noodzakelijk. Bron: https://genforce.github.io/eqgan/

Van Improving GAN Equilibrium by Raising Spatial Awareness: hier scrubbet de gebruiker door een reeks van potentiële overgangspunten tussen twee latent ruimte-locaties, maar binnen de grenzen van vooraf getrainde locaties in de latent ruimte. Om andere soorten transformaties op basis van hetzelfde materiaal toe te passen, is herconfiguratie en/of opnieuw trainen noodzakelijk. Bron: https://genforce.github.io/eqgan/

Naast het feit dat het ontvankelijk is voor geheel nieuwe gebruikersbeelden, kan de gebruiker ook handmatig ‘bevriezen’ van elementen die hij wil conserveren tijdens het transformatieproces. Op deze manier kan de gebruiker ervoor zorgen dat (bijvoorbeeld) achtergronden niet verschuiven of dat ogen open of dicht blijven.

Gegevens

Het attribuutregressienetwerk werd getraind op drie netwerken: FFHQ, CelebAMask-HQ en een lokaal, GAN-gegenereerd netwerk verkregen door 400.000 vectoren te bemonsteren uit de Z-ruimte van StyleGAN-V2.

Uit-distributiebeelden (OOD) werden gefilterd en attributen werden geëxtraheerd met behulp van Microsoft’s Face API, waarna het resulterende beeldenset werd gesplitst in 90/10, waardoor 721.218 trainingsbeelden en 72.172 testbeelden overbleven om te vergelijken.

Testen

Hoewel het experimentele netwerk aanvankelijk was geconfigureerd om 35 potentiële transformaties te accommoderen, werden deze teruggeschroefd tot acht om analoge tests uit te voeren tegen de vergelijkbare kaders InterFaceGAN, GANSpace en StyleFlow.

De acht geselecteerde kenmerken waren Leeftijd, Kaaldheid, Baard, Expressie, Geslacht, Bril, Pitch en Yaw. Het was noodzakelijk om de concurrerende kaders opnieuw in te richten voor sommige van de acht kenmerken die niet in de oorspronkelijke distributie waren voorzien, zoals het toevoegen van kaaldheid en baard aan InterFaceGAN.

Er trad, zoals verwacht, een grotere mate van entanglement op in de rivaliserende architectuur. Bijvoorbeeld, in één test, veranderden InterFaceGAN en StyleFlow beiden het geslacht van de persoon toen ze werden gevraagd om leeftijd toe te passen:

Twee van de concurrerende kaders rolden een geslachtsverandering in de 'leeftijd'-transformatie, evenals het veranderen van de haarkleur zonder directe opdracht van de gebruiker.

Twee van de concurrerende kaders rolden een geslachtsverandering in de ‘leeftijd’-transformatie, evenals het veranderen van de haarkleur zonder directe opdracht van de gebruiker.

Bovendien vonden twee van de rivalen dat bril en leeftijd onlosmakelijke facetten zijn:

Bril en haarkleur verandering erbij voor niets!

Bril en haarkleur verandering erbij voor niets!

Het is geen uniforme overwinning voor het onderzoek: zoals te zien is in de bijgevoegde video die aan het einde van het artikel is ingebed, is het kader het minst effectief bij het extrapoleren van diverse hoeken (yaw), terwijl GANSpace een beter algemeen resultaat heeft voor leeftijd en de oplegging van bril. Het latent-to-latent-kader is gelijk aan GANSpace en StyleFlow met betrekking tot het toevoegen van pitch (hoofdhoek).

Resultaten berekend op basis van een kalibratie van de MTCNN-gezichtsdetector. Lagere resultaten zijn beter.

Resultaten berekend op basis van een kalibratie van de MTCNN-gezichtsdetector. Lagere resultaten zijn beter.

Voor meer details en betere resolutie van voorbeelden, bekijk de bijgevoegde video van het artikel hieronder.

Eerst gepubliceerd op 16 februari 2022.

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai