Andersons hoek

Emoties in videobeelden veranderen met AI

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Onderzoekers uit Griekenland en het VK hebben een novuele diepe leerbenadering ontwikkeld om de uitdrukkingen en de schijnbare gemoedstoestand van mensen in videobeelden te veranderen, terwijl de geloofwaardigheid van hun lipbewegingen in overeenstemming met het originele geluid wordt behouden op een manier die eerder pogingen niet heeft kunnen evenaren.

Uit de video die bij het artikel is gevoegd (aan het einde van dit artikel), een korte clip van acteur Al Pacino waarvan de uitdrukking subtiel wordt gewijzigd door NED, op basis van hoogwaardige semantische concepten. Bron: https://www.youtube.com/watch?v=Li6W8pRDMJQ

Uit de video die bij het artikel is gevoegd (aan het einde van dit artikel), een korte clip van acteur Al Pacino waarvan de uitdrukking subtiel wordt gewijzigd door NED, op basis van hoogwaardige semantische concepten die individuele gezichtsuitdrukkingen definiëren en hun geassocieerde emotie. De ‘Reference-Driven’-methode aan de rechterkant neemt de geïnterpreteerde emotie(s) van een bronvideo en past deze toe op de gehele videosequentie. Bron: https://www.youtube.com/watch?v=Li6W8pRDMJQ

Dit specifieke veld valt binnen de groeiende categorie van deepfaked emoties, waarbij de identiteit van de oorspronkelijke spreker wordt behouden, maar hun uitdrukkingen en micro-uitdrukkingen worden gewijzigd. Naarmate deze specifieke AI-technologie volwassener wordt, biedt het de mogelijkheid voor film- en tv-producties om subtiele wijzigingen aan te brengen in de uitdrukkingen van acteurs – maar het opent ook een vrij nieuwe categorie van ’emotie-gewijzigde’ video-deepfakes.

Veranderende gezichten

Gezichtsuitdrukkingen van publieke figuren, zoals politici, worden zorgvuldig gecultiveerd; in 2016 kwam Hillary Clinton’s gezichtsuitdrukkingen onder intensieve mediabeoordeling voor hun potentieel negatieve impact op haar electorale vooruitzichten; gezichtsuitdrukkingen blijken ook een onderwerp van interesse te zijn voor de FBI; en ze zijn een kritische indicator in sollicitatiegesprekken, waardoor de (verre) vooruitzicht van een live ‘uitdrukking-controle’-filter een gewenste ontwikkeling is voor sollicitanten die proberen een voorselectie te doorstaan op Zoom.

Een onderzoek uit 2005 uit het VK beweerde dat gezichtsuitdrukking invloed heeft op stembeslissingen, terwijl een artikel uit 2019 in de Washington Post de gebruik van ‘uit de context’ video clip delen onderzocht, wat momenteel het dichtstbijzijnde is dat voorstanders van nepnieuws hebben om daadwerkelijk te kunnen veranderen hoe een publieke figuur lijkt te gedragen, reageren of voelt.

Naar neurale expressie-manipulatie

Op dit moment is de staat van de kunst in het manipuleren van faciale affect nogal rudimentair, omdat het het ontwarren van hoogwaardige concepten (zoals verdrietig, boos, gelukkig, lachend) van daadwerkelijke video-inhoud betreft. Hoewel traditionele deepfake-architecturen deze ontwarren heel goed lijken te doen, is het nog steeds nodig dat twee trainingsface-sets overeenkomende uitdrukkingen voor elke identiteit bevatten.

Omdat gezichtsidentificatie en pose-karakteristieken momenteel zo verweven zijn, is een brede gelijkheid van expressie, hoofdpose en (in mindere mate) belichting nodig over twee gezichtsdatasets om een effectief deepfake-model te trainen op systemen zoals DeepFaceLab. Hoe minder een bepaalde configuratie (zoals 'zij-aanzicht/lachend/beschenen') in beide face-sets wordt weergegeven, hoe minder nauwkeurig het zal worden weergegeven in een deepfake-video, als dat nodig is.

Typische voorbeelden van gezichtsbeelden in datasets die worden gebruikt om deepfakes te trainen. Momenteel kunt u alleen iemands gezichtsuitdrukking manipuleren door ID-specifieke expressie→expressie-padwerken te creëren in een deepfake-neuraal netwerk. Deepfake-software uit 2017 heeft geen intrinsieke, semantische begrip van een ‘lach’ – het kaart alleen waargenomen veranderingen in gezichtsgeometrie over de twee onderwerpen.

Wat wenselijk is en nog niet perfect is bereikt, is om te herkennen hoe onderwerp B (bijvoorbeeld) lacht en gewoon een ‘lach’ schakelaar in de architectuur te creëren, zonder dat het nodig is om het te koppelen aan een equivalent beeld van onderwerp A dat lacht.

Het nieuwe artikel heet Neural Emotion Director: Speech-preserving semantic control of facial expressions in “in-the-wild” videos en komt van onderzoekers aan de School of Electrical & Computer Engineering van de National Technical University of Athens, het Institute of Computer Science van de Foundation for Research and Technology Hellas (FORTH) en de College of Engineering, Mathematics and Physical Sciences van de University of Exeter in het VK.

Het team heeft een kader ontwikkeld genaamd Neural Emotion Director (NED), dat een 3D-gebaseerd emotie-translatienetwerk omvat, 3D-Based Emotion Manipulator.

NED neemt een ontvangen reeks expressieparameters en vertaalt deze naar een doeldomein. Het is getraind op ongepaarde gegevens, wat betekent dat het niet nodig is om te trainen op datasets waarbij elke identiteit overeenkomende gezichtsuitdrukkingen heeft.

De video, die aan het einde van dit artikel wordt weergegeven, loopt door een reeks tests waarbij NED een schijnbare emotionele toestand oplegt aan beelden uit de YouTube-dataset.

De video, die aan het einde van dit artikel wordt weergegeven, loopt door een reeks tests waarbij NED een schijnbare emotionele toestand oplegt aan beelden uit de YouTube-dataset.

De auteurs claimen dat NED de eerste video-gebaseerde methode is voor het ‘regisseren’ van acteurs in willekeurige en onvoorspelbare situaties en hebben de code beschikbaar gemaakt op de projectpagina van NED.

Methode en architectuur

Het systeem is getraind op twee grote videodatasets die zijn geannoteerd met ’emotie’-labels.

De uitvoer wordt mogelijk gemaakt door een video-gezichtsrenderer die het gewenste emotionele toestand weergeeft in video met behulp van traditionele gezichtssynthesetechnieken, waaronder gezichtssegmentatie, gezichtslandmarkalignering en mengen, waarbij alleen het gezichtsgebied wordt gesynthetiseerd en vervolgens opgelegd aan de oorspronkelijke beelden.

De architectuur voor de pipeline van de Neural Emotion Detector (NED). Bron: https://arxiv.org/pdf/2112.00585.pdf

De architectuur voor de pipeline van de Neural Emotion Detector (NED). Bron: https://arxiv.org/pdf/2112.00585.pdf

Aanvankelijk verkrijgt het systeem 3D-gezichtsherstel en legt gezichtslandmarkaligneringen op aan de invoerframes om de expressie te identificeren. Vervolgens worden deze herstelde expressieparameters doorgegeven aan de 3D-gebaseerde Emotion Manipulator, en een stijlvector berekend door middel van een semantische label (zoals ‘gelukkig’) of door een referentiebestand.

Een referentiebestand is een video die een specifieke herkende expressie/emotie weergeeft, die vervolgens wordt opgelegd aan de gehele doelvideo, waarbij de oorspronkelijke expressie wordt verwijderd.

Stadia in de emotie-overdrachtspipeline, met verschillende acteurs die zijn bemonsterd uit YouTube-videos.

Stadia in de emotie-overdrachtspipeline, met verschillende acteurs die zijn bemonsterd uit YouTube-videos.

De uiteindelijk gegenereerde 3D-gezichtsvorm wordt vervolgens samengevoegd met de Normalized Mean Face Coordinate (NMFC) en de oogafbeeldingen (de rode stippen in de bovenstaande afbeelding), en doorgegeven aan de neurale renderer, die de uiteindelijke manipulatie uitvoert.

Resultaten

De onderzoekers voerden uitgebreide studies uit, waaronder gebruikers- en ablatiestudies, om de effectiviteit van de methode te evalueren ten opzichte van eerder werk, en vonden dat NED in de meeste categorieën de huidige stand van de kunst in deze subsector van neurale gezichtsmanipulatie overtreft.

De auteurs van het artikel voorzien dat latere implementaties van dit werk, en tools van een soortgelijke aard, voornamelijk nuttig zullen zijn in de tv- en filmindustrie, en verklaren:

‘Onze methode opent een groot aantal nieuwe mogelijkheden voor nuttige toepassingen van neurale renderTechnologieën, variërend van filmnabewerking en videospellen tot foto-realistische affectieve avatars.’

Dit is een vroeg werk in het veld, maar een van de eerste die gezichtsreenactment met video probeert in plaats van stilbeelden. Hoewel video’s in wezen veel stilbeelden zijn die heel snel achter elkaar worden afgespeeld, zijn er tijdelijke overwegingen die eerdere toepassingen van emotie-overdracht minder effectief maken. In de bijgevoegde video en voorbeelden in het artikel zijn visuele vergelijkingen opgenomen van de uitvoer van NED ten opzichte van andere vergelijkbare recente methoden.

Meer gedetailleerde vergelijkingen en veel meer voorbeelden van NED zijn te vinden in de volledige video hieronder:

 

3 december 2021, 18:30 GMT+2 – Op verzoek van een van de auteurs van het artikel zijn correcties aangebracht met betrekking tot het ‘referentiebestand’, dat ik ten onrechte had gesteld als een stil foto (terwijl het in feite een videoclip is). Ook een correctie van de naam van het Institute of Computer Science van de Foundation for Research and Technology.
3 december 2021, 20:50 GMT+2 – Een tweede verzoek van een van de auteurs van het artikel voor een verdere correctie van de naam van de bovengenoemde instelling.

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai