Andersons hoek
Het herschikken van gezichten in video’s met machine learning

Een onderzoeksproject tussen China en het VK heeft een nieuwe methode ontwikkeld om gezichten in video’s te herschikken. De techniek maakt het mogelijk om de gezichtsstructuur overtuigend te verbreden en te verkleinen, met een hoge consistentie en zonder artifacten.

Uit een YouTube-video die door de onderzoekers als bronmateriaal werd gebruikt, lijkt actrice Jennifer Lawrence als een meer uitgemergelde persoonlijkheid (rechts). Bekijk de bijgevoegde video onderaan het artikel voor meer voorbeelden in betere resolutie. Bron: https://www.youtube.com/watch?v=tA2BxvrKvjE
Dit soort transformatie is meestal alleen mogelijk met traditionele CGI-methoden die het hele gezicht via gedetailleerde en dure motion-capping-, rigging- en textuurprocedures zouden moeten herscheppen.
In plaats daarvan wordt de CGI in de techniek geïntegreerd in een neurale pipeline als parametrische 3D-gezichtsinformatie die vervolgens als basis wordt gebruikt voor een machine learning-workflow.

Traditionele parametrische gezichten worden steeds vaker gebruikt als richtlijnen voor transformatieprocessen die AI in plaats van CGI gebruiken. Bron: https://arxiv.org/pdf/2205.02538.pdf
De auteurs verklaren:
‘Ons doel is om hoogwaardige portretvideo’s te produceren door de algehele vorm van de portretgezichten te bewerken volgens de natuurlijke gezichtsdeformatie in de echte wereld. Dit kan worden gebruikt voor toepassingen zoals het genereren van gezichten voor schoonheidsbehandelingen en gezichtsvergroting voor visuele effecten.’
Hoewel 2D-gezichtsvervorming en -verdraaiing al beschikbaar is voor consumenten sinds de introductie van Photoshop (en heeft geleid tot vreemde en vaak onaanvaardbare subculturen rond gezichtsvervorming en lichaamsdysmorfie), is het een moeilijke truc om dit in video’s te doen zonder CGI.

Mark Zuckerberg’s gezichtsafmetingen worden uitgebreid en verkleind door de nieuwe Chinese/Britse techniek.
Lichaamsherschikking is momenteel een gebied van intense interesse in de computerzichtsector, voornamelijk vanwege het potentieel in mode-e-commerce, hoewel iemand laten lijken alsof ze langer of skeletachtig divers zijn momenteel een opvallende uitdaging is.
Evenzo is het veranderen van de vorm van een hoofd in videobeelden op een consistente en overtuigende manier het onderwerp geweest van eerder onderzoek van de onderzoekers van het nieuwe artikel, hoewel die implementatie last had van artifacten en andere beperkingen. De nieuwe aanbieding breidt de mogelijkheden van dat eerdere onderzoek uit van statische naar videouitvoer.
Het nieuwe systeem werd getraind op een desktop-pc met een AMD Ryzen 9 3950X met 32GB geheugen en gebruikt een optische stroomalgoritme van OpenCV voor bewegingskaarten, gesmoord door het StructureFlow-framework; het Facial Alignment Network (FAN) component voor landmark-schatting, dat ook wordt gebruikt in de populaire deepfakes-pakketten; en de Ceres Solver om optimalisatie-uitdagingen op te lossen.

Een extreem voorbeeld van gezichtsverbreeding met het nieuwe systeem.
Het artikel heet Parametric Reshaping of Portraits in Videos en komt van drie onderzoekers van de Zhejiang Universiteit en één van de Universiteit van Bath.
Over het gezicht
Onder het nieuwe systeem wordt de video uitgepakt in een reeks afbeeldingen en wordt eerst een starre pose geschat voor elk gezicht. Vervolgens worden een representatief aantal opeenvolgende frames gezamenlijk geschat om consistente identiteitsparameters te construeren over de hele reeks afbeeldingen (d.w.z. de frames van de video).

Architectuur van de gezichtsvervormingssysteem.
Hierna wordt de expressie geëvalueerd, waardoor een herschikkingsparameter wordt geïmplementeerd door lineaire regressie. Vervolgens wordt een nieuwe ondertekende afstandsfunctie (SDF) benadering gebruikt om een dichte 2D-kaart van de gezichtslijnen vóór en na herschikking te construeren.
Tenslotte wordt een content-aware vervormingsoptimalisatie uitgevoerd op de uitvoervideo.
Parametriseerbare gezichten
Het proces maakt gebruik van een 3D-morfabel gezichtsmodel (3DMM), een steeds populairdere aanvulling op neurale en GAN-gebaseerde gezichtssynthesesystemen, evenals toepasbaar voor deepfakedetectiesystemen.

Niet uit het nieuwe artikel, maar een voorbeeld van een 3D-morfabel gezichtsmodel (3DMM) – een parametriseerbaar prototypegezicht dat in het nieuwe project wordt gebruikt. Boven links, landmark-toepassing op een 3DMM-gezicht. Boven rechts, de 3D-mesh-vertices van een isomap. Onder links toont landmark-fitting; onder-midden, een isomap van de geëxtraheerde gezichtstekstuur; en onder rechts, een resulterende fitting en vorm. Bron: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf
Het workflow van het nieuwe systeem moet rekening houden met gevallen van occlusie, zoals een situatie waarin de onderwerp wegkijkt. Dit is een van de grootste uitdagingen in deepfakesoftware, aangezien FAN-landmarks weinig capaciteit hebben om hiermee rekening te houden en de kwaliteit verliezen als het gezicht afwijkt of wordt afgedekt.
Het nieuwe systeem kan deze valkuil vermijden door een contour-energie te definiëren die in staat is om de grens tussen het 3D-gezicht (3DMM) en het 2D-gezicht (zoals gedefinieerd door FAN-landmarks) te matchen.
Optimalisatie
Een nuttige inzet voor een dergelijk systeem zou zijn om real-time-deformatie te implementeren, bijvoorbeeld in videochat-filters. Het huidige kader maakt dit niet mogelijk en de benodigde rekenbronnen zouden ‘live’-deformatie een opvallende uitdaging maken.
Volgens het artikel, en onder de veronderstelling van een 24fps-videodoel, vertegenwoordigen per-frame-bewerkingen in de pipeline een latentie van 16,344 seconden voor elke seconde aan beeldmateriaal, met extra eenmalige hits voor identiteitschatting en 3D-gezichtsdeformatie (321ms en 160ms, respectievelijk).
Daarom is optimalisatie cruciaal om vooruitgang te boeken bij het verlagen van de latentie. Aangezien gezamenlijke optimalisatie over alle frames een ernstige overhead aan het proces zou toevoegen, en init-stijl-optimalisatie (veronderstellend op de consistente opeenvolgende identiteit van de spreker vanuit de eerste frame) zou kunnen leiden tot anomalieën, hebben de auteurs een schaarse schema aangenomen om de coëfficiënten van frames te berekenen die op praktische tussenpozen zijn bemonsterd.
Gezamenlijke optimalisatie wordt vervolgens uitgevoerd op deze subset van frames, waardoor een slankere reconstructieproces ontstaat.
Gezichtsvervorming
De vervormingstechniek die in het project wordt gebruikt, is een aanpassing van het werk van de auteurs uit 2020 Deep Shapely Portraits (DSP).

Deep Shapely Portraits, een inzending van 2020 voor ACM Multimedia. Het artikel wordt geleid door onderzoekers van de ZJU-Tencent Game en Intelligent Graphics Innovation Technology Joint Lab. Bron: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4
De auteurs merken op ‘We breiden deze methode uit van het herschikken van één monochrome afbeelding naar het herschikken van de hele beeldreeks.’
Tests
Het artikel merkt op dat er geen vergelijkbaar eerder materiaal was om de nieuwe methode te evalueren. Daarom hebben de auteurs frames van hun vervormde videouitvoer vergeleken met statische DSP-uitvoer.

Het testen van het nieuwe systeem tegen statische afbeeldingen van Deep Shapely Portraits.
De auteurs merken op dat artifacten het gevolg zijn van de DSP-methode, vanwege het gebruik van schaarse mapping – een probleem dat het nieuwe kader oplost met dichte mapping. Bovendien, zo beweert het artikel, demonstreert video die is gegenereerd door DSP een gebrek aan gladheid en visuele coherentie.
De auteurs verklaren:
‘De resultaten laten zien dat onze aanpak robuust kan produceren coherente herschikte portretvideo’s, terwijl de op afbeeldingen gebaseerde methode gemakkelijk kan leiden tot opvallende flikkering-artefacten.’
Bekijk de bijgevoegde video hieronder voor meer voorbeelden:
Eerst gepubliceerd op 9 mei 2022. Gewijzigd om 18.00 uur EET, ‘veld’ vervangen door ‘functie’ voor SDF.












