Andersons hoek

Google’s LipSync3D Biedt Verbeterde ‘Deepfaked’ Lipbewegingssynchronisatie

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Een samenwerking tussen Google AI-onderzoekers en het Indian Institute of Technology Kharagpur biedt een nieuw kader voor het synthetiseren van pratende hoofden uit audio-inhoud. Het project heeft als doel om geoptimaliseerde en redelijk-geresourceerde manieren te creëren om ‘pratende hoofd’-video-inhoud te maken van audio, voor het doel van het synchroniseren van lipbewegingen met nagesynchte of machinevertaalde audio, en voor gebruik in avatars, in interactieve toepassingen en in andere real-time-omgevingen.

Bron: https://www.youtube.com/watch?v=L1StbX9OznY

Bron: https://www.youtube.com/watch?v=L1StbX9OznY

De machine learning-modellen die getraind zijn in het proces – genaamd LipSync3D – vereisen alleen een enkele video van de doelgezichtsidentiteit als invoergegevens. De datapreparatiepijplijn scheidt de extractie van gezichtsgeometrie van de evaluatie van verlichting en andere facetten van een invoervideo, waardoor een meer economische en gefocuste training mogelijk is.

De tweestaps werkstroom van LipSync3D. Boven, de generatie van een dynamisch getextureerde 3D-gezicht van de 'doel'-audio; onder, de invoeging van de gegenereerde mesh in een doelvideo.

De tweestaps werkstroom van LipSync3D. Boven, de generatie van een dynamisch getextureerde 3D-gezicht van de ‘doel’-audio; onder, de invoeging van de gegenereerde mesh in een doelvideo.

In feite is LipSync3D’s meest opvallende bijdrage aan het lichaam van onderzoeksinspanningen op dit gebied misschien zijn verlichtingsnormalisatie-algoritme, dat de training en inferentie-verlichting ontkoppelt.

Het ontkoppelen van verlichtingsgegevens van algemene geometrie helpt LipSync3D om meer realistische lipbewegingsuitvoer te produceren onder moeilijke omstandigheden. Andere benaderingen van de afgelopen jaren hebben zich beperkt tot 'vaste' verlichtingsomstandigheden die hun beperkte capaciteit op dit punt niet zullen onthullen.

Het ontkoppelen van verlichtingsgegevens van algemene geometrie helpt LipSync3D om meer realistische lipbewegingsuitvoer te produceren onder moeilijke omstandigheden. Andere benaderingen van de afgelopen jaren hebben zich beperkt tot ‘vaste’ verlichtingsomstandigheden die hun beperkte capaciteit op dit punt niet zullen onthullen.

Tijdens de voorverwerking van de invoerdataframes moet het systeem speculaire punten identificeren en verwijderen, aangezien deze specifiek zijn voor de verlichtingsomstandigheden waaronder de video is opgenomen, en anders zullen interfereren met het proces van opnieuw verlichten.

LipSync3D, zoals de naam al aangeeft, voert geen enkele pixelanalyse uit op de gezichten die het evalueert, maar gebruikt actief geïdentificeerde gezichtskenmerken om motile CGI-stijl-meshes te genereren, samen met de ‘uitgevouwen’ texturen die eromheen worden gewikkeld in een traditionele CGI-pijplijn.

Pose-normalisatie in LipSync3D. Links zijn de invoerframes en gedetecteerde kenmerken; in het midden, de genormaliseerde vertices van de gegenereerde mesh-evaluatie; en rechts, de overeenkomstige texturen-atlas, die de grondwaarheid voor texturenvoorspelling biedt. Bron: https://arxiv.org/pdf/2106.04185.pdf

Pose-normalisatie in LipSync3D. Links zijn de invoerframes en gedetecteerde kenmerken; in het midden, de genormaliseerde vertices van de gegenereerde mesh-evaluatie; en rechts, de overeenkomstige texturen-atlas, die de grondwaarheid voor texturenvoorspelling biedt. Bron: https://arxiv.org/pdf/2106.04185.pdf

Behalve de novale relighting-methode, claimen de onderzoekers dat LipSync3D drie hoofdinnovaties biedt ten opzichte van voorgaand werk: de scheiding van geometrie, verlichting, pose en textuur in discrete gegevensstromen in een genormaliseerde ruimte; een gemakkelijk trainbare auto-regressieve texturenvoorspellingsmodel dat tijdelijk consistente video-synthese produceert; en verhoogde realisme, zoals beoordeeld door menselijke beoordelingen en objectieve metrieken.

Het opsplitsen van de verschillende facetten van de video-gezichtsbeelden biedt meer controle in video-synthese.

Het opsplitsen van de verschillende facetten van de video-gezichtsbeelden biedt meer controle in video-synthese.

LipSync3D kan passende lipgeometrie-beweging rechtstreeks uit audio afleiden door fonemen en andere facetten van spraak te analyseren en ze om te zetten in bekende overeenkomstige spierposities rond de mond.

Dit proces gebruikt een joint-predictiepijplijn, waarbij de afgeleide geometrie en textuur toegewezen encoders hebben in een auto-encoder-opstelling, maar een audio-encoder delen met de spraak die op het model moet worden opgelegd:

LipSync3D’s labiele bewegingssynthese is ook bedoeld om gestileerde CGI-avatars aan te drijven, die in feite alleen maar hetzelfde soort mesh- en textureninformatie zijn als real-world-beelden:

Een gestileerde 3D-avatar heeft zijn lipbewegingen aangedreven in real-time door een bron-spreker-video. In een dergelijke situatie zouden de beste resultaten worden behaald door persoonlijke voorafgaande training.

Een gestileerde 3D-avatar heeft zijn lipbewegingen aangedreven in real-time door een bron-spreker-video. In een dergelijke situatie zouden de beste resultaten worden behaald door persoonlijke voorafgaande training.

De onderzoekers verwachten ook het gebruik van avatars met een iets meer realistische uitstraling:

De voorbeelden van trainingskosten voor de video’s variëren van 3-5 uur voor een 2-5 minuten durende video, in een pijplijn die TensorFlow, Python en C++ op een GeForce GTX 1080 gebruikt. De trainingsessies gebruikten een batchgrootte van 128 frames over 500-1000 epochs, waarbij elke epoch een complete evaluatie van de video vertegenwoordigde.

Naar Dynamische Re-Synching Van Lipbeweging

Het veld van re-synching van lippen om een nieuwe audio-track te accommoderen, heeft de aandacht gekregen van computer-visie-onderzoek in de afgelopen jaren (zie hieronder), niet in de laatste plaats omdat het een bijproduct is van omstreden deepfake-technologie.

In 2017 presenteerde de Universiteit van Washington onderzoek dat in staat was om lip-synchrone van audio te leren, en het gebruikte om de lipbewegingen van de toenmalige president Obama te veranderen. In 2018 leidde het Max Planck-instituut voor Informatiekunde een ander onderzoeksinitiatief om identiteit-naar-identiteit-video-overdracht mogelijk te maken, met lip-synchrone als een bijproduct van het proces; en in mei 2021 onthulde AI-startup FlawlessAI zijn eigendomsrechterigheid lip-synchrone-technologie TrueSync, die wijd in de pers werd ontvangen als een middel om de technologie voor nasynchronisatie van dialogen in grote filmuitgaven over talen te verbeteren.

En, natuurlijk, de voortdurende ontwikkeling van deepfake open-source-repositories biedt een andere tak van actief gebruikersbijdragende onderzoek in deze sfeer van gezichtssynthese.

nc-technologie TrueSync, die wijd in de pers werd ontvangen als een middel om de technologie voor nasynchronisatie van dialogen in grote filmuitgaven over talen te verbeteren. En, natuurlijk, de voortdurende ontwikkeling van deepfake open-source-repositories biedt een andere tak van actief gebruikersbijdragende onderzoek in deze sfeer van gezichtssynthese.

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai