AI-modellen en platforms

AniPortrait: Audio-gestuurde synthese van fotorealistische portretanimaties

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

In de loop der jaren heeft de creatie van realistische en expressieve portretanimaties van statische afbeeldingen en audio een reeks toepassingen gevonden, waaronder gaming, digitale media, virtual reality en veel meer. Ondanks de potentie van deze toepassingen, is het nog steeds moeilijk voor ontwikkelaars om kaders te creëren die in staat zijn om hoge kwaliteit animaties te genereren die temporele consistentie behouden en visueel aantrekkelijk zijn. Een belangrijke oorzaak van deze complexiteit is de behoefte aan een intrigerende coördinatie van lipbewegingen, hoofdposities en gezichtsuitdrukkingen om een visueel overtuigend effect te creëren.

In dit artikel zullen we het hebben over AniPortrait, een nieuw kader ontworpen om hoge kwaliteit animaties te genereren die worden aangedreven door een referentieportretbeeld en een audiosample. De werking van het AniPortrait-kader is verdeeld in twee fasen. Eerst extracteert het AniPortrait-kader de tussenliggende 3D-weergaven uit de audiosamples en projecteert deze in een reeks 2D-gezichtskenmerken. Vervolgens gebruikt het kader een robuust diffusiemodel in combinatie met een bewegingsmodule om de reeks gezichtskenmerken om te zetten in temporeel consistente en fotorealistische animaties. De experimentele resultaten demonstreren de superioriteit en het vermogen van het AniPortrait-kader om hoge kwaliteit animaties te genereren met uitzonderlijke visuele kwaliteit, pose-diversiteit en gezichtsnatuurlijkheid, waardoor een verhoogde en verrijkte perceptuele ervaring wordt geboden. Bovendien heeft het AniPortrait-kader een opmerkelijk potentieel in termen van controleerbaarheid en flexibiliteit en kan het effectief worden toegepast in gebieden zoals gezichtsreenactment, gezichtsbewegingsbewerking en meer.

AniPortrait: Fotorealistische portretanimatie

Het creëren van realistische en expressieve portretanimaties is al een tijdje het onderwerp van onderzoekers vanwege het enorme potentieel en de toepassingen die zich uitstrekken van digitale media en virtual reality tot gaming en meer. Ondanks jaren van onderzoek en ontwikkeling, is het nog steeds een significante uitdaging om hoge kwaliteit animaties te produceren die temporele consistentie behouden en visueel aantrekkelijk zijn. Een belangrijke hindernis voor ontwikkelaars is de behoefte aan een intrigerende coördinatie tussen hoofdposities, visuele expressies en lipbewegingen om een visueel overtuigend effect te creëren. Bestaande methoden hebben gefaald om deze uitdagingen aan te pakken, voornamelijk omdat de meeste van hen afhankelijk zijn van beperkte capaciteitsgeneratoren zoals NeRF, motion-based decoders en GAN voor visuele inhoudscreatie.

Het AniPortrait-kader is gebaseerd op de vooruitgang van diffusiemodellen en heeft als doel hoge kwaliteit geanimeerde portretten te genereren met behulp van een referentiebeeld en een audiosample. De werking van het AniPortrait-kader is verdeeld in twee fasen. In de eerste fase gebruikt het AniPortrait-kader transformatie-gebaseerde modellen om een reeks 3D-gezichtsmazen en hoofdposities te extraheren uit audio-input, en projecteert deze vervolgens in een reeks 2D-gezichtskenmerken. De eerste fase stelt het AniPortrait-kader in staat om lipbewegingen en subtiele expressies van de audio te capteren, evenals hoofdbewegingen die synchroon lopen met het ritme van de audiosample. De tweede fase gebruikt het AniPortrait-kader een robuust diffusiemodel in combinatie met een bewegingsmodule om de reeks gezichtskenmerken om te zetten in een fotorealistische en temporeel consistente geanimeerde portret.

Experimentele resultaten demonstreren de superioriteit van het AniPortrait-kader in het creëren van animaties met indrukwekkende gezichtsnatuurlijkheid, uitstekende visuele kwaliteit en gevarieerde poses. Door 3D-gezichtsweergaven te gebruiken als tussenliggende kenmerken, verwerft het AniPortrait-kader flexibiliteit om deze weergaven aan te passen aan zijn behoeften. De aanpasbaarheid verhoogt aanzienlijk de toepasbaarheid van het AniPortrait-kader in domeinen zoals gezichtsreenactment en gezichtsbewegingsbewerking.

AniPortrait: Werking en methodologie

Het voorgestelde AniPortrait-kader bestaat uit twee modules, namelijk Lmk2Video en Audio2Lmk. De Audio2Lmk-module probeert een reeks kenmerken te extraheren die intrigerende lipbewegingen en gezichtsuitdrukkingen van audio-input vastleggen, terwijl de Lmk2Video-module deze reeks kenmerken gebruikt om hoge kwaliteit portretvideo’s te genereren met temporele stabiliteit.

Audio2Lmk

Voor een gegeven reeks spraakfragmenten is het primaire doel van het AniPortrait-kader om de corresponderende 3D-gezichtsmazenreeks te voorspellen met vectorweergaven van translatie en rotatie. Het AniPortrait-kader gebruikt de pre-getrainde wav2vec-methode om audiofuncties te extraheren, en het model toont een hoge mate van generalisatie en is in staat om intonatie en uitspraak van de audio nauwkeurig te herkennen, wat een cruciale rol speelt bij het genereren van realistische gezichtsanimaties.

Lmk2Video

Voor een gegeven referentieportretbeeld en een reeks gezichtskenmerken, creëert de Lmk2Video-module een temporeel consistente portretanimatie, en deze animatie is afgestemd op de beweging met de reeks kenmerken, en behoudt een uiterlijk dat consistent is met het referentiebeeld, en tenslotte wordt de portretanimatie weergegeven als een reeks portretframes.

AniPortrait: Implementatie en resultaat

Voor de Audio2Lmk-fase gebruikt het AniPortrait-kader de wav2vec2.0-component als backbone en levert het MediaPipe-architectuur om 3D-mazen en 6D-posities te extraheren voor annotaties. Het model haalt de trainingsdata voor de Audio2Mesh-component uit zijn interne dataset, die ongeveer 60 minuten aan hoge kwaliteit spraakgegevens bevat van één spreker.

Zoals wordt aangetoond in de volgende afbeelding, genereert het AniPortrait-kader een reeks animaties die superieure kwaliteit en realisme demonstreren.

Het kader gebruikt vervolgens een tussenliggende 3D-weergave die kan worden bewerkt om de uitvoer aan te passen aan de vereisten. Bijvoorbeeld kunnen gebruikers kenmerken extraheren uit een bepaalde bron en de ID wijzigen, waardoor het AniPortrait-kader een gezichtsreenactment-effect kan creëren.

Slotgedachten

In dit artikel hebben we het over AniPortrait gehad, een nieuw kader ontworpen om hoge kwaliteit animaties te genereren die worden aangedreven door een referentieportretbeeld en een audiosample. Door eenvoudigweg een referentiebeeld en een audiofragment in te voeren, kan het AniPortrait-kader een portretvideo genereren met natuurlijke hoofdbewegingen en soepele lipbewegingen. Door de robuuste generalisatiecapaciteiten van het diffusiemodel te benutten, genereert het AniPortrait-kader animaties die indrukwekkende realistische beeldkwaliteit en levendige beweging vertonen.

Een ingenieur van beroep, een schrijver van hart. Kunal is een technisch schrijver met een diepe liefde en begrip voor AI en ML, toegewijd aan het vereenvoudigen van complexe concepten in deze gebieden door middel van zijn boeiende en informatieve documentatie.