AI-modeller og platforme

AniPortrait: Audio-drevet syntese af fotorealistiske portrætanimationer

mm
Føj Unite.AI til dine foretrukne kilder på Google

Gennem årene har skabelsen af realistiske og udtryksfulde portrætanimationer fra statiske billeder og lyd fundet en række anvendelser, herunder spil, digitale medier, virtuel virkelighed og meget mere. Trods sin potentiale anvendelse er det stadig svært for udviklere at skabe rammer, der kan generere højkvalitetsanimationer, der opretholder temporal konsistens og er visuelt tillokkende. En væsentlig årsag til kompleksiteten er behovet for intrikat koordination mellem læbebevægelser, hovedpositioner og ansigtsudtryk for at skabe en visuelt tillokkende effekt.

I denne artikel vil vi tale om AniPortrait, en ny ramme designet til at generere højkvalitetsanimationer drevet af et referenceportrætbillede og en lydfil. AniPortraits arbejdsprincip er inddelt i to faser. Først udtrækker AniPortrait-rammen de mellemliggende 3D-repræsentationer fra lydfilerne og projicerer dem herefter ind i en sekvens af 2D-ansigtslandemærker. Dernæst anvender rammen en robust diffusionsmodel kombineret med en bevægelsesmodul til at omdanne landemærkesekvensen til temporalt konsistente og fotorealistiske animationer. De eksperimentelle resultater demonstrerer AniPortrait-rammens overlegenhed og evne til at generere højkvalitetsanimationer med exceptionel visuel kvalitet, posediversitet og ansigtsnaturlighed, og dermed tilbyder en forbedret og beriget perceptuel oplevelse. Desuden har AniPortrait-rammen en bemærkelsesværdig potentiale i forhold til kontrollerbarhed og fleksibilitet og kan anvendes effektivt i områder som ansigtsreenactment, ansigtsbevægelsesredigering og meget mere. Denne artikel har til formål at dække AniPortrait-rammen i dybden og udforske mekanismen, metoden, arkitekturen i rammen samt dens sammenligning med state-of-the-art-rammer. Så lad os komme i gang.

AniPortrait: Fotorealistiske portrætanimationer

At skabe realistiske og udtryksfulde portrætanimationer har været fokus for forskere i en længere periode på grund af deres fantastiske potentiale og anvendelser, der spænder fra digitale medier og virtuel virkelighed til spil og meget mere. Trods års forskning og udvikling er det stadig en betydelig udfordring at producere højkvalitetsanimationer, der opretholder temporal konsistens og er visuelt tillokkende. En væsentlig hindring for udviklere er behovet for intrikat koordination mellem hovedpositioner, visuelle udtryk og læbebevægelser for at skabe en visuelt tillokkende effekt. Eksisterende metoder har ikke kunnet tackle disse udfordringer, primært fordi de fleste af dem afhænger af begrænsede kapacitetsgenereringer som NeRF, bevægelsesbaserede dekodere og GAN til visuel indholdsskabelse. Disse netværk viser begrænsede generaliseringsmuligheder og er ustabile i generering af højkvalitetsindhold. Imidlertid har den seneste opdukken af diffusionsmodeller gjort det muligt at generere højkvalitetsbilleder, og nogle rammer bygget på diffusionsmodeller samt tidsmæssige moduler har gjort det muligt at skabe overbevisende videoer, hvilket har gjort diffusionsmodellerne til at udmærke sig.

Bygget på fremskridtene inden for diffusionsmodeller, har AniPortrait-rammen til formål at generere højkvalitetsanimerede portrætter ved hjælp af et referencebillede og en lydfil. AniPortraits arbejdsprincip er inddelt i to faser. I den første fase anvender AniPortrait-rammen transformer-baserede modeller til at udtrække en sekvens af 3D-ansigtsnet og hovedposition fra lydinput, og projicerer dem herefter ind i en sekvens af 2D-ansigtslandemærker. Den første fase giver AniPortrait-rammen mulighed for at fange læbebevægelser og subtile udtryk fra lyden samt hovedbevægelser, der synkroniserer med rytmen af lydfilen. I den anden fase anvender AniPortrait-rammen en robust diffusionsmodel kombineret med en bevægelsesmodul til at omdanne landemærkesekvensen til en fotorealistisk og temporalt konsistent animeret portræt. For at være mere specifikken bygger AniPortrait-rammen på netværksarkitekturen fra den eksisterende AnimateAnyone-model, der anvender Stable Diffusion 1.5, en potent diffusionsmodel til at generere levende og flydende billeder baseret på et referencebillede og en kropbevægelsessekvens. Det, der er værd at bemærke, er, at AniPortrait-rammen ikke anvender poseguidermodulen i dette netværk, som den er implementeret i AnimateAnyone-rammen, men redesigner den, hvilket giver AniPortrait-rammen mulighed for ikke kun at opretholde en letvægtsdesign, men også at udvise forbedret præcision i generering af læbebevægelser.

Eksperimentelle resultater demonstrerer AniPortrait-rammens overlegenhed i skabelse af animationer med imponerende ansigtsnaturlighed, fremragende visuel kvalitet og varierede poser. Ved at anvende 3D-ansigtsrepræsentationer som mellemliggende funktioner giver AniPortrait-rammen sig selv mulighed for at modificere disse repræsentationer efter behov. Denne tilpasning forbedrer AniPortrait-rammens anvendelighed på tværs af domæner, herunder ansigtsreenactment og ansigtsbevægelsesredigering.

AniPortrait: Arbejdsprincip og metode

Den foreslåede AniPortrait-ramme består af to moduler, nemlig Lmk2Video og Audio2Lmk. Audio2Lmk-modulen forsøger at udtrække en sekvens af landemærker, der fanger intrikate læbebevægelser og ansigtsudtryk fra lydinput, mens Lmk2Video-modulen anvender denne landemærkesekvens til at generere højkvalitetsportrætvideoer med temporal stabilitet. Følgende figur præsenterer en oversigt over AniPortrait-rammens arbejdsprincip. Som det kan ses, udtrækker AniPortrait-rammen først 3D-ansigtsnettet og hovedpositionen fra lyden og projicerer disse to elementer herefter ind i 2D-nøglepunkter. I den anden fase anvender rammen en diffusionsmodel til at omdanne 2D-nøglepunkterne til en portrætvideo med to faser, der trænes samtidigt inden for netværket.

Audio2Lmk

For en given sekvens af taleklip, er det primære mål for AniPortrait-rammen at forudsige den tilsvarende 3D-ansigtsnetsekvens med vektorrepræsentationer af translation og rotation. AniPortrait-rammen anvender den forudtrænede wav2vec-metode til at udtrække lydfunktioner, og modellen viser en høj grad af generaliseringsmuligheder og er i stand til at genkende intonation og udtale fra lyden nøjagtigt, hvilket spiller en afgørende rolle i generering af realistiske ansigtsanimationer. Ved at udnytte de erhvervede robuste talefunktioner er AniPortrait-rammen i stand til effektivt at anvende en simpel arkitektur bestående af to fc-lag til at omdanne disse funktioner til 3D-ansigtsnet. AniPortrait-rammen observerer, at denne enkle design, der er implementeret af modellen, ikke kun forbedrer effektiviteten af slutningsprocessen, men også sikrer nøjagtighed. Når det kommer til at omdanne lyd til pose, anvender AniPortrait-rammen den samme wav2vec-netværk som ryggraden, selv om modellen ikke deler vægt med audio-til-mesh-modulen. Det skyldes primært, at pose er mere forbundet med tone og rytme i lyden, hvilket har en anden betoning i forhold til audio-til-mesh-opgaver. For at tage hensyn til påvirkningen af tidligere tilstande anvender AniPortrait-rammen en transformer-dekoder til at afkode poseseekvensen. Under denne proces integrerer rammen lydfunktionerne i dekoderen ved hjælp af cross-attention-mekanismer, og for begge moduler træner rammen dem ved hjælp af L1-tab. Når modellen får pose- og mesh-sekvensen, anvender den perspektivprojektion til at omdanne disse sekvenser til en 2D-sekvens af ansigtslandemærker, der herefter anvendes som inputsignaler for den efterfølgende fase.

Lmk2Video

For en given referenceportrætbillede og en sekvens af ansigtslandemærker, skaber Lmk2Video-modulen en temporalt konsistent portrætanimation, og denne animation afstemmer bevægelsen med landemærkesekvensen og opretholder et udseende, der er konsistent med referencebilledet, og endelig repræsenterer portrætanimationen som en sekvens af portrætframes. Designet af Lmk2Videos netværksstruktur søger inspiration fra den allerede eksisterende AnimateAnyone-ramme. AniPortrait-rammen anvender en Stable Diffusion 1.5, en ekstremt potent diffusionsmodel, som ryggrad, og integrerer en tidsmæssig bevægelsesmodul, der effektivt omdanner multi-frames støjinput til en sekvens af video-frames. Samtidig anvender en ReferencenNet-netværkskomponent strukturen fra Stable Diffusion 1.5 og anvender den til at udtrække udseendesinformation fra referencebilledet og integrerer den i ryggraden. Den strategiske design sikrer, at ansigtets ID forbliver konsistent på tværs af outputvideoen. I modsætning til AnimateAnyone-rammen forbedrer AniPortrait-rammen kompleksiteten af PoseGuider-designet. Den originale version af AnimateAnyone-rammen består kun af et par convolution-lag efterfulgt af, at landemærkefunktionerne sammenlægges med latenterne på inputlaget af ryggraden. AniPortrait-rammen opdager, at designet mangler i at fange intrikate bevægelser af læberne, og for at tackle dette problem anvender rammen den multi-skala-strategi af ConvNet-arkitekturen og integrerer landemærkefunktioner af tilsvarende skalaer i forskellige blokke af ryggraden. Desuden introducerer AniPortrait-rammen en yderligere forbedring ved at inkludere landemærkerne fra referencebilledet som en ekstra input. Cross-attention-modulen i PoseGuider-komponenten faciliterer interaktionen mellem mål-landemærkerne for hver frame og reference-landemærkerne. Denne proces giver netværket yderligere hints til at forstå sammenhængen mellem udseende og ansigtslandemærker, hvilket hjælper med at generere portrætanimationer med mere præcis bevægelse.

AniPortrait: Implementering og resultat

For Audio2Lmk-fasen anvender AniPortrait-rammen wav2vec2.0-komponenten som ryggrad og udnytter MediaPipe-arkitekturen til at udtrække 3D-mesh og 6D-pose til annotationer. Modellen henter træningsdata for Audio2Mesh-komponenten fra sin interne dataset, der består af næsten 60 minutters højkvalitets taledata fra en enkelt taler. For at sikre, at 3D-meshen, der udtrækkes af MediaPipe-komponenten, er stabil, instrueres taleaktøren til at se kameraet i øjnene og opretholde en fast hovedposition under hele optagelsesprocessen. For Lmk2Video-modulen implementerer AniPortrait-rammen en to-trins træningsapproach. I den første fase fokuserer rammen på at træne ReferenceNet og PoseGuider, 2D-komponenten af ryggraden, og udelader bevægelsesmodulen. I den anden fase fryser rammen alle andre komponenter og koncentrerer sig om at træne bevægelsesmodulen. Til denne fase anvender rammen to store, højkvalitetsfaciale videodatasets til at træne modellen og behandler alle data ved hjælp af MediaPipe-komponenten til at udtrække 2D-ansigtslandemærker. Desuden forbedrer AniPortrait-modellens følsomhed over for læbebevægelser ved at differentiere de øvre og nedre læber med forskellige farver, når der renderes posebilledet fra 2D-landemærker.

Som demonstreret i følgende billede genererer AniPortrait-rammen en række animationer, der viser overlegen kvalitet såvel som realisme.

Rammen anvender herefter en mellemliggende 3D-repræsentation, der kan redigeres for at manipulere outputtet efter behov. For eksempel kan brugere udtrække landemærker fra en bestemt kilde og ændre dets ID, hvilket giver AniPortrait-rammen mulighed for at skabe en ansigtsreenactment-effekt.

Endelige tanker

I denne artikel har vi talt om AniPortrait, en ny ramme designet til at generere højkvalitetsanimationer drevet af et referenceportrætbillede og en lydfil. Ved blot at indtaste et referencebillede og en lydfil kan AniPortrait-rammen generere en portrætvideo, der viser naturlig hovedbevægelse og glat læbebevægelse. Ved at udnytte diffusionsmodellens robuste generaliseringsmuligheder genererer AniPortrait-rammen animationer, der viser imponerende realistisk billedkvalitet og levende bevægelse. AniPortraits arbejdsprincip er inddelt i to faser. Først udtrækker AniPortrait-rammen de mellemliggende 3D-repræsentationer fra lydfilerne og projicerer dem herefter ind i en sekvens af 2D-ansigtslandemærker. Dernæst anvender rammen en robust diffusionsmodel kombineret med en bevægelsesmodul til at omdanne landemærkesekvensen til temporalt konsistente og fotorealistiske animationer. De eksperimentelle resultater demonstrerer AniPortrait-rammens overlegenhed og evne til at generere højkvalitetsanimationer med exceptionel visuel kvalitet, posediversitet og ansigtsnaturlighed, og dermed tilbyder en forbedret og beriget perceptuel oplevelse. Desuden har AniPortrait-rammen en bemærkelsesværdig potentiale i forhold til kontrollerbarhed og fleksibilitet og kan anvendes effektivt i områder som ansigtsreenactment, ansigtsbevægelsesredigering og meget mere.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.