Andersons vinkel

Googles LipSync3D tilbyr forbedret ‘Deepfaked’ Bevegelsessynkronisering av Leppebevegelser

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Et samarbeid mellom Google AI-forskere og det indiske teknologiske institutt i Kharagpur tilbyr et nytt rammeverk for å syntetisere talehoder fra lydinnhold. Prosjektet har som mål å produsere optimaliserte og rimelig ressursbaserte måter å lage ‘talehode’-videoinnhold fra lyd, for å synkronisere leppebevegelser med dubbed eller maskinoversatte lyd, og for bruk i avatarer, i interaktive applikasjoner og i andre sanntidsmiljøer.

Kilde: https://www.youtube.com/watch?v=L1StbX9OznY

Kilde: https://www.youtube.com/watch?v=L1StbX9OznY

De maskinlæringsmodellene som er trenet i prosessen – kalt LipSync3D – krever bare en enkelt video av målansiktet som inndata. Dataforberedelsespipelinen skiller ut ekstraksjon av ansiktsgeometri fra evaluering av lys og andre aspekter av en inndatavideo, og tillater mer økonomisk og fokusert trening.

De to-stegs arbeidsflyten for LipSync3D. Øverst, generering av en dynamisk teksturert 3D-ansikt fra 'mål'-lyden; nederst, innsetting av den genererte meshen i en målvideo.

De to-stegs arbeidsflyten for LipSync3D. Øverst, generering av en dynamisk teksturert 3D-ansikt fra ‘mål’-lyden; nederst, innsetting av den genererte meshen i en målvideo.

I virkeligheten kan LipSync3Ds mest merkbare bidrag til forskningsinnsatsen i dette området være dens lysnormaliseringsalgoritme, som frakobler trening og inferensbelysning.

Frakobling av lysdata fra generell geometri hjelper LipSync3D til å produsere mer realistiske leppebevegelser under utfordrende forhold. Andre tilnærminger i de siste årene har begrenset seg til 'faste' lysforhold som ikke avslører deres mer begrensede kapasitet i denne henseende.

Frakobling av lysdata fra generell geometri hjelper LipSync3D til å produsere mer realistiske leppebevegelser under utfordrende forhold. Andre tilnærminger i de siste årene har begrenset seg til ‘faste’ lysforhold som ikke avslører deres mer begrensede kapasitet i denne henseende.

Under forbehandling av inndata rammer, må systemet identifisere og fjerne spekularpunkter, da disse er spesifikke for lysforholdene under hvilke videoen ble tatt, og ellers vil forstyrre prosessen med å gjenlyse.

LipSync3D, som navnet antyder, utfører ikke bare pikselanalyse på ansiktene det vurderer, men aktivt bruker identifiserte ansiktslandemerker til å generere motile CGI-stiler, sammen med ‘utfoldede’ teksturer som er viklet rundt dem i en tradisjonell CGI-pipeline.

Posisjonsnormalisering i LipSync3D. Til venstre er inndata rammer og detekterte funksjoner; i midten, normaliserte vertexer av den genererte mesh-vurderingen; og til høyre, den tilsvarende teksturatlasen, som gir grunnfakta for teksturforutsigelse. Kilde: https://arxiv.org/pdf/2106.04185.pdf

Posisjonsnormalisering i LipSync3D. Til venstre er inndata rammer og detekterte funksjoner; i midten, normaliserte vertexer av den genererte mesh-vurderingen; og til høyre, den tilsvarende teksturatlasen, som gir grunnfakta for teksturforutsigelse. Kilde: https://arxiv.org/pdf/2106.04185.pdf

Bortsett fra den nye relighting-metoden, hevder forskerne at LipSync3D tilbyr tre hovedinnovasjoner på tidligere arbeid: separasjon av geometri, lys, posisjon og tekstur i separate datastrømmer i en normalisert rom; en lett trenbar auto-regressiv teksturforutsigelsesmodell som produserer tidskonsistent video-syntese; og økt realisme, som vurderes av menneskelige vurderinger og objektive målinger.

Deling av de ulike aspektene av videoansiktsbilder gir større kontroll i video-syntese.

Deling av de ulike aspektene av videoansiktsbilder gir større kontroll i video-syntese.

LipSync3D kan avlede passende leppegometribevegelse direkte fra lyd ved å analysere fonemer og andre aspekter av tale, og oversette dem til kjente tilsvarende muskelposisjoner rundt munnområdet.

Dette prosessen bruker en felles-forutsigelses-pipeline, hvor den infererte geometrien og teksturen har dedikerte koderere i en autoencoder-oppsetting, men deler en lydkode med talen som skal påføres modellen:

LipSync3Ds labile bevegelsessyntese er også ment å drive stiliserte CGI-avatarer, som i virkeligheten bare er samme type mesh- og teksturinformasjon som virkelige bilder:

En stilisert 3D-avatar har sine leppebevegelser drevet i sanntid av en kilde-taler-video. I en slik situasjon ville de beste resultater bli oppnådd med personlig forhåndstrenning.

En stilisert 3D-avatar har sine leppebevegelser drevet i sanntid av en kilde-taler-video. I en slik situasjon ville de beste resultater bli oppnådd med personlig forhåndstrenning.

Forskere forventer også å bruke avatarer med en litt mer realistisk følelse:

Eksempel på trenings­tider for videoer varierer fra 3-5 timer for en 2-5 minutters video, i en pipeline som bruker TensorFlow, Python og C++ på en GeForce GTX 1080. Trenings­sessjonene brukte en batch-størrelse på 128 rammere over 500-1000 epoker, hvor hver epoke representerer en fullstendig vurdering av videoen.

Mot Dynamisk Om-Synkronisering Av Leppebevegelser

Feltet for om-synkronisering av lepper for å tilpasse en ny lydspor har mottatt mye oppmerksomhet i datavisjonsforskning i de siste årene (se under), ikke minst som det er et biprodukt av kontroversiell deepfake-teknologi.

I 2017 presenterte University of Washington forskning som kunne lære leppegensynkronisering fra lyd, og bruke det til å endre leppegensbevegelsene til daværende president Obama. I 2018 ledet Max Planck-instituttet for informatikk en annen forskningsinitiativ for å muliggjøre identitet-til-identitet video-overføring, med leppegensynkronisering som et biprodukt av prosessen; og i mai 2021 avslørte AI-startup FlawlessAI sin proprietære leppegenssynkroniserings-teknologi TrueSync, som ble vidt mottatt i pressen som en muliggjører av forbedret dubbingsteknologi for store film-utgivelser på tvers av språk.

Og, naturligvis, den pågående utviklingen av åpne kildekodemagasiner for deepfakes tilbyr en annen gren av aktivt bruker-bidragt forskning i dette området av ansiktsbildesyntese.

nc teknologi TrueSync, som ble vidt mottatt i pressen som en muliggjører av forbedret dubbingsteknologi for store film-utgivelser på tvers av språk. Og, naturligvis, den pågående utviklingen av åpne kildekodemagasiner for deepfakes tilbyr en annen gren av aktivt bruker-bidragt forskning i dette området av ansiktsbildesyntese.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai