Andersonin kulma
Google’n LipSync3D tarjoaa parannettua “deepfaked” huulien liikkeen synchronointia

Google AI -tutkijoiden ja Intian teknillisen korkeakoulun Kharagpurin yhteistyö tarjoaa uuden kehyksen puhuvien pään syntetisointiin äänisisällöstä. Projekti pyrkii tuottamaan optimoituja ja kohtuullisia resursseja puhuvan pään video sisällön luomiseen äänestä, huulien liikkeen synchronointia varten, sekä käytettäväksi avatareissa, interaktiivisissa sovelluksissa ja muissa reaaliaikaisissa ympäristöissä.

Lähde: https://www.youtube.com/watch?v=L1StbX9OznY
Koneoppimismallit, jotka koulutetaan prosessissa – kutsutaan LipSync3D: ksi – vaativat vain yhden videon kohdehenkilön kasvojen tunnistamiseen. Datavalmisteluputki erottaa kasvojen geometrian arvioinnin valaistuksen ja muiden input-videon ulottuvuuksien arvioinnista, sallien taloudellisemman ja kohdennetumman koulutuksen.

LipSync3D:n kaksivaiheinen työnkulku. Ylhäällä dynaamisen tekstuurin 3D-kasvojen generointi ‘kohde’-äänestä; alhaalla generoitu meshin lisääminen kohdevideoon.
Todellisuudessa LipSync3D:n merkittävin panos tutkimuksen alaan saattaa olla sen valaistusnormalisointialgoritmi, joka erottaa koulutuksen ja päätöksen valaistuksen.

Valaistusdatan erottaminen yleisestä geometriasta auttaa LipSync3D: tä tuottamaan realistisempaa huulien liikkeen tulostetta haastavissa olosuhteissa. Muiden viimeaikaisien lähestymistapojen on rajoitettu ‘kiinteät’ valaistusolosuhteet, jotka eivät paljasta heidän rajoittuneempaa kapasiteettiaan tässä suhteessa.
Input-tietojen esikäsittelyssä järjestelmän on tunnistettava ja poistettava spekulaariset pisteet, koska ne ovat valaistusolosuhteiden mukaisia, ja muuten ne häiritsisivät valaistuksen uudelleenohjauksen prosessia.

LipSync3D, kuten sen nimestä voidaan päätellä, ei suorita pelkästään pikselianalyysiä tutkittavien kasvojen osalla, vaan käyttää aktiivisesti tunnistettuja kasvonpiirteitä liikkuvaan CGI-tyyliseen verkkoon yhdessä ‘avattujen’ tekstuurien kanssa, jotka ovat perinteisessä CGI-pipelineissa.

LipSync3D:n asennonsäätö. Vasemmalla ovat input-kehykset ja havaitut piirteet; keskellä generoitu verkon normalisoidut särmät; ja oikealla vastaava tekstuuriatlas, joka tarjoaa perustiedon tekstuurin ennustamiseen. Lähde: https://arxiv.org/pdf/2106.04185.pdf
Lisäksi uuden valaistusmenetelmän, tutkijat väittävät, että LipSync3D tarjoaa kolme pääinnovaatiota aiempaan työhön: geometrian, valaistuksen, asennon ja tekstuurin erottaminen erillisiin tietovirtoihin normalisoidussa tilassa; helposti koulutettava itseään toistava tekstuurin ennustusmalli, joka tuottaa aikajatkuvaa video synteesiä; ja lisääntynyt realisminen, jonka ihmiset ja objektiiviset mittarit ovat arvioineet.

Eri video kasvokuvan ulottuvuuksien erottaminen sallii suuremman valvonnan video synteesissä.
LipSync3D voi johtaa sopivan huulien geometrian liikkeen suoraan äänestä analysoimalla foneemeja ja muita puheen ulottuvuuksia ja kääntämällä ne tunnettuun vastaavaan lihasasentoon suun ympärillä.

Tämä prosessi käyttää yhdessä ennustusputkea, jossa arvioitu geometria ja tekstuurilla on omat kooderit autoenkooderin asetuksessa, mutta jaetaan äänen kooderi puheen kanssa, jota on tarkoitus asettaa malliin:
LipSync3D:n herkkä liikkeen synteesi on myös tarkoitus voimistaa tyylikkäitä CGI-avatareja, jotka ovat vain samaa tyyppisiä mesh- ja tekstuuritietoa kuin todelliset kuvat:

Tyylikäs 3D-avatari, jonka huulien liikkeet ohjataan reaaliajassa lähdepuhujan videosta. Tällaisessa tilanteessa parhaat tulokset saavutetaan henkilökohtaisella esikoulutuksella.
Tutkijat odottavat myös avatareja, joilla on hieman realistisempi olo:
![]()
Esimerkki koulutusajoista videota varten on 3-5 tuntia 2-5 minuutin videolle, jossa käytetään TensorFlowia, Pythonia ja C++: ta GeForce GTX 1080: lla. Koulutussessiot käyttivät 128 kehyksen batch-kokoa 500-1000 epochin ajan, ja jokainen epoch edusti yhtä täydellistä videon arviointia.
Kohti dynaamista huulien liikkeen synchronointia
Huulien synchronointi uuden ääniraidan kanssa on saanut paljon huomiota tietokoneen näköalojen tutkimuksessa viime vuosina (ks. alla), ei vähiten siksi, että se on kiistanalaisen deepfake-tekniikan sivutuote.
Vuonna 2017 Washingtonin yliopisto esitteli tutkimuksen, joka pystyi oppimaan huulien synchronoinnin äänestä ja käytti sitä muuttaakseen silloisen presidentin Obaman huulien liikkeitä. Vuonna 2018 Max Planck -instituutti informaatiotekniikassa johti toista tutkimushanketta mahdollistaakseen identiteetin > identiteetin videon siirron, jossa huulien synchronointi oli sivutuote prosessista; ja toukokuussa 2021 AI-startup FlawlessAI paljasti oman lip-sync-tekniikkansa TrueSyncin, jota vastaanotettiin laajasti lehdistössä parantuneiden dubbausteknologioiden mahdollistajana suurten elokuva julkaisujen kielien yli.
Ja, tietysti, deepfake-avoin lähdekoodirepositorion jatkuva kehitys tarjoaa toisen aktiivisen käyttäjien osallistumisen tutkimuksen haaran kasvojen kuvan synteesin alalla.











