Andersonin kulma

Kasvojen uudelleenmuokkaus videossa koneoppimisen avulla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tutkimusyhteistyö Kiinan ja Yhdistyneen kuningaskunnan välillä on kehittänyt uuden menetelmän kasvojen uudelleenmuokkaamiseen videossa. Tekniikka mahdollistaa vakuuttavan kasvonrakenteen laajentamisen ja kaventamisen, ja se on hyvin johdonmukainen ja ilman häiriöitä.

YouTube-videosta, jota tutkijat käyttivät lähdemateriaalina, näyttelijä Jennifer Lawrence näyttää enemmän ketun kaltaiselta (oikea). Katso videon mukana oleva video artikkelin alussa, jossa on lisää esimerkkejä paremmassa resoluutiossa. Lähde: https://www.youtube.com/watch?v=tA2BxvrKvjE

YouTube-videosta, jota tutkijat käyttivät lähdemateriaalina, näyttelijä Jennifer Lawrence näyttää enemmän kalpealta (oikea). Katso videon mukana oleva video artikkelin alussa, jossa on lisää esimerkkejä paremmassa resoluutiossa. Lähde: https://www.youtube.com/watch?v=tA2BxvrKvjE

Tällainen muodonmuutos on yleensä mahdollista vain perinteisillä CGI-menetelmillä, jotka edellyttävät kasvon täydellistä uudelleenluomista yksityiskohtaisen ja kalliin motion-capping-, rigging- ja texturing-prosessin kautta.

Sen sijaan tämän tekniikan CGI on integroitu neurorunkoon parametriseksi 3D-kasvotiedoksi, jota käytetään myöhemmin koneoppimisprosessin perustana.

Perinteiset parametrinen kasvot ovat yhä enemmän ohjeita muodonmuutokselle, joka käyttää koneoppimista CGI:n sijaan. Lähde: https://arxiv.org/pdf/2205.02538.pdf

Perinteiset parametrinen kasvot ovat yhä enemmän ohjeita muodonmuutokselle, joka käyttää koneoppimista CGI:n sijaan. Lähde: https://arxiv.org/pdf/2205.02538.pdf

Tekijät toteavat:

‘Tavoitteemme on luoda korkealaatuisia muokattuja videokuvia, jotka muokkaavat kasvon muotoa luonnollisen kasvonmuodon mukaan. Tätä voidaan käyttää sovelluksiin, kuten kauneudenmuokkaukseen ja visuaalisiin efekteihin.’

Vaikka 2D-kasvomuokkaus ja vääristymä on ollut kuluttajien saatavilla Photoshoppin kehittymisen myötä (ja johtanut outoihin ja usein epähyväksyttäviin alakulttuureihin kasvonvääristymisen ja kehon dysmorfian ympärillä), on se vaikea tehdä videossa ilman CGI:ä.

Mark Zuckerbergin mitat laajennettiin ja kavennettiin kiinalais-brittiläisellä tekniikalla.

Mark Zuckerbergin kasvon mitat laajennettiin ja kavennettiin uudella kiinalais-brittiläisellä tekniikalla.

Kehon muokkaus on tällä hetkellä kiinnostuksen aihe tietokoneen näköalalla, pääasiassa sen potentiaalin vuoksi muodin verkkokaupassa, vaikka tehdä joku näyttää pidemmältä tai luurankomaisemmalta on edelleen haasteellista.

Vastaavasti kasvon muodon muuttaminen videomateriaalissa johdonmukaisella ja vakuuttavalla tavalla on ollut aiheena aikaisemmalle tutkimukselle uuden tutkimuksen tekijöiden toimesta, vaikka tuo toteutus kärsi häiriöistä ja rajoituksista. Uusi tarjous laajentaa edellisen tutkimuksen mahdollisuuksia staattisesta videotuotantoon.

Uusi järjestelmä koulutettiin työpöytätietokoneella, jossa on AMD Ryzen 9 3950X -prosessori ja 32 GB muistia, ja se käyttää OpenCV:n optista virtausta liikkeen karttojen luomiseen, jota sileää StructureFlow-kehyksen avulla; Kasvon suunnan arviointiverkkoa (FAN) maamerkkien arvioimiseen, jota käytetään myös suositussa deepfake-paketeissa; ja Ceres Solver -ratkaisua optimointihaasteiden ratkaisemiseen.

Äärimmäinen esimerkki kasvon laajentamisesta uudella järjestelmällä.

Äärimmäinen esimerkki kasvon laajentamisesta uudella järjestelmällä.

Tutkimus on otsikoitu Parametrinen kasvonmuokkaus videossa, ja se on kolmen Zhejiangin yliopiston tutkijan ja yhden Bathin yliopiston tutkijan työtä.

Kasvojen muokkaus

Uuden järjestelmän alla video puretaan kuvaussarjaksi, ja jokaisen kasvon jäykkyys arvioidaan ensin. Sitten edustava määrä seuraavia kehysmuotoja arvioidaan yhdessä, jotta voidaan rakentaa johdonmukaiset identiteettiparametrit koko kuvan ajan (ts. videon kehykset).

Kasvonvääristymisen arkkitehtuuri.

Kasvonvääristymisen arkkitehtuuri.

Tämän jälkeen ilme arvioidaan, josta saadaan uudelleenmuokkausparametri, jota sovelletaan lineaarisen regressioanalyysin avulla. Seuraavaksi uusi allekirjoitettu etäisyysfunktiomenetelmä (SDF) luo tiheän 2D-kartan kasvon piirteistä ennen ja jälkeen muokkaamista.

Lopuksi suoritetaan sisällön tietoinen vääristymisoptimointi tulostevideossa.

Parametrinen kasvot

Prosessi hyödyntää 3D-muokattavaa kasvomallia (3DMM), josta on tullut yhä suositumpi apuväline neuroniseen ja GAN-pohjaiseen kasvon synteesijärjestelmiin, sekä sovellettavissa deepfake-havaitsemisjärjestelmiin.

Ei ole tästä tutkimuksesta, mutta esimerkki 3D-muokattavasta kasvomallista (3DMM) - parametrinen kasvomalli, jota käytetään uudessa projektissa. Ylävasen reunassa on maamerkki sovellettu 3DMM-kasvoille. Yläoikea, 3D-meshin pisteet isokartassa. Alhaalla vasemmalla on maamerkin sovittaminen; alhaalla keskellä, isokartta irrotetun kasvon tekstuurista; ja alhaalla oikealla, tuloksena oleva sovitus ja muoto. Lähde: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf

Ei ole tästä tutkimuksesta, mutta esimerkki 3D-muokattavasta kasvomallista (3DMM) – parametrinen kasvomalli, jota käytetään uudessa projektissa. Ylävasen reunassa on maamerkki sovellettu 3DMM-kasvoille. Yläoikea, 3D-meshin pisteet isokartassa. Alhaalla vasemmalla on maamerkin sovittaminen; alhaalla keskellä, isokartta irrotetun kasvon tekstuurista; ja alhaalla oikealla, tuloksena oleva sovitus ja muoto. Lähde: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf

Uuden järjestelmän työnkulkuun on otettava huomioon tapaukset, joissa kasvo on peitetty, kuten esimerkiksi silloin, kun kohteena oleva henkilö kääntyy pois. Tämä on yksi suurimmista haasteista deepfake-ohjelmistoissa, koska FAN-maamerkit eivät pysty ottamaan näitä tapauksia huomioon, ja ne alkavat heiketä laadussa, kun kasvo kääntyy pois tai on peitetty.

Uusi järjestelmä pystyy välttämään tämän ansan määrittelemällä reunamuodon energian, joka pystyy vastaamaan 3D-kasvon (3DMM) ja 2D-kasvon (FAN-maamerkit määrittelemä) rajaa.

Optimointi

Hyödyllinen käyttö tällaiselle järjestelmälle olisi toteuttaa reaaliaikainen muodonmuutos, esimerkiksi videoneuvottelusovelluksissa. Nykyinen kehys ei mahdollista tätä, ja tarvittavat laskentaresurssit tekisivät “reaaliaikaisen” muodonmuutoksen merkittäväksi haasteeksi.

Tutkimuksen mukaan, olettaen 24 fps-videokohdetta, kehysoperaatiot prosessissa edustavat viivettä 16,344 sekuntia jokaiselle sekunnille kohtauksia, ja lisäksi yksittäisiä iskuja identiteetin arvioimiseksi ja 3D-kasvon muodonmuutokseksi (321 ms ja 160 ms vastaavasti).

Optimointi on siis avain edistymiseen viiveen laskemiseksi. Koska yhteinen optimointi kaikissa kehyksissä lisäisi merkittävästi prosessin kuormitusta, ja init-tyyppinen optimointi (olettaen jatkuvaa identiteetin jatkumista puhujasta ensimmäisestä kehyksestä) voisi johtaa anomaliaksi, tekijät ovat omaksuneet harvan scheman laskemaan kehyskohtaisia kerrointa.

Yhteinen optimointi suoritetaan tämän kehysosajoukon kohdalla, mikä johtaa ohuempaan prosessiin.

Kasvon vääristymä

Vääristymätekniikka, jota käytetään tässä projektissa, on sovellettu tekijöiden vuoden 2020 työstä Syvät muodonmuutokset (DSP).

Syvät muodonmuutokset, vuoden 2020 ACM Multimedian esitys. Tutkimus on ZJU-Tencent Game and Intelligent Graphics Innovation Technology Joint Lab -tutkijoiden johdolla. Lähde: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

Syvät muodonmuutokset, vuoden 2020 ACM Multimedian esitys. Tutkimus on ZJU-Tencent Game and Intelligent Graphics Innovation Technology Joint Lab -tutkijoiden johdolla. Lähde: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

Tekijät toteavat ‘Laajennamme tätä menetelmää yhden monokulaarisen kuvan muokkaamisesta koko kuvan sarjan muokkaamiseen.’

Testit

Tutkimuksessa todetaan, että ei ollut vertailukelpoista aiempaa materiaalia, jotta uutta menetelmää voitiin arvioida. Sen vuoksi tekijät vertasivat kehyksiä heidän vääristyneistä videotuotoksistaan statisiikan DSP-tuloksiin.

Uuden järjestelmän testaaminen statisiikan kuvien kanssa Syvät muodonmuutokset -tutkimuksesta.

Uuden järjestelmän testaaminen statisiikan kuvien kanssa Syvät muodonmuutokset -tutkimuksesta.

Tekijät toteavat, että DSP-menetelmästä aiheutuu häiriöitä harvan kartan käytön vuoksi – ongelmaa, jonka uusi kehys ratkaisee tiheän kartan avulla. Lisäksi videon tuottaminen DSP:llä, tutkimuksen mukaan, näyttää sileäyttä ja visuaalista yhtenäisyyttä.

Tekijät toteavat:

‘Tulokset osoittavat, että voimme luoda vakuuttavasti yhtenäisiä muokattuja videokuvia, kun taas kuvapohjainen menetelmä voi helposti johtaa huomattaviin vilkkuvien häiriöiden ilmestymiseen.’

Katso alla oleva video, jossa on lisää esimerkkejä:

 

Julkaistu ensimmäisen kerran 9. toukokuuta 2022. Muutettu kello 18.00 EET, korvattiin ‘kenttä’ ‘funktiolla’ SDF:lle.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai