Andersonin kulma
Uusi Deepfake-menetelmä ratkaisee “kasvojen isäntä”-ongelman

Huolimatta useista vuosista medialta saatuista yliampuvista väitteistä syvänvalokuvien mahdollisuuksista horjuttaa pitkään vallinnutta uskomusta videokuvan aitoutta kohtaan, kaikki tällä hetkellä suositut menetelmät perustuvat “kasvojen isäntien” löytämiseen, jotka ovat suunnilleen samanmuotoisia kuin kohdekasvo.
Kun alkuperäisessä kuvamateriaalissa on laaja kasvo, mutta kohdehenkilöllä on kapea kasvo, tulokset ovat aina olleet ongelmallisia, koska tällainen siirto edellyttää alkuperäisen kasvojen osittista poistamista ja taustan uudelleenrakentamista. Nykyiset paketit, kuten DeepFaceLab ja FaceSwap, pystyvät tuottamaan rajoittuneita tuloksia, kun konfiguraatio on käänteinen (kapea > laaja), mutta niillä ei ole mahdollisuutta vakuuttavasti ratkaista tätä skenaariota.
Nyt Kiinan ja Xiamen-yliopiston yhteistyö on kehittänyt uuden lähestymistavan, joka on nimeltään HifiFace, ja jonka tarkoituksena on korjata tämä puute.

Kaksi HifiFace-syvänvalokuvaa, joista ensimmäinen on Anne Hathaway, jossa saavutetaan hyvä muistinvarainen muoto, vaikka isäntäkasvojen muoto on yhteensopimaton. HifiFace toimii myös hyvin kohteilla, joilla on silmälasit, jotka ovat perinteisesti olleet este syvänvalokuvissa. Lähde: https://arxiv.org/pdf/2106.09965.pdf
Syvänvalokuvan kasvojen muokkaus
Aikaisemmat lähestymistavat, kuten vuoden 2019 Aiheen riippumaton kasvojen vaihto ja uudelleenjärjestäminen (FSGAN), ovat perustuneet 3DMM-mallinnukseen (3D-muokkaukselliset mallit) tai muihin menetelmiin, jotka perustuvat kasvojen maantieteelliseen tunnistamiseen tai muunnokseen, jossa kasvojen piirteet määräävät vaihdon rajat.

3DMM-kasvojen maantieteellinen havainnointi. Lähde: https://github.com/Yinghao-Li/3DMM-fitting
Vaikka kilpailevat menetelmät ovat käyttäneet kasvojen tunnistusverkkojen ominaisuuksia, ne on suunniteltu ennen kaikkea kokoamalla tekstuuria uudelleen, eivätkä ne tuota vakuuttavaa tulosta, kun isäntäkasvojen muoto ei ole täysin yhteensopiva (ts. hiusten, leukan ja poskipäiden rajojen määritys).
Tätä varten Kiinalaiset tutkijat, jotka työskentelevät Xiamen-yliopiston Media Analytics and Computing Lab -yksikössä, kehittivät päästä-päähän-verkon, joka laskee kohde- ja lähdekuvan kertoimia 3D-mallinnusmallin avulla, joka yhdistetään muodoksi ja yhdistetään identiteetin vektoritiedon kanssa kasvojen tunnistusverkosta.
Tämä geometrinen tieto syötetään koodaus-purku-malliin rakenteellisena tietona, joka sekoitetaan kohdekuvan ilmeen ja asentoon, jotka käytetään apuna tarkalle siirrolle.
Sanastollinen kasvojen yhdistäminen
Lisäksi HifiFace sisältää Sanastollisen kasvojen yhdistämisen (SFF) -komponentin, joka käyttää matalatasoista ominaisuutta koodaajassa säilyttääksesi paikallisen ja tekstuurin tiedon ilman identiteetin menetystä. Koodaajan ja purkuajan ominaisuudet yhdistetään oppimalla sopeutuvalla maskilla, ja taustatieto sekoitetaan tulokseen oppimalla kasvomaskin avulla.

HifiFace toiminnassa. Lähde: https://johann.wang/HifiFace/
Tällä tavalla HifiFace poikkeaa alkuperäisen materiaalin kasvojen rajojen käytöstä kovina rajoituksina, käyttämällä laajennettua kasvojen semanttista segmentointia, jossa malli voi suorittaa paremmin sopeutuvan yhdistämisen kasvojen reunamuodoissa.

Kaksi aikaisempaa lähestymistapaa (vasemmalla ylhäällä ja alhaalla) ja uusi HifiFace-arkkitehtuuri, joka koostuu koodaajasta, purkuajasta, 3D-muodon tietoisen identiteetin poistajasta ja SFF-moduulista.
Vertaillessa aiempia menetelmiä FSGAN, SimSwap ja FaceShifter, HifiFace osoittaa ylivoimaisen kasvojen muodon jäljentämisen, koska se ei pyri “haamumaisiin” elementteihin, joissa kasvojen rajoitukset sekoittavat identiteetin > identiteetin kartoituksen, vaan rakentaa ne uudelleen.
Testaus
Tutkijat toteuttivat järjestelmän käyttäen VGGFace2 ja DeepGlint Asian-Celeb -tietoja. Kasvot olivat kohdistettu 5 ulospäin osoittavien maamerkkien avulla ja uudelleenleikattu 256×256 pikseliksi. Myös muokattu portrait-enhancement-verkko generoi 512×512 pikselin version, jotta saataisiin korkeampi resoluutio. Malli oli koulutettu Adam-algoritmin avulla.
Vaikka FaceShifter säilyttää identiteetin hyvin, se ei pysty käsittämään ongelmia, kuten ilmeen, värin ja peittämisen, yhtä tehokkaasti kuin HifiFace, ja sen verkkostruktuuri on monimutkaisempi. FSGAN:lla on ongelmia siirtää valaistus lähdekuvasta kohdekuvaksi.
Tutkijat käyttävät FaceForensics++ -vertailua, jossa otetaan kymmenen kehyksen näyte kunkin muunnetun videon joukosta kilpailevien menetelmien kesken, ja havaitsevat, että HifiFace saavutti ylivoimaisen ID-hakutuloksen. Testatessaan muita tekijöitä, kuten kuvanlaatua, tutkijat totesivat myös, että heidän menetelmänsä ylittää kilpailevat menetelmät.
Työ edustaa edelleen askelta alkuperäisen materiaalin abstrahoinnissa, jotta se on vain karkea pohja, johon voidaan siirtää tarkat identiteetit. Jotkut nykyisistä FOSS-paketeista, mukaan lukien DeepFaceLab, sisältävät alkuvaiheen toiminnallisuuden pään korvaamiseksi, mutta ne eivät, kuten HifiFace, huomioi hiuksia, ja ne ovat tehokkaampia “rakentamassa” kasvoa kuin muokkaamassa sitä sopimaan toivottuun kohdekuvan.

















