Andersonin kulma

Uusi ja yksinkertaisempi Deepfake-menetelmä, joka ylittää aiemmat lähestymistavat

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Kiinalaisen tekoälytutkimusryhmän ja Yhdysvaltojen tutkijoiden yhteistyö on kehittänyt mahdollisesti ensimmäisen oikean innovaation deepfake-teknologiassa neljän vuoden ajan.

Uusi menetelmä voi suorittaa kasvojen vaihdon, joka ylittää kaikki olemassa olevat kehykset standardien havaintotesteissä, ilman, että tarvitsee kerätä ja kuratoida suuria omistettuja tietoja ja kouluttaa niitä jopa viikon ajan vain yhden identiteetin vuoksi. Esimerkkejä, jotka esitetään uudessa tutkimuksessa, mallit on koulutettu kahdella suositulla julkkisten tietokannalla, yhdellä NVIDIA Tesla P40 -näytönohjaimella noin kolmen päivän ajan.

Koko video on liitettynä tämän artikkelin loppuun. Tässä näyte videosta, joka on lisämateriaalina uudessa tutkimuksessa, Scarlett Johanssonin kasvoja siirretään lähderekisteröintiin. CihaNet poistaa reunan peittämisen ongelman, joka ilmenee vaihdon aikana, muodostamalla ja toteuttamalla syvempiä suhteita lähderekisteröinti- ja kohdeidentiteetin välillä, mikä merkitsee loppua

Koko video on liitettynä tämän artikkelin loppuun. Tässä näyte videosta, joka on lisämateriaalina yhden uuden tutkimuksen tekijän toimittamana, Scarlett Johanssonin kasvoja siirretään lähderekisteröintiin. CihaNet poistaa reunan peittämisen ongelman, joka ilmenee vaihdon aikana, muodostamalla ja toteuttamalla syvempiä suhteita lähderekisteröinti- ja kohdeidentiteetin välillä, mikä merkitsee loppua “ilmeisille rajoille” ja muiden yhdistämisen virheiden, jotka ilmenevät perinteisissä deepfake-lähestymistavoissa. Lähde: https://mitchellx.github.io/#video

Uusi lähestymistapa poistaa tarpeen “liimata” siirrettävä identiteetti karkeasti kohdevideoon, mikä usein johtaa paljastaviin artefakteihin, jotka ilmenevät siinä, missä väärä kasvo loppuu ja todellinen, alkuperäinen kasvo alkaa. Sen sijaan “hallusinaatiokartat” käytetään syvemmän visuaalisten piirteiden sekoittamiseen, koska järjestelmä erottaa identiteetin kontekstista paljon nykyisiä menetelmiä paremmin, ja siten se voi sekoittaa kohdeidentiteetin syvemmin.

Tutkimuksesta. CihaNet-muunnokset tapahtuvat hallusinaatiokarttojen (alareuna) kautta. Järjestelmä käyttää kontekstiinformaatiota (ts. kasvon suunta, hiukset, silmälasit ja muut peittävät esteet jne.) kokonaan siirtämiseen käytettävästä kuvasta, ja kasvon identiteetin tietoja kokonaan siirtämiseen käytettävästä henkilöstä. Tämä kyky erottaa kasvo kontekstista on kriittinen järjestelmän onnistumiselle. Lähde: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257

Tutkimuksesta. CihaNet-muunnokset tapahtuvat hallusinaatiokarttojen (alareuna) kautta. Järjestelmä käyttää kontekstiinformaatiota (ts. kasvon suunta, hiukset, silmälasit ja muut peittävät esteet jne.) kokonaan siirtämiseen käytettävästä kuvasta, ja kasvon identiteetin tietoja kokonaan siirtämiseen käytettävästä henkilöstä. Tämä kyky erottaa kasvo kontekstista on kriittinen järjestelmän onnistumiselle. Lähde: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257

Vaikuttavasti uusi hallusinaatiokartta tarjoaa täydellisemmän kontekstin vaihdolle, verrattuna kovin maskien, jotka usein vaativat laajaa kuratointia (ja DeepFaceLab-tapauksessa erillistä koulutusta) ja tarjoavat rajoitetun joustavuuden todellisen yhdistämisen suhteen.

Lisämateriaaleista, jotka on toimittanut yksi tutkimuksen tekijöistä, käyttäen sekä FFHQ- että Celeb-A HQ -tietokantoja, VGGFace- ja Forensics++-tietokannoissa. Ensimmäiset kaksi saraketta näyttävät satunnaisesti valitut (oikeat) kuvat, jotka on vaihdettu. Seuraavat neljä saraketta näyttävät vaihdon tuloksia neljällä parhaalla menetelmällä, jotka ovat saatavilla, ja viimeinen sarake näyttää CihaNetin tuloksen. FaceSwap-arkistoa on käytetty, sen sijaan, että olisi käytetty suositumpaa DeepFaceLabia, koska molemmat projektit ovat haaroja alkuperäisestä 2017 Deepfakes-koodista GitHubissa. Vaikka kummassakin projektissa on lisätty malleja, tekniikoita, monia käyttöliittymiä ja lisätyökaluja, deepfakeen mahdollistava perusohjelmisto ei ole muuttunut ja on yhteinen molemmille. Lähde: https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip

Tutkimus tutkimus, jonka otsikko on One-stage Context and Identity Hallucination Network, on tehty tutkijoille, jotka ovat liitetyt JD AI Researchiin ja Massachusettsin yliopistoon Amherstiin, ja se on tuettu Kiinan kansallisen t&D-ohjelman Grant No. 2020AAA0103800:lla. Se esiteltiin 29. ACM International Conference on Multimediassa, 20.-24. lokakuuta Chengdussa, Kiinassa.

Ei tarvitse ‘kasvojen suoraa’ vertailua

Molemmat suosituimmat nykyiset deepfake-ohjelmistot, DeepFaceLab ja kilpaileva haara FaceSwap, suorittavat monimutkaisia ja usein käsin kuratoiduista työnkulkuja, jotta voidaan tunnistaa, mihin suuntaan kasvo on kallistunut, mitkä esteet ovat esteenä (jälleen kerran manuaalisesti), ja miten käsitellään monia muita ärsyttäviä esteitä (mukaan lukien valaistus), jotka tekevät niiden käytöstä kaukana “napsauta ja valitse” -kokemuksesta, jota väärin esitetään medialla deepfaken syntymästä lähtien.

Toisin sanoen CihaNet ei vaadi, että kaksi kuvaa on otettu suoraan kameraan, jotta voidaan poistaa ja hyödyntää hyödyllistä identiteettitietoa yhdestä kuvasta.

<img class="size-full wp-image-178605" src="https://www.unite.ai/wp-content/uploads/2021/11/cihanet-angles.jpg" alt="Näissä esimerkeissä joukko deepfake-ohjelmistojen kilpailijoita haastetaan vaihtamaan kasvoja, jotka eivät ole vain erilaisia identiteettejä, vaan eivät myöskään ole samassa suunnassa. Ohjelmisto, joka perustuu alkuperäiseen deepfakes-arkistoon (kuten suositun DeepFaceLab ja FaceSwap, kuvassa yllä), ei pysty käsittelemään kulman eroa kahden vaihdettavan kuvan välillä (katso kolmas sarake). Sen sijaan CihaNet voi abstrahoida identiteetin oikein, koska kasvon "asento" ei ole identiteettitiedon sisällä.

Arkkitehtuuri

CihaNet-projekti, tutkijoiden mukaan, sai inspiraationsa Microsoft Researchin ja Pekingin yliopiston yhteistyöhön vuonna 2019, joka kutsuttiin FaceShifteriksi, vaikka se tekee joitakin merkittäviä ja kriittisiä muutoksia vanhan menetelmän perusrakenteeseen.

FaceShifter käyttää kahta Adaptive Instance Normalization (AdaIN) -verkkoa identiteettitiedon käsittelyyn, joka siirretään kohdekuvan kautta maskin kautta, samalla tavalla kuin nykyinen suosittu deepfake-ohjelmisto (ja kaikki sen liittyvät rajoitukset), käyttäen lisäksi HEAR-Netiä (joka sisältää erillisen aliverkon, joka on koulutettu peittävien esteiden häiriöihin – lisäkerros monimutkaisuutta).

Sen sijaan uusi arkkitehtuuri käyttää suoraan tätä “kontekstuaalista” tietoa itse muunnokselle, kaksivaiheisen yhdistetyn sovittimen avulla (C-AdaIN), joka tarjoaa kontekstin johdonmukaisuuden (ts. kasvon iho ja peittävät esteet) ID-relevanttien alueiden osalta.

Toinen tärkeä aliverkko järjestelmässä on Swapping Block (SwapBlk), joka luo integroidun ominaisuuden viittaamalla kuvaan ja upotettuun “identiteetin” tietoon lähderekisteröinnistä, ohittaen useat vaiheet, jotka ovat tarpeen tämän saavuttamiseksi perinteisillä tavoilla.

Jotta voidaan erottaa konteksti ja identiteetti, hallusinaatiokartta luodaan kullekin tasolle, joka toimii pehmeänä segmentointimaskina, ja vaikuttaa laajemmin ominaisuuksiin tämän kriittisen osan deepfake-prosessissa.

Kun hallusinaatiokartan arvo kasvaa, selkeä reitti identiteettien välillä ilmenee.

Kun hallusinaatiokartan arvo kasvaa, selkeä reitti identiteettien välillä ilmenee.

Tällä tavoin koko vaihtoprosessi suoritetaan yhdessä vaiheessa ja ilman jälkikäsittelyä.

Data ja testaus

Kokeillaakseen järjestelmää tutkijat kouluttivat neljä mallia kahdella erittäin suositulla ja monipuolisella avoimella kuvatietokannalla – CelebA-HQ ja NVIDIA:n Flickr-Faces-HQ Dataset (FFHQ), joista kummassakin on 30 000 ja 70 000 kuvaa.

Kummassakaan perustietokannassa ei tehty lohkaisua tai suodatusta. Kummassakin tapauksessa tutkijat kouluttivat koko tietokannan yhdellä Tesla GPU:lla kolmen päivän ajan, oppimissuhteella 0,0002 Adam-optimoimisella.

He sitten renderöivät joukon satunnaisia vaihtoja tuhansien henkilöiden kesken, jotka ovat mukana tietokannoissa, ilman huomiota siitä, ovatko kasvot samanlaisia tai jopa sukupuolten mukaisia, ja vertasivat CihaNetin tuloksia neljän johtavan deepfake-kehyksen tuloksiin: FaceSwap (joka edustaa suositumpaa DeepFaceLabia, koska ne jakavat saman alkuperäisen koodin 2017 repositoryssa, joka toi deepfakes-maailmaan); edellä mainittu FaceShifter; FSGAN; ja SimSwap.

Verrattaessa tuloksia VGG-Face, FFHQ, CelebA-HQ ja FaceForensics++ avulla, tutkijat totesivat, että heidän uusi malli ylittää kaikki aiemmat mallit, kuten taulukossa alla näkyy.

Kolme mittaria, joita käytettiin tulosten arvioimiseen, olivat rakenteellinen samankaltaisuus (SSIM), asennontarkkuusvirhe ja ID-hakutarkkuus, joka lasketaan onnistuneiden parien prosenttiosuutena.

Tutkijat väittävät, että CihaNet edustaa ylivoimaista lähestymistapaa laadukkaiden tulosten suhteen, ja merkittävää edistystä nykyisessä deepfake-teknologian tilassa, poistamalla laajan ja työlään maskiarkkitehtuurin ja -menetelmien taakan, ja saavuttamalla hyödyllisemmän ja toimivamman identiteetin ja kontekstin erottamisen.

Katso alla olevia video-esimerkkejä uudesta tekniikasta. Voit löytää koko videon täältä.

Lisämateriaaleista uudesta tutkimuksesta, CihaNet suorittaa kasvojen vaihdon eri identiteeteille. Lähde: https://mitchellx.github.io/#video

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai