Andersonin kulma

Syvän äänen vuoden koitto: Deepfaked Emotions

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tutkijat ovat kehittäneet uuden koneoppimismenetelmän, jolla voidaan asettaa tahallisesti uudet tunteet kasvoille videossa, soveltamalla olemassa olevia teknologioita, jotka ovat viime aikoina nousseet ratkaisuksi ulkomaisten kielten dubbaamiseen sopivien huulien liikkeiden kanssa.

Tutkimus on yhdenmukainen yhteistyö Northeastern Universityn ja MIT:n Media Labin välillä, ja se on nimeltään Käännöskyrät: Video-Videon Kasvontunnistus. Vaikka tutkijat myöntävät, että alkujaan tulokset vaativat edelleen kehittämistä, he väittävät, että menetelmä, jota kutsutaan Wav2Lip-Emotioniksi, on ensimmäinen, joka suoraan käsittelee videon ilmeiden muuttamista neuroverkkojen avulla.

Pohjakoodi on julkaistu GitHubissa, vaikka mallin tarkistuspisteet lisätään myöhemmin avoimeen lähdekoodirepositorioon, kirjoittajat lupaavat.

Vasemmalla, 'surullinen' kehys lähtevidiosta. Oikealla, 'iloinen' kehys. Keskellä ovat kaksi uutta lähestymistapaa vaihtoehtoisten tunteiden synteesiin - ylärive: täysin maskattu kasvo, jossa koko ilmeen pinta on korvattu; alarivi: perinteisempi Wav2Lip-menetelmä, joka korvaa ainoastaan kasvon alaosan.

Vasemmalla, ‘surullinen’ kehys lähtevidiosta. Oikealla, ‘iloinen’ kehys. Keskellä ovat kaksi uutta lähestymistapaa vaihtoehtoisten tunteiden synteesiin – ylärive: täysin maskattu kasvo, jossa koko ilmeen pinta on korvattu; alarivi: perinteisempi Wav2Lip-menetelmä, joka korvaa ainoastaan kasvon alaosan. Lähde: https://raw.githubusercontent.com/jagnusson/Wav2Lip-Emotion/main/literature/ADGD_2021_Wav2Lip-emotion.pdf

Yksittäinen Video Lähdetietona

Teoriassa tällaiset manipulaatiot ovat saatavilla jo olemassa olevien deepfake-repositorioiden kautta, kuten DeepFaceLab tai FaceSwap. Kuitenkin standardityökalu vaatisi vaihtoehtoisen identiteetin ‘kohde’-identiteetin, kuten näyttelijän joka esittää kohdetta, jonka omat ilmeet siirrettäisiin toiseen yksilöön, yhdessä muun suorituksen kanssa. Lisäksi deepfake-äänenkloonaukset olisivat yleensä tarpeen illuusion täydentämiseksi.

Lisäksi, todellinen ilmeen muuttaminen kohteen yksittäisessä lähdetiedostossa näissä suosituissa kehyksissä vaatisi kasvon suunnan muuttamista tavalla, jota nämä arkkitehtuurit eivät tue.

Wav2Lip-Emotion säilyttää huulien synchronisaation alkuperäisestä videoiden ääni dialoogista muuttaen liittyviä ilmeitä.

Wav2Lip-Emotion säilyttää huulien synchronisaation alkuperäisestä videoiden ääni dialoogista muuttaen liittyviä ilmeitä.

Sen sijaan Wav2Lip-Emotion pyrkii ‘kopioimaan ja liimaamaan’ tunteisiin liittyviä ilmeitä yhdestä videon osasta ja korvaamaan ne muihin kohtiin, itse asettamallaan lähdetiedon niukkuuden, joka on tarkoitus lopulta tarjota alempi ponnistelu menetelmä ilmeiden manipulointiin.

Offline-malleja voidaan kehittää myöhemmin, jotka on koulutettu vaihtoehtoisilla videoilla puhujasta, poistamalla tarpeen millekään yksittäiselle videolle sisältää ‘värilevy’ ilmeiden tiloja, joilla voidaan manipuloida videota.

Mahdolliset Tarkoitukset

Kirjoittajat ehdottavat useita sovelluksia ilmeiden muuttamiseen, mukaan lukien live-vide-suodatin, jolla voidaan korvata PTSD:n ja kasvohermojen halvauspotilaiden vaikutukset. Tutkimus huomauttaa:

‘Yksilöt, joilla on tai joilla ei ole rajoitettuja kasvojen ilmeitä, voivat hyötyä siitä, että he voivat säätää omia ilmeitään paremmin sopimaan heidän sosiaalisiin olosuhteisiinsa. Joku voi haluta muuttaa ilmeitä videoissa, jotka näytetään heille. Puhujat voivat huutaa toisilleen videoneuvottelussa, mutta silti haluavat kerätä sisällön ilman epämiellyttäviä ilmeitä. Tai elokuvaohjaaja voi haluta lisätä tai vähentää näyttelijän ilmeitä.’

Kasvojen ilme on avain- ja ydinaspekti aikomusta, jopa siinä tapauksessa, että se voi hankaloittaa puhuttuja sanoja, ilmeen muuttaminen tarjoaa myös mahdollisuuden muuttaa, miten viestintä vastaanotetaan.

Aikaisemmat Tutkimukset

Koneoppimisen ilmeiden muuttamiseen liittyvät tutkimukset ulottuvat vuoteen 2012, jolloin yhteistyö Adoben, Facebookin ja Rutgersin yliopiston välillä ehdotti menetelmää ilmeiden muuttamiseen käyttäen tensoripohjaista 3D-geometrian rekonstruktioita, joka vaativasti asetti CGI-verkon jokaisen kohdevideon kehykseen muutoksen tekemiseksi.

Vuoden 2012 Adoben/Facebookin tutkimus muutti ilmeitä asettamalla perinteisiä, CGI-pohjaisia muutoksia videomateriaaliin. Ilmeitä voitiin lisätä tai vähentää. Lähde: https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf

Vuoden 2012 Adoben/Facebookin tutkimus muutti ilmeitä asettamalla perinteisiä, CGI-pohjaisia muutoksia videomateriaaliin. Ilmeitä voitiin lisätä tai vähentää. Lähde: https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf

Vaikka tulokset olivat lupaavia, menetelmä oli raskas ja tarvitsi merkittäviä resursseja. Tässä vaiheessa CGI oli edellä tietokoneen näön perusteisia lähestymistapoja suoraan piirtoalueen ja pikselien manipulointiin.

Lisäksi MEAD, tietokanta ja ilmeiden generoimismalli, joka julkaistiin vuonna 2020, pystyi generoimaan ‘puhuvan pään’ videoita, vaikka se ei ollut yhtä monimutkainen kuin alkuperäisen lähdetiedoston suora muuttaminen.

Ilmeiden generointi vuoden 2020 MEAD:lla, yhteistyö SenseTime Researchin, Carnegie Mellonin ja kolmen kiinalaisen yliopiston välillä. Lähde: https://wywu.github.io/projects/MEAD/MEAD.html

Ilmeiden generointi vuoden 2020 MEAD:lla, yhteistyö SenseTime Researchin, Carnegie Mellonin ja kolmen kiinalaisen yliopiston välillä. Lähde: https://wywu.github.io/projects/MEAD/MEAD.html

Vuonna 2018 julkaistiin toinen tutkimus, joka käsitteli GANimation: Anatomically-aware Facial Animation from a Single Image, yhdysvaltalais-espanjalainen akateeminen tutkimusyhteistyö, joka käytti generatiivisia vastakkainoppija (GAN) ilmeiden muuttamiseen vain kuvissa.

Ilmeiden muuttaminen kuvissa GANimationin avulla. Lähde: https://arxiv.org/pdf/1807.09251.pdf

Ilmeiden muuttaminen kuvissa GANimationin avulla. Lähde: https://arxiv.org/pdf/1807.09251.pdf

Wav2Lip-Emotion

Sen sijaan uusi projekti perustuu Wav2Lipiin, joka herätti huomiota vuonna 2020 tarjoamalla potentiaalisen menetelmän huulien synchronisaatiolle uuden puhetta (tai laulua) varten, jota ei ollut esiintynyt alkuperäisessä videossa.

Alkuperäinen Wav2Lip-arkkitehtuuri oli koulutettu BBC:n arkistojen puhuttujen lauseiden aineistolla. Jotta Wav2Lip voidaan sovittaa ilmeiden muuttamistehtävään, tutkijat ‘hienosäätivät’ arkkitehtuurin edellä mainitulla MEAD-tietokannalla.

MEAD koostuu 40 tunnin videomateriaalista, jossa 60 näyttelijää lukee samaa lausetta eri kasvojen ilmein. Näyttelijät ovat 15 eri maasta ja tarjoavat kansainvälisiä piirteitä, joiden tarkoituksena on auttaa projektia (ja johtuvia projekteja) tuottamaan sovellettavaa ja hyvin yleistettyä ilmeiden synteesiä.

Tutkimuksen aikana MEAD oli julkaissut vain tietokannan ensimmäisen osan, joka sisälsi 47 yksilöä, jotka esittivät ilmeitä kuten ‘vihamielinen’, ‘inhoreaktio’, ‘pelko’, ‘halveksunta’, ‘iloinen’, ‘surullinen’ ja ‘yllätys’. Tässä alkuvaiheessa uuden lähestymistavan kanssa tutkijat rajoittivat projektin laajuutta asettamalla tai muuttamalla ainoastaan ‘iloinen’ ja ‘surullinen’ tunteita, koska ne ovat helpoimmin tunnistettavissa.

Menetelmä ja Tulokset

Alkuperäinen Wav2Lip-arkkitehtuuri korvaa ainoastaan kasvon alaosan, kun taas Wav2Lip-Emotion kokeilee myös täydellisen kasvojen maskin ja ilmeiden synteesiä. Näin ollen tutkijoiden oli muutettava myös sisäänrakennettuja arviointimenetelmiä, koska ne eivät olleet suunniteltu täydelliseen kasvojen konfiguraatioon.

Kirjoittajat parantavat alkuperäistä koodia säilyttämällä alkuperäisen äänen syötteen ja ylläpitämällä huulien liikkeen johdonmukaisuutta.

Generaattorin osa sisältää identiteetin koodarin, puhetunnistimen ja kasvojen dekooderin, alkuperäisen työn mukaisesti. Puhetunniste koodataan lisäksi pinottuna 2D-konvoluutioina, jotka liitetään sitten niiden liittyviin kehyksiin.

Generaattorin lisäksi muunnettu arkkitehtuuri sisältää kolme pääasiallista diskriminaattorikomponenttia, jotka kohdistuvat huulien synchronisaation, tunteen tavoitteen ja visuaalisen laadun vastakkainoppiin.

Täydellisen kasvojen rekonstruktioon ei ollut esimerkkiä alkuperäisessä Wav2Lip-työssä, ja malli koulutettiin alusta alkaen. Alempaan kasvojen koulutukseen (puolikas maski) tutkijat jatkoivat alkuperäisen Wav2Lip-koodin mukaisista tarkistuspisteistä.

Lisäksi automaattisen arvioinnin, tutkijat käyttivät joukkoistettua mielipidettä, jota toimitti puoli-automatisoitu palvelualusta. Työntekijät arvioivat yleensä tulokset korkeiksi ilmeiden tunnistamisen suhteen, kun taas he ilmoittivat vain ‘kohtalaiset’ arviot kuvan laadun suhteen.

Kirjoittajat ehdottavat, että tulevissa tutkimuksissa voidaan parantaa generoituja videoiden laatua, ja että tämä työ voidaan soveltaa myös tulevaisuudessa merkittyyn tai automaattisesti johdettuihin lähdetietoihin ja tietokantoihin, johtaen lopulta aitoon järjestelmään, jossa tunteita voidaan säätää ylös tai alas käyttäjän mielin mukaan, tai lopulta korvata vastakkaisten tunteiden kanssa suhteessa alkuperäiseen lähdetiedostoon.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai