Andersonin kulma

Emotion Muutokset Videomateriaalissa Käyttäen Tekoälyä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tutkijat Kreikasta ja Iso-Britanniasta ovat kehittäneet uuden syväoppimismenetelmän, jolla voidaan muuttaa videomateriaalissa esiintyvien henkilöiden ilmeitä ja näennäistä tunnelmaa, säilyttäen samalla huulten liikkeiden uskollisuuden alkuperäiseen ääneen tavalla, jota aiemmat yritykset eivät ole pystyneet saavuttamaan.

Videon, joka on liitetty tähän artikkeliin, lyhyt Al Pacino -klippi, jonka ilme on hienosti muutettu NED:llä, korkean tason semanttisten käsitteiden perusteella. Lähde: https://www.youtube.com/watch?v=Li6W8pRDMJQ

Videon, joka on liitetty tähän artikkeliin, lyhyt Al Pacino -klippi, jonka ilme on hienosti muutettu NED:llä, korkean tason semanttisten käsitteiden perusteella, jotka määrittelevät yksittäisiä kasvojen ilmeitä ja niiden liittyviä tunteita. “Viite-ohjattu” -menetelmä oikealla puolella ottaa lähdemateriaalin tulkittuja tunteita ja soveltaa niitä koko videosekvenssiin. Lähde: https://www.youtube.com/watch?v=Li6W8pRDMJQ

Tämä tietty ala kuuluu kasvavaan luokkaan deepfaked emotion, jossa alkuperäisen puhujan identiteetti säilytetään, mutta heidän ilmeensä ja mikroilmeensä muutetaan. Koska tämä tekoälytekniikka kehittyy, se tarjoaa mahdollisuuksia elokuva- ja tv-tuotannoille tehdä hienoisia muutoksia näyttelijöiden ilmeisiin – mutta myös avaa uuden kategorian “tunnealteroitu” videodeepfake.

Muuttuvat Kasvot

Julkisten hahmojen, kuten poliitikkojen, kasvojen ilmeet ovat tarkkaan kuratoituja; vuonna 2016 Hillary Clintonin kasvojen ilmeet tulivat intensiivisen median tarkastelun alle heidän mahdollisen negatiivisen vaikutuksensa vuoksi hänen vaalivoittoaan vastaan; kasvojen ilmeet ovat myös kiinnostuksen aihe FBI:lle; ja ne ovat kriittinen osoitin työhaastatteluissa, mikä tekee (kaukaisen) mahdollisuuden “ilmeohjaus-suodattimelle” toivottavaksi kehitykseksi työnhakijoille, jotka yrittävät päästä Zoomin esivalintaan.

Vuoden 2005 tutkimus Iso-Britanniasta vahvisti, että kasvojen ulkonäkö vaikuttaa äänestyspäätöksiin, kun taas vuoden 2019 Washington Post -artikkeli tarkasteli “irrallisista” videoklippien jakamista, joka on tällä hetkellä lähinnä mitä valeuutisille on tarjolla todellisen muuttamisen sijaan, miten julkisuuden henkilö näyttää käyttäytyvän, reagoivan tai tuntevan.

Kohti Neurologista Ilmeen Muokkausta

Tällä hetkellä kasvojen ilmeen muokkaamisen tila on melko perustasainen, koska se vaatii eriyttämistä korkean tason käsitteistä (kuten suru, viha, ilo, hymy) todellisesta videomateriaalista. Vaikka perinteiset deepfake-arkkitehtuurit näyttävät saavuttavan tämän eriyttämisen melko hyvin, tunteiden heijastaminen eri identiteettien välillä edellyttää, että kaksi kasvojen koulutusjoukkoa sisältää vastaavia ilmeitä kullekin identiteetille.

Koska kasvojen tunnistus ja asento-ominaisuudet ovat tällä hetkellä niin tiiviisti kytköksissä, laaja tasapuolisuus ilmeissä, pään asennossa ja (jonkin verran) valaistuksessa on tarpeen kahden kasvojen tietojoukon välillä kouluttaa tehokas deepfake-malli järjestelmissä kuten DeepFaceLab. Mitä vähemmän tietty konfiguraatio (kuten

Typical esimerkkejä kasvojen kuvista, joita käytetään deepfake-koulutusjoukkoihin. Tällä hetkellä voit muuttaa henkilön kasvojen ilmeä vain luomalla ID-spesifiset ilme-ilme-reitit deepfake-neuraaliverkkoon. Vuoden 2017 deepfake-ohjelmistoilla ei ole sisäistä, semanttista ymmärrystä “hymyestä” – se vain kartoittaa ja vastaa havaittuja muutoksia kasvojen geometriassa kahden aiheen välillä.

Mikä on toivottavaa, ja mitä ei ole vielä täysin saavutettu, on tunnistaa, miten aihe B (esim.) hymyilee, ja luoda yksinkertainen “hymy”-vaihtoehto arkkitehtuuriin ilman, että se tarvitsee olla kytköksissä vastaavaan kuvaan aihe B:stä hymyilemässä.

Uusi tutkimus on otsikoitu Neurologinen Emotion Ohjaaja: Puhetta säilyttävä semanttinen valvonta kasvojen ilmeistä “luonnonvalaisissa” videoissa, ja se tulee tutkijoilta Ateenan kansallisen teknillisen yliopiston sähkö- ja tietotekniikan tiedekunnasta, Kreikan perustuslaillisen tutkimus- ja teknologiayhteisön tietotekniikan instituutista ja Exeterin yliopiston insinööritieteiden, matematiikan ja fysikaalisten tieteiden collegesta Iso-Britanniassa.

Tiimi on kehittänyt kehyksen, joka on nimeltään Neurologinen Emotion Ohjaaja (NED), joka sisältää 3D-pohjaisen emotion-käännöksen, 3D-pohjaisen Emotion Manipulaattorin.

NED ottaa vastaan ilme-parametrien sarjan ja kääntää ne kohdealueeseen. Se on koulutettu epäparillella datalla, mikä tarkoittaa, että ei ole välttämätöntä kouluttaa datalla, jossa kunkin identiteetin on oltava vastaavia kasvojen ilmeitä.

Videon, joka on liitetty tähän artikkeliin, ajaa läpi sarjan testejä, joissa NED määrää näennäisen emotionaalisen tilan YouTube-videomateriaaliin.

Videon, joka on liitetty tähän artikkeliin, ajaa läpi sarjan testejä, joissa NED määrää näennäisen emotionaalisen tilan YouTube-videomateriaaliin.

Tutkijat väittävät, että NED on ensimmäinen videopohjainen menetelmä “ohjaamiseen” näyttelijöitä satunnaisissa ja arvaamattomissa tilanteissa, ja he ovat tehneet koodin saataville NED:n projektisivulla.

Menetelmä ja Arkkitehtuuri

Järjestelmä on koulutettu kahdella suurella videodatalla, jotka on merkitty “tunteen” tunnisteilla.

Tuloste on mahdollista videokasvojen renderöijän ansiosta, joka renderöi halutun emotion videolle perinteisten kasvojen kuvansynteesimenetelmien avulla, mukaan lukien kasvojen segmentointi, kasvojen maamerkkien kohdistus ja sekoitus, jossa vain kasvojen alue syntetisoidaan ja sitten asetetaan alkuperäiseen videomateriaaliin.

NED-pipeline-arkkitehtuuri. Lähde: https://arxiv.org/pdf/2112.00585.pdf

NED-pipeline-arkkitehtuuri. Lähde: https://arxiv.org/pdf/2112.00585.pdf

Aluksi järjestelmä hankkii 3D-kasvojen palautuksen ja asettaa kasvojen maamerkit syötteen kehyksiin tunnistamaan ilmeen. Tämän jälkeen nämä palautetut ilme-parametrit siirretään 3D-pohjaiseen Emotion Manipulaattoriin, ja tyylivektori lasketaan joko semanttisen tunnisteen (kuten “ilo”) tai viite-tiedoston avulla.

Viite-tiedosto on video, joka esittää tietyn tunnistetun ilmeen/emotion, joka sitten asetetaan koko kohde-videon ylle, vaihtaen alkuperäisen ilmeen.

Tunteen siirtoprosessin vaiheet, joissa on näytteitä eri näyttelijöistä YouTube-videosta.

Tunteen siirtoprosessin vaiheet, joissa on näytteitä eri näyttelijöistä YouTube-videosta.

Lopullinen generoitu 3D-kasvojen muoto yhdistetään Normaaloidun Keskimääräisen Kasvojen Koordinaatin (NMFC) ja silmäkuvien (punaiset pisteet yllä olevassa kuvassa) kanssa ja siirretään neurorenderöijälle, joka suorittaa lopullisen manipulaation.

Tulokset

Tutkijat suorittivat laajat tutkimukset, mukaan lukien käyttäjä- ja ablaatio-tutkimukset, arvioidakseen menetelmän tehokkuutta verrattuna aiempaan työhön, ja havaitsivat, että useimmissa kategoriassa NED ylittää tämän alueen nykyisen tilan.

Tutkimuksen tekijät kuvittelevat, että myöhemmät tämän työn toteutukset ja samankaltaiset työkalut tulevat olemaan hyödyllisiä ensisijaisesti tv- ja elokuvateollisuudessa, ja toteavat:

‘Menetelmämme avaa runsaasti uusia mahdollisuuksia hyödyllisiin sovelluksiin neurorenderöintiteknologioista, aina elokuvien jälkituotannosta ja videopelistä photo-realistisiin affektiivisiin avatar-eihin.’

Tämä on varhainen työ alalla, mutta yksi ensimmäisistä, jotka yrittävät kasvojen uudelleen toteutusta videolla eikä vain kuvilla. Vaikka videot ovat periaatteessa vain monta kuvaa, jotka pyörivät hyvin nopeasti, on ajallisia huomioita, jotka tekevät aiemmat emotion-siirron sovellukset vähemmän tehokkaiksi. Liitetyssä videossa ja esimerkeissä tutkimuksessa tekijät sisältävät visuaalisia vertailuja NED:n tuloksista verrattuna muihin verrattaviin menetelmiin.

Lisätietoja ja enemmän esimerkkejä NED:stä voidaan löytää tästä alla olevasta videosta:

 

3. joulukuuta 2021, 18:30 GMT+2 – Yhden tutkimuksen tekijän pyynnöstä tehtiin korjauksia “viite-tiedostoon” liittyen, jonka sanoin virheellisesti olevan still-kuva (vaikka se on itse asiassa videoklippi). Myös korjattiin Kreikan perustuslaillisen tutkimus- ja teknologiayhteisön tietotekniikan instituutin nimeä. 3. joulukuuta 2021, 20:50 GMT+2 – Toisen pyynnön yhden tutkimuksen tekijän toisesta muutoksesta edellä mainitun instituution nimeen.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai