Andersonin kulma

Syvendes rivoluzione di Deepfake: Disentanglement

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

CGI-datan täydentämistä käytetään uudessa projektissa saavuttamaan parempi hallinta deepfake-kuvista. Vaikka et voi edelleenkään käyttää CGI-päitä tehokkaasti täyttämään puuttuvia aukkoja deepfake-kasvojen aineistoissa, uusi tutkimusalan aalto identiteetin ja kontekstin erottamiseksi merkitsee, että pian et ehkä tarvitse.

Joitain viime vuosien menestyneimpien deepfake-videoiden luojat valitsevat lähdevideonsa hyvin tarkkaan, välttäen pitkiä profiilikuvauskohtauksia (ts. sivusuoraan otettuja kuvia, joita poliisi käyttää pidätyksissä), teräviä kulmia ja epätavallisia tai liioiteltuja ilmeitä. Yhä useammin deepfake-videoiden esittelyvideot, jotka tehdään neuvotteluissa, ovat editoituja koosteita, jotka valitsevat “helpoimmat” kulmat ja ilmeet deepfakingiin.

Todellisuudessa deepfake-kuvissa käytettävän alkuperäisen henkilön (jonka identiteetti poistetaan deepfaken avulla) täytyy katsoa suoraan kameraan, ja ilmeiden vaihteluväli on vähäinen.

Useimmat viime vuosien suositut deepfake-kuvat ovat esittäneet kohteita, jotka katsovat suoraan kameraan, ja joko ilman ilmeitä tai yksinkertaisilla ilmeillä (kuten hymyllä), jotka voidaan helposti poimia punaisen maton paparazzikuvista, tai (kuten vuoden 2019 Sylvester Stallonen deepfake-kuvassa Terminatorina, kuvassa vasemmalla), parhaassa tapauksessa ilman ilmeitä, koska neutraalit ilmeet ovat erittäin yleisiä ja helppoja sisällyttää deepfake-malleihin.

Useimmat viime vuosien suositut deepfake-kuvat ovat esittäneet kohteita, jotka katsovat suoraan kameraan, ja joko ilman ilmeitä tai yksinkertaisilla ilmeillä (kuten hymyllä), jotka voidaan helposti poimia punaisen maton paparazzikuvista, tai (kuten vuoden 2019 Sylvester Stallonen deepfake-kuvassa Terminatorina, kuvassa vasemmalla), parhaassa tapauksessa ilman ilmeitä, koska neutraalit ilmeet ovat erittäin yleisiä ja helppoja sisällyttää deepfake-malleihin.

Koska deepfake-teknologiat, kuten DeepFaceLab ja FaceSwap, suorittavat nämä yksinkertaiset vaihdot hyvin, olemme tarpeeksi lumoutuneita siitä, mitä he saavuttavat, ja emme huomaa, mitä he eivät pysty tekemään, eivätkä usein edes yritä.

Kuvakaappaukset arvostetusta deepfake-videosta, jossa Arnold Schwarzenegger muutetaan Sylvester Stalloneksi - ellei kulmat ole liian hankalat. Profiilit ovat edelleen deepfake-lähestymistapojen pitkäaikainen ongelma, osittain siksi, että avoimen lähdekoodin ohjelmisto, jota käytetään kasvojen asentojen määrittämiseen deepfake-kehyksissä, ei ole optimoitu sivukuville, mutta pääasiassa siksi, että sopivia lähdeaineistoja ei ole kummassakaan tarvittavasta aineistosta.

Kuvakaappaukset arvostetusta deepfake-videosta, jossa Arnold Schwarzenegger muutetaan Sylvester Stalloneksi – ellei kulmat ole liian hankalat. Profiilit ovat edelleen deepfake-lähestymistapojen pitkäaikainen ongelma, osittain siksi, että avoimen lähdekoodin ohjelmisto, jota käytetään kasvojen asentojen määrittämiseen deepfake-kehyksissä, ei ole optimoitu sivukuville, mutta pääasiassa siksi, että sopivia lähdeaineistoja ei ole kummassakaan tarvittavasta aineistosta. Source: https://www.youtube.com/watch?v=AQvCmQFScMA

Uusi tutkimus Israelista ehdottaa uutta menetelmää, jossa käytetään synteettistä dataa, kuten CGI-päitä, deepfaken viemiseksi 2020-luvulle, todellakin erottamalla kasvojen identiteetin kontekstista (ts. Tom Cruisen kasvojen perusominaisuuksia kaikista kulmista).

Uusi järjestelmä erottaa poseen ja kontekstiin (ts. silmän räpäyttämiseen) yksilön identiteetin koodauksesta, käyttäen siihen liittymätöntä synteettistä kasvoaineistoa (kuvassa vasemmalla). Ylärivissä näemme

Uusi järjestelmä erottaa poseen ja kontekstiin (ts. silmän räpäyttämiseen) yksilön identiteetin koodauksesta, käyttäen siihen liittymätöntä synteettistä kasvoaineistoa (kuvassa vasemmalla). Ylärivissä näemme “silmän räpäytys”-ilmeen siirrettävän Barack Obaman identiteettiin, johdettuna GAN:n latentin avaruuden oppimasta epälineaarisesta polusta, jota edustaa vasemmalla oleva CGI-kuva. Rivissä alla näemme venyneen suunurkan kasvon piirteen siirrettävän entisen presidentin kasvoille. Alhaalla oikeassa reunassa näemme molemmat ominaisuudet sovellettuna yhtä aikaa. Source: https://arxiv.org/pdf/2111.08419.pdf

Tämä ei ole pelkkää deepfake-pupettia, tekniikkaa, joka on sovellettavissa avatareihin ja osittaiseen kasvojen synkronointiin, ja jolla on rajoitettu potentiaali täysimittaisten deepfake-videoiden muuntamiseen.

Päinvastoin, tämä edustaa tietä eteenpäin perustavanlaatuiseen identiteetin ja kontekstin erottamiseen, tarjoten tien korkeamman tason, eheytettyyn kuva-synteesiin perustuvaan deepfake-kehykseen.

Uusi tutkimus on nimeltään Delta-GAN-Encoder: Encoding Semantic Changes for Explicit Image Editing, using Few Synthetic Samples, ja se on peräisin Technion – Israel Institute of Technologyn tutkijoilta.

Jotta ymmärtäisimme, mitä tämä tutkimus tarkoittaa, katsotaan, miten deepfake-videot valmistetaan nykyään kaikista deepfake-porno-sivustoista Industrial Light and Magic (koska DeepFaceLab-avoin lähdekoodirepositorio on tällä hetkellä hallitseva sekä “amateur”- että ammattimaisessa deepfakingissa).

Mikä estää nykyisiä deepfake-teknologioita?

Deepfake-videot luodaan kouluttamalla encoder/decoder -konemallia kahdella kansioryhmällä kasvokuvia – henkilö, jonka haluat “maalata yli” (aiemmassa esimerkissä Arnie), ja henkilö, jonka haluat siirtää videomateriaaliin (Sly).

Eri poseiden ja valaistusolosuhteiden esimerkkejä kahdessa eri kasvoaineistossa. Huomaa erottuva ilme kolmannen rivin lopussa sarjassa A, jolla ei ole läheistä vastinetta toisessa aineistossa.

Eri poseiden ja valaistusolosuhteiden esimerkkejä kahdessa eri kasvoaineistossa. Huomaa erottuva ilme kolmannen rivin lopussa sarjassa A, jolla ei ole läheistä vastinetta toisessa aineistossa.

Encoder/decoder-järjestelmä vertaa sitten jokaista kuvaa kummassakin kansioryhmässä toisiinsa, ylläpitäen, parantaa ja toistaa tämän toiminnon satoja tuhansia iteraatioita (usein viikon ajan), kunnes se ymmärretään molempien identiteettien olennaiset ominaisuudet tarpeeksi hyvin voidakseen vaihtaa niitä vapaasti.

Kummallekin henkilölle, joka on mukana vaihtoprosessissa, deepfake-rakenteen oppima identiteetti on sekoitettu kontekstiin. Se ei voi oppia ja soveltaa yleisiä periaatteita jonkin yleisen poseen osalta, vaan tarvitsee runsaasti esimerkkejä koulutusaineistossa kummallekin identiteetille, joka on mukana kasvojen vaihdossa.

Siksi jos haluat vaihtaa kaksi identiteettiä, jotka tekevät jotain epätavallisempaa kuin vain hymyileminen tai katseleminen suoraan kameraan, tarvitset monia esimerkkejä kyseisestä posesta/identiteetistä molemmissa aineistoissa.

Koska kasvojen identiteetti ja poseen ominaisuudet ovat tällä hetkellä kiinteästi kytköksissä, laaja yhdenmukaisuus ilmeistä, pään asennosta ja (jonkin verran) valaistuksesta on tarpeen kahdessa kasvoaineistossa kouluttaaksesi tehokkaan deepfake-mallin DeepFaceLab-järjestelmissä. Mitä vähemmän tietty konfiguraatio (kuten

Koska kasvojen identiteetti ja poseen ominaisuudet ovat tällä hetkellä kiinteästi kytköksissä, laaja yhdenmukaisuus ilmeistä, pään asennosta ja (jonkin verran) valaistuksesta on tarpeen kahdessa kasvoaineistossa kouluttaaksesi tehokkaan deepfake-mallin DeepFaceLab-järjestelmissä. Mitä vähemmän tietty konfiguraatio (kuten “sivukuva/hymy/aurinko”) on esillä kummassakaan aineistossa, sitä vähemmän se renderöi deepfake-videossa, jos se on tarpeen.

Jos aineisto A sisältää epätavallisen poseen, mutta aineisto B puuttuu siitä, olet melkein ulkona onnesta; riippumatta siitä, kuinka kauan koulutat mallia, se ei koskaan opi toistamaan posea identiteettien välillä, koska se oli vastaanottanut vain puolet tarvittavasta tiedosta koulutuksen aikana.

Vaikka sinulla on oikeat kuvat, se saattaa olla riittämätön: jos aineisto A sisältää poseen, mutta aineisto B sisältää vastaavan poseen, mutta eri valaistusolosuhteissa, vaihdon laatu ei ole yhtä hyvä kuin jos molemmat jakavat yhteisiä valaistusominaisuuksia.

Miksi data on niukkaa?

Ellet ole usein pidätetty, sinulla ei todennäköisesti ole paljon sivuprofiilikuvia itsestäsi. Mitä sinulla on, sinä heittäisit pois. Koska kuva-agentit tekevät samoin, sivuprofiilikuvat ovat vaikeasti saatavissa.

Deepfakers usein sisällyttävät useita kopioita vähäisestä sivuprofiilikuvamateriaalista, jota heillä on identiteetistä, kasvojen aineistoon, jotta pose saa ainakin vähän huomiota ja aikaa koulutuksen aikana, sen sijaan, että se hylätään poikkeamana.

On kuitenkin paljon enemmän mahdollisia sivuprofiilikuvatyyppejä kuin mitä todennäköisesti on saatavilla aineistoon sisällyttämistä varten – hymyilevä, murhaava, karjuva, itku, pimeästi valaistu, halveksiva, väsynyt, iloinen, salamanvalaisin, yläviistoon katsominen, alaviistoon katsominen, avoin silmä, suljettu silmä… ja niin edelleen. Minkä tahansa näiden poseiden yhdistelmistä voisi tarvita kohde-deepfake-videossa.

Ja se on vain profiileja. Kuinka monta kuvaa sinulla on itsesi katsomassa suoraan ylös? Onko sinulla tarpeeksi kuvia edustamaan laajasti 10 000 mahdollista ilmettä, joita voit pitää samassa asennossa samasta kamerakulmasta, kattamalla vähintään osan miljoonasta mahdollisesta valaistusympäristöstä?

Todennäköisesti sinulla ei ole edes yhtä kuvaa itsesi katsomassa ylös. Ja se on vain kaksi kulmaa sadasta, joita tarvitaan täydelliseen kattavuuteen.

Vaikka olisi mahdollista luoda täydellinen kasvojen kattavuus kaikista kulmista eri valaistusolosuhteissa, tuloksena oleva aineisto olisi liian suuri koulutettavaksi, järjestyksessä satoja tuhansia kuvia; ja vaikka se voitaisiin kouluttaa, nykyisten deepfake-kehysten koulutusprosessi heittäisi suurimman osan tästä lisätystä datasta pois hyödyttömien ominaisuuksien puolesta, koska nykyiset kehykset ovat reduktionistisia eivätkä skaalautuvia.

Synteettinen korvaaminen

Deepfaken synnystä lähtien deepfakers ovat kokeilleet käyttämällä CGI-tyyppistä kuvaa, pääja 3D-sovelluksissa, kuten Cinema4D ja Maya, luomaan ne “puuttuvat poseet”.

Ei tarvita AI:ta; näyttelijä luodaan perinteisessä CGI-ohjelmassa, Cinema 4D: ssä, käyttäen verkkomalleja ja bittikarttatekstureita - teknologiaa, joka on peräisin 1960-luvulta, vaikka se saavutti laajan käytön vasta 1990-luvulla. Teoriassa tämä kasvomalli voisi käyttää deepfake-lähdemateriaalin luomiseen epätavallisille poseille, valaistustyyleille ja kasvojen ilmeille. Käytännössä se on ollut rajoitettua tai ei lainkaan hyödyllistä deepfakingissa, koska CGI-renderöintien

Ei tarvita AI:ta; näyttelijä luodaan perinteisessä CGI-ohjelmassa, Cinema 4D: ssä, käyttäen verkkomalleja ja bittikarttatekstureita – teknologiaa, joka on peräisin 1960-luvulta, vaikka se saavutti laajan käytön vasta 1990-luvulla. Teoriassa tämä kasvomalli voisi käyttää deepfake-lähdemateriaalin luomiseen epätavallisille poseille, valaistustyyleille ja kasvojen ilmeille. Käytännössä se on ollut rajoitettua tai ei lainkaan hyödyllistä deepfakingissa, koska CGI-renderöintien “epäaidon” näyttäminen valuu yli vaihdettuihin videoihin. Source: Tämän artikkelin kirjoittajan kuva https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Tämä menetelmä hylätään yleensä pian uusien deepfake-harjoittajien toimesta, koska vaikka se voi tarjota poseita ja ilmeitä, joita ei muuten ole saatavilla, synteettinen ulkonäkö CGI-kasvoista valuu yleensä yli vaihdoissa johtuen identiteetin ja kontekstin sekoittumisesta.

Tämä voi johtaa “uncanny valley” -kasvojen välähdyksiin muuten vakuuttavassa deepfake-videossa, kun algoritmi alkaa käyttää ainoaa dataa, jonka se voi löytää epätavalliselle poseelle tai ilmeelle – ilmeiseksi tekaistuille kasvoille.

Yksi suosituimmista deepfake-kohteista, 3D-deepfake-algoritmi australialaiselle näyttelijälle Margot Robbille on sisällytetty DeepFaceLiven oletusasennukseen, DeepFaceLab-version, joka voi suorittaa deepfake-toimintoja suoratoistona, kuten webcam-istunnoissa. CGI-versio, kuten yllä, voisi käyttää hankalasti saataville

Yksi suosituimmista deepfake-kohteista, 3D-deepfake-algoritmi australialaiselle näyttelijälle Margot Robbille on sisällytetty DeepFaceLiven oletusasennukseen, DeepFaceLab-version, joka voi suorittaa deepfake-toimintoja suoratoistona, kuten webcam-istunnoissa. CGI-versio, kuten yllä, voisi käyttää hankalasti saataville “puuttuville” kulmille deepfake-aineistoissa. Source: https://sketchfab.com/3d-models/margot-robbie-bust-for-full-color-3d-printing-98d15fe0403b4e64902332be9cfb0ace

CGI-kasvot irrotettuina, abstraktina ohjeistuksena

Sen sijaan, että uusi Delta-GAN Encoder (DGE) -menetelmä Israelin tutkijoilta on tehokkaampi, koska poseen ja kontekstin tiedot CGI-kuvista on täysin erottettu kohdehenkilön “identiteetin” tiedoista.

Näemme tämän periaatteen toiminnassa alla olevassa kuvassa, jossa on saatu erilaisia pään suuntia käyttämällä CGI-kuvaa ohjeistuksena. Koska identiteetin piirteet eivät ole liittyneet kontekstin piirteisiin, ei ole vuotoa CGI-kasvojen epäaidosta, tekoisesta ulkonäöstä eikä identiteetistä, jota ne edustavat.

Uudella menetelmällä et tarvitse löytää kolmea erillistä kuvaa, jotta voit tehdä deepfaken useista kulmista - voit vain kääntää CGI-päätä, jonka abstraktit piirteet asetetaan identiteettiin ilman mitään identiteettitietojen vuotoa.

Uudella menetelmällä et tarvitse löytää kolmea erillistä kuvaa, jotta voit tehdä deepfaken useista kulmista – voit vain kääntää CGI-päätä, jonka abstraktit piirteet asetetaan identiteettiin ilman mitään identiteettitietojen vuotoa.

Delta-GAN-Encoder. Ylävasen ryhmä: alkuperäiskuvan kulmaa voidaan muuttaa toiseksi ja renderöidä uusi alkuperäiskuvaksi, joka heijastuu ulostulossa; yläoikea ryhmä: valaistus on myös eriytetty identiteetistä, mahdollistaen valaistustyylejä; alavasen ryhmä: useita kasvonpiirteitä muutetaan luomaan

Delta-GAN-Encoder. Ylävasen ryhmä: alkuperäiskuvan kulmaa voidaan muuttaa toiseksi ja renderöidä uusi alkuperäiskuvaksi, joka heijastuu ulostulossa; yläoikea ryhmä: valaistus on myös eriytetty identiteetistä, mahdollistaen valaistustyylejä; alavasen ryhmä: useita kasvonpiirteitä muutetaan luomaan “surullinen” ilme; alaoikea ryhmä: yksittäinen kasvonpiirre muutetaan siten, että silmät räpyttelevät.

Tämä identiteetin ja kontekstin erottaminen saavutetaan koulutusvaiheessa. Uuden deepfake-arkkitehtuurin putki etsii etsii pre-koulutetun Generative Adversarial Networkin (GAN) latentin vektoria, joka vastaa muunnettavaa kuvaa – Sim2Real-metodologia, joka perustuu IBM:n AI-tutkimuksen 2018 projektiin.

Tutkijat toteavat:

‘Vain muutamalla näytteellä, jotka eroavat tietyn ominaisuuden suhteen, voidaan oppia eriytetty käyttäytyminen pre-koulutetusta sekoitetusta generatiivisesta mallista. Ei ole tarpeen täsmällisiä todellisia näytteitä saavuttaa tämä tavoite, joka ei välttämättä ole toteutettavissa.

‘Käyttämällä epärealistisia data-näytteitä sama tavoite voidaan saavuttaa hyödyntämällä koodatun latentin vektorien semantiikkaa. Haluttujen muutosten soveltaminen olemassa oleviin data-näytteisiin voidaan tehdä ilman latentin avaruuden eksplisiittistä tutkimista.’

Tutkijat odottavat, että tämän projektin ydinperiaatteet voisivat siirtää muita aloja, kuten sisäarkkitehtuuriin, ja että Delta-GAN-Encoderiin sovellettava Sim2Real-menetelmä voisi lopulta mahdollistaa deepfake-instrumentaation pelkästään luonnoksien perusteella, eikä CGI-tyyppisen syötteen perusteella.

Voidaan väittää, että uuden israelilaisen järjestelmän kyky synnyttää deepfake-videota on paljon vähemmän merkittävää kuin edistyminen, jonka tutkimus on saavuttanut identiteetin ja kontekstin erottamisessa, saavuttaen samalla enemmän valvontaa GAN:n latentin avaruudessa.

Identiteetin ja kontekstin erottaminen on aktiivinen tutkimuksen ala kuvasynteesissä; tammikuussa 2021 Amazonin johtama tutkimus paperi osoitti samanlaista poseen hallintaa ja erottamista, ja vuonna 2018 Kiinan tiedeakatemian Shenzhen-instituutin tutkimus paperi teki edistystä satunnaisissa näkymissä GAN:ssa.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai