Andersonin kulma

Julkkisten Deepfake -kasvojen tunnistaminen ulkoisista kasvoalueista

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Microsoftin ja kiinalaisen yliopiston välinen uusi yhteistyö on ehdottanut uutta tapaa julkkisten deepfake -kasvojen tunnistamiseksi hyödyntämällä nykyisten deepfake -tekniikoiden heikkouksia tunnistamaan identiteettejä, jotka on “heijastettu” toisiin ihmisiin.

Lähestymistapa on nimeltään Identity Consistency Transformer (ICT), ja se toimii vertaamalla kasvojen uloimpia osia (leuka, poskipäät, hiustenrajat ja muut ulommat reunat) kasvojen sisäosiin. Järjestelmä hyödyntää yleisesti saatavilla olevia julkkisten julkisia kuvia, mikä rajoittaa sen tehokkuutta vain kuuluisiin julkkisiin, joiden kuvia on saatavilla suurina määrinä laajasti saatavilla tietokoneen näködatassa ja internetissä.

Väärennettyjen kasvojen peittäminen seitsemällä tekniikalla: DeepFake in FF+; DeepFake in Google DeepFake Detection; DeepFaceLab; Face2Face; FSGAN; ja DF-VAE. Lähde: https://arxiv.org/pdf/2203.01318.pdf

Väärennettyjen kasvojen peittäminen seitsemällä tekniikalla: DeepFake in FF+; DeepFake in Google DeepFake Detection; DeepFaceLab; Face2Face; FSGAN; ja DF-VAE. Suositut paketit, kuten DeepFaceLab ja FaceSwap, tarjoavat samanlaisen rajoitetun peittävyyden. Lähde: https://arxiv.org/pdf/2203.01318.pdf

Kuva yllä osoittaa, että nykyiset suositut deepfake -menetelmät ovat melko resurssirajoitettuja ja riippuvat isäntäkasvoista / -ruumiista vähentämään todisteita kasvojen korvaamisesta.

Vaikka eri menetelmät voivat kattaa koko otsan ja suuren osan leuan ja poskipäiden alueista, ne ovat kaikki enemmän tai vähemmän rajoitettuja isäntäkasvojen kehyksessä.

Saliency-kartta, joka korostaa ICT:n laskemaa 'sisäistä' ja 'uloista' identiteettiä. Kun sisäinen kasvotunnistus on tehty, mutta ulkoinen identiteetti ei vastaa, ICT arvioi kuvan virheelliseksi.

Saliency-kartta, joka korostaa ICT:n laskemaa ‘sisäistä’ ja ‘uloista’ identiteettiä. Kun sisäinen kasvotunnistus on tehty, mutta ulkoinen identiteetti ei vastaa, ICT arvioi kuvan virheelliseksi.

Testeissä ICT osoittautui pystyväksi havaitsemaan deepfake -sisällön jopa matalan resoluution videossa, jossa koko videon sisältö on heikentynyt pakkausvirheiden vuoksi, mikä auttaa piilotamaan jäljelle jäävät todisteet deepfake -prosessista – tilanne, joka hämmennystää monia muita deepfake -tunnistusmenetelmiä.

ICT suoriutuu kilpailijoistaan deepfake -sisällön tunnistamisessa. Katso video artikkelin lopusta lisätietoja ja parempaa resoluutiota. Lähde: https://www.youtube.com/watch?v=zgF50dcymj8

ICT suoriutuu kilpailijoistaan deepfake -sisällön tunnistamisessa. Katso video artikkelin lopusta lisätietoja ja parempaa resoluutiota. Katso liitettävä video artikkelin lopusta lisätietoja. Lähde: https://www.youtube.com/watch?v=zgF50dcymj8

Tutkimus artikkeli on nimeltään Julkkisten suojaaminen Identity Consistency Transformerin avulla, ja se on peräisin yhdeksältä tutkijalta, jotka ovat eri tavoin liitettynä Kiinan tiede- ja teknologiayliopistoon, Microsoft Research Asiaan ja Microsoft Cloud + AI:hin.

Luotettavuuden aukko

On ainakin kaksi syytä, miksi suositut kasvojen vaihtamiseen käytettävät algoritmit, kuten DeepFaceLab ja FaceSwap, jättävät huomiotta uloimman alueen vaihdettavista kasvoista.

Ensinnäkin, deepfake -mallien kouluttaminen on aikaa vievää ja resursseja vaativaa, ja “yhteensopivien” isäntäkasvojen / -ruumiiden käyttäminen vapauttaa GPU-sykliä ja -epokkeja keskittymään sisäisiin, suhteellisen muuttumattomiin kasvojen alueisiin, joita käytetään identiteetin määrittämiseen (koska muuttujat, kuten painonvaihtelut ja vanheneminen, ovat vähiten todennäköisiä muuttamaan näitä peruskasvonpiirteitä lyhyellä aikavälillä).

Toiseksi, useimmat deepfake -lähestymistavat (ja tämä on varmasti tapaus DeepFaceLab:in kanssa, ohjelmistoa, jota käytetään suosituimmissa tai maineikkaimmissa käytännöissä) eivät pysty replikoimaan “kasvojen reunaa” alueita, kuten poskia ja leuka-aluetta, ja ne ovat rajoitettuja siinä, että niiden ylävirran ( 2017 ) koodi ei ollut laajalti osoittanut tätä ongelmaa.

Tapauksissa, joissa identiteetit eivät vastaa hyvin, deepfake -algoritmi on “täyttävä” taustaan kasvojen ympärillä, mikä tehdään kömpelösti jopa parhaimmillaan, jopa parhaiden deepfake -tekijöiden, kuten Ctrl Shift Face, käsissä, jonka tulosta käytettiin tutkimuksen tutkimuksissa.

Parhaimmista: still-kuvat deepfake -videosta, jossa Jim Carrey on vaihdettu Gary Oldmaniin. Tämä työ edustaa todennäköisesti parhaimmista saatavilla olevista tuloksista DeepFaceLab:in ja jälkikäsittelytekniikoiden avulla. Kuitenkin vaihdot rajoittuvat suhteellisen vähäiseen huomioon, jonka DFL antaa ulkoisille kasvoille, vaativat jättimäisen datan kuraation ja koulutuksen ponnistelun osoittamaan uloimmat piirteet.

Parhaimmista: still-kuvat deepfake -videosta, jossa Jim Carrey on vaihdettu Gary Oldmaniin. Tämä työ edustaa todennäköisesti parhaimmista saatavilla olevista tuloksista DeepFaceLab:in ja jälkikäsittelytekniikoiden avulla. Kuitenkin vaihdot rajoittuvat suhteellisen vähäiseen huomioon, jonka DFL antaa ulkoisille kasvoille, vaativat jättimäisen datan kuraation ja koulutuksen ponnistelun osoittamaan uloimmat piirteet. Lähde: https://www.youtube.com/watch?v=x8igrh1eyLk

Tämä “sleight of hand” tai huomion siirtäminen pääosin välttää julkista huomiota nykyisessä deepfake -kasvojen kasvavan realismin huolehtimisessa, koska kriittiset kykymme deepfake -kasvojen ympärillä ovat edelleen kehittymässä “shokki ja ihme” -vaiheen yli.

Jakautuneet identiteetit

Uusi tutkimus toteaa, että useimmat aiemmat deepfake -tunnistusmenetelmät riippuvat virheistä, jotka pettävät vaihtoprosessin, kuten epäjohdonmukaiset pään asennot ja räpäyttäminen, muun muassa monia muita tekniikoita. Vain tällä viikolla uusi deepfake -tunnistusartikkeli on ehdottanut käyttämään FaceSwap -kehyksen eri mallityyppien “signaalia” väärennetyn videon tunnistamiseen (ks. kuva alla).

Deepfake -tunnistus eri mallityyppien signaaleilla FaceSwap -kehyksessä. Lähde: https://arxiv.org/pdf/2202.12951.pdf

Deepfake -tunnistus eri mallityyppien signaaleilla FaceSwap -kehyksessä. Lähde: https://arxiv.org/pdf/2202.12951.pdf

ICT:n arkkitehtuuri luo kaksi erillistä sisäkkäistä identiteettiä henkilölle, joista kummastakin on vahvistettava ennen kuin koko identiteetti voidaan todeta “oikeaksi” kuvaksi tai kuvaksi.

ICT:n koulutus- ja testausvaiheen arkkitehtuuri.

ICT:n koulutus- ja testausvaiheen arkkitehtuuri.

Identiteetin jakautuminen tapahtuu näkö- Transformerin avulla, joka suorittaa kasvontunnistuksen ennen kuin jakaa tutkitut alueet sisäisiin ja ulkoisiin identiteetteihin kuuluviksi tokeneiksi.

Pätkien jakaminen kahteen rinnakkaiseen identiteetin osoittimeen.

Pätkien jakaminen kahteen rinnakkaiseen identiteetin osoittimeen.

Tutkimus toteaa:

‘Valitettavasti olemassa olevat kasvontunnistusmenetelmät ovat taipuvaisia kuvaamaan eniten erottuvan alueen, ts. sisäisen kasvon tunnistamiseen ja epäonnistuvat identiteetin tiedon tallentamisessa ulkoisessa kasvossa. Identity Consistency Transformerin avulla koulutamme mallin, joka oppii identiteetin parin, yhden sisäiselle kasvolle ja toisen ulkoiselle kasvolle, suunnittelemalla Transformerin, jossa sisäinen ja ulkoinen identiteetti voidaan oppia yhtenäisesti yhdistetyssä mallissa.’

Koska ei ole olemassa olevaa mallia tälle tunnistusprotokollalle, tutkijat ovat kehittäneet uudenlaisen johdonmukaisuuden menetelmän, joka voi toimia auktorisointitapahtumana. “Sisäinen tokeni” ja “ulkoinen tokeni”, jotka johtuvat identiteetin erottelumallista, lisätään perinteisiin patch- upotusten tuottamiin kasvontunnistuskehyksiin.

Data ja koulutus

ICT-verkko koulutettiin Microsoft Researchin MS-Celeb-1M -tietokannassa, joka sisältää 10 miljoonaa julkkisten kasvokuvaa, jotka kattavat yhden miljoonan identiteetin, mukaan lukien näyttelijöitä, poliitikkoja ja monia muita merkittäviä henkilöitä. Aikaisemman menetelmän Face X-ray (toinen Microsoft Research -aloite) mukaisesti ICT:n oma väärennös generointirutiini vaihtaa sisäisiä ja ulkoisia kasvoalueita tietokannasta luodakseen aineistoa, jolla testata algoritmia.

Tämän sisäisen vaihdon suorittamiseksi ICT tunnistaa kaksi kuvaa tietokannasta, jotka näyttävät samanlaisilta pään asennoilta ja kasvonpiirteiltä, luo keskisten piirteiden maskialueen (johon voidaan suorittaa vaihto) ja suorittaa deepfake -vaihdon RGB-värikorjauksella.

Syy siihen, miksi ICT on rajoitettu julkkisten tunnistamiseen, on se, että se perustuu (sen tehokkaimmassa varianteissa) uuteen viitekokoelmaan, joka sisältää johdettuja kasvovektoreita keskuskorpukselta (tässä tapauksessa MS-Celeb-1M, vaikka viittaus voitaisiin laajentaa verkkoon saatavilla oleviin kuviin, mikä todennäköisesti olisi olemassa vain hyvin tunnettujen julkisuuden henkilöiden kohdalla).

Nämä johdettujen vektorien pariutukset toimivat auktorisointitokeneina sisäisten ja ulkoisten kasvoalueiden vahvistamiseksi yhdessä.

Tutkijat toteavat, että näistä menetelmistä saatavat tokenit edustavat “korkean tason” piirteitä, mikä johtaa deepfake -tunnistusprosessiin, joka on todennäköisemmin selviävä haastavista ympäristöistä, kuten matalan resoluution tai muuten heikentyneestä videosta.

Olennaisesti ICT ei etsi virheiden perusteella todisteita, vaan keskittyy identiteetin vahvistamismenetelmiin, jotka ovat enemmän kasvontunnistustekniikoita – lähestymistapa, joka on vaikea, kun dataa on vähän, kuten tapauksissa, joissa tutkitaan deepfake -kostopornon vaikutusta ei-julkkisiin kohteisiin.

Testit

MS-Celeb-1M:llä koulutettu ICT jaettiin viiteavusteisiin ja “sokeisiin” algoritmin versioihin ja testattiin useiden kilpailevien tietokantojen ja menetelmien kanssa. Nämä sisälsivät FaceForensics++ (FF++), tietokannan, joka sisältää 1000 aitoa ja deepfake -videota, luotua neljällä menetelmällä, mukaan lukien Face2Face ja FaceSwap; Google Deepfake Detection (DFD), joka koostuu tuhansista Googlella luoduista deepfake -videoista; Celeb-DeepFake v1 (CD1), joka sisältää 408 aitoa ja 795 syntetisoitua, matalaa artefaktia sisältävää videota; Celeb-DeepFake v2, v1:n laajennus, joka sisältää 590 aitoa ja 5 639 väärennettyä videota; ja Kiinan 2020 Deeper-Forensics (Deeper).

Nämä ovat tietokannat; testaushaasteiden tunnistusmenetelmät olivat Multi-task, MesoInc4, Capsule, Xception-c0, c2 (menetelmä, jota käytetään FF++:ssa), FWA/DSP-FW Albanyn yliopistosta, Two-Branch, PCL+I2G ja Yuval Nirkin konteksti-epäjohdonmukaisuusmenetelmä.

Mainittujen tunnistusmenetelmien tarkoituksena on havaita tiettyjä kasvojen manipulointityyppejä. Lisäksi näiden menetelmien ohella tutkimuksen tekijät testasivat yleisempiä deepfake -tunnistusmenetelmiä Face X-ray, Michiganin osavaltion yliopiston FFD, CNNDetection ja Patch-Forensics MIT CSAIL:stä.

Ilmeisimmät tulokset testistä ovat, että kilpailevat menetelmät laskevat dramaattisesti tehokkuutta, kun videon resoluutio ja laatu heikkenevät. Koska osa deepfake -tunnistuksen mahdollisuuksista on ei-HD- tai muuten heikentyneessä videossa, tämä näyttäisi olevan merkittävä tulos.

Yllä olevassa tuloksessa sininen ja punainen viiva osoittavat ICT-menetelmien kestävyyden kuvan heikentymiseen kaikilla alueilla paitsi Gaussian-kohinan esteenä (joka ei ole todennäköistä Zoom- ja web-kameratyylisissä kuvissa), kun taas kilpailevien menetelmien luotettavuus romahtaa.

Taulukossa alla nähdään eri deepfake -tunnistusmenetelmien tehokkuus näkymättömissä tietokannoissa. Harmaat ja tähdellä merkityt tulokset osoittavat vertailua alkuperäisistä, suljetuissa projekteissa julkaistuista tuloksista, joita ei voida ulkoisesti vahvistaa. Lähes kaikilla vertailtavilla kehyksillä ICT suoriutuu paremmin kuin kilpailevat deepfake -tunnistuslähestymistavat (lihavoitu).

Lisäksi tutkijat suorittivat Ctrl Shift Facen YouTube-kanavan sisällön, ja havaitsivat, että kilpailevat menetelmät saavuttivat huomattavasti heikommat tunnistustulokset:

Merkittävää tässä on, että FF++ -menetelmät (Xception-c23) ja FFD, jotka saavuttavat joitakin korkeimpia tuloksia joissakin testituloksissa uuden tutkimuksen yleisissä testeissä, saavuttavat tässä “todellisessa maailmassa” olevassa deepfake -sisällössä paljon alempia tuloksia kuin ICT.

Tutkijat päättävät tutkimuksensa toiveella, että sen tulokset ohjaavat deepfake -tunnistusyhteisöä kohti samankaltaisia aloitteita, jotka keskittyvät helpommin yleistettäviin korkean tason piirteisiin, ja poispäin “kylmästä sodasta” virheiden havaitsemisesta, jossa uusimmat menetelmät ovat jatkuvasti vanhentuneita deepfake -kehysten kehityksen vuoksi tai muista tekijöistä, jotka tekevät nämä menetelmät vähemmän kestäviksi.

Katso lisää esimerkkejä ICT:n tunnistamasta deepfake -sisällöstä, joka usein ylittää vaihtoehtoiset menetelmät.

 

 

Julkaistu ensimmäisen kerran 4. maaliskuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai