Andersonin kulma

Syväväärennös-Havaitseminen Perustuu Alkuperäisiin Ihmisen Biometrisiin Piirteisiin

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
Images produced by deepfakers at the DeepFaceLab Discord Channel

Uusi tutkimus Italian ja Saksan tutkijoista esittää menetelmän syväväärennös-videoiden havaitsemiseksi biometrisen kasvo- ja äänen käyttäytymisen perusteella, sen sijaan, että luotaisiin kasvojen synteesijärjestelmiä, kalliiden vesileimojen ratkaisuja tai muita kömpelömpiä lähestymistapoja.

Runko vaatii syötteenä 10 tai useamman erilaisen, ei-väärennetyn videon kohteesta. Se ei kuitenkaan vaadi erityistä koulutusta, uudelleenkoulutusta tai täydentämistä kohdekuvissa, koska sen sisällyttämä malli on jo abstrahoinut todennäköiset vektorietäisyydet oikeiden ja väärennettyjen videoiden välillä laajasti sovellettavalla tavalla.

Kontrastinen oppiminen on POI-Forensics-lähestymistapan perusta. Lähteiden perusteella johdettuja vektoreita verrataan samoihin vektoreihin potentiaalisessa väärennettyssä videossa, jossa on otettu huomioon sekä videon että äänen komponentit väärennetystä kuvamateriaalista. Lähde: https://arxiv.org/pdf/2204.03083.pdf

Kontrastinen oppiminen on POI-Forensics-lähestymistapan perusta. Lähteiden perusteella johdettuja vektoreita verrataan samoihin vektoreihin potentiaalisessa väärennettyssä videossa, jossa on otettu huomioon sekä videon että äänen komponentit väärennetystä kuvamateriaalista. Lähde: https://arxiv.org/pdf/2204.03083.pdf

Nimeämällä POI-Forensics, lähestymistapa perustuu liikkeen ja äänen vihjeisiin, jotka ovat yksilöllisiä todelliselle henkilölle, jota syväväärennös kohdistaa.

Vaikka tällainen järjestelmä voisi mahdollistaa täysin automaattiset, ‘esirenderöidyt’ todennuskehykset julkkiksille, poliitikoille, YouTube-vaikuttajille ja muille henkilöille, joista on runsaasti saatavilla videoaineistoa, se voisi myös sopeutua kehykseksi, jossa tavalliset syväväärennösten uhrit voivat potentiaalisesti osoittaa hyökkäysten epäaidon.

POI-Forensicsin ekstractoiduista piirteistä johdetut visualisoinnit aidosta ja väärennetystä videomateriaalista neljän kohteen kohdalla t-SNE-kehyksessä.

POI-Forensicsin ekstractoiduista piirteistä johdetut visualisoinnit aidosta ja väärennetystä videomateriaalista neljän kohteen kohdalla t-SNE-kehyksessä.

Tutkijat väittävät, että POI-Forensics saavuttaa uuden tilan taidetta syväväärennösten havaitsemisessa. Useiden yleisten tietokantojen kohdalla tämä kehys saavuttaa 3%, 10% ja 7%:n parannuksen AUC-pisteissä korkealaatuisissa, matalalaatuisissa ja ‘hyökättyjä’ videoissa vastaavasti. Tutkijat lupaavat julkaista koodin pian.

POI-Forensicsin suorituskyky verrattuna kilpaileviin SOTA-kehyksiin pDFDC, DeepFakeTIMIT, FakeAVCelebV2 ja KoDF. Koulutus suoritettiin kussakin tapauksessa FaceForensics++, ID-Reveal ja kirjoittajien menetelmällä VoxCeleb2:lla. Tulokset sisältävät sekä korkealaatuiset että matalalaatuiset videot.

POI-Forensicsin suorituskyky verrattuna kilpaileviin SOTA-kehyksiin pDFDC, DeepFakeTIMIT, FakeAVCelebV2 ja KoDF. Koulutus suoritettiin kussakin tapauksessa FaceForensics++ ja kirjoittajien ID-Reveal VoxCeleb2:lla. Tulokset sisältävät sekä korkealaatuiset että matalalaatuiset videot.

Tutkijat toteavat:

‘Koulutus suoritetaan yksinomaan oikeilla puhuvien kasvojen videoilla, joten havainto ei riipu minkään tietyn manipulointimenetelmän käytöstä ja antaa korkeimman yleistettävyyden. Lisäksi menetelmämme voi havaita sekä yksittäisiä modaalisiin (ääni vain, video vain) että monimodaalisiin (ääni-video) hyökkäyksiä, ja se on kestävä matalalaatuisille tai vahingoittuneille videoille rakentamalla ainoastaan korkean tason semanttisia piirteitä.’

Uusi artikkeli, joka sisältää elementtejä joistakin kirjoittajien visuaalisen ID-Reveal -projektista vuodelta 2021, on nimeltään Ääni-Kuvallinen Kiinnostuksen Kohde Syväväärennös-Havaitseminen, ja se on yhteistyöprojekti Napolin Federico II -yliopiston ja Münchenin Teknillisen Yliopiston välillä.

Syväväärennös-Asekilpailu

Jotta voitettaisiin tällainen havaintojärjestelmä, syväväärennös- ja ihmisen synteesijärjestelmien olisi kyettävä vähintään simuloimaan visuaalisia ja äänen biometrisiä vihjeitä tarkoitetusta kohdehenkilöstä – teknologiaa, joka on vuosia eteenpäin ja todennäköisesti pysyy kalliiden ja suljettujen järjestelmien kehittämisen purviewissa, joita kehittävät VFX-yritykset, joilla on etulyöntiasema tarkoitetun kohteen (tai heidän perintönsä, kuolleiden henkilöiden simulaation tapauksessa) yhteistyön ja osallistumisen kautta.

Kirjoittajien aiempi lähestymistapa, ID-Reveal, keskittyi täysin visuaaliseen tietoon. Lähde: https://arxiv.org/pdf/2012.02512.pdf

Kirjoittajien aiempi lähestymistapa, ID-Reveal, keskittyi täysin visuaaliseen tietoon. Lähde: https://arxiv.org/pdf/2012.02512.pdf

Menestyneet ja suositut syväväärennös-menetelmät, kuten FaceSwap ja DeepFaceLab/Live, eivät tällä hetkellä kykene luomaan tällaisia yksityiskohtaisia biometrisiä approksimaatioita, vaan luottavat parhaimmillaan lahjattuihin impersonaattoreihin, joille väärennetty identiteetti on pantu, ja yleensä enemmän sovellettavissa olevaan luonnolliseen kuvamateriaaliin “samankaltaisista” henkilöistä. Eikä syväväärennös-pakettien ydinkoodin rakenne, joka on vuodelta 2017 ja jolla on vähän modulaarisuutta ja joka on ylätaso DFL:lle ja FaceSwapille, tee tämänkaltaisen toiminnallisuuden lisäämistä mahdolliseksi.

Nämä kaksi hallitsevaa syväväärennös-pakettia perustuvat autoenkoodereihin. Vaihtoehtoiset ihmisen synteesimenetelmät voivat käyttää generatiivista vastakkaisuusverkkoa (GAN) tai neuroradianssikenttää (NeRF) ihmisen identiteetin uudelleenluomiseen; mutta molemmat tutkimussuunnat ovat vuosia eteenpäin, jopa tuottamaan täysin fotorealistista ihmisen videota.

Äänen simulaatio lukuun ottamatta biometrisen simulaation on erittäin alhaalla listalla haasteita, joita vastaan ihmisen kuvan synteesi kohtaa. Joka tapauksessa, äänen timbre ja muiden laatuominaisuuksien jäljittäminen ei jäljitä sen eksentrisyyksiä ja ‘kertoo’, tai tapaa, jolla todellinen kohdehenkilö käyttää semanttista rakennetta. Siksi äänen simulaation täydellisyys ei ratkaise biometrisen aitouden mahdollista esteettä.

Arxivissa yksin on useita syväväärennös-havainnontekniikoita ja innovaatioita julkaistu joka viikko. Viimeaikaiset lähestymistavat ovat perustuneet ääni-kasvo-homogeneisuuteen, paikalliseen binaariseen histogrammiin (FF-LBPH), ihmisen havaintoon äänen syväväärennöksistä, kasvojen reunojen analyysiin, videon heikentymisen huomioon ottamiseen ja ‘oikeudelliseen ballistiikkaan’ – muiden muassa.

Segmentoitu histogrammanalyysi on yksi viimeisimmistä tekniikoista, joita tarjotaan syväväärennösten havaitsemisen parantamiseksi. Lähde: https://arxiv.org/pdf/2203.09928.pdf

Segmentoitu histogrammanalyysi on yksi viimeisimmistä tekniikoista, joita tarjotaan syväväärennösten havaitsemisen parantamiseksi. Lähde: https://arxiv.org/pdf/2203.09928.pdf

Lähestymistapa, Data ja Arkkitehtuuri

POI-Forensics käyttää monimodaalista lähestymistapaa identiteetin vahvistamiseen, hyödyntäen pehmeitä biometrisiä piirteitä visuaalisten ja äänen vihjeiden perusteella. Kehys sisältää erilliset ääni- ja videoverkkorakenteet, jotka lopulta johtavat ominaisvektoritietoihin, jotka voidaan verrata samoihin piirteisiin potentiaalisessa syväväärennös-videossa, jota tutkitaan.

POI-Forensicsin arkkitehtuuri.

POI-Forensicsin konseptuaalinen arkkitehtuuri.

Molemmat erilliset (ääni tai video) ja fuusioiden analyysi voidaan suorittaa kohdeklippeihin, ja lopulta saadaan POI-samankaltaisuusindeksi. Kontrastinen häviöfunktio perustuu vuoden 2021 akateemiseen yhteistyöhön Google Researchin, Bostonin yliopiston, Snap Inc.:n ja MIT:n välillä.

Pohjadata jaettiin kohtekohtaisesti. 4608 identiteettiä käytettiin koulutukseen, ja 512 jätettiin validointiin. 500 identiteettiä, jotka käytettiin FakeAVCelebV2:ssa (testikandidaatti, ks. alla), poistettiin, jotta saataisiin ei-polarisoituneet tulokset.

Molemmat verkkorakenteet koulutettiin 12 epochin ajan epätavallisen suuren batch-koon (2304 batchia per epoch) ja Adam-optimoinnin kanssa eri yhdistetyllä painojen päättymisellä 10−4:n oppimisnopeudella ja 0,01:n painojen päättymisellä.

Testaus ja Tulokset

Syväväärennös-tietokannat, joita tutkittiin tämän projektin kohdalla, olivat esikatselu DeepFake Detection Challenge -tietokanta, joka sisältää kasvojen vaihdon 68 kohteen kesken, joista 44 identiteettiä valittiin, joilla on yli 9 videota, yhteensä 920 oikeaa videota ja 2925 väärennettyä videota; DeepFake-TIMIT, GAN-pohjainen tietokanta, joka sisältää 320 videota 32 kohteesta, yhteensä 290 oikeaa videota ja 580 väärennettyä videota, joista jokainen on vähintään 4 sekunnin pituinen; FakeAVCelebV2, joka sisältää 500 oikeaa videota VoxCeleb2:sta, ja noin 20 000 väärennettyä videota eri tietokannoista, joihin lisättiin väärennetty ääni SV2TTS:llä yhdenmukaisuuden vuoksi; ja KoDF, Korean syväväärennös-tietokanta, jossa on 403 identiteettiä, jotka on väärennetty FaceSwapin, DeepFaceLab:n ja FSGAN:in avulla, sekä kolme First Order Motion Mallia (FOMM).

Tämä tietokanta sisältää myös äänen ohjatun kasvojen synteesin ATFHP:n ja Wav2Lip:in tuloksia, ja tutkijat käyttivät johdettua tietokantaa, joka sisältää 276 oikeaa videota ja 544 väärennettyä videota.

Mittareina käytettiin alueen alle vastaanottimen operaatiokäyrä (AUC) ja noin 10%:n ‘väärän hälytyksen’ todennäköisyys, joka olisi ongelmallista kehyksissä, jotka sisällyttävät ja kouluttavat väärennettyä dataa, mutta jota ei POI-Forensicsissä tarvita, koska se käyttää ainoastaan aitoa videoaineistoa syötteenään.

Menetelmät testattiin Seferbekovin syväväärennös-havaintomenetelmää vastaan, joka saavutti ensimmäisen sijan Kaggle Deepfake Detection -haasteessa; FTCN:ää (Fully Temporal Convolution Network), joka on yhteistyö Kiinan Xiamen-yliopiston ja Microsoft Research Asian välillä; LipForensics, joka on yhteistyö Imperial College Londonin ja Facebookin välillä vuodelta 2021; ja ID-Reveal, joka on joitakin tutkijoiden aiempi projekti, joka jättää äänen osuuden pois ja käyttää 3D-muokkausmallia yhdessä vastakkaisen pelin skenaariolla väärennetyn tuloksen havaitsemiseksi.

Tuloksissa (ks. yllä oleva taulukko) POI-Forensics ylitti vertailukohtaisen Seferbekovin 2,5%:lla AUC-pisteissä ja 1,5%:lla tarkkuudessa. Suorituskyky oli kilpailukykyisempää muiden tietokantojen kohdalla korkealaatuisissa videoissa.

Kuitenkin uusi lähestymistapa osoitti merkittävän johtumisen kaikkia kilpailevia vertailumenetelmiä vastaan matalalaatuisissa videoissa, jotka ovat todennäköisimmin skenaario, jossa syväväärennökset voivat hämätä tavallisia katsojia ‘todellisissa maailman’ konteksteissa.

Tutkijat toteavat:

‘Todellakin, tässä haastavassa skenaariossa ainoastaan identiteettiin perustuvat lähestymistavat tarjoavat edelleen hyvän suorituskyvyn, koska ne perustuvat korkean tason semanttisiin piirteisiin, jotka ovat melko kestäviä kuvavirheille.’

Koska POI-Forensics käyttää ainoastaan oikeaa videoaineistoa lähtöaineistona, saavutus on väittävästi suurempi, ja se viittaa siihen, että potentiaalisten syväväärennösten uhrien alkuperäisten biometristen piirteiden käyttäminen on arvokas tie eteenpäin ‘artefaktien kylmän sodan’ välttämiseksi syväväärennös-ohjelmistojen ja syväväärennös-havaintoratkaisujen välillä.

Lopullisessa testissä tutkijat lisäsivät häiritsevää ääntä syötteenä, menetelmällä, joka voi luotettavasti hämätä luokittelijoita. Vanha nopea gradientin merkintämenetelmä osoittautui edelleen erittäin tehokkaaksi tässä suhteessa.

Häirintästrategiat laskivat onnistumisprosenttia kaikissa menetelmissä ja tietokannoissa, AUC-pisteet laskivat 10%:sta 38%:iin. Kuitenkin ainoastaan POI-Forensics ja kirjoittajien aiempi menetelmä ID-Reveal pystyivät ylläpitämään kohtuullista suorituskykyä tässä hyökkäyskuviossa, mikä viittaa siihen, että korkean tason piirteet, jotka liittyvät pehmiin biometrisiin piirteisiin, ovat erittäin kestäviä syväväärennös-havainnon välttämiseksi.

Tutkijat johtavat:

‘Yhteenvetona uskomme, että menetelmämme on ensimmäinen askel; erityisesti korkean tason semanttisten piirteiden käyttäminen on lupaava tulevaisuuden tutkimussuunta. Lisäksi monimodaalinen analyysi voidaan rikastaa sisällyttämällä enemmän tietoa muista aloista, kuten tekstuaalisesta datasta.’

 

Julkaistu ensimmäisen kerran 8. huhtikuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai