Andersonin kulma
GOTCHA – Deepfaken CAPTCHA-järjestelmä

Uuden-Yorkin yliopiston tutkimus lisää kasvavaa näyttöä siitä, että meidän ehkä pian on otettava deepfake-vastainen “juopumuustesti”, jotta voimme vahvistaa identiteettimme ennen herkkää videopuhelua – kuten työsuhteeseen liittyvää videoneuvottelua tai muuta herkkää tilannetta, joka voi houkutella huijareita, jotka käyttävät reaaliaikaisia deepfake-suoratoistopalveluita.

Joitakin aktiivisia ja passiivisia haasteita, jotka on sovellettu videopuheluun GOTCHA-järjestelmässä. Käyttäjän on noudatettava ja läpäistävä haasteet, kun taas lisäksi on “passiivisia” menetelmiä (kuten yritetään kuormittaa mahdollista deepfake-järjestelmää), joista käyttäjällä ei ole vaikutusvaltaa. Lähde: http://export.arxiv.org/pdf/2210.06186
Esitetty järjestelmä on nimeltään GOTCHA – tribuutti CAPTCHA-järjestelmille, jotka ovat muodostuneet yhä suuremmaksi esteeksi verkkoselailun aikana viimeisten 10-15 vuoden aikana, joissa automaattiset järjestelmät vaativat käyttäjältä tehtäviä, joita koneet eivät ole hyviä, kuten eläinten tunnistaminen tai epäselvän tekstin tulkitseminen (ja, ironisesti, nämä haasteet usein muuttavat käyttäjän ilmaiseksi AMT-tyyppiseksi ulkoistettavaksi annotoijaksi).
Olennaisesti GOTCHA laajentaa elokuun 2022 DF-Captcha -tutkimusta Ben-Gurionin yliopistosta, joka oli ensimmäinen, joka ehdotti henkilön vaatimista hyppäämään muutamien visuaalisten semanttisten silkkien läpi todistaakseen aitousensa.

Elokuun 2022 tutkimus Ben-Gurionin yliopistosta ehdotti ensimmäisenä interaktiivisia tehtäviä käyttäjälle, kuten naamansa peittäminen tai ihonsa painaminen – tehtäviä, joita jopa hyvin koulutetut reaaliaikaiset deepfake-järjestelmät eivät olisi ennustaneet tai pystyisi käsittelemään fotorealistisesti. Lähde: https://arxiv.org/pdf/2208.08524.pdf
Merkittävästi GOTCHA lisää “passiivisia” menetelmiä “kaskadiin” ehdotetuista testeistä, mukaan lukien epäaidon elementtien automaattinen ylittäminen käyttäjän naamalle ja “kuormittaminen” kehyksiä, jotka kulkevat läpi alkuperäistä järjestelmää. Kuitenkin vain käyttäjän reagoivat tehtävät voidaan arvioida erityisten lupien saamatta pääsyä käyttäjän paikalliseen järjestelmään – mikä, oletettavasti, tulisi paikallisten moduulien tai laajennusten muodossa suosittuihin järjestelmiin, kuten Skypeen ja Zoomiin, tai jopa omistettujen ohjelmistojen muodossa, jotka on suunniteltu erityisesti huijareiden torjumiseen.

Tutkimuksesta, kuvailu vuorovaikutuksesta soittajan ja järjestelmän välillä GOTCHA-järjestelmässä, pisteviivoina osoitetaan päätöksen virtaukset.
Tutkijat vahvistivat järjestelmän uudella tietojoukolla, joka sisälsi yli 2,5 miljoonaa videokehystä 47 osallistujalta, joista jokainen suoritti 13 haastetta GOTCHA-järjestelmässä. He väittävät, että kehys aiheuttaa “johdonmukaisen ja mitattavan” vähennyksen deepfake-sisällön laadussa petollisille käyttäjille, kuormittaa paikallista järjestelmää, kunnes ilmenevät ilmiöt tekevät petoksen ilmeiseksi paljain silmin (vaikka GOTCHA sisältää myös joitakin hienompia algoritmisia analyysimenetelmiä).
Uusi tutkimus on nimeltään Gotcha: Haaste-vastausjärjestelmä reaaliaikaisen deepfake-havaitsemiseen (järjestelmän nimi on iso kirjainmuodossa runko-tekstissä, mutta ei julkaisun otsikossa, vaikka se ei ole akronyymi).
Monoilla haasteilla
Pääosin Ben-Gurionin tutkimuksen mukaisesti, varsinaiset käyttäjän näkökulmasta haasteet on jaettu useaan tehtävän tyyppiin.
Kansien peittäminen vaatii käyttäjältä joko peittämään naamansa kädellä tai muilla esineillä tai esittämään naamansa kulmasta, joka ei ole todennäköisesti koulutettu deepfake-malliin (yleensä johtuen koulutusdatan puutteesta “outo” asennoista – katso kuvan ensimmäinen kuva yllä).
Lisäksi käyttäjän itsensä suorittamien toimien lisäksi GOTCHA voi ylittää satunnaisia kasvon leikkauksia, tarroja ja lisättyjä todellisuuden efektejä, jotta “korruptoi” kasvo-virtausta, jota paikallinen koulutettu deepfake-malli odottaa, aiheuttaen sen epäonnistumisen. Kuten mainittiin aiemmin, vaikka tämä on “passiivinen” prosessi käyttäjälle, se on intrusiivinen ohjelmisto, joka tarvitsee pääsyn suoraan lopputuotteen virtaukseen.
Seuraavaksi käyttäjaa voidaan vaatia asettamaan naamansa epätavallisiin kasvoilmeisiin, jotka ovat todennäköisesti poissa tai aliedustettuina koulutusjoukossa, aiheuttaen deepfake-virtauksen laadun laskua (kuva “b”, toinen sarakkeesta vasemmalle, ensimmäisessä kuvassa yllä).
Tämän testien osana käyttäjää voidaan vaatia lukemaan tekstiä tai keskustelemaan, joka on suunniteltu haastamaan paikallista reaaliaikaista deepfake-järjestelmää, joka ei ole koulutettu riittävän laajaa fonemi- tai muiden suun datan joukkoa, jotta se voisi rekonstruoida tarkan huulien liikkeen tällaisen tarkastelun alla.
Lopulta (ja tämä haaste vaatii lopputuotteen näyttelijän taitoja), tässä luokassa käyttäjää voidaan pyytää suorittamaan “mikroilmeen” – lyhyt ja vapaaehtoinen kasvoilme, joka paljastaa tunteen. Tutkimus sanoo ‘[se] kestää yleensä 0,5-4,0 sekuntia, ja on vaikea tehdä väärä’.
Vaikka tutkimus ei kuvaa, miten mikroilme voidaan poistaa, logiikka viittaa siihen, että ainoa tapa tehdä se on luoda sopiva tunne lopputuotteen käyttäjälle, ehkä esittämällä hätkähdyttävää sisältöä osana testin toimintaa.

Kasvon vääristymät, valaistus ja odottamattomat vieraat
Lisäksi ehdotetun työn mukaisesti, uusi tutkimus ehdottaa, että lopputuotteen käyttäjää pyydetään suorittamaan epätavallisia kasvon vääristymiä ja manipulaatioita, kuten painaminen sormea poskeen, vuorovaikutus kasvojen ja/tai hiusten kanssa ja suorittaminen muita liikkeitä, joita nykyinen reaaliaikainen deepfake-järjestelmä ei ole todennäköisesti pysty käsittelemään, koska ne ovat marginaalisia toimia – vaikka ne olisivat läsnä koulutusjoukossa, niiden jäljitelmä olisi todennäköisesti alhaisen laatuisia, linjassa muiden “poikkeama” -datan kanssa.

Hymy, mutta tämä “masentunut naama” ei käännetä hyvin paikallisella reaaliaikaisella deepfake-järjestelmällä.
Lisähaaste on muuttaa valaistusolosuhteita, joissa lopputuotteen käyttäjä on, koska on mahdollista, että deepfake-mallin koulutus on optimoitu standardiin videoneuvottelutilanteeseen tai jopa tarkasti valaistusolosuhteisiin, joissa puhelu tapahtuu.
Näin ollen käyttäjää voidaan pyytää suunnata taskulampun valoa kasvoihin tai muulla tavoin muuttaa valaistusta (ja on huomattava, että tämä lähestymistapa on keskeinen ehdotus toisessa reaaliaikaisessa deepfake-havaintatutkimuksessa, joka julkaistiin tämän kesän aikana).

Reaaliaikaiset deepfake-järjestelmät haastavat odottamattoman valaistuksen – ja jopa useita ihmisiä virtauksessa, jossa se odotti vain yhtä yksilöä.
Jos ehdotettu järjestelmä pystyy puuttumaan paikalliseen käyttäjävirtaukseen (jota epäillään sisältävän deepfake-välittäjän), lisäämällä odottamattomia kuvioita (katso keskisarake yllä) voidaan vaarantaa deepfake-algoritmin kyky ylläpitää simulaatiota.
Lisäksi, vaikka on epärealistista odottaa, että vastaanottaja voi olla mukana useita ihmisiä, jotka auttavat todentamaan heidät, järjestelmä voi puuttua lisäämällä kasvoja (oikeanpuoleisin kuva yllä) ja nähdä, jos jokin paikallinen deepfake-järjestelmä tekee virheen vaihtaessaan huomion – tai jopa yrittäessä deepfaking kaikkia heitä (autoencoder deepfake-järjestelmillä ei ole “tunnistamisen” kykyä, joka voisi pitää huomion yhdellä yksilöllä tässä skenaariossa).
Steganografia ja kuormittaminen
GOTCHA sisältää myös lähestymistavan, joka on ensin ehdotettu Kalifornian yliopistossa San Diegossa huhtikuussa, ja joka käyttää steganografiaa salaamaan viestin käyttäjän paikalliseen videovirtaukseen. Deepfake-toiminnot tuhoavat tämän viestin, johtaen todennusvirheeseen.

Huhtikuun 2022 tutkimuksesta, San Diegon yliopistosta ja San Diegon osavaltion yliopistosta, menetelmä, jolla määritetään aito identiteetti, nähdessään, selviääkö steganografinen signaali, joka on lähetetty käyttäjän videovirtaukseen, paikallisen silmukan läpi koskemattomana – jos se ei selviä, deepfake-petos voi olla käynnissä. Lähde: https://arxiv.org/pdf/2204.01960.pdf
Lisäksi GOTCHA pystyy kuormittamaan paikallisen järjestelmän (saadakseen pääsyn ja luvan), monistamalla virtauksen ja esittämällä “liiallista” dataa paikalliselle järjestelmälle, joka on suunniteltu aiheuttamaan replikointivirhe paikallisessa deepfake-järjestelmässä.
Järjestelmä sisältää muita testejä (katso tutkimus yksityiskohtia), mukaan lukien haaste, jossa puhelimeen perustuvan vastaanottajan on käännettävä puhelimen ylösalaisin, mikä vääristää paikallista deepfake-järjestelmää:

Tämäntyyppinen asia toimisi vain vakuuttavalla käyttötapaauksella, jossa käyttäjä on pakotettu antamaan paikallisen pääsyn virtaukseen, eikä sitä voida toteuttaa yksin passiivisella arvioinnilla käyttäjän videota, toisin kuin interaktiiviset testit (kuten painaminen sormea poskeen).
Käytännöllisyys
Tutkimus koskettaa lyhyesti sitä, missä määrin näiden kaltaiset testit voivat ärsyttää lopputuotteen käyttäjää tai aiheuttaa hänelle jotain vaivaa – esimerkiksi vaatimalla käyttäjältä olla saatavilla useita esineitä, joita voidaan tarvita testeihin, kuten aurinkolasit.
Se myös tunnustaa, että on vaikea saada voimakkaita vastaanottajia noudattamaan testirutiineja. Videopuhelun kohdalla johtajan kanssa tutkijat toteavat:
‘Käytettävyys on avainasia tässä, joten epäviralliset tai kevyet haasteet (kuten kasvon vääristymät tai ilmeet) eivät ole soveliaita. Haasteet, jotka käyttävät ulkoisia fyysisiä esineitä, eivät ole toivottavia. Tässä kontekstissa on muokattu sopivasti ja GOTCHA sovittaa haasteensa vastaavasti.’
Data ja testit
GOTCHA testattiin neljää paikallista reaaliaikaista deepfake-järjestelmää vastaan, mukaan lukien kaksi varianttia erittäin suositusta autoencoder deepfake-luojasta DeepFaceLab (‘DFL’, vaikka tutkimus ei mainitse DeepFaceLive, joka on ollut DeepFaceLab:n “live”-toteutus elokuusta 2021 lähtien ja näyttää todennäköisimmältä alkuperäiseltä resursilta mahdolliselle huijarille).
Neljä järjestelmää olivat DFL, joka on koulutettu “kevyesti” tuntemattomalle henkilölle, joka osallistuu testeihin, ja julkkiselle; DFL, joka on koulutettu täydellisemmin, 2 miljoonaan iteraatioon tai askeliin, jossa odotetaan paljon suorituskykyisempää mallia; Latent Image Animator (LIA); ja Face Swapping Generative Adversarial Network (FSGAN).
Tiedot on kerätty ja kuratoitu mainittuja videoklippiä, joissa 47 käyttäjää suorittaa 13 aktiivista haastetta, ja jokainen käyttäjä tuottaa noin 5-6 minuutin 1080p-videota 60fps. Tutkijat toteavat myös, että tämä data tullaan julkaisemaan myöhemmin.
Anomalian havaitseminen voidaan suorittaa joko ihmisen havainnoitsijana tai algoritmilla. Jälkimmäisessä tapauksessa järjestelmä on koulutettu 600 kasvoilla FaceForensics -tietojoukosta. Regressiohäviöfunktio oli voimakas Learned Perceptual Image Patch Similarity (LPIPS), kun taas binääinen cross-entropia käytettiin luokittelijan kouluttamiseen. EigenCam käytettiin visualisoimaan havaintojen painoja.

Ensisijaiset tulokset GOTCHA-testeistä.
Tutkijat totesivat, että kaikkien neljän järjestelmän täydellisessä testikaskadissa matalin määrä ja vakavuus anomaliasta (ts. ilmiöitä, jotka paljastavat deepfake-järjestelmän läsnäolon) saavutettiin korkeammin koulutetun DFL-jakelun kautta. Vähemmän koulutettu versio kamppaili erityisesti jäljittelemään monimutkaisia huulien liikkeitä (jotka vievät vain vähän kehystä, mutta jotka saavat korkean ihmisen huomion), kun taas FSGAN oli keskitien välillä kahden DFL-version välillä, ja LIA osoittautui täysin riittämättömäksi tehtävään, ja tutkijat katsoivat, että LIA epäonnistuisi todellisessa käyttöönotossa.
Julkaistu ensimmäisen kerran 17. lokakuuta 2022.












