Andersonin kulma

Syvänäköiset voivat tehokkaasti hämätä monia suuria kasvojen ‘elävyyden’ API:ja

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
From DeepFace Live - Arnold Schwarzenegger 224 3.03M Iterations | RTX A6000 - https://www.youtube.com/watch?v=9tr35y-yQRY

Yhdysvaltain ja Kiinan välinen uusi tutkimusyhteistyö on tutkinut joitain maailman suurimmista kasvojen perusteella tapahtuvaan todennusjärjestelmiin ja havainnut, että useimmat niistä ovat haavoittuvaisia kehittyville ja uusille syvänäköhyökkäyksille.

Tutkimus suoritettiin syvänäköhyökkäyksiä käyttäen mukautettua kehystä, jota vastaan hyökättiin Facial Liveness Verification (FLV) -järjestelmiin, jotka ovat yleisesti saatavilla suurilta toimittajilta ja myydään palveluna asiakkaille, kuten lentoyhtiöille ja vakuutusyhtiöille.

Tutkimuksesta, yleiskatsaus FLV-API:den toiminnasta suurilla toimittajilla. Lähde: https://arxiv.org/pdf/2202.10673.pdf

Tutkimuksesta, yleiskatsaus FLV-API:den toiminnasta suurilla toimittajilla. Lähde: https://arxiv.org/pdf/2202.10673.pdf

Kasvojen elävyys on tarkoitettu torjumaan tekniikoita, kuten vastustuskykyisiä kuvahyökkäyksiä, naamioiden ja esikuvatun videon käyttöä, niin kutsuttuja mestarien kasvoja ja muita visuaalisen tunnisteen kloonaamista.

Tutkimus osoittaa, että näiden järjestelmien rajoitettu määrä syvänäköhavaitsemismoduuleja, joista useat palvelevat miljoonia asiakkaita, on kaukana täydellisyydestä ja saattaa olla määritelty vanhentuneilla syvänäkötekniikoilla tai olla liian arkkitehtuurikohtaisia.

Tutkimuksen tekijät toteavat:

‘[Eri] syvänäkömenetelmillä on vaihtelua eri toimittajien välillä… Ilman pääsyä kohde-FLV-toimittajien teknisiin yksityiskohtiin, spekuloidaan, että tällaiset vaihtelut johtuvat toimittajien käyttämistä puolustuskeinoista. Esimerkiksi jotkut toimittajat voivat käyttää puolustuksia tiettyjä syvänäköhyökkäyksiä vastaan.’

Ja jatkavat:

‘[Useimmat] FLV-API:t eivät käytä anti-syvänäköhavaitsemista; jopa niillä, joilla on tällaiset puolustukset, niiden tehokkuus on huolestuttavaa (esim. se voi havaita laadukkaita syntetisoituja videoita, mutta ei pysty havaitsemaan huonolaatuisia).

Tutkijat huomauttavat tässä suhteessa, että ‘aidonus’ on suhteellista:

‘[Vaikka] syntetisoitu video on epätodellinen ihmisille, se voi silti ohittaa nykyisen anti-syvänäköhavaitsemismekanismin hyvin suurella onnistumisprosentilla.’

Ylhäällä, esimerkki syvänäkökuvista, jotka pystyivät todentamaan tutkijoiden kokeissa. Alhaalla, näyttävästi realistisemmat väärennetyt kuvat, jotka eivät pystyneet todentamaan.

Ylhäällä, esimerkki syvänäkökuvista, jotka pystyivät todentamaan tutkijoiden kokeissa. Alhaalla, näyttävästi realistisemmat väärennetyt kuvat, jotka eivät pystyneet todentamaan.

Toinen löytö oli, että nykyiset yleiset kasvojen todennusjärjestelmien konfiguraatio on vinoutunut valkoisten miesten suuntaan. Seurauksena on, että naiset ja ei-valkoiset identiteetit ovat tehokkaampia ohittamaan todennusjärjestelmiä, asettaen asiakkaat näissä ryhmissä suuremmalle riskille syvänäköpohjaisen hyökkäyksen kautta.

Raportti osoittaa, että valkoiset miehet ovat tarkimmin ja tarkin arvioituja suosituilla kasvojen elävyyden todennus-API:illa. Yllä olevassa taulukossa nähdään, että naiset ja ei-valkoiset identiteetit voivat helpommin ohittaa järjestelmät.

Raportti osoittaa, että valkoiset miehet ovat tarkimmin ja tarkin arvioituja suosituilla kasvojen elävyyden todennus-API:illa. Yllä olevassa taulukossa nähdään, että naiset ja ei-valkoiset identiteetit voivat helpommin ohittaa järjestelmät.

Tutkimusraportti toteaa, että ‘on vinoutumia [Kasvojen elävyyden todennuksessa], jotka voivat aiheuttaa merkittäviä turvallisuusriskejä tietyn ryhmän ihmisille.’

Tutkijat suorittivat myös eettisiä kasvojen todennushyökkäyksiä Kiinan hallitusta, suurta kiinalaista lentoyhtiötä, yhtä Kiinan suurimmista vakuutusyhtiöistä ja R360:aa, yhtä maailman suurimmista yksisarvisista sijoitusryhmistä, ja raportoivat onnistuneen ohittamisen näiden organisaatioiden alihankkijoiden käyttämien tutkittujen API:den avulla.

Kiinalaisen lentoyhtiön onnistuneen todennusohittamisen tapauksessa alihankkijan API vaati käyttäjältä ‘pään heiluttamista’ todisteena mahdollista syvänäkömateriaalia vastaan, mutta tämä osoittautui toimimattomaksi tutkijoiden kehittämää kehystä vastaan, joka sisältää kuusi syvänäköarkkitehtuuria.

Lentoyhtiön arvio pään liikkeestä ei estänyt syvänäkömateriaalia ohittamasta todennusta.

Lentoyhtiön arvio pään liikkeestä ei estänyt syvänäkömateriaalia ohittamasta todennusta.

Tutkimusraportti toteaa, että tutkijat ovat olleet yhteydessä osallistuviin toimittajiin, jotka ovat ilmoittaneet työstä.

Tutkijat esittävät joukon suosituksia nykyisen kasvojen elävyyden todennusjärjestelmien parantamiseksi, mukaan lukien yksittäisen kuvan todennuksen (Image-based FLV) hylkääminen, jossa todennus perustuu yhteen asiakkaan kameravirran kehykseen; syvänäköhavaitsemisjärjestelmien päivittäminen kuvan ja äänen alueilla; vaatimus, että äänitodennus videossa on synchronoitu huulien liikkeiden kanssa (mitä se ei yleensä ole); ja vaatimus, että käyttäjät suorittavat eleitä ja liikkeitä, jotka ovat tällä hetkellä vaikeita syvänäköjärjestelmille jäljitettäväksi (esim. profiilien näkymät ja osittainen kasvojen peittäminen).

Tutkimusraportti paperi on otsikoitu Näkeminen on elämää? Uudelleenarviointi kasvojen elävyyden todennuksen turvallisuudesta syvänäköaikakaudella, ja se on yhteistyössä johtavien tekijöiden Changjiang Lin ja Li Wangin sekä viiden muun tekijän kanssa Pennsylvanian osavaltion yliopistosta, Zhejiangin yliopistosta ja Shandongin yliopistosta.

Lähtökohtana olevat kohdat

Tutkijat kohdistivat kuusi eniten edustavaa kasvojen elävyyden todennus (FLV) -toimittajaa, jotka on anonymisoitu salanimillä tutkimuksessa.

Toimittajat ovat edustettuina seuraavasti: ‘BD’ ja ‘TC’ edustavat konglomeraattitoimittajaa, jolla on suurin määrä kasvoihin liittyviä API-kutsuja ja suurin osuus Kiinan AI-pilvipalveluista; ‘HW’ on ‘yksi suurimmista [kiinalaisista] julkisista pilvipalveluiden markkinoista’; ‘CW’ on nopein kasvaja tietokoneen näön alalla ja saavuttaa johtavan markkina-aseman; ‘ST’ on yksi suurimmista tietokoneen näön toimittajista; ja ‘iFT’ on yksi Kiinan suurimmista ohjelmistotoimittajista.

Tiedot ja arkkitehtuuri

Tutkimuksen taustatietoja ovat Kiinalaisen CelebA-Spoof -aloitteen 625 537 kuvaa sekä Michiganin osavaltion yliopiston SiW-M -tietokannan live-videot vuodelta 2019.

Kaikki kokeet suoritettiin palvelimella, jossa on kaksi 2,40 GHz Intel Xeon E5-2640 v4 -prosessoria, 256 GB RAM-muistia ja 4 TB kiintolevy, sekä neljä 1080Ti NVIDIA -näytönohjainta, yhteensä 44 GB toimivaa VRAM:ia.

Kuusi yhteen

Tutkimuksessa kehitetty kehys on nimeltään LiveBugger, ja se sisältää kuusi viimeisintä syvänäkökehyksiä, jotka on suunnattu FLV-järjestelmien neljää pääpuolustusta vastaan.

LiveBugger sisältää monia syvänäkölähestymistapoja ja keskittyy FLV-järjestelmien neljään päähyökkäysvektoriin.

LiveBugger sisältää monia syvänäkölähestymistapoja ja keskittyy FLV-järjestelmien neljään päähyökkäysvektoriin.

Kuusi syvänäkökehyksiä, joita tutkimuksessa käytettiin, ovat: Oxfordin yliopiston vuoden 2018 X2Face; Yhdysvaltain akateeminen yhteistyö ICface; kaksi vuoden 2019 Israelilaisen FSGAN -projektin varianttia; Italian First Order Method Model (FOMM) vuodelta 2020; ja Pekingin yliopiston Microsoftin tutkimusyhteistyö FaceShifter (vaikka FaceShifter ei ole avoimen lähdekoodin, tutkijoiden oli rakennettava se uudelleen julkaisun arkkitehtuuritietojen perusteella).

Menetelmiä, joita näissä kehyksissä käytettiin, olivat esimerkiksi esikuvatun videon käyttäminen, jossa väärennetyn videon kohteet suorittavat toimintoja, jotka on poimittu API:n todennusvaatimuksista aiemmassa LiveBuggerin arviomoduulissa, sekä tehokkaan ‘syvänäkö-nukkeuden’ käyttäminen, joka kääntää yhden henkilön elävät liikkeet syvänäkövirraksi, joka on lisätty varastoidun web-kameravirran sekaan.

Esimerkki jälkimmäisestä on DeepFaceLive, joka debytoi viime kesänä suositun DeepFaceLab -ohjelman liitännäisohjelmana, jotta voidaan mahdollistaa syvänäkövirran lähettäminen reaaliajassa, mutta jota ei ole mukana tutkijoiden tutkimuksessa.

Hyökkäys neljää vektoria vastaan

FLV-järjestelmän neljä hyökkäysvektoria ovat: kuvapohjainen FLV, joka käyttää yhtä käyttäjän antamaa valokuvaa todennusmerkkinä kasvojen tunnistamiseen järjestelmässä; hiljaisuuspohjainen FLV, joka vaatii käyttäjältä videon lataamista; toimintapohjainen FLV, joka vaatii käyttäjältä toimintoja, jotka on määrätty alustalla; ja äänipohjainen FLV, joka vertaa käyttäjän ääntä järjestelmän äänitallenteeseen.

Ensimmäinen haaste järjestelmälle on määrittää, miten paljon API paljastaa vaatimuksiaan, koska ne voidaan sitten ennakoida ja sovittaa syvänäköprosessiin. Tämä käsitellään LiveBuggerin älykkään moottorin kautta, joka kerää tietoa vaatimuksista julkisesti saatavilla olevasta API-dokumentaatiosta ja muista lähteistä.

Koska julkaistut vaatimukset saattavat puuttua (erityisistä syistä) API:n todellisista ohjelmistoista, älykäs moottori sisältää tutkimusmoduulin, joka kerää implisiittisiä tietoja API-kutsujen tuloksista. Tutkimushankkeessa tämä tapahtui virallisten offline-‘testi’-API:den avulla, jota kehittäjät olivat tarjonneet, sekä vapaaehtoisten avulla, jotka tarjosivat omia tilejään testaamiseen.

Älykäs moottori etsii todisteita siitä, käyttääkö API tiettyä lähestymistapaa, joka voisi olla hyödyllistä hyökkäyksissä. Tällaisia ominaisuuksia ovat koherenssin havaitseminen, joka tarkistaa, ovatko videon kehykset aikajärjestyksessä jatkuvia – vaatimus, joka voidaan määrittää lähettämällä sekoitetut videokehykset ja havaitsemalla, johtuuko tämä todennuksen epäonnistumisesta.

Moduuli etsii myös Huulien liikkeen havaitsemista, jossa API tarkistaa, onko videossa oleva ääni synchronized huulien liikkeiden kanssa (harvoin tapahtuu – katso ‘Tulokset’ alla).

Tulokset

Tutkijat totesivat, että kaikki kuusi arvioidussa API:sta eivät käyttäneet koherenssin havaitsemista kokeiden aikana, jolloin LiveBuggerin syvänäkömoottori pystyi yksinkertaisesti liittämään syntetisoituja ääniä syvänäkövideoon perustuen vapaaehtoisten materiaaliin.

Kuitenkin joitakin alihankkijoiden sovelluksia havaittiin lisänneen koherenssin havaitsemisen prosessiin, mikä edellytti videon ennakkoon renderöintiä, jotta voidaan ohittaa se.

Lisäksi vain muutamia API-toimittajia käytti huulien liikkeen havaitsemista; useimmissa tapauksissa video ja ääni analysoitiin erillisinä määrinä, eikä ollut toimintoa, joka yrittäisi vastata huulien liikettä ääneen.

LiveBuggerin erilaiset tulokset, jotka kattavat syvänäkötekniikkojen kirjon FLV-API:den hyökkäysvektoreita vastaan. Suuremmat luvut osoittavat suurempaa onnistumisprosenttia FLV:n ohittamisessa syvänäkötekniikkojen avulla. Kaikki API:t eivät sisällä kaikkia mahdollisia puolustuksia FLV:lle; esimerkiksi joitakin ei ole suojattu syvänäköhyökkäyksiltä, kun taas toiset eivät tarkista, ovatko huulien liike ja ääni synkronoituja videossa todennuksen aikana.

LiveBuggerin erilaiset tulokset, jotka kattavat syvänäkötekniikkojen kirjon FLV-API:den hyökkäysvektoreita vastaan. Suuremmat luvut osoittavat suurempaa onnistumisprosenttia FLV:n ohittamisessa syvänäkötekniikkojen avulla. Kaikki API:t eivät sisällä kaikkia mahdollisia puolustuksia FLV:lle; esimerkiksi joitakin ei ole suojattu syvänäköhyökkäyksiltä, kun taas toiset eivät tarkista, ovatko huulien liike ja ääni synkronoituja videossa todennuksen aikana.

Johtopäätös

Tutkimuksen tulokset ja tulevaisuuden näkymät FLV-API:lle ovat monimutkaisia, ja tutkijat ovat koonneet ne toimivaan ‘haavoittuvuusarkkitehtuuriin’, joka auttaa FLV-kehittäjiä ymmärtämään joitakin havaittuja ongelmia

Tutkimuksen suositusten verkosto, joka koskee kasvojen perusteella tapahtuvan videoidentifikaation nykyistä ja potentiaalista haavoittuvuutta syvänäköhyökkäyksille.

Tutkimuksen suositusten verkosto, joka koskee kasvojen perusteella tapahtuvan videoidentifikaation nykyistä ja potentiaalista haavoittuvuutta syvänäköhyökkäyksille.

Suositukset toteavat:

‘FLV:n turvallisuusriskit ovat laajasti olemassa monissa todellisissa sovelluksissa ja uhkaavat siten miljoonien loppukäyttäjien turvallisuutta’

Tutkijat toteavat myös, että toimintapohjaisen FLV:n käyttö on ‘marginaalista’, ja että toimintojen määrän lisääminen, joita käyttäjiltä vaaditaan, ‘ei voi tuoda turvallisuutta’.

Lisäksi tutkijat toteavat, että äänentunnistuksen ja kasvojen tunnistuksen yhdistäminen (videossa) on turha puolustus, jos API-toimittajat eivät ala vaatia, että huulien liikkeet on synchronoitu ääneen.

Tutkimus ilmestyy FBI:n viimeaikaisen varoituksen jälkeen liiketoiminnalle syvänäköpetosten vaaroista, lähes vuosi sen jälkeen, kun he varoittivat teknologian käytöstä ulkomaisten vaikuttamisen operaatioissa, ja yleisiä pelkoja siitä, että live-syvänäköteknologia mahdollistaa uuden rikollisuusaallon, joka kohdistuu yleisöön, joka edelleen luottaa videoidentifikaation turvallisuusarkkitehtuuriin.

Nämä ovat edelleen syvänäköhyökkäyksen alkuvaiheita todennuskohteena; vuonna 2020 35 miljoonaa dollaria petkattiin väärennetyllä ääniteknologialla UAE:n pankista, ja UK:n johtaja joutui vuonna 2019 maksamaan 243 000 dollaria.

 

Julkaistu ensimmäisen kerran 23. helmikuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai