Andersons vinkel

Dypfakes kan effektivt lure mange større ansikts-‘liveness’-APIer

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
From DeepFace Live - Arnold Schwarzenegger 224 3.03M Iterations | RTX A6000 - https://www.youtube.com/watch?v=9tr35y-yQRY

Et nytt forskningssamarbeid mellom USA og Kina har undersøkt sårbarheten for dypfakes hos noen av de største ansiktsbaserte autentiseringssystemer i verden, og funnet ut at de fleste av dem er sårbare for utvikling og fremvoksende former for dypfake-angrep.

Forskningen ble gjennomført med et eget rammeverk som ble brukt mot Facial Liveness Verification (FLV)-systemer som vanligvis leveres av større leverandører, og solgt som en tjeneste til nedstrømskunder som flyselskaper og forsikringsselskaper.

Fra artikkelen, en oversikt over funksjonen til Facial Liveness Verification (FLV) APIer hos større leverandører. Kilde: https://arxiv.org/pdf/2202.10673.pdf

Fra artikkelen, en oversikt over funksjonen til Facial Liveness Verification (FLV) APIer hos større leverandører. Kilde: https://arxiv.org/pdf/2202.10673.pdf

Ansiktsliveness er ment å avvise bruk av teknikker som adversarial image attacks, bruk av masker og forhåndsinnspilt video, såkalte ‘master faces’, og andre former for visuell ID-kloning.

Studien konkluderer med at det begrensede antallet dypfake-deteksjonsmoduler i disse systemene, mange av dem som betjener millioner av kunder, er langt ifra ufeilbarlige, og kan ha blitt konfigurert for dypfake-teknikker som nå er foreldet, eller kan være for arkitekturspesifik.

Forfatterne bemerker:

‘[Forskjellige] dypfake-metoder viser variasjoner over forskjellige leverandører…Uten tilgang til de tekniske detaljene til mål-FLV-leverandørene, spekulerer vi på at slike variasjoner skyldes forsvarstiltakene som er deployert av forskjellige leverandører. For eksempel kan visse leverandører deployere forsvar mot bestemte dypfake-angrep.’

Og fortsetter:

‘[De fleste] FLV-APIer bruker ikke anti-dypfake-deteksjon; selv for de som har slike forsvar, er deres effektivitet bekymringsverdig (f.eks. kan de detektere høykvalitets syntetiske videoer, men ikke detektere lavkvalitets videoer).’

Forskerne observerer, i denne sammenhengen, at ‘autentisitet’ er relativ:

‘[Selv om] en syntetisk video er ureal for mennesker, kan den likevel bypass den nåværende anti-dypfake-deteksjonsmekanismen med en svært høy suksessrate.’

Ovenfor, eksempler på dypfake-bilder som kunne autentisere i forfatternes eksperimenter. Under, mer realistiske feilbilder som ikke kunne autentisere.

Ovenfor, eksempler på dypfake-bilder som kunne autentisere i forfatternes eksperimenter. Under, mer realistiske feilbilder som ikke kunne autentisere.

En annen funn var at den nåværende konfigurasjonen av generiske ansiktsverifiseringsystemer er skjev mot hvite menn. Deretter ble det funnet at kvinnelige og ikke-hvite identiteter var mer effektive i å bypass verifiseringssystemer, og satte kunder i disse kategoriene i større risiko for brudd via dypfake-baserte teknikker.

Rapporten finner at hvite mann-identiteter er mest grundig og nøyaktig vurdert av populære ansiktsliveness-verifiserings-APIer. I tabellen ovenfor ser vi at kvinnelige og ikke-hvite identiteter kan lett bypasses systemene.

Rapporten finner at hvite mann-identiteter er mest grundig og nøyaktig vurdert av populære ansiktsliveness-verifiserings-APIer. I tabellen ovenfor ser vi at kvinnelige og ikke-hvite identiteter kan lett bypasses systemene.

Rapporten observerer at ‘det finnes bias i [Facial Liveness Verification], som kan bringe betydelige sikkerhetsrisiko til en bestemt gruppe mennesker.’

Forfatterne har også gjennomført etiske ansiktsautentiseringsangrep mot en kinesisk regjering, et større kinesisk flyselskap, ett av de største livsforsikringsselskapene i Kina, og R360, ett av de største enhorn-investeringsselskapene i verden, og rapporterer suksess i å bypass disse organisasjonenes nedstrøms bruk av de studerte API-ene.

I tilfelle en vellykket autentiseringsbypass for det kinesiske flyselskapet, krevde den nedstrøms API at brukeren skulle ‘ryste hodet’ som en bekreftelse mot potensiell dypfake-materiale, men dette viste seg ikke å fungere mot rammeverket utviklet av forskerne, som inkorporerer seks dypfake-arkitekturer.

Til tross for flyselskapets evaluering av en brukers hodebevegelse, kunne dypfake-innhold passere testen.

Til tross for flyselskapets evaluering av en brukers hodebevegelse, kunne dypfake-innhold passere testen.

Rapporten bemerker at forfatterne har kontaktet leverandørene involvert, som har angivelig erkjent arbeidet.

Forfatterne tilbyr en rekke anbefalinger for forbedringer i den nåværende tilstanden av FLV, inkludert å forkaste enkeltbildeautentisering (‘Image-based FLV’), hvor autentisering baseres på ett enkelt bilde fra en kundes kamerafeed; en mer fleksibel og omfattende oppdatering av dypfake-deteksjonssystemer over bilde- og taleområder; å pålegge behovet for at talebasert autentisering i brukerens video skal være synkronisert med leppebevegelser (hvilket de ikke er nå, generelt); og å kreve at brukerne utfører gesturer og bevegelser som for tiden er vanskelige for dypfake-systemer å gjenskape (for eksempel profilvisninger og delvis skjulte ansikter).

Den rapporten heter Seeing is Living? Rethinking the Security of Facial Liveness Verification in the Deepfake Era, og kommer fra felles hovedforfattere Changjiang Li og Li Wang, og fem andre forfattere fra Pennsylvania State University, Zhejiang University og Shandong University.

Kjernen av målene

Forskerne rettet seg mot de ‘seks mest representative’ Facial Liveness Verification (FLV)-leverandører, som har blitt anonymisert med kryptonymer i forskningen.

Leverandørene er representert slik: ‘BD’ og ‘TC’ representerer en konsernsleverandør med det største antallet ansiktsrelaterte API-kall, og den største andelen av Kinas AI-skytjenester; ‘HW’ er ‘en av leverandørene med den største [kinesiske] offentlige skytjenestemarked’; ‘CW’ har den raskeste veksten i datavisning, og oppnår en ledende markedsposisjon; ‘ST’ er blant de største datavisningsleverandørene; og ‘iFT’ teller blant de største AI-programvareleverandørene i Kina.

Data og arkitektur

De underliggende dataene som driver prosjektet inkluderer en datasett på 625 537 bilder fra den kinesiske initiativet CelebA-Spoof, sammen med livevideoer fra Michigan State Universitys 2019 SiW-M-datasett.

Alle eksperimentene ble gjennomført på en server med to 2,40 GHz Intel Xeon E5-2640 v4-prosessorer som kjører på 256 GB RAM med en 4 TB HDD, og fire orkestrerte 1080Ti NVIDIA-GPUer, for en total på 44 GB operative VRAM.

Seks i én

Rammeverket utviklet av rapportens forfattere kalles LiveBugger, og inkorporerer seks state-of-the-art dypfake-rammer rettet mot de fire hovedforsvar i FLV-systemer.

LiveBugger inneholder diverse dypfake-tilnærminger, og sentrerer seg på de fire hovedangrepsvektorene i FLV-systemer.

LiveBugger inneholder diverse dypfake-tilnærminger, og sentrerer seg på de fire hovedangrepsvektorene i FLV-systemer.

De seks dypfake-rammene som ble brukt er: Oxford Universitets 2018 X2Face; det amerikanske akademiske samarbeidet ICface; to variasjoner av det israelske prosjektet FSGAN fra 2019; det italienske First Order Method Model (FOMM) fra tidlig 2020; og Peking Universitets Microsoft Research-samarbeid FaceShifter (selv om FaceShifter ikke er åpen kilde, måtte forfatterne rekonstruere det basert på de publiserte arkitekturdetaljene).

Metodene som ble brukt blant disse rammeverkene inkluderte bruk av forhåndsrendret video hvor subjektene i spoof-videoen utfører rutinehandlinger som er trukket ut fra API-autentiseringskrav i en tidligere evalueringmodul av LiveBugger, og også bruk av effektiv ‘dypfake-puppetry’, som oversetter levende bevegelser fra en person til en dypfake-strøm som er injisert i en ko-optert webcam-strøm.

Et eksempel på det siste er DeepFaceLive, som debuterte sommeren 2021 som et tillegg til det populære DeepFaceLab, for å muliggjøre sanntids dypfake-strømming, men som ikke er inkludert i forfatternes forskning.

Angrepet på de fire vektorene

De fire angrepsvektorene i et typisk FLV-system er: bildebasert FLV, som bruker et enkelt brukerleverert bilde som en autentiseringstoken mot et ansikts-ID som er på registrert med systemet; stillebasert FLV, som krever at brukeren laster opp en video klipp; aksjonsbasert FLV, som krever at brukeren utfører handlinger diktert av plattformen; og talebasert FLV, som sammenligner en brukers prompted tale mot systemets databaseinnlegg for den brukers talepatron.

Den første utfordringen for systemet er å etablere hvor langt en API vil avsløre sine krav, siden de kan bli forventet og tilpasset i dypfake-prosessen. Dette håndteres av Intelligence Engine i LiveBugger, som samler informasjon om krav fra offentlig tilgjengelige API-dokumentasjon og andre kilder.

Siden de publiserte kravene kan være fraværende (av forskjellige årsaker) fra API-ens faktiske rutiner, inkorporerer Intelligence Engine en sonde som samler implisitt informasjon basert på resultater fra utforskende API-kall. I forskningsprosjektet ble dette fasilitert av offisielle offline ‘test’-APIer som er gitt for utvikleres skyld, og også av frivillige som tilbød å bruke sine egne live-kontoer for testing.

Intelligence Engine søker etter bevis for om en API for tiden bruker en bestemt tilnærming som kan være nyttig i angrep. Trekk av denne typen kan inkludere koherensdeteksjon, som sjekker om rammer i en video er tidsmessig kontinuerlige – et krav som kan etableres ved å sende forvirrede video-rammer og observere om dette bidrar til autentiseringsfeil.

Modulen søker også etter Lip Language Detection, hvor API-en kan sjekke om lyden i videoen er synkronisert til brukerens leppebevegelser (sjelden tilfelle – se ‘Resultater’ nedenfor).

Resultater

Forfatterne fant ut at alle seks evaluerte API-er ikke bruker koherensdeteksjon på tidspunktet for eksperimentene, og tillot dermed dypfake-motoren i LiveBugger å enkelt sy sammen syntetisk audio med dypfake-video, basert på bidrag fra frivillige.

Likevel ble noen nedstrømsapplikasjoner (dvs. kunder av API-rammeverkene) funnet å ha lagt til koherensdeteksjon i prosessen, og nødvendiggjorde dermed forhåndsinnspilling av en video tilpasset å omgå dette.

I tillegg bruker bare noen av API-leverandørene lip language detection; for de fleste av dem analyseres video og audio som separate mengder, og det finnes ingen funksjonalitet som prøver å matche leppebevegelsen til den tilgjengelige audioen.

Diverse resultater som spenner over rekken av fake-teknikker tilgjengelige i LiveBugger mot den varierte rekken av angrepsvektorer i FLV-APIer. Høyere tall indikerer at angriperen har penetrert autentiseringen med dypfake-teknikker. Ikke alle API-er inkluderer alle mulige forsvar for FLV; for eksempel inkluderer noen ikke noen forsvar mot dypfakes, mens andre ikke sjekker om leppebevegelse og audio matcher i brukerens video under autentisering.

Diverse resultater som spenner over rekken av fake-teknikker tilgjengelige i LiveBugger mot den varierte rekken av angrepsvektorer i FLV-APIer. Høyere tall indikerer en høyere suksessrate i å penetrere FLV med dypfake-teknikker. Ikke alle API-er inkluderer alle mulige forsvar for FLV; for eksempel inkluderer noen ikke noen forsvar mot dypfakes, mens andre ikke sjekker om leppebevegelse og audio matcher i brukerens video under autentisering.

Konklusjon

Rapportens resultater og indikasjoner for fremtiden av FLV-API-er er labyrintiske, og forfatterne har konkatenerert dem i en fungerende ‘arkitektur av sårbarheter’ som kan hjelpe FLV-utviklere med å forstå noen av problemene som er avdekket”

Rapportens nettverk av anbefalinger om den eksisterende og potensielle sårbarheten av ansiktsbasert video-identifikasjon til dypfake-angrep.

Rapportens nettverk av anbefalinger om den eksisterende og potensielle sårbarheten av ansiktsbasert video-identifikasjon til dypfake-angrep.

Anbefalingene bemerker:

‘Sikkerhetsrisikoen for FLV finnes vidt i mange virkelige applikasjoner, og truer dermed sikkerheten for millioner av sluttbrukere’

Forfatterne observerer også at bruk av aksjonsbasert FLV er ‘marginale’, og at å øke antallet handlinger som brukerne må utføre ‘kan ikke bringe noen sikkerhetsgevinst’.

Forfatterne bemerker videre at å kombinere talegjenkjenning og tidsbasert ansiktsgjenkjenning (i video) er et resultatløst forsvar, med mindre API-leverandørene begynner å kreve at leppebevegelser er synkronisert med audioen.

Rapporten kommer i lys av en nylig FBI-advarsel til bedrifter om farene ved dypfake-svindel, nesten ett år etter deres varsling om teknologiens bruk i utenlandske påvirkningsoperasjoner, og generelle frykter om at sanntids dypfake-teknologi vil muliggjøre en ny krimbølge på en offentlighet som fortsatt stoler på videoautentiseringssikkerhetsarkitekturer.

Disse er fortsatt de tidlige dagene av dypfake som en autentiseringsangrepsflate; i 2020 ble $35 millioner dollar svindlet fra en bank i UAE ved bruk av dypfake-lytteknologi, og en britisk direktør ble likeledes svindlet til å utbetale $243 000 i 2019.

 

Først publisert 23. februar 2022.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai