Cybersikkerhet
Deteksjon av video-konferanse deepfakes med en smarttelefons «vibrate»-funksjon

Ny forskning fra Singapore har foreslått en ny metode for å detektere om noen på den andre siden av en smarttelefon video-konferanse-verktøy bruker metoder som DeepFaceLive for å ligne noen andre.
Den nye tilnærmingen, kalt SFake, forkaster de passive metoder som de fleste systemer bruker, og får brukerens telefon til å vibrere (ved å bruke de samme ‘vibrere’-mekanismene som er vanlige på smarttelefoner), og subtilt uskarpe ansiktet.
Selv om live deepfaking-systemer er i stand til å replikere bevegelsesuskarping, så lenge uskarpt bilde var inkludert i treningsdataene, eller i det minste i pre-treningsdataene, kan de ikke reagere raskt nok på uventet uskarping av denne typen, og fortsetter å produsere ikke-uskarpe deler av ansiktet, og avslører eksistensen av en deepfake-konferanse.

DeepFaceLive kan ikke respondere raskt nok til å simulere uskarpingen forårsaket av kamera-vibrasjonene. Kilde: https://arxiv.org/pdf/2409.10889v1
Testresultatene på forskernes eget kurerte datasett (siden ingen datasett med aktive kamera-rystelse eksisterer) fant at SFake overgikk konkurrerende video-baserte deepfake-detekteringsmetoder, selv når de møtte utfordrende omstendigheter, som den naturlige håndbevegelsen som skjer når den andre personen i en video-konferanse holder kameraet med hånden, i stedet for å bruke en statisk telefon-monter.
Det økende behovet for video-basert deepfake-deteksjon
Forskning på video-basert deepfake-deteksjon har økt nylig. I kjølvannet av flere års suksessfulle stemme-baserte deepfake-tyverier, tidligere i år ble en finansarbeider lurt til å overføre 25 millioner dollar til en svindler som brukte en deepfake-video-konferanse for å ligne en CFO.
Selv om et system av denne typen krever en høy grad av maskinvare-tilgang, er mange smarttelefon-brukere allerede vant til å bruke finansielle og andre typer verifiseringstjenester som ber oss om å registrere våre ansikts-trekk for ansikts-basert autentisering (dette er faktisk en del av LinkedIn’s verifiseringsprosess).
Det ser derfor ut til at slike metoder vil bli stadig mer vanlige for video-konferanse-systemer, ettersom denne typen kriminalitet fortsetter å skape overskrifter.
De fleste løsninger som adresse sanntids video-konferanse deepfaking antar en meget statisk scenario, der kommunikanten bruker en stasjonær webcam, og ingen bevegelse eller ekstreme miljø- eller lys-endringer er forventet. En smarttelefon-samtale tilbyr ingen slik ‘fast’ situasjon.
I stedet bruker SFake en rekke detekteringsmetoder for å kompensere for det høye antallet visuelle variasjoner i en hånd-holdt smarttelefon-basert video-konferanse, og ser ut til å være det første forskningsprosjektet som adresse problemet ved å bruke standard vibrasjons-utstyr bygget inn i smarttelefoner.
Artikkelen paperet heter Shaking the Fake: Detecting Deepfake Videos in Real Time via Active Probes, og kommer fra to forskere fra Nanyang Technological University i Singapore.
Metode
SFake er designet som en sky-basert tjeneste, der en lokal app sender data til en fjern API-tjeneste for å bli prosessert, og resultater sendes tilbake.
Men dens kun 450mb fotavtrykk og optimerte metode tillater at den kan prosessere deepfake-deteksjon helt på enheten selv, i tilfeller der nettverks-tilkobling kan føre til at sendte bilder blir for komprimert, og påvirker diagnostisk prosess.
Å kjøre ‘all lokal’ på denne måten betyr at systemet ville ha direkte tilgang til brukerens kamera-feed, uten codec-forstyrrelser ofte forbundet med video-konferanser.
Gjennomsnittlig analyse-tid krever en fire-sekunders video-klipp, under hvilket brukeren blir bedt om å forbli stille, og under hvilket SFake sender ‘sonder’ for å forårsake kamera-vibrasjoner å skje, på selektivt tilfeldige intervaller som systemer som DeepFaceLive ikke kan respondere på i tide.
(Det bør påpekes at noen angriper som ikke har inkludert uskarpt innhold i trenings-datasettet er usannsynlig å være i stand til å produsere en modell som kan generere uskarping, selv under mye mer gunstige omstendigheter, og at DeepFaceLive ikke kan bare ‘legge til’ denne funksjonaliteten til en modell trent på et under-kurert datasett)
Systemet velger utvalgte områder av ansiktet som potensielle deepfake-innhold, og ekskluderer øyne og øyebryn (siden blunking og annen ansikts-bevegelse i dette området er utenfor rekkevidden av uskarings-deteksjon, og ikke en ideell indikator).

Konseptuell skjema for SFake.
Som vi kan se i det konseptuelle skjemaet ovenfor, etter å ha valgt utvalgte og ikke-forutsigbare vibrasjons-mønster, bestemt den beste fokuserings-lengden, og utført ansikts-gjenkjenning (inkludert landemerke-deteksjon via en Dlib-komponent som estimerer standard 68 ansikts-landemerker), SFake avleder grader fra inndata-ansiktet og konsentrerer seg om utvalgte områder av disse grader.
Varians-sekvensen oppnås ved å sekvensielt analysere hver ramme i det korte klippet under studie, til den gjennomsnittlige eller ‘ideelle’ sekvensen er nådd, og resten forkastet.
Dette gir uttrekte funksjoner som kan brukes som en kvantifiserer for sannsynligheten for deepfake-innhold, basert på det trente datasettet (av hvilket, mer om dette øyeblikket).
Systemet krever en bilde-oppløsning på 1920×1080 piksler, samt en minst 2x zoom-krav for linser. Artikkelen bemerker at slike oppløsninger (og enda høyere oppløsninger) støttes i Microsoft Teams, Skype, Zoom og Tencent Meeting.
De fleste smarttelefoner har en front-kamera og en selv-kamera, og ofte bare ett av disse har zoom-kapasiteten som SFake krever; appen ville derfor kreve at kommunikanten bruker hvilken som helst av de to kameraene som møter disse kravene.
Formålet her er å få en korrekt proporsjon av brukerens ansikt inn i video-strømmen som systemet vil analysere. Artikkelen observerer at den gjennomsnittlige avstanden som kvinner bruker mobile enheter er 34,7 cm, og for menn, 38,2 cm (som rapportert i Journal of Optometry), og at SFake opererer svært godt på disse avstandene.
Ettersom stabilisering er et problem med hånd-holdt video, og ettersom uskarpingen som skjer fra hånd-bevegelse er en hindring for funksjonen til SFake, prøvde forskerne flere metoder for å kompensere. Den mest suksessfulle av disse var å beregne den sentrale punktet av de estimerte landemerker og bruke dette som en ‘anker’ – effektivt en algoritme-stabiliseringsteknikk. Ved denne metoden ble en nøyaktighet på 92% oppnådd.
Data og tester
Siden ingen passende datasett eksisterte for formålet, utviklet forskerne sitt eget:
‘[Vi] bruker 8 forskjellige merker av smarttelefoner for å spille inn 15 deltakere av varierende kjønn og alder for å bygge vårt eget datasett. Vi plasserer smarttelefonen på telefon-holderen 20 cm unna deltakeren og zoomer inn to ganger, med mål på deltakerens ansikt for å omfatte alle ansikts-trekk mens vi vibrerer smarttelefonen i forskjellige mønster.
‘For telefoner hvis front-kamera ikke kan zoome, bruker vi bak-kameraene som erstatning. Vi spiller inn 150 lange videoer, hver 20 sekunder lange. Som standard antar vi at detekterings-perioden varer 4 sekunder. Vi klipper 10 klipp av 4 sekunder lange fra en lang video ved å tilfeldig velge start-tiden. Derfor får vi totalt 1500 ekte klipp, hver 4 sekunder lange.’
Selv om DeepFaceLive (GitHub-lenke) var det sentrale målet for studien, ettersom det er nærmest sikkert fokus for kriminell interesse i forhold til video-konferanse-svindel, inkluderte forskerne fire andre metoder for å trene deres basis-detekteringsmodell: Hififace; FS-GANV2; RemakerAI; og MobileFaceSwap – den siste av disse en særlig passende valg, gitt mål-miljøet.
1500 fakede videoer ble brukt for trening, sammen med det samme antallet ekte og uendrede videoer.
SFake ble testet mot flere forskjellige klassifiserings-algoritmer, inkludert SBI; FaceAF; CnnDetect; LRNet; DefakeHop-varianter; og den gratis online deepfake-detekterings-tjenesten Deepaware. For hver av disse deepfake-metodene ble 1500 fakede og 1500 ekte videoer trent.
For basis-test-klassifiseringen ble en enkel to-lags neural nettverk med en ReLU-aktiveringsfunksjon brukt. 1000 ekte og 1000 fakede videoer ble tilfeldig valgt (selv om de fakede videoene var eksklusivt DeepFaceLive-eksempler).
Area Under Receiver Operating Characteristic Curve (AUC/AUROC) og Nøyaktighet (ACC) ble brukt som metrikker.
For trening og inferens ble en NVIDIA RTX 3060 brukt, og testene kjørt under Ubuntu. Test-videoene ble spilt inn med en Xiaomi Redmi 10x, en Xiaomi Redmi K50, en OPPO Find x6, en Huawei Nova9, en Xiaomi 14 Ultra, en Honor 20, en Google Pixel 6a og en Huawei P60.
For å være i samsvar med eksisterende detekteringsmetoder, ble testene implementert i PyTorch. Primære test-resultater er illustrert i tabellen nedenfor:

Resultater for SFake mot konkurrerende metoder.
Her kommenterer forfatterne:
‘I alle tilfeller overskred SFake’s detekterings-nøyaktighet 95%. Blant de fem deepfake-algoritmene, unntatt Hififace, utfører SFake bedre mot andre deepfake-algoritmer enn de andre seks detekterings-metodene. Ettersom vår klassifisering er trent ved å bruke fakede bilder generert av DeepFaceLive, når den høyeste nøyaktighets-raten på 98,8% når den detekterer DeepFaceLive.
‘Når den møter fakede ansikter generert av RemakerAI, utfører andre detekterings-metoder dårlig. Vi spekulerer på at dette kan skyldes automatisk komprimering av videoer når de lastes ned fra internettet, resulterende i tap av bilde-detaljer og dermed redusert detekterings-nøyaktighet. Dette påvirker imidlertid ikke SFake, som oppnår en nøyaktighet på 96,8% i deteksjon mot RemakerAI.’
Forfatterne bemerker videre at SFake er det mest performante systemet i scenariet med en 2x zoom på opptakslinsen, ettersom dette forsterker bevegelse, og er en usedvanlig utfordrende prospekt. Selv i denne situasjonen var SFake i stand til å oppnå gjenkjenning-nøyaktighet på 84% og 83%, henholdsvis for 2,5 og 3 forstørrelse-faktorer.
Konklusjon
Et prosjekt som bruker svakhetene til et live deepfake-system mot seg selv er et friskt tilbud i et år der deepfake-deteksjon har vært dominert av artikler som har bare rørt opp venerable tilnærmingene rundt frekvens-analyse (som er langt ifra immun mot innovasjoner i deepfake-rommet).
I slutten av 2022 brukte et annet system monitor-lysbølge-variasjon som en detektor-krok; og i samme år demonstrerte jeg selv DeepFaceLive’s evne til å håndtere harde 90-graders profil-utsikt, og fikk en del samfunns-interesse.
DeepFaceLive er det riktige målet for et slikt prosjekt, ettersom det nærmest sikkert er fokus for kriminell interesse i forhold til video-konferanse-svindel.
Imidlertid har jeg nylig sett noen anekdotiske bevis på at LivePortrait-systemet, som for tiden er svært populært i VFX-samfunnet, håndterer profil-utsikt mye bedre enn DeepFaceLive; det ville ha vært interessant hvis det kunne ha vært inkludert i denne studien.
Først publisert tirsdag, 24. september 2024












