Andersons vinkel
Detektering af video-konference deepfakes med en smartphones ‘vibrationsfunktion’

Nyt forskning fra Singapore har foreslået en ny metode til at detektere, om nogen på den anden side af en smartphone-videoconferencing-værktøj bruger metoder som DeepFaceLive til at efterligne nogen andre.
Den nye tilgang, der er døbt SFake, forkaster de passive metoder, der anvendes af de fleste systemer, og får brugerens telefon til at vibrere (ved hjælp af de samme ‘vibrationsmekanismer’, der er almindelige på smartphones), og blurrer subtelt ansigtet.
Selv om live deepfaking-systemer er i stand til at genskabe bevægelsesblurr, så længe blurret footage er inkluderet i træningsdata eller i det mindste i fortræningsdata, kan de ikke reagere hurtigt nok på uventet blurr af denne type, og fortsætter med at producere ikke-blurrede dele af ansigter, hvilket afslører eksistensen af en deepfake-konferenceopkald.

DeepFaceLive kan ikke reagere hurtigt nok på at simulere blurren forårsaget af kamera-vibrationer. Kilde: https://arxiv.org/pdf/2409.10889v1
Testresultater på forskernes selv-curaterede dataset (da der ikke findes nogen datasets, der omfatter aktiv kamera-rystelse) fandt, at SFake overgik konkurrerende video-baserede deepfake-detektionsmetoder, selv når de stod over for udfordrende omstændigheder, såsom den naturlige håndbevægelse, der opstår, når den anden person i en video-konference holder kameraet med hånden i stedet for at bruge en statisk telefonholder.
Det voksende behov for video-baseret deepfake-detektion
Forskning i video-baseret deepfake-detektion er øget i det seneste år. I kølvandet på flere års succesfulde stemme-baserede deepfake-tyverier, blev en finansarbejder tidligere på året snydt til at overføre 25 millioner dollars til en svindler, der brugte en deepfake-video-konference-opkald til at efterligne en CFO.
En system af denne type kræver en høj grad af hardware-adgang, men mange smartphone-brugere er allerede vant til, at finansielle og andre former for verificeringstjenester beder os om at optage vores ansigtstræk til ansigtsgenkendelse (det er endda en del af LinkedIn’s verificeringsproces).
Det synes derfor sandsynligt, at sådanne metoder vil blive mere og mere udbredte i video-konferencesystemer, da denne type kriminalitet fortsætter med at skabe overskrifter.
De fleste løsninger, der tager sig af real-time video-konference deepfaking, antager en meget statisk situation, hvor kommunikanten bruger en stationær webcam, og der ikke er nogen bevægelse eller ekstreme miljø- eller lysændringer.
En smartphone-opkald tilbyder ingen sådan ‘fast’ situation.
I stedet bruger SFake en række detektionsmetoder til at kompensere for det store antal visuelle variationer i en håndholdt smartphone-baseret video-konference, og synes at være det første forskningsprojekt, der tager sig af problemet ved hjælp af standard-vibrationsudstyr bygget ind i smartphones.
Den artikel er døbt Shaking the Fake: Detecting Deepfake Videos in Real Time via Active Probes, og kommer fra to forskere fra Nanyang Technological University i Singapore.
Metode
SFake er designet som en cloud-baseret tjeneste, hvor en lokal app sender data til en fjern API-tjeneste til at blive behandlet, og resultaterne sendes tilbage.
Men dens lille 450mb fodaftryk og optimerede metode tillader, at den kan behandle deepfake-detektion helt på enheden selv, i tilfælde hvor netværksforbindelse kan få sendte billeder til at blive for komprimeret, hvilket påvirker diagnostikprocessen.
At køre ‘all local’ på denne måde betyder, at systemet har direkte adgang til brugerens kamerafeed, uden codec-interferens, der ofte er forbundet med video-konferencing.
Gennemsnitlig analyse tid kræver en fire-sekunders video-eksempel, under hvilken brugeren bedes om at blive stille, og under hvilken SFake sender ‘sonder’ for at få kamera-vibrationer til at opstå, på selektivt tilfældige interval, som systemer som DeepFaceLive ikke kan reagere på i tide.
(Det skal gentages, at enhver angriber, der ikke har inkluderet blurret indhold i træningsdata, er usandsynlig at kunne producere en model, der kan generere blurr, selv under langt mere gunstige omstændigheder, og at DeepFaceLive ikke bare kan ’tilføje’ denne funktion til en model, der er trænet på en under-curateret dataset)
Systemet vælger bestemte områder af ansigtet som områder med potentiel deepfake-indhold, og udelukker øjne og øjenbryn (da blinkning og andre ansigtsbevægelser i dette område er uden for rammerne af blurret-detektion, og ikke er en ideal indikator).

Konceptuel skema for SFake.
Som vi kan se i det konceptuelle skema ovenfor, efter at have valgt passende og ikke-forudsigelige vibrationsmønstre, fastsat den bedste brændvidde og udført ansigtsgenkendelse (herunder landmark-detektion via en Dlib-komponent, der estimerer standard 68 ansigtlandmærker), SFake udleder gradienter fra input-ansigtet og koncentrerer sig om valgte områder af disse gradienter.
Varianssekvensen opnås ved at sekventielt analysere hver ramme i den korte klip under undersøgelse, indtil den gennemsnitlige eller ‘ideelle’ sekvens er nået, og resten afvist.
Dette giver extracted features, der kan bruges som en kvantificator for sandsynligheden for deepfaked-indhold, baseret på den trænede database (om hvilken mere om lidt).
Systemet kræver en billedopløsning på 1920×1080 pixels, samt en zoom-krav på mindst 2x for linsen. Artiklen bemærker, at sådanne opløsninger (og endda højere opløsninger) er understøttet i Microsoft Teams, Skype, Zoom og Tencent Meeting.
De fleste smartphones har en forside- og selvside-kamera, og ofte kun en af disse har zoom-kapaciteterne, der kræves af SFake; appen ville derfor kræve, at kommunikanten brugte det kamera, der opfylder disse krav.
Formålet her er at få en korrekt proportion af brugerens ansigt ind i video-streamen, som systemet vil analysere. Artiklen observerer, at den gennemsnitlige afstand, som kvinder bruger mobilenheder, er 34,7 cm, og for mænd, 38,2 cm (som rapporteret i Journal of Optometry), og at SFake fungerer meget godt på disse afstande.
Da stabilisering er et problem med håndholdt video, og da blurren, der opstår fra håndbevægelse, er en hindring for SFakes funktionsmåde, prøvede forskerne flere metoder til at kompensere. Den mest succesfulde af disse var at beregne den centrale punkt af de estimerede landmærker og bruge dette som en ‘anker’ – effektivt en algoritmic stabiliseringsteknik. Ved denne metode opnåedes en nøjagtighed på 92%.
Data og tests
Da der ikke eksisterede nogen passende datasets til formålet, udviklede forskerne deres eget:
‘[Vi] bruger 8 forskellige mærker af smartphones til at optage 15 deltagere af varierende køn og alder til at bygge vores eget dataset. Vi placerer smartphone på telefonholder 20 cm væk fra deltageren og zoomer ind to gange, med fokus på deltagerens ansigt for at omfatte alle hans ansigtstræk, mens vi vibrerer smartphone i forskellige mønstre.
‘For telefoner, hvis forside-kamera ikke kan zoome, bruger vi bagside-kameraet som erstatning. Vi optager 150 lange videoer, hver 20 sekunder lange. Som standard antager vi, at detektionsperioden varer 4 sekunder. Vi klipper 10 klip af 4 sekunder lange fra en lang video ved at tilfældiggøre starttiden. Derfor får vi i alt 1500 rigtige klip, hver 4 sekunder lange.’
Selv om DeepFaceLive (GitHub-link) var det centrale mål for studiet, da det er det mest udbredte åbne kilde live deepfaking-system, inkluderede forskerne fire andre metoder til at træne deres basis-detektionsmodel: Hififace; FS-GANV2; RemakerAI; og MobileFaceSwap – den sidste af disse en særligt passende valg, givet målet-miljøet.
1500 fakede videoer blev brugt til træning, sammen med det samme antal rigtige og uændrede videoer.
SFake blev testet mod flere forskellige klassificatorer, herunder SBI; FaceAF; CnnDetect; LRNet; DefakeHop-varianter; og den gratis online deepfake-detektionstjeneste Deepaware. For hver af disse deepfake-metoder blev 1500 fakede og 1500 rigtige videoer trænet.
For den grundlæggende test-klassificator blev en simpel to-lags neural network med en ReLU-aktiveringsfunktion brugt. 1000 rigtige og 1000 fakede videoer blev tilfældigt valgt (selv om de fakede videoer udelukkende var DeepFaceLive-eksempler).
Area Under Receiver Operating Characteristic Curve (AUC/AUROC) og nøjagtighed (ACC) blev brugt som metrikker.
For træning og inferens blev en NVIDIA RTX 3060 brugt, og testene kørt under Ubuntu. Testvideoerne blev optaget med en Xiaomi Redmi 10x, en Xiaomi Redmi K50, en OPPO Find x6, en Huawei Nova9, en Xiaomi 14 Ultra, en Honor 20, en Google Pixel 6a og en Huawei P60.
For at være i overensstemmelse med eksisterende detektionsmetoder blev testene implementeret i PyTorch. Primære testresultater er illustreret i tabellen nedenfor:

Resultater for SFake mod konkurrerende metoder.
Her kommenterer forfatterne:
‘I alle tilfælde overgik SFakes detektionsnøjagtighed 95%. Blandt de fem deepfake-algoritmer, undtagen Hififace, opfører SFake sig bedre mod andre deepfake-algoritmer end de andre seks detektionsmetoder. Da vores klassificator er trænet med fakede billeder genereret af DeepFaceLive, når den den højeste nøjagtighedsrate på 98,8%, når den detekterer DeepFaceLive.
‘Når vi står over for fakede ansigter genereret af RemakerAI, opfører andre detektionsmetoder sig dårligt. Vi formoder, dette kan skyldes den automatiske kompression af videoer, når de downloades fra internettet, hvilket resulterer i tab af billedetaljer og dermed reducerer detektionsnøjagtigheden. Dette påvirker dog ikke SFakes detektion, der opnår en nøjagtighed på 96,8% i detektion mod RemakerAI.’
Forfatterne bemærker yderligere, at SFake er det mest performante system i scenariet med en 2x-zoom anvendt på optagelseslinsen, da dette forstærker bevægelse, og er en ekstremt udfordrende situation. Selv i denne situation var SFake i stand til at opnå en genkendelsesnøjagtighed på 84% og 83% for henholdsvis 2,5 og 3-forstørrelsesfaktorer.
Konklusion
Et projekt, der bruger svaghederne i et live deepfake-system imod sig selv, er en frisk tilbud i et år, hvor deepfake-detektion har været domineret af artikler, der har blot rystet op i ærværdige tilgange omkring frekvensanalyse (hvilket langt fra er immun over for innovationer i deepfake-rummet).
I slutningen af 2022 brugte et andet system monitor-lysstyrke-variance som en detektor-krok; og i samme år demonstrerede jeg selv min egen demonstration af DeepFaceLives udygtighed til at håndtere hårde 90-graders profil-views, som fik nogen fællesskabsinteresse.
DeepFaceLive er det rigtige mål for et sådant projekt, da det sandsynligvis er fokus for kriminelle interesser i forhold til video-konference-svindel.
Men jeg har for nylig set nogen anekdotisk bevis for, at LivePortrait-systemet, der i øjeblikket er meget populært i VFX-fællesskabet, håndterer profil-views langt bedre end DeepFaceLive; det ville have været interessant, hvis det kunne have været inkluderet i denne undersøgelse.
Først udgivet tirsdag, 24. september 2024

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









