Kybernetická bezpečnost
Detekce deepfake videokonferencí pomocí funkce “vibrate” chytrého telefonu

Nový výzkum ze Singapuru navrhl novou metodu detekce deepfake videokonferencí pomocí funkce “vibrate” chytrého telefonu.
Nazvaný SFake, nový přístup opouští pasivní metody používané většinou systémů a způsobuje, že telefon uživatele vibruje (pomocí stejných “vibrate” mechanismů běžných u chytrých telefonů), a jemně rozostří jeho tvář.
Although live deepfaking systémy jsou schopny replikovat motion blur, pokud byl rozostřený záznam zahrnut do trénovacího dat, nebo alespoň do před-trénovacího dat, nemohou reagovat dostatečně rychle na neočekávaný rozostření tohoto druhu a pokračují ve výstupu nerozostřených částí obličeje, odhalující existenci deepfake konference.

DeepFaceLive nemůže dostatečně rychle simulovat rozostření způsobené kamerovými vibracemi. Source: https://arxiv.org/pdf/2409.10889v1
Testovací výsledky na vlastním datasetu (protože neexistují žádné datasety s aktivním kamerovým pohybem) ukázaly, že SFake překonal ostatní video-založené metody detekce deepfake, dokonce i v náročných situacích, jako je přirozený pohyb ruky, který se vyskytuje, když osoba na druhé straně videokonference drží kameru v ruce, místo použití statického telefonního držáku.
Rostoucí potřeba detekce deepfake videokonferencí
Výzkum v oblasti detekce deepfake videokonferencí se v poslední době zvýšil. V důsledku několika let úspěšných hlasových deepfake loupeží, na počátku tohoto roku byl finanční pracovník oklamán a přinucen převést 25 milionů dolarů na účet podvodníka, který se vydával za finančního ředitele v deepfake videokonferenčním hovoru.
Although takový systém vyžaduje vysokou úroveň hardwarového přístupu, mnoho uživatelů chytrých telefonů je již zvyklých na finanční a jiné typy ověřovacích služeb, které nás žádají, abychom nahráli naše obličejové rysy pro face-based autentizaci (skutečně, toto je součástí ověřovacího procesu LinkedIn).
Je tedy pravděpodobné, že takové metody se budou stále více používat pro videokonferenční systémy, protože tento typ zločinu bude pokračovat ve výroku.
Většina řešení, která řeší deepfake videokonference, předpokládá statickou situaci, kde komunikant používá stacionární webovou kameru a neočekává se žádný pohyb nebo nadměrné změny prostředí nebo osvětlení. Telefonní hovor nenabízí žádnou “pevnou” situaci.
Místo toho SFake používá několik detekčních metod, aby kompenzoval vysoký počet vizuálních variant v ručně držené smartphone videokonferenci, a zdá se, že je to první výzkumný projekt, který řeší tento problém pomocí standardního vibrace zařízení vestavěného do chytrých telefonů.
The paper je nazvaný Shaking the Fake: Detecting Deepfake Videos in Real Time via Active Probes, a pochází od dvou výzkumníků z Nanyang Technological University v Singapuru.
Metoda
SFake je navržen jako cloud-based služba, kde lokální aplikace by poslala data na vzdálenou API službu, aby byla zpracována, a výsledky by byly odeslány zpět.
However, jeho malá velikost 450mb a optimalizovaná metodika umožňuje, aby detekce deepfake probíhala zcela na zařízení, v případech, kdy síťové připojení by mohlo způsobit kompresi odesílaných obrazů, což by ovlivnilo diagnostický proces.
Během “all local” režimu má systém přímý přístup k uživatelskému kamerovému toku, bez codec interference často spojené s videokonferencemi.
Průměrný čas analýzy vyžaduje čtyřsekundový video vzorek, během kterého je uživatel požádán, aby zůstal nehybný, a během kterého SFake posílá “probes” pro způsobení kamerových vibrací, v selektivně náhodných intervalech, které systémy jako DeepFaceLive nemohou reagovat včas.
(Mělo by být znovu zdůrazněno, že jakýkoli útočník, který nezahrnul rozostřený obsah do trénovacího datasetu, je nepravděpodobné, že bude schopen vygenerovat model, který může generovat rozostření, dokonce i za mnohem příznivějších okolností, a že DeepFaceLive nemůže jednoduše “přidat” tuto funkci k modelu trénovanému na podkurátorském datasetu)
Systém vybírá vybrané oblasti obličeje jako potenciální deepfake obsah, vylučuje oči a obočí (protože blikání a jiná obličejová motility v této oblasti je mimo rozsah rozostření, a není ideálním ukazatelem).

Konceptuální schéma pro SFake.
Como můžeme vidět v konceptuálním schématu výše, po výběru vhodných a nepředvídatelných vibrací, stanovení nejlepší ohniskové vzdálenosti a provedení obličejové rozpoznávání (včetně detekce obličejových rysů pomocí Dlib komponenty, která odhaduje standardních 68 obličejových rysů), SFake odvozuje gradienty z vstupního obličeje a soustředí se na vybrané oblasti těchto gradientů.
Variabilní sekvence je získána sekvenční analýzou každého snímku v krátkém klipu, dokud není dosaženo průměrné nebo “ideální” sekvence, a zbytek je zanedbán.
To poskytuje extrahované funkce, které lze použít jako kvantifikátor pro pravděpodobnost deepfaked obsahu, založený na trénovaném databázi (o které, více okamžikem).
Systém vyžaduje rozlišení 1920×1080 pixelů, stejně jako minimální 2x zoom požadavku pro objektiv. Paper uvádí, že taková rozlišení (a dokonce i vyšší rozlišení) jsou podporována v Microsoft Teams, Skype, Zoom a Tencent Meeting.
Většina chytrých telefonů má přední a zadní kameru, a často pouze jedna z nich má požadovanou zoom kapacitu; aplikace by proto vyžadovala, aby komunikant používal kteroukoli z těchto kamer, která splňuje tyto požadavky.
Cílem je získat správný poměr uživatelského obličeje do video toku, který systém bude analyzovat. Paper uvádí, že průměrná vzdálenost, ve které ženy používají mobilní zařízení, je 34,7 cm, a pro muže, 38,2 cm (jak hlášeno v Journal of Optometry), a že SFake funguje velmi dobře na těchto vzdálenostech.
Because stabilization je problémem u ručně držených videí, a protože rozostření, které vzniká z pohybu ruky, je překážkou fungování SFake, výzkumníci vyzkoušeli několik metod, aby kompenzovali. Nejúspěšnější z nich bylo vypočítání centrálního bodu odhadnutých rysů a použití tohoto jako “anchor” – efektivní algoritmická stabilizační technika. Touto metodou byla dosažena přesnost 92%.
Data a testy
Because neexistují žádné vhodné datasety pro tento účel, výzkumníci vytvořili své vlastní:
‘[My] používáme 8 různých značek chytrých telefonů, aby nahráli 15 účastníků různých pohlaví a věku, aby vytvořili náš vlastní dataset. Umístíme chytrý telefon na telefonní držák 20 cm daleko od účastníka a dvakrát zoomujeme, aby se zaměřilo na účastníkovo obličej a zahrnulo všechny jeho obličejové rysy, zatímco vibrujeme chytrý telefon v různých vzorcích.
‘Pro telefony, jejichž přední kamery nemohou zoomovat, používáme zadní kamery jako náhradu. Nahráváme 150 dlouhých videí, každé 20 sekund dlouhé. Ve výchozím nastavení předpokládáme, že detekční období trvá 4 sekundy. Řezáme 10 klipů po 4 sekundách z jednoho dlouhého videa náhodným výběrem startovacího času. Proto získáváme celkem 1500 reálných klipů, každý 4 sekundy dlouhý.’
Although DeepFaceLive (GitHub link) byl centrálním cílem studie, protože je téměř jistě zaměřen na kriminální zájem v ohledu na videokonferenční podvody, výzkumníci zahrnuli čtyři další metody pro trénování základního detekčního modelu: Hififace; FS-GANV2; RemakerAI; a MobileFaceSwap – poslední z nich je zvláště vhodný výběr, vzhledem k cílovému prostředí.
1500 falešných videí bylo použito pro trénování, spolu s ekvivalentním počtem reálných a neupravených videí.
SFake byl testován proti několika různým klasifikátorům, včetně SBI; FaceAF; CnnDetect; LRNet; DefakeHop varianty; a bezplatná online služba detekce deepfake Deepaware. Pro každou z těchto deepfake metod byly trénovány 1500 falešných a 1500 reálných videí.
Pro základní testovací klasifikátor byl použit jednoduchý dvouvrstvý neuronový síť s ReLU aktivací. 1000 reálných a 1000 falešných videí bylo náhodně vybráno (ačkoli falešná videa byla výhradně DeepFaceLive příklady).
Plocha pod křivkou ROC (AUC/AUROC) a Přesnost (ACC) byly použity jako metriky.
Pro trénování a inference byl použit NVIDIA RTX 3060, a testy byly spuštěny pod Ubuntu. Testovací videa byla nahrána pomocí Xiaomi Redmi 10x, Xiaomi Redmi K50, OPPO Find x6, Huawei Nova9, Xiaomi 14 Ultra, Honor 20, Google Pixel 6a a Huawei P60.
Abyste byli v souladu s existujícími detekčními metodami, testy byly implementovány v PyTorch. Primární testovací výsledky jsou znázorněny v tabulce níže:

Výsledky pro SFake proti konkurenčním metodám.
Zde autoři komentují:
‘Ve všech případech přesahuje detekční přesnost SFake 95%. Mezi pěti deepfake algoritmy, kromě Hififace, SFake vykonává lépe proti ostatním deepfake algoritmům než ostatní šest detekčních metod. Jako náš klasifikátor je trénován pomocí falešných obrazů generovaných DeepFaceLive, dosahuje nejvyšší přesnost 98,8%, když detekuje DeepFaceLive.
‘Když čelí falešným obličejům generovaným RemakerAI, ostatní detekční metody vykonávají špatně. Spekuluji, že to může být způsobeno automatickým komprimováním videí při stahování z internetu, což vede ke ztrátě obrazových detailů a tím snižuje detekční přesnost. Nicméně, to neovlivňuje detekci SFake, která dosahuje přesnosti 96,8% při detekci proti RemakerAI.’
Autoři dále uvádějí, že SFake je nejvýkonnějším systémem v scénáři 2x zoomu aplikovaného na snímací čočku, protože to zveličuje pohyb, a je to neuvěřitelně náročná perspektiva. I v této situaci SFake dosáhl rozpoznávací přesnosti 84% a 83%, resp. pro 2,5 a 3 násobné faktory.
Závěr
Projekt, který využívá slabosti živého deepfake systému proti sobě, je osvěžující nabídkou v roce, kdy detekce deepfake byla ovlivněna papíry, které pouze míchaly venerabilní přístupy kolem frekvenční analýzy (která je daleko od imunity vůči inovacím v deepfake prostoru).
Na konci roku 2022, jiný systém používal monitor brightness variance jako detektor hook; a ve stejném roce, má vlastní demonstrace neschopnosti DeepFaceLive zpracovat tvrdé 90stupňové profilové pohledy získala some komunitní zájem.
DeepFaceLive je správným cílem pro takový projekt, protože je téměř jistě zaměřen na kriminální zájem v ohledu na videokonferenční podvody.
However, I have lately seen some anecdotal evidence that the LivePortrait system, currently very popular in the VFX community, handles profile views much better than DeepFaceLive; it would have been interesting if it could have been included in this study.
First published Tuesday, 24. září 2024












